建议集成 FunASR/SenseVoice 替代实时语音对话的 ASR 模块

Author: LauraGPTCreated May 31, 2026Updated May 31, 2026

功能建议

gpt_academic 已有实时语音对话功能,非常出色!建议集成 FunASR/SenseVoice 作为 ASR 引擎选项。

为什么选择 FunASR/SenseVoice?

  • SenseVoice:超快非自回归 ASR(234M 参数),中文识别精度极高
  • 比 Whisper 快 5-10 倍:非自回归架构,更适合实时对话场景
  • 情感检测:内置识别语音情感
  • 音频事件检测:识别笑声、掌声等
  • Fun-ASR-Nano:基于 LLM 的 ASR(800M 参数),支持热词定制
  • 流式识别:支持 WebSocket 实时流式 ASR
  • OpenAI 兼容 APIfunasr-server 提供标准接口

快速接入:

from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall")
result = model.generate(input="audio.wav")

或通过 API 服务:

funasr-server --device cuda
# /v1/audio/transcriptions 接口

Source: binary-husky/gpt_academic