#292·KrillinAI

建议: 集成 FunASR/SenseVoice 作为 ASR 引擎选项

Author: LauraGPTCreated May 31, 2026Updated May 31, 2026

功能建议

建议在 KrillinAI 中集成 FunASR/SenseVoice 作为语音识别引擎选项。

为什么适合

KrillinAI 做视频翻译配音,ASR 是第一步也是最关键的一步。FunASR 相比 Whisper 的优势:

  • SenseVoice (234M):非自回归模型,无幻觉问题(视频字幕中避免出现胡编内容)
  • 比 Whisper 快 5 倍+:批量处理视频时效率显著提升
  • 中文识别准确率:显著优于 Whisper,特别是抖音/B站等中文内容
  • 内置 VAD + 标点恢复:开箱即用,不需要额外工具
  • Fun-ASR-Nano (LLM-based):31 语种,带字级时间戳,适合精准字幕对齐
  • OpenAI 兼容 APIfunasr-server 可作为 drop-in 替代

快速集成

python
from funasr import AutoModel

model = AutoModel(model="iic/SenseVoiceSmall")
result = model.generate(input="video_audio.wav")
text = result[0]["text"]

或使用 API:

bash
funasr-server --device cuda
# POST /v1/audio/transcriptions

参考