建议: 集成 FunASR/SenseVoice 作为 ASR 引擎选项
Author: LauraGPTCreated May 31, 2026Updated May 31, 2026
功能建议
建议在 KrillinAI 中集成 FunASR/SenseVoice 作为语音识别引擎选项。
为什么适合
KrillinAI 做视频翻译配音,ASR 是第一步也是最关键的一步。FunASR 相比 Whisper 的优势:
- SenseVoice (234M):非自回归模型,无幻觉问题(视频字幕中避免出现胡编内容)
- 比 Whisper 快 5 倍+:批量处理视频时效率显著提升
- 中文识别准确率:显著优于 Whisper,特别是抖音/B站等中文内容
- 内置 VAD + 标点恢复:开箱即用,不需要额外工具
- Fun-ASR-Nano (LLM-based):31 语种,带字级时间戳,适合精准字幕对齐
- OpenAI 兼容 API:
funasr-server可作为 drop-in 替代
快速集成
from funasr import AutoModel
model = AutoModel(model="iic/SenseVoiceSmall")
result = model.generate(input="video_audio.wav")
text = result[0]["text"]或使用 API:
funasr-server --device cuda
# POST /v1/audio/transcriptions参考
- FunASR — 16K+ stars
- SenseVoice — 8K+ stars
- 类似项目 pyVideoTrans(17.6K stars) 已集成 FunASR
Source: krillinai/KrillinAI