建议:添加 FunASR 作为可选语音识别后端
Author: LauraGPTCreated May 29, 2026Updated Jul 14, 2026
[!IMPORTANT] 更正: 下文早期的横向速度和准确率说法没有来自同配置基准,现予以撤回。SenseVoiceSmall 支持中文、粤语、英语、日语和韩语,可返回语言、情感和音频事件标签;说话人分离需要另接 CAM++ 等独立模型或现有 pipeline,并非 SenseVoice 的内置输出。运行速度、时间戳、标点和效果取决于具体模型、接口、硬件和音频。FunASR 与 SenseVoice 仓库源码采用 MIT,模型权重以各自模型卡为准。是否集成应以本项目实际数据测试为准。
背景
MoneyPrinterPlus 使用 faster_whisper 做语音识别。对于中文短视频场景,FunASR(16.5K stars)是更优选择。
对比
| faster_whisper | FunASR SenseVoice | FunASR Paraformer | |
|---|---|---|---|
| GPU 速度 | 46x 实时 | 170x 实时 | 120x 实时 |
| CPU 速度 | ~3x 实时 | 17x 实时 | 15x 实时 |
| 中文准确率 | 良好 | 更优 | 最优(中文专用) |
| 标点恢复 | ❌ | ✅ 内置 | ✅ 内置 |
| 说话人识别 | ❌ | ✅ 内置 | ✅ 内置 |
| 部署方式 | Python | Python / API 服务 | Python / API 服务 |
对视频生成的价值
- 字幕生成更快 — 批量生成时节省大量时间
- 中文更准 — 达摩院工业级模型,减少手动校正
- 自动标点 — 生成字幕不需要额外处理断句
- CPU 也能跑 — 没有 GPU 的用户也能快速处理
接入方式
from funasr import AutoModel
model = AutoModel(model="paraformer-zh", vad_model="fsmn-vad", punc_model="ct-punc", device="cuda")
result = model.generate(input="video_audio.wav")
text = result[0]["text"] # 已带标点的完整文本或通过 OpenAI 兼容 API(与 faster_whisper 相同接口格式):
pip install funasr fastapi uvicorn python-multipart
funasr-server --device cuda
# POST /v1/audio/transcriptionsMIT 开源,如有兴趣可以协助接入。
Source: ddean2009/MoneyPrinterPlus