Baike.dev
All toolsAI codingTrendingOpen sourceNewsSubmit
Log in
Back to tool/Back to issues
#143·MoneyPrinterPlus

建议:添加 FunASR 作为可选语音识别后端

Author: LauraGPTCreated May 29, 2026Updated Jul 14, 2026

[!IMPORTANT] 更正: 下文早期的横向速度和准确率说法没有来自同配置基准,现予以撤回。SenseVoiceSmall 支持中文、粤语、英语、日语和韩语,可返回语言、情感和音频事件标签;说话人分离需要另接 CAM++ 等独立模型或现有 pipeline,并非 SenseVoice 的内置输出。运行速度、时间戳、标点和效果取决于具体模型、接口、硬件和音频。FunASR 与 SenseVoice 仓库源码采用 MIT,模型权重以各自模型卡为准。是否集成应以本项目实际数据测试为准。

背景

MoneyPrinterPlus 使用 faster_whisper 做语音识别。对于中文短视频场景,FunASR(16.5K stars)是更优选择。

对比

faster_whisper FunASR SenseVoice FunASR Paraformer
GPU 速度 46x 实时 170x 实时 120x 实时
CPU 速度 ~3x 实时 17x 实时 15x 实时
中文准确率 良好 更优 最优(中文专用)
标点恢复 ❌ ✅ 内置 ✅ 内置
说话人识别 ❌ ✅ 内置 ✅ 内置
部署方式 Python Python / API 服务 Python / API 服务

对视频生成的价值

  1. 字幕生成更快 — 批量生成时节省大量时间
  2. 中文更准 — 达摩院工业级模型,减少手动校正
  3. 自动标点 — 生成字幕不需要额外处理断句
  4. CPU 也能跑 — 没有 GPU 的用户也能快速处理

接入方式

python
from funasr import AutoModel

model = AutoModel(model="paraformer-zh", vad_model="fsmn-vad", punc_model="ct-punc", device="cuda")
result = model.generate(input="video_audio.wav")
text = result[0]["text"]  # 已带标点的完整文本

或通过 OpenAI 兼容 API(与 faster_whisper 相同接口格式):

bash
pip install funasr fastapi uvicorn python-multipart
funasr-server --device cuda
# POST /v1/audio/transcriptions

MIT 开源,如有兴趣可以协助接入。

Source: ddean2009/MoneyPrinterPlus

View original on GitHubView discussion on GitHub