请支持 audio.cpp 作为本地 ASR + TTS / 声音克隆后端

Author: 0xShug0Created Sep 7, 2026Updated Sep 14, 2026

大家好!我是 audio.cpp 的维护者。

我注意到 VideoLingo 的配音流程同时需要 ASR 和 TTS,所以在想 audio.cpp 是否可以作为一个统一的本地后端,同时覆盖这两部分。

audio.cpp 目前已经支持70+ 模型, 包括15 个 ASR 模型和 38 个 TTS/声音克隆模型,并且还在通过社区贡献持续扩展。其中一些 ASR 集成由官方模型团队直接贡献,包括 Mistral AI、FunASR、IBM 和 Microsoft 的团队。

TTS 方面,目前支持 Qwen3-TTS、IndexTTS 2/2.5、Higgs Audio TTS v3、Fish Audio、PocketTTS、VibeVoice Breeze TTS2等模型。

这些模型都可以通过同一个 C++ runtime 在本地运行,并针对 CUDA、Metal、Vulkan 和 HIP 做了性能优化。

audio.cpp 推理本身完全不依赖 Python,同时提供 Server API 和 CLI,因此 VideoLingo 可以通过一个统一后端接入多种本地 ASR、TTS 和声音克隆模型。

不知道你们是否会对这种集成方式感兴趣?关于 audio.cpp 的任何问题我都很乐意回答。