请支持 audio.cpp 作为本地 ASR + TTS / 声音克隆后端

Author: 0xShug0Created Sep 7, 2026Updated Sep 18, 2026

大家好!我是 [audio.cpp](https://github.com/0xShug0/audio.cpp) 的维护者。

我注意到 LiveTalking 已经支持多个本地 TTS/声音克隆引擎,也看到了 #601 中关于加入 FunASR 的讨论。所以我在想,audio.cpp 是否可以作为一个统一的本地音频后端。

audio.cpp 目前已经支持 70+ 个音频模型,其中包括 15 个 ASR 模型和 38 个 TTS/声音克隆模型,并且还在通过社区贡献持续扩展。其中一些 ASR 集成由官方模型团队直接贡献,包括 Mistral AI、FunASR、IBM 和 Microsoft 的团队。

TTS 方面,目前支持 Qwen3-TTS、IndexTTS 2/2.5、Higgs Audio TTS v3、Fish Audio、PocketTTS、VibeVoice 等模型。

这些模型都可以通过同一个 C++ runtime 在本地运行,并针对 CUDA、Metal、Vulkan 和 HIP 做了性能优化。性能方面,audio.cpp 通常比对应的 Python 实现快 2~8 倍,并且我们的社区还在持续推动热门模型的性能优化。

audio.cpp 推理本身完全不依赖 Python,同时提供 Server API 和 CLI 支持,因此 LiveTalking 可以通过一个统一后端接入多种本地 TTS、声音克隆和 ASR 模型。

不知道你们是否会对这种集成方式感兴趣?关于 audio.cpp 的任何问题我都很乐意回答。