请支持 audio.cpp 作为本地 ASR + TTS / 声音克隆后端
Author: 0xShug0Created Sep 7, 2026Updated Sep 18, 2026
大家好!我是 [audio.cpp](https://github.com/0xShug0/audio.cpp) 的维护者。
我注意到 LiveTalking 已经支持多个本地 TTS/声音克隆引擎,也看到了 #601 中关于加入 FunASR 的讨论。所以我在想,audio.cpp 是否可以作为一个统一的本地音频后端。
audio.cpp 目前已经支持 70+ 个音频模型,其中包括 15 个 ASR 模型和 38 个 TTS/声音克隆模型,并且还在通过社区贡献持续扩展。其中一些 ASR 集成由官方模型团队直接贡献,包括 Mistral AI、FunASR、IBM 和 Microsoft 的团队。
TTS 方面,目前支持 Qwen3-TTS、IndexTTS 2/2.5、Higgs Audio TTS v3、Fish Audio、PocketTTS、VibeVoice 等模型。
这些模型都可以通过同一个 C++ runtime 在本地运行,并针对 CUDA、Metal、Vulkan 和 HIP 做了性能优化。性能方面,audio.cpp 通常比对应的 Python 实现快 2~8 倍,并且我们的社区还在持续推动热门模型的性能优化。
audio.cpp 推理本身完全不依赖 Python,同时提供 Server API 和 CLI 支持,因此 LiveTalking 可以通过一个统一后端接入多种本地 TTS、声音克隆和 ASR 模型。
不知道你们是否会对这种集成方式感兴趣?关于 audio.cpp 的任何问题我都很乐意回答。
Source: lipku/LiveTalking