添加对 https://huggingface.co/Tencent/AuK-Flash 的支持
作者: AshD创建于 2026年9月12日更新于 2026年9月12日
https://auk-project.GitHub.io/ AuK 是一个包含 1.5 亿个参数的基础模型,它可以通过编辑或生成音频来回答自然语言指令。一个多模态语言模型会同时读取指令和可选的参考音频;一个 50 Hz 的 VAE 会提供声学潜在量;一个混合 Transformer 模型会在流匹配目标下融合这两个流。
内容来源: jamiepine/voicebox