对话式语音生成模型
中央管理系统 2025/05/20 - CSM在Hugging Face 变形器的4.52.1版本中是本地有用的,我们模式2025/03/13中有更多的信息,我们正在发布1B CSM的变体。 检查站设在Hugging Face上。 --- CSM(Conversational Speech Model)是来自芝麻的语音生成模型,从文本和音频输入生成RVQ音频代码. 该模型架构使用LLaMA主干线和更小的音频解码器来生成米米音频代码. CSM的一个微调变体赋予互动语音演示功能, 还有一个主机Hugging Face空间可供测试音频生成. A 兼容CUDA的GPU 该代码已在CUDA 12.4和 12.6上测试过,但也可能在其他版本上工作类似,Python 3.10被推荐,但较新的版本可能很好 对于一些音频操作,ffmpeg可能被要求访问后继.