模型请求 + 实现计划: dots.tts (rednote-hilab) 零样本语音克隆
作者: amargupta0428创建于 2026年8月22日更新于 2026年8月27日
我想使用 sb1992/dots-tts-mlx 提供的 Apache-2.0 MLX 运行时,添加零样本语音克隆支持。实现将在 `mlx_audio/tts/models/dots_tts` 中提供该运行时,并将其 mlx-lm 导入替换为 `mlx_audio.lm`,同时暴露 mlx-audio 的标准 `Model`/`ModelConfig` 和 `GenerationResult` 接口。由于检查点中包含三个独立加载的安全张量,我建议添加一个小型通用加载器钩子,让自加载模型跳过正常的合并权重步骤,而不再仅依赖 `sanitize()`。我已经创建了一个可用分支(black/isort 保持清洁,673 个测试通过,包括 22 个新测试,为 vendored 工作打包了完整的 Apache-2.0 通知,今晚对发布的社区 int4 权重进行了端到端验证),在开放 PR 之前,我还将提供一个可根加载的模型仓库路径或子文件夹机制(发布的权重位于不同的子目录中),一个真正的生成测试,以及冷加载内存测量。你是否更喜欢按照家庭惯例使用 vendored 模型包,还是围绕外部 dots-tts-mlx 包提供可选的适配器?
内容来源: Blaizzy/mlx-audio