#961·mlx-audio

流式输入架构

作者: keless创建于 2026年9月16日更新于 2026年9月16日

你好,我最近在 QwenTTS 模型上做了一些工作,地址是:https://GitHub.com/keless/Qwen3-TTS-streaming-input。 从 Qwen3-TTS-streaming 这个分支开始,它本身是原始 Qwen3-TTS 的分支,专注于流式输出音频。我添加了流式输入文本的功能。通过将输入文本与输出音频生成分离,我能够从一个 LLM 模型中流式输入标记,并保持韵律/上下文保持和共享,以便在流式输出音频的同时处理多个语句。这意味着,与其等待 LLM 发出的第一句话或单词,我们可以立即开始从第一个流式标记中生成音频。此外,一旦完成一句,我们可以继续使用相同的上下文处理下一句(甚至多个句子的段落),因此,口头回复在所有输入之间是一致的。 我是在 Linux 机器上使用 Nvidia 显卡做了这项工作,但现在我正在研究 MacStudio 架构,并想知道是否应该使用 mlx-audio(以更好地利用 Metal);然而,显然,我为将流式输入添加到 Qwen3-TTS 而做的工作目前不存在于 mlx-audio 中。 我认为这项工作可能可以在某些,但不是所有的不同的音频架构中进行通用化(特别是像 Kokoro 和 Chatterbox 这样的模型,它们不是自回归的,可能不会工作)。你认为将这项功能添加到你的项目中是一个好主意吗?

内容来源: Blaizzy/mlx-audio