mlx-audio · Issues· 106 开放
在 GitHub 打开本地同步的开放议题(评论请到 GitHub 查看)
- #961
流式输入架构
更新于 2026年9月16日 - #950
没有 HF 处理器的 Whisper 检查点 (例如 mlx-community/whisper-large-v3-turbo-8bit, 使用 mlx-audio-plus 转换) 会在较晚的时间出现混乱的"未找到处理器"错误,而不是清晰的加载时间消息
更新于 2026年9月7日 - #944
nemotron_asr: 通过现有的实时 STT 合约暴露实时输入会话
更新于 2026年9月4日 - #938
特性: 从模型元数据生成动态 UI 表单
更新于 2026年9月2日 - #928
Qwen3-ASR 处理无效、短或无语音的音频输入时出现问题
更新于 2026年8月29日 - #927
Qwen3-ASR 串流时间戳依赖于 max_tokens,而不是音频时间
更新于 2026年8月29日 - #921
ICL 语音克隆发生随机变异(没有 EOS,24 秒的垃圾音频) — 根本原因:ref_text 未覆盖完整的 ref_audio;通过官方 PyTorch A/B 确认,这不是端口问题
更新于 2026年8月28日 - #917
Whisper non_speech_tokens 在空结果(0.4.4 STT)上出现 IndexError: encode("-")[0] 导致崩溃
更新于 2026年8月28日 - #916
Voxtral TTS: 装饰性的单引号可以添加幻觉语音
更新于 2026年8月27日 - #903
模型请求 + 实现计划: dots.tts (rednote-hilab) 零样本语音克隆
更新于 2026年8月27日 - #902
当检查点键不匹配时,STT load_model 会默默返回一个随机初始化的模型(默认 strict=False)
更新于 2026年8月25日 - #898
流式传输 /v1/audio/speech 会每个分块发送一个完整的容器文件,在每个接缝处插入可听到的静音(所有容器格式)
更新于 2026年8月21日 - #875
POST /v1/audio/transcriptions: ndjson 将推理时出现的错误报告为 200,体为空
更新于 2026年8月7日 - #44
如何使用 Sesame Labs?
repo/mlx-audio更新于 2026年7月23日 - #16
支持稳定音频 Open v1.0
repo/mlx-audio更新于 2026年7月23日