百科.dev
全部条目AI 编程趋势榜开源项目技术资讯提交条目
登录
返回工具页

mlx-audio · Issues· 106 开放

在 GitHub 打开

本地同步的开放议题(评论请到 GitHub 查看)

  • #961

    流式输入架构

    更新于 2026年9月16日
  • #950

    没有 HF 处理器的 Whisper 检查点 (例如 mlx-community/whisper-large-v3-turbo-8bit, 使用 mlx-audio-plus 转换) 会在较晚的时间出现混乱的"未找到处理器"错误,而不是清晰的加载时间消息

    更新于 2026年9月7日
  • #944

    nemotron_asr: 通过现有的实时 STT 合约暴露实时输入会话

    更新于 2026年9月4日
  • #938

    特性: 从模型元数据生成动态 UI 表单

    更新于 2026年9月2日
  • #928

    Qwen3-ASR 处理无效、短或无语音的音频输入时出现问题

    更新于 2026年8月29日
  • #927

    Qwen3-ASR 串流时间戳依赖于 max_tokens,而不是音频时间

    更新于 2026年8月29日
  • #921

    ICL 语音克隆发生随机变异(没有 EOS,24 秒的垃圾音频) — 根本原因:ref_text 未覆盖完整的 ref_audio;通过官方 PyTorch A/B 确认,这不是端口问题

    更新于 2026年8月28日
  • #917

    Whisper non_speech_tokens 在空结果(0.4.4 STT)上出现 IndexError: encode("-")[0] 导致崩溃

    更新于 2026年8月28日
  • #916

    Voxtral TTS: 装饰性的单引号可以添加幻觉语音

    更新于 2026年8月27日
  • #903

    模型请求 + 实现计划: dots.tts (rednote-hilab) 零样本语音克隆

    更新于 2026年8月27日
  • #902

    当检查点键不匹配时,STT load_model 会默默返回一个随机初始化的模型(默认 strict=False)

    更新于 2026年8月25日
  • #898

    流式传输 /v1/audio/speech 会每个分块发送一个完整的容器文件,在每个接缝处插入可听到的静音(所有容器格式)

    更新于 2026年8月21日
  • #875

    POST /v1/audio/transcriptions: ndjson 将推理时出现的错误报告为 200,体为空

    更新于 2026年8月7日
  • #44

    如何使用 Sesame Labs?

    repo/mlx-audio更新于 2026年7月23日
  • #16

    支持稳定音频 Open v1.0

    repo/mlx-audio更新于 2026年7月23日