#801·index-tts

[2.5 中文质量回归] 与 2.0 的可复现盲测及公开模型架构疑问

Author: david-bowiegxwCreated Aug 29, 2026Updated Aug 29, 2026

问题概述

在使用相同中文参考音频和相同中文文本时,IndexTTS 2.5 相比 IndexTTS 2.0 在部分样本中出现可感知的自然度/正常度退化。类似反馈见 #759 和已关闭的 #781。

为减少先入为主和音量偏差,我做了一轮 A/B 盲测。希望维护者帮忙确认:这是已知的速度/多语言取舍、公开 checkpoint 变体的差异,还是可以通过推理或训练配置修正的问题。

环境和统一条件

  • macOS / Apple MPS
  • Python 3.11.13
  • PyTorch 2.8.0 / torchaudio 2.8.0
  • 2.0 和 2.5 均使用 FP32
  • 官方公开源码与权重
  • 2 条参考声线 × 3 类中文文本:中性叙述、情绪/重音、韵律/声调
  • 固定 seed:20260830
  • top_p=0.8top_k=30temperature=0.8num_beams=3repetition_penalty=10.0
  • 关闭 use_emo_textuse_random,不传入额外情绪向量
  • 2.5 使用 lang="ZH"duration_factor=1.0
  • A/B 标签逐组随机打乱
  • 盲听副本仅使用固定增益匹配到 -20 dBFS RMS,原始 WAV 也保留,未做降噪、EQ、压缩或时间伸缩

盲测结果

听者只按“哪个更自然、正常”选择总体偏好,不将页面中的 1–5 分视为有效定量分数。

组别 参考声 文本类型 偏好版本
C01 常用中文参考声 中性叙述 2.0
C02 常用中文参考声 情绪与重音 2.0
C03 常用中文参考声 韵律与声调 2.0
C04 官方示例参考声 中性叙述 2.0
C05 官方示例参考声 情绪与重音 2.5
C06 官方示例参考声 韵律与声调 2.0

汇总:

  • 总体:2.0 获胜 5/6,2.5 获胜 1/6。
  • 常用中文参考声:2.0 获胜 3/3。
  • 官方示例参考声:2.0 获胜 2/3。
  • 中性叙述和韵律/声调:2.0 均获胜 2/2。
  • 情绪/重音:两版各胜 1/2。

这是单听者、6 组、单 seed 的初步盲测,不足以估计人群 MOS,也不代表所有中文场景。但两条声线、三类文本中呈现了明显偏向,希望官方进一步进行同条件中文主观 A/B。如有需要,我可补充可公开的官方参考声线样本、原始 WAV、响度匹配版和复现脚本。

与论文/公开实现相关的疑问

1. 说话人条件的变化

2.0 公开实现默认使用 Conformer/Perceiver 处理序列级参考特征;2.5 推理使用单个 192 维 CAMPPlus embedding,再经 spk_emb_proj 投影:

这是否可能保留全局 speaker identity,但减少中文局部发音习惯、音色纹理和韵律细节?

2. Semantic Codec 由 50 Hz 降到 25 Hz

是否进行过 2.0/2.5 在相同中文集合、相同 prompt 上的主观 SMOS/PMOS/QMOS A/B?能否提供中文结果或 50 Hz 高保真版的消融?

3. GPT latent enhancement

2.0 的 S2M 推理使用 use_gpt_latent=True,并将 GPT hidden states 与 semantic embedding 融合;2.5 改为 semantic_codec.decode(codes)。这一变化是否做过针对高情绪中文清晰度与主观质量的消融?

4. 论文中的 Zipformer 与公开 checkpoint

2.5 技术报告描述用 Zipformer 替换 U-DiT,但截至 2026-08-30,官方 mainflow_matching.py 仍只实例化 DiT,公开 config.yaml 也是 dit_type: "DiT"。当前公开的 s2mel.pth 是论文中的 U-DiT 版吗?Zipformer 版是否计划发布?

5. 公开 GPT checkpoint 是否为 RL 版

模型卡同时列出 IndexTTS 2.5 和 IndexTTS 2.5-RL,但仓库中只有一份 gpt.pth。请问它对应 base 还是 GRPO 后的 checkpoint?

6. 情绪数据配对与多语言采样

#783 已询问第三阶段 prompt/target 的情绪对齐。2.5 中文/英文情绪数据仍为 135 小时,但新增了大量日语、西班牙语和阿拉伯语数据。能否说明第三阶段的语言/情绪采样比例以及情绪配对策略?

期望

  • 确认公开 GPT/S2M checkpoint 分别对应的论文变体。
  • 如有建议的中文推理参数,请提供官方配置。
  • 建议进行同 prompt、同文本、同推理条件的 2.0/2.5 中文主观 A/B。
  • 考虑发布中文高保真 checkpoint,或者 25/50 Hz、CAMPPlus/序列 speaker conditioner、base/RL 的消融结果。