[2.5 中文质量回归] 与 2.0 的可复现盲测及公开模型架构疑问
问题概述
在使用相同中文参考音频和相同中文文本时,IndexTTS 2.5 相比 IndexTTS 2.0 在部分样本中出现可感知的自然度/正常度退化。类似反馈见 #759 和已关闭的 #781。
为减少先入为主和音量偏差,我做了一轮 A/B 盲测。希望维护者帮忙确认:这是已知的速度/多语言取舍、公开 checkpoint 变体的差异,还是可以通过推理或训练配置修正的问题。
环境和统一条件
- macOS / Apple MPS
- Python 3.11.13
- PyTorch 2.8.0 / torchaudio 2.8.0
- 2.0 和 2.5 均使用 FP32
- 官方公开源码与权重
- 2 条参考声线 × 3 类中文文本:中性叙述、情绪/重音、韵律/声调
- 固定 seed:
20260830 top_p=0.8、top_k=30、temperature=0.8、num_beams=3、repetition_penalty=10.0- 关闭
use_emo_text、use_random,不传入额外情绪向量 - 2.5 使用
lang="ZH"、duration_factor=1.0 - A/B 标签逐组随机打乱
- 盲听副本仅使用固定增益匹配到
-20 dBFS RMS,原始 WAV 也保留,未做降噪、EQ、压缩或时间伸缩
盲测结果
听者只按“哪个更自然、正常”选择总体偏好,不将页面中的 1–5 分视为有效定量分数。
| 组别 | 参考声 | 文本类型 | 偏好版本 |
|---|---|---|---|
| C01 | 常用中文参考声 | 中性叙述 | 2.0 |
| C02 | 常用中文参考声 | 情绪与重音 | 2.0 |
| C03 | 常用中文参考声 | 韵律与声调 | 2.0 |
| C04 | 官方示例参考声 | 中性叙述 | 2.0 |
| C05 | 官方示例参考声 | 情绪与重音 | 2.5 |
| C06 | 官方示例参考声 | 韵律与声调 | 2.0 |
汇总:
- 总体:2.0 获胜 5/6,2.5 获胜 1/6。
- 常用中文参考声:2.0 获胜 3/3。
- 官方示例参考声:2.0 获胜 2/3。
- 中性叙述和韵律/声调:2.0 均获胜 2/2。
- 情绪/重音:两版各胜 1/2。
这是单听者、6 组、单 seed 的初步盲测,不足以估计人群 MOS,也不代表所有中文场景。但两条声线、三类文本中呈现了明显偏向,希望官方进一步进行同条件中文主观 A/B。如有需要,我可补充可公开的官方参考声线样本、原始 WAV、响度匹配版和复现脚本。
与论文/公开实现相关的疑问
1. 说话人条件的变化
2.0 公开实现默认使用 Conformer/Perceiver 处理序列级参考特征;2.5 推理使用单个 192 维 CAMPPlus embedding,再经 spk_emb_proj 投影:
这是否可能保留全局 speaker identity,但减少中文局部发音习惯、音色纹理和韵律细节?
2. Semantic Codec 由 50 Hz 降到 25 Hz
是否进行过 2.0/2.5 在相同中文集合、相同 prompt 上的主观 SMOS/PMOS/QMOS A/B?能否提供中文结果或 50 Hz 高保真版的消融?
3. GPT latent enhancement
2.0 的 S2M 推理使用 use_gpt_latent=True,并将 GPT hidden states 与 semantic embedding 融合;2.5 改为 semantic_codec.decode(codes)。这一变化是否做过针对高情绪中文清晰度与主观质量的消融?
4. 论文中的 Zipformer 与公开 checkpoint
2.5 技术报告描述用 Zipformer 替换 U-DiT,但截至 2026-08-30,官方 main 的 flow_matching.py 仍只实例化 DiT,公开 config.yaml 也是 dit_type: "DiT"。当前公开的 s2mel.pth 是论文中的 U-DiT 版吗?Zipformer 版是否计划发布?
5. 公开 GPT checkpoint 是否为 RL 版
模型卡同时列出 IndexTTS 2.5 和 IndexTTS 2.5-RL,但仓库中只有一份 gpt.pth。请问它对应 base 还是 GRPO 后的 checkpoint?
6. 情绪数据配对与多语言采样
#783 已询问第三阶段 prompt/target 的情绪对齐。2.5 中文/英文情绪数据仍为 135 小时,但新增了大量日语、西班牙语和阿拉伯语数据。能否说明第三阶段的语言/情绪采样比例以及情绪配对策略?
期望
- 确认公开 GPT/S2M checkpoint 分别对应的论文变体。
- 如有建议的中文推理参数,请提供官方配置。
- 建议进行同 prompt、同文本、同推理条件的 2.0/2.5 中文主观 A/B。
- 考虑发布中文高保真 checkpoint,或者 25/50 Hz、CAMPPlus/序列 speaker conditioner、base/RL 的消融结果。
Source: index-tts/index-tts