VITS 无法使用 CISAMPA 语音单元输入从旁遮普语数据集中合成可理解的音频
作者: Fatima-Naseem071创建于 2025年5月5日更新于 2025年9月30日
你好! 我正在使用 Case Insensitive Speech Assessment Method Phonetic Alphabet (CISAMPA) 中写成的音素级转录,在一个旁遮音单发音者的旁遮音数据集上训练 VITS 模型。训练过程没有出错,但合成的音频听不懂 — 单词听起来不清楚或毫无意义,而且似乎有些音素发音错误或完全跳过。当我在默认的 LJSpeech 数据集上训练模型时,情况就不一样了,它按照预期工作。
内容来源: jaywalnut310/vits