最初发表(日文)于former.workstyle.tech.
打造"情感-压迫TTS"模型:如何"质量"盖茨能反射" 我当时在做一个自动化管道,为情感-表现TTS模型生成培训数据.
为12个情感(欢乐,悲伤,愤怒,恐惧等)中的每一个,我用应用的目标情感准备了多段音频剪辑.
这自然需要质量控制。
我用Whisper来翻译生成的音频 并且只保留了与剧本完全匹配的片段 由此而来的模式最终会发出平和单音.
问题是质量控制过程本身。
切换情感风格仍然听起来像同一个声音 这个模型对每一种情感都有不同的"风格"——欢快的风格,悲伤的风格等——并且可以在它们之间切换时合成语音.
然而,在切换风格时,所感知到的音频差异微乎其微.
这些数字令人痛心地说明了这一点。
我测量了每种情感风格的合成和一种中性风格的同心素相似性.
如果情绪被正确应用,相似性应当降低(即数值应当较小).
一个近0.9的同位素相似性意味着即使在使用"欢乐"风格时,输出的声音也几乎与中性声音相同.
情感风格实际上不起作用.
老实说,当我第一次听样品的时候, 我想,"嗯,没关系"。
直到数字显示为0.9,我才意识到有严重错误.
三个根源 其中两个是配置问题,第三个是真正的罪魁祸首。
1.
扬声器 CFG 设置使截音发出不同的声音 当剧本以"Waa!"或"Eh!"等插曲开头时,片段的开头听起来会像完全不同的声音.
控制对参考音频的忠诚度的参数在情感应用时打破了扬声器的一致性.
2.
Emojis Get Read as Audio I曾将emojis作为情感标记列入剧本,但要么被大声读取("快乐的脸"),要么引发出意料的音效.
这些标记应该放在文字外.
3.
唯心验证法的平取 这是主要问题。
校验拒绝情感- Rich 音频 管道产生多个候选剪辑,并只保留那些通过Whisper验证的.
接下来会发生的: 情感丰富的音频往往有: 颤抖的声音 (恐惧) 扩展或上升的发音 在结尾(欢乐) 音量扭曲 (愤怒) 淡出结局 (悲哀) 所有这些使得Whisper的识别更加困难,导致抄本偏离了剧本并失败验证.
平地,单通取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取取 他们不费力地通过了验证 因此,当根据"它是否与剧本相匹配"进行过滤的片段时,情感-sparse拍摄的片段被不成比例地选中.
大门越严格,这种偏见就越强烈。
城门越好,神器就变了 目标(训练一种情感上表达的声音)和方法(根据脚本忠诚性进行选择)直接相冲突.
由于每个组成部分都运转正常,因此没有出现错误,使问题难以被察觉。
将验证分为两个阶段:过滤和排名 解决办法是将甄选过程分为两个阶段。
第一阶段只是一个质量过滤器,它不能决定排名。
第二阶段采用单独的衡量标准对候选人进行排名。
如何测量“应用的情绪” 为了衡量情感是否被应用,我们使用风格嵌入相距于合成的剪辑和同名扬声器的中性版本.
由于TTS模型能从音频中提取出风格向量,我们利用了这一点.
如果嵌入提取不可用, 您可以使用下列组合进行相近 : 中度 F0 F0 范围( 以半通量计) RMS 差异 关键的想法是衡量相对偏离中性值,而不是绝对值.
试图定义绝对阈值,如“欢乐应该声音亮”,迫使你调整