18 从量产语音模型——从传播TTS语音设计到培训公司创造和质量门坑的透视
18 Insights from Mass-Producing Voice Models — From Diffusion TTS Voice Design to Training Corpus Creation and Quality Gate Pitfalls
最初发表(日文)于former.workstyle.tech. 这是从单行标题设计出声音的记录,自动创建学习体,并通过全面检查传递所有12个特定角色的声音(针对男女的旁白/咨询/销售/介绍/操作/MC)。 我写了我在大约一个月的实际工作中遇到的失败,分为18篇文章。 本条为目录. "结论前声"设计,语音制造,语音操作都是不同的技术,故障不一. 设计使用扩散TTS. 语音由标题和随机种子决定,使其完全可再生. 制造业主要是制造物剂。 质量门的设计直接...
最初发表(日文)于former.workstyle.tech. 这是从单行标题设计出声音的记录,自动创建学习体,并通过全面检查传递所有12个特定角色的声音(针对男女的旁白/咨询/销售/介绍/操作/MC)。 我写了我在大约一个月的实际工作中遇到的失败,分为18篇文章。 本条为目录. "结论前声"设计,语音制造,语音操作都是不同的技术,故障不一. 设计使用扩散TTS. 语音由标题和随机种子决定,使其完全可再生. 制造业主要是制造物剂。 质量门的设计直接决定了语音质量. 操作依赖于轻量级预训模型. 传播TTS对对话来说太慢了(在同一GPU上慢了2.5倍). 最大的教训可以归纳为一点: 拥有一个质量的大门和它的效果是两个不同的事物. 这18篇文章中有6篇是关于存在但无效的大门。 阅读顺序 物品按设计、制造、检查、操作顺序排列。 从顶端读取会带你经历一个单一的声音被创建和部署到制作的旅程. 第1章:设计——如何确定声音 TTS选取的声音质量太慢了 对话 A 2.5x实时因子(RTF)差. 我们是如何在两阶段方法上下定决心的:用传播的TTS设计出声音,并使用经过预先训练的模型进行演讲. 由字幕和随机种子决定。 通过保存设计值的分类账,即使模型丢失,声音也可以被再生成. 让一台机器从24位候选人中选择“类似纳拉特的声音”, 自动测量演讲率,入声率,稳定性只听从上层候选人. 此外,关于所有男性候选人如何因尺度限制而被淘汰的故事。 第2章:制造业——公司质量直接成为声音 更严格的质量门, 更摩诺能 取出生存 所有情感充斥的蝎子最终都变得单调的原因是质量门本身. 这是这个系列的中心故事. 培训结束后无法改变的语音率和语音率被烤入教程中。 它们不能用合成参数加以调整。 TTS that changes "Recording location" Every Time even with same model and speakers, 频率特性对于每个片段来说是不同的. 如果不标准化,样式切换会导致声音质量不一致。 如果五分之一的剪辑很粗糙 整个风格就会变得粗糙 将水分稀释为平均水分, 第3章:检查——有一个门和它的有效性是不同的, 验证由于kana正常化而丢弃了长元音,使得缺陷根本无法被察觉. "一个小"变成"Shomo" 模型和参数都很好,但输入文本被打破. 符号去除列表中会降下"-","-"和"-"等字符. 迷幻护法只在迷幻中失败 单行虫只使警卫在必要情况下无效. "三个字符" 质量之门允许 变成一个Verbal Tic 通过大门的大小 与模型复制的声音大小相匹配 拒绝可治愈缺陷候选人 衡量产品特性的尺度还是工艺状态? Transcription STT 唯一的检查中看不到的错失了 0.1秒的添加剂声音,在两者之间保持安静。 用波形信封抓住他们 第4章:行动——作为工厂运行 70分钟的培训材料丢失到网络一线断开导致205次重复. 查找区域