最初发表(日文)于former.workstyle.tech.
TTS模型的质量控制:为什么我用TTS模型的质量控制(QC)来进行这种过程: 让模型读取探针句 用Whisper比对脚本来检查精确度和后延 分析波形以表达持续时间,声音压力,F0来检测异常现象 我创造了12个声音,并通过这个QC传递了所有的声音.
华声得到4/4的精度,没有后延,而音压在正常范围内.
我报告100%的通过率。
后来,当我从不同角度重新检查时,其中4个仍然有缺陷.
由于根本的局限性,这些对于基于STT的检查来说是看不见的。
STT 丢入短音 第一个线索是当我收到这个报告时, 这个模式在剧本中并没有产生声音(其根源是训练服被污染:质量门允许的"3个角色"变成了口语)。
我最初没有检查的原因很简单:Whisper放弃了这些声音。
翻译中完全没有0. 28秒的话。
在 STT 输出中可能不会出现不有意义的短音 。
只要您只看抄本, 我甚至总结道, “STT得到0/6, 所以没有额外的声音, ” 错误地将我测量方法的盲点当成目标属性。
通过波形信封查看 实际的输出出现在波形中。
通过从RMS信封中取出表达出的块并检查它们的序列,我们可以检测出这些文物.
为什么双阈值重要 这部分非常关键。
仅针对低音量声音的相对阈值就失败了.
如果整体体积安静,最大值会很小,导致噪声地层被错误地归类为所表述.
绝对阈值单是高音量的声音就失败了.
呼吸或嘴唇被归类为表达。 12个声音的音压从−13.3到−18.8分贝不等,因此两个阈值都无法跨越所有声音. 30ms以下的丢弃区块也是必要的.
没有这个,嘴唇噪声或分解噪声就出现了同多出小块,打破了下游逻辑.
检测标准 一旦提取出表达的区块,我们就核查:“在最后区块之前是否有足够的沉默,该区块是否有足够的持续时间?” 被测量的文物有0.26–0.91秒的沉默缺口,因此0.25就足够了.
避免捕捉淡出尾巴。
测量出文物有0.07–0.36秒长.
所有12个模型中的逗号导致的假阳性 在我第一次扫描中,所有12个模型都触发了探测器.
探测器的句子里写着: 这是在逗号后暂停。
在“QQ”之后有一个空白,然后是“QQ”。
最终块是脚本本身的一部分,然而它却完全符合检测条件(gap + 后续的发音). “在最后的空白之后, 因为它不考虑脚本结构。
有两个定律: 将探测器限制在单句内.
如果用逗号排除句子,尸体后的任何言论都可以被确定为文物.
这就是我通过的——简单执行和不依赖文字。
与脚本端位置对齐 。
从 Whisper 片段衍生出脚本端位置, 并检查能量是否超过此点 。
这更为笼统,但又再次引起STT的依赖.
如果文物不出现在Whisper片段,则最终位置可能会被错误地确定.
在去除假阳性后:模型活体 男性叙述者 6/6 女性操作者 4/6 女性陈述者 4/6 男性陈述者 2/6 剩余 8 0/6 如果我报告的初步结果是... ..