最初发表(日文)于former.workstyle.tech.
我找到一个传播TTS, 产生声音 从一个标题传递这个描述, 它会说话 准确的声音。
你可以产生任何日语语音,甚至不准备一秒钟的扬声器音频.
此外,同样的标题和随机种子将永远产生相同的声音。
我认为这对互动的阿凡达人可能有用, 简言之, 但它太值钱 丢弃, 所以我重新设计它。
基准:2.5x 在同一个GPU上的更慢器 Our 现有系统使用了一个预先训练的TTS(Style-Bert-VITS2-基于).
我们在同一个GPU切片上合成了同样的7.5秒的句子来进行比较.
发动机条件生成 时间 RTF 扩散 TTS 40 步 2g.20gb 1.9–2.1s 0.25–0.28 扩散 TTS 24 步 2g.20gb 1.4–2.0s 0.19–0.27 扩散 TTS 16 步 2g.20gb 1.1–1.4s 0.15–0.19 预训练型号 2g.20gb 0.74–0.81s 0.115–0.127 RTF (Real Time Factor) = 生成时间 QQ音频长度.
低点会更快 在40个步骤中, 即使将步骤切到16,仍然留下了1.5×的缺口.
而低于16个步骤,质量崩溃(6个步骤在收听时被立即拒绝).
在较小的GPU片上,缺口会进一步扩大.
发动机条件生成 时间 RTF 扩散 TTS 40 步 1g.10gb 3.4–4.0s 046–0.54 扩散 TTS 16 步 1g.10gb 2.0s 0.27 在谈话中,音频被合成并逐句播放.
延迟到第一句播放决定了用户体验.
每轮落后一至二秒是令人望而却步的。
升级 GPU 未解决 我考虑分配更多GPU资源, 但测量结果显示固定起落架为~1.1秒.
甚至剪接步骤到12,一代时间以1.1–1.4秒最下沉.
这是因为模型加载和文本处理,这些部分没有从平行主义中受益。
因此,即使拥有4x资源,最快的一代人也会是~1.0-1.2秒——仍然比预训模型的0.8秒慢.
成本倍增。
我们决定不通过该决议草案。
一个有用的外卖:先测量固定的间接费用。
通过将步骤降低到性能停止改善的地步,可以估计出瓶颈有多少是相平行的.
拆分"工作流速度"是唯一的缺点.
但传播 TTS 提供了预先训练过的模型无法提供的东西:仅从标题产生声音。
被预先训练的模型只能再现在训练中看到的声音.
因此,我们分道扬镳:在设计过程中,传播TTS创造了“这种声音 ” 。
我们用这个声音录制了~200行,用来建造一个训练馆,然后训练一个轻量级的模型用于跑步时间.
TTS只运行一次, 产生一个声音需要70分钟, 此分割到工作决定论生成的条件 。
同样的字幕和种子必须总是产生相同的声音.
我们无法重现设计的声音, 由于这个地产,我们只需要存储设计分类账来再造模型.
即使我们失去了训练有素的模型文件,我们也可以从标题和种子中再生出准确的声音. (我们一度丢失了驱动脚本,但通过恢复日志中的标题和种子恢复了声音:[[决定-语音-gacha-和-设计-领导者++Voice Gacha和设计Ledger]]])。
音频质量必须经受训练。
由于产生的音频成为培训数据,传播TTS的音频质量设定了上限.
我们通过实际的训练和倾听来证实这一点——这里没有问题。
议长身份必须始终如一。
超过200个片段,声音必须保持一致.
这是棘手的。
以感叹为起点的句子有时在开头会改变演讲者,强烈的情感表达会打破演讲者的身份.
我们通过仔细管理参考音频来解决了这个问题