> 返回资讯列表
news_article.exe
📰

単一のラフクリップは、スタイル全体を台無しにすることができます - 5の良いものを選ぶ方法

A single rough clip can ruin the entire style — How to choose 5 good ones

2026年9月2日7 次浏览来源:Dev.to 阅读原文

既に公開されている(日本語) forge.workstyle.tech. 私たちが使っているTTSは、「いくつかの代表的なクリップ」から感情的なスタイルを作成します。 楽しいスタイルのために、例えば、いくつかの楽しいオーディオクリップを渡すと、平均的なスタイルのベクトルが登録されます。 まず、各グループから最初の5つのクリップを渡しました。このスタイルでシンセサイジングすることで、ホアスの声が生まれました。 失敗することなく、すべての単一の文。 200のうちの1つは違いを生む 原因は、私が通過した5つで1つ以上のラフクリップが混合されたことだった。 生成されたオーディオは、低品質であることの特定の確率を持っています。 音声はラフに聞こえるので、ピッチは不安定に変動したり、オクターブは中流にジャンプしたりできます。 これらは、コンテンツが正しく読み込まれているため、品質ゲート(スクリプトマッチング)を渡します。そのため、音の荒さは...

既に公開されている(日本語) forge.workstyle.tech. 私たちが使っているTTSは、「いくつかの代表的なクリップ」から感情的なスタイルを作成します。 楽しいスタイルのために、例えば、いくつかの楽しいオーディオクリップを渡すと、平均的なスタイルのベクトルが登録されます。 まず、各グループから最初の5つのクリップを渡しました。このスタイルでシンセサイジングすることで、ホアスの声が生まれました。 失敗することなく、すべての単一の文。 200のうちの1つは違いを生む 原因は、私が通過した5つで1つ以上のラフクリップが混合されたことだった。 生成されたオーディオは、低品質であることの特定の確率を持っています。 音声はラフに聞こえるので、ピッチは不安定に変動したり、オクターブは中流にジャンプしたりできます。 コンテンツが正しく読み込まれているため、品質ゲート(スクリプトマッチング)を渡しますので、音の粗さは検出されません。 コルパス全体には約200個のクリップが含まれているため、いくつかのラフなものが混在しても、全体的な学習への影響は最小限です。 ただし、スタイル登録には5つのクリップのみが使われます。 それらの5つが粗い場合、その影響は20%になります。 平均への希釈は、期待どおりに機能しません。 スタイルベクターは、埋め込むスペースの平均値ですが、ラフなオーディオは「粗さ」の方向の通常の範囲外にあります。 1つのアウターで4つの通常のクリップを平均すると、重力の中心はアウターに向かって大幅に引き出されます。 その結果、そのスタイルで合成されたすべてのオーディオは、粗い品質を運ぶ。 単一クリップの粗さは、そのスタイルのすべての出力に伝播します。 クリップを「ラフ」にするのは何ですか? 聴いたときに「ラフ」を感じるものを破壊し、私は2つの主な要因を発見しました:ジッタ(periodの変動): 不安定なボーカルコード振動期間、大まかな印象に。 オクターブジャンプ:F0推定は、隣接したフレーム間のダブルまたはハーフにジャンプします。 これは、実際の音声のクラックや推定エラーに起因することができます, しかし、両マニフェストは「不安定な音」として. これらの2つの要素を測定し、最も低い値でクリップを選択します。 オクターブジャンプは、知覚に大きな影響を与えるので、より重大(×2.0)を重ねています。 ジッタは連続粗さで、ジャンプは「声の割れ」として際立たせる離散的な壊れ目です。 登録コードが変更されました。これは偽りを解消しました。 ショートボイスセグメントのクリップを除く 部分は間違いなく重要です。 ショートインジェクション(「はい!」、「オケイ!」)、多くの未発音の文章(「デスシシシ、シッカリ」)は、いくつかのボイスフレームしか持っていません。 これらからジッタを計算することは無意味であり、チャンスのためにそれらを最も安定的に識別することができる。 負傷不可能なクリップは、候補から除外されます。 5枚以下のクリップが残っている場合、できるだけ多く選択します。 ⚠️ ジッタは低い声で過小評価されます このメトリクスは既知の弱さを持っています:自動相関を使用してF0推定は、より低い声のためのエラー傾向です。 基礎的な周波数の誤りや推定はフレーム間でジャンプすることがあります。 これらのエラーはジッタとしてカウントされます。 実際には、男性の声は31-56%のジッタ値を示した。 正常な人間の声のジッターが1%未満であるので、測定の間違いは明らかに支配します。 そのため:同じスピーカー内での相対比較に使用できます。 エラーは均一に適用されますので、ランキングは意味があります。 特に男女間の比較には使用できません。 低い声は均一にdisadvantagedです。 スタイル登録は、同じスピーカーのクリップから選択することを含みますので、このメトリックは目的のためにうまく機能します。 異なる目的(複数の候補から良い声を選ぶ)の重みのある値で同じメトリックを使用する場合、すべての男性候補は負のスコアを受け取ります([[[[スクリーニング-voices-by-metrics-not-ears]を参照してください)。 24の候補者から機械選択「Narrator-like Voices」を選択)。)。 これは、メトリックを誤った場合であり、重量を調整し、他の判断基準を組み込んだ。 品質ゲートの分離 この問題は、「正しい内容」と「きれいな音」が別のゲートを必要とすることを強調した。 ゲートチェック

> 分享: