Un seul clip rugueux peut ruiner tout le style — Comment choisir 5 bons
A single rough clip can ruin the entire style — How to choose 5 good ones
A l'origine publié (en japonais) sur forge.workstyle.tech. Le TTS que nous utilisons crée des styles émotionnels à partir de "quelques clips représentatifs". Pour un style joyeux, par exemple, passer quelques clips audio joyeux enregistre un vecteur de style moyen. Au début, j'ai simplement passé les cinq premiers clips de chaque groupe : la synthèse avec ce style a donné lieu à des voix enroulées. Chaque phrase, sans faute. Un sur 200 fait une différence La cause était qu'un ou plusieurs clips bruts ont été mélangés avec les cinq que j'ai passés. L'audio généré a une certaine probabilité d'être de mauvaise qualité. Les voix peuvent sonner rugueuses, les emplacements peuvent fluctuer instables, ou les octaves peuvent sauter au milieu de la phrase. Ceux-ci passent toujours la grille de qualité (correspondance de texte) parce que le contenu est lu correctement, donc la rugosité du son va...
A l'origine publié (en japonais) sur forge.workstyle.tech. Le TTS que nous utilisons crée des styles émotionnels à partir de "quelques clips représentatifs". Pour un style joyeux, par exemple, passer quelques clips audio joyeux enregistre un vecteur de style moyen. Au début, j'ai simplement passé les cinq premiers clips de chaque groupe : la synthèse avec ce style a donné lieu à des voix enroulées. Chaque phrase, sans faute. Un sur 200 fait une différence La cause était qu'un ou plusieurs clips bruts ont été mélangés avec les cinq que j'ai passés. L'audio généré a une certaine probabilité d'être de mauvaise qualité. Les voix peuvent sonner rugueuses, les emplacements peuvent fluctuer instables, ou les octaves peuvent sauter au milieu de la phrase. Ceux-ci passent toujours la grille de qualité (correspondance de texte) parce que le contenu est lu correctement, de sorte que la rugosité du son ne se détecte pas. L'ensemble du corpus contient environ 200 clips, donc même si quelques-uns sont mélangés, leur impact sur l'apprentissage global est minime. Cependant, seulement cinq clips sont utilisés pour l'enregistrement de style. Si l'un de ces cinq est rugueux, son impact devient de 20%. Et la dilution dans la moyenne ne fonctionne pas aussi bien que prévu. Les vecteurs de style sont des moyennes dans l'espace d'intégration, mais l'audio rugueux se trouve souvent en dehors de la plage normale dans la direction de la "hoarseness". En moyenne quatre clips normaux avec un aberrant, le centre de gravité est tiré significativement vers l'aberrant. En conséquence, tous les sons synthétisés avec ce style portent une qualité enroulée. La rugosité d'un seul clip se propage à toutes les sorties de ce style. Qu'est-ce qui fait un clip "rough" ? Décomposition de ce qui se sent "rugueux" à l'écoute, j'ai trouvé deux facteurs principaux: Périodes de vibration du cordon vocal instables, entraînant une impression brutale. Sauts d'octave : L'estimation F0 saute à double ou à moitié entre les cadres adjacents. Cela peut être dû à des erreurs réelles de fissuration de la voix ou d'estimateur, mais les deux se manifestent comme « son instable ». Je mesure ces deux facteurs et sélectionne les clips avec les valeurs les plus basses. Les sauts octaves sont pondérés plus fortement (×2.0) parce qu'ils ont un plus grand impact sur la perception. Le jitter est une rugosité continue, tandis que les sauts sont des pauses discrètes qui se distinguent par des « fissures vocales ». Le code d'enregistrement a été modifié pour : À l'exclusion des clips avec segments courts exprimés La partie est subtilement importante. De courtes interjections ("Oui!", "Ok!") ou des phrases avec de nombreux sons non-voilés ("desu shi", "shikkari") peuvent avoir seulement quelques images exprimées. Calculer les jitters à partir de ceux-ci est sans signification et pourrait mal les identifier comme le plus stable en raison du hasard. Les clips injugables sont exclus des candidats. Si moins de cinq clips restent, nous sélectionnons autant que possible. Le jitter est surestimé dans les voix inférieures Cette métrique a une faiblesse connue : l'estimation F0 à l'aide de l'autocorrélation est plus sujette aux erreurs pour les voix inférieures. L'harmonisation peut être confondue avec la fréquence fondamentale, ou l'estimation peut sauter entre les cadres. Ces erreurs sont comptées comme jitter. En pratique, les voix masculines ont montré des valeurs de jitter de 31 à 56 %. Étant donné que la voix humaine normale est inférieure à 1%, l'erreur de mesure domine clairement. Par conséquent: Il peut être utilisé pour des comparaisons relatives au sein du même haut-parleur. Les erreurs sont appliquées uniformément, donc les classements sont significatifs. Il ne peut être utilisé pour les comparaisons entre orateurs, en particulier entre les sexes. Les voix inférieures sont uniformément défavorisées. Puisque l'enregistrement de style implique la sélection à partir de clips du même haut-parleur, cette métrique fonctionne bien à nos fins. Lorsque l'on utilise la même mesure avec des valeurs pondérées à des fins différentes (sélection de bonnes voix de plusieurs candidats), tous les candidats de sexe masculin ont obtenu des notes négatives (voir [[screening-voix-by-metrics-not-ears]). Il s'agissait d'un cas de mauvaise application de la mesure, et nous avons ajusté les pondérations et incorporé d'autres critères de jugement. Séparation des barrières de qualité Cette question a mis en évidence le fait que le « contenu correct » et le « son propre » exigent des portes séparées. Porte Chec