> 返回资讯列表
news_article.exe
📰

Один грубый клип может испортить весь стиль — Как выбрать 5 хороших

A single rough clip can ruin the entire style — How to choose 5 good ones

2026年9月2日6 次浏览来源:Dev.to 阅读原文

Первоначально опубликовано на японском языке на forge.workstyle.tech. TTS, которые мы используем, создают эмоциональные стили из «несколько репрезентативных клипов». Для радостного стиля, например, прохождение нескольких радостных аудиоклипов регистрирует средний вектор стиля. Сначала я просто передал первые пять клипов из каждой группы: Синтезирование с этим стилем приводило к хриплым голосам. Каждое предложение, без сбоев. Один из 200 делает разницу Причиной было то, что один или несколько грубых клипов были смешаны с пятью, которые я прошел. Сгенерированный звук имеет определенную вероятность быть низкого качества. Голоса могут звучать грубо, смолы могут колебаться неустойчиво, или октавы могут прыгать в середине предложения. Они по-прежнему проходят через качественные ворота (соответствие сценария), потому что контент читается правильно, поэтому шероховатость звука идет.

Первоначально опубликовано на японском языке на forge.workstyle.tech. TTS, которые мы используем, создают эмоциональные стили из «несколько репрезентативных клипов». Для радостного стиля, например, прохождение нескольких радостных аудиоклипов регистрирует средний вектор стиля. Сначала я просто передал первые пять клипов из каждой группы: Синтезирование с этим стилем приводило к хриплым голосам. Каждое предложение, без сбоев. Один из 200 делает разницу Причиной было то, что один или несколько грубых клипов были смешаны с пятью, которые я прошел. Сгенерированный звук имеет определенную вероятность быть низкого качества. Голоса могут звучать грубо, смолы могут колебаться неустойчиво, или октавы могут прыгать в середине предложения. Они по-прежнему проходят через качественные ворота (соответствие сценария), потому что содержимое читается правильно, поэтому шероховатость звука остается незамеченной. Весь корпус содержит около 200 клипов, поэтому даже если несколько грубых смешаны, их влияние на общее обучение минимально. Однако для регистрации стиля используются только пять клипов. Если один из этих пяти является грубым, его влияние становится 20%. И разведение в среднем работает не так хорошо, как ожидалось. Векторы стиля являются средними в пространстве встраивания, но грубый звук часто лежит далеко за пределами нормального диапазона в направлении «хриплости». При усреднении четырех нормальных зажимов с одним выбросом центр тяжести значительно притягивается к выбросу. В результате, весь звук, синтезированный с этим стилем, имеет хриплое качество. Грубость одного клипа распространяется на все выходы этого стиля. Что делает клип "грубым"? Разбивая то, что кажется «грубым» при прослушивании, я обнаружил два основных фактора: джиттер (колебание периода): Нестабильные периоды вибрации голосовых связок, приводящие к грубому впечатлению. Октавные прыжки: F0 оценка прыжков, чтобы удвоить или наполовину между соседними кадрами. Это может быть связано с фактическим взломом голоса или ошибками оценки, но оба проявляются как «нестабильный звук». Я измеряю эти два фактора и выбираю клипы с наименьшими значениями. Октавные прыжки весят больше (×2,0), потому что они оказывают большее влияние на восприятие. Джиттер — это непрерывная шероховатость, в то время как прыжки — это дискретные разрывы, которые выделяются как «растрескивание голоса». Регистрационный код был изменен на: Это устранило охриплость. Исключая клипы с короткими озвученными сегментами Эта часть очень важна. Короткие междометия («Да!», «Хорошо!») или предложения со многими неозвученными звуками («десу ши», «шиккари») могут иметь только несколько озвученных кадров. Вычисление дрожания от них бессмысленно и может неправильно идентифицировать их как наиболее устойчивые из-за случайности. Непредвзятые клипы исключаются из числа кандидатов. Если осталось меньше пяти клипов, мы выбираем как можно больше. Jitter переоценен в более низких голосах Эта метрика имеет известную слабость: оценка F0 с использованием автокорреляции более подвержена ошибкам для более низких голосов. Гармоника может быть ошибочно принята за фундаментальную частоту, или оценка может прыгать между кадрами. Эти ошибки считаются дрожью. На практике мужские голоса показали джиттерные значения 31-56%. Поскольку нормальное дрожание человеческого голоса составляет менее 1%, ошибка измерения явно доминирует. Следовательно, он может использоваться для относительных сравнений внутри одного и того же динамика. Ошибки применяются равномерно, поэтому ранжирование имеет смысл. Его нельзя использовать для сопоставления ораторов, особенно между полами. Низкие голоса одинаково невыгодны. Поскольку регистрация стиля включает в себя выбор из клипов одного и того же динамика, эта метрика отлично подходит для наших целей. При использовании одной и той же метрики с взвешенными значениями для разных целей (выбор хороших голосов от нескольких кандидатов) все кандидаты-мужчины получали отрицательные оценки (см. [[скрининг-голоса по метрике-не-уши]]). Это был случай неправильного применения метрики, и мы скорректировали веса и включили другие критерии суждения. Разделение качественных ворот Этот вопрос подчеркнул, что «правильное содержание» и «чистый звук» требуют отдельных ворот. Ворота Чехов

> 分享: