18 идей от массовых голосовых моделей — от диффузии TTS Voice Design до создания корпуса обучения и ловушек ворот качества
18 Insights from Mass-Producing Voice Models — From Diffusion TTS Voice Design to Training Corpus Creation and Quality Gate Pitfalls
Первоначально опубликовано на японском языке на forge.workstyle.tech. Это запись проектирования голосов из однострочных подписей, автоматического создания учебного корпуса и передачи всех 12 ролевых голосов (рассказчик / консультант / продавец / представитель / оператор / MC как для мужчин, так и для женщин) через полный контроль. Я писал о неудачах, с которыми столкнулся примерно за один месяц фактической работы, разделившись на 18 статей. Эта статья является таблицей содержания. Конструкция Conclusion Upfront Voice, производство голоса и голосовая работа — это разные технологии с разными сбоями. Дизайн использует диффузию TTS. Голос определяется подписью и случайным семенем, что делает его полностью воспроизводимым. Производство — это прежде всего производство корпуса. Дизайн качественных ворот напрямую...
Первоначально опубликовано на японском языке на forge.workstyle.tech. Это запись проектирования голосов из однострочных подписей, автоматического создания учебного корпуса и передачи всех 12 ролевых голосов (рассказчик / консультант / продавец / представитель / оператор / MC как для мужчин, так и для женщин) через полный контроль. Я писал о неудачах, с которыми столкнулся примерно за один месяц фактической работы, разделившись на 18 статей. Эта статья является таблицей содержания. Конструкция Conclusion Upfront Voice, производство голоса и голосовая работа — это разные технологии с разными сбоями. Дизайн использует диффузию TTS. Голос определяется подписью и случайным семенем, что делает его полностью воспроизводимым. Производство — это прежде всего производство корпуса. Дизайн качественных ворот напрямую определяет качество голоса. Операция опирается на легкие предварительно обученные модели. Диффузия TTS слишком медленная для разговора (в 2,5 раза медленнее на том же GPU). Самый большой урок сводится к одному: наличие качественных ворот и их эффективность — это две разные вещи. Шесть из этих 18 статей посвящены воротам, которые существовали, но не были эффективными. Порядок чтения Статьи расположены в порядке проектирования → изготовления → инспекции → эксплуатации. Чтение сверху проведет вас по пути создания и развертывания одного голоса в производство. Глава 1: Дизайн — Как определить голос, выбранный TTS для качества звука был слишком медленным для разговора Разница в 2,5 раза в реальном времени (RTF) Как мы остановились на двухэтапном подходе: проектировании голосов с диффузией TTS и использовании предварительно обученных моделей для речи. Рисование голосов, как голоса Гача, определяется подписями и случайными семенами. Сохраняя реестр дизайнерских ценностей, голоса могут быть воссозданы, даже если модель потеряна. Позволить машине выбирать «голоса, подобные рассказчикам» из 24 кандидатов, слушая всех кандидатов, неустойчиво. Автоматически измеряйте скорость речи, интонацию и стабильность, чтобы слушать только лучших кандидатов. Кроме того, история о том, как все кандидаты-мужчины были исключены из-за метрических ограничений. Глава 2: Производство — качество корпуса напрямую становится голосом: чем жестче качественные ворота, тем более монотонными выживают дублеры Причина, по которой все тело, наполненное эмоциями, стало монотонным, заключалась в самих качественных воротах. Это центральная история этого сериала. Скорость речи не может быть изменена после окончания обучения, и частота речи запекается в корпус. Они не могут быть скорректированы с помощью параметров синтеза. TTS, который меняет «Запись местоположения» Каждый раз Даже с одной и той же моделью и динамиком частотные характеристики отличаются для каждого клипа. Если они не стандартизированы, переключение стилей приводит к несовместимому качеству звука. Если один из пяти клипов грубый, весь стиль становится хриплым. Разведение в среднем не помогает. Глава 3: Инспекция — наличие ворот и их эффективность отличаются от привычки ИИ растягивать «привет»? Проверка отбрасывала длинные гласные из-за нормализации кана, делая дефект принципиально незаметным. «A Little» становится «Shomo» Модель и параметры были в порядке, но входной текст был нарушен. Список удаления символов включал в себя такие символы, как «".», «".» и «".». Кодекс гвардии галлюцинаций не сработал только во время галлюцинаций Однолинейная ошибка делала охрану неэффективной только в необходимых ситуациях. «Три персонажа» Разрешенные Quality Gate стали вербальным Тиком Размер проходящих через ворота соответствовал размеру звука, воспроизводимого моделью. Отклонение кандидатов на исправленные дефекты Измеряет ли метрика характеристики продукта или состояние процесса? Дефекты, невидимые при проверке транскрипции STT, пропускают 0,1-секундные аддитивные звуки с тишиной между ними. Захватите их с конвертами формы волны. Глава 4 Операция — Запуск в качестве фабрики 70 минут учебного материала, потерянного при отключении сети Blink One, привел к 205 повторным запросам. Поиск области