Обучение и конвейер данных
Схема обучения менее привлекательна, но именно она делает результат стабильным.
Два этапа
Предварительная подготовка: Речевой корпус английского языка в масштабе Интернета. Целью было акустическое покрытие, а не совершенство. Научите модель настоящей речи потокикак слоги перетекают друг в друга.
Тонкая настройка: Кураторские записи студийного уровня. В каждом клипе было:
- Описания, проверенные человеком (возраст голоса, тон, акцент)
- Теги эмоций
- Изменение акцента (американский, британский, ближневосточный и т. д.)
- Вариация ролей (злодей, ведущий, рассказчик)
Все было безжалостно обработано: Передискретизация 24 кГц, нормализация LUFS (-23 LUFS), обрезка тишины с помощью VAD, выравнивание уровня фраз с помощью Montreal Forced Aligner, MinHash-LSH для дедупликации текста и Chromaprint для дедупликации звука.
Каждая секунда этих данных была в кодировке SNAC перед обучением, поэтому модель никогда не видела сигналы напрямую, а только их компактные представления. Вот почему он может транслироваться в режиме реального времени и при этом звучать естественно.
2025-11-06 02:40:00
1762397992
#Maya1 #Первый #TTS #голосовым #дизайном #уже #здесь #Мехул #Гупта #Наука #данных #вашем #кармане #ноябрь
Ещё по этой теме

