Maya1: Первый TTS с голосовым дизайном AI уже здесь! | Мехул Гупта | Наука о данных в вашем кармане | ноябрь 2025 г.

Обучение и конвейер данных

Схема обучения менее привлекательна, но именно она делает результат стабильным.

Два этапа

Предварительная подготовка: Речевой корпус английского языка в масштабе Интернета. Целью было акустическое покрытие, а не совершенство. Научите модель настоящей речи потокикак слоги перетекают друг в друга.

Тонкая настройка: Кураторские записи студийного уровня. В каждом клипе было:

  • Описания, проверенные человеком (возраст голоса, тон, акцент)
  • Теги эмоций
  • Изменение акцента (американский, британский, ближневосточный и т. д.)
  • Вариация ролей (злодей, ведущий, рассказчик)

Все было безжалостно обработано: Передискретизация 24 кГц, нормализация LUFS (-23 LUFS), обрезка тишины с помощью VAD, выравнивание уровня фраз с помощью Montreal Forced Aligner, MinHash-LSH для дедупликации текста и Chromaprint для дедупликации звука.

Каждая секунда этих данных была в кодировке SNAC перед обучением, поэтому модель никогда не видела сигналы напрямую, а только их компактные представления. Вот почему он может транслироваться в режиме реального времени и при этом звучать естественно.

2025-11-06 02:40:00


1762397992
#Maya1 #Первый #TTS #голосовым #дизайном #уже #здесь #Мехул #Гупта #Наука #данных #вашем #кармане #ноябрь

Ещё по этой теме

Read more:  Во время открытия статуи Пэт Райли напоминает «Лейкерс» о ключах к победе

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.