Microsoft раскрывает Vibevoice для более длинного разговорного звука ИИ

1756854560
2025-09-02 22:46:00

Microsoft имеет выпущенный Vibevoice, новая модель искусственного интеллекта с открытым исходным кодом (ИИ), которая позволяет пользователям создавать подкасты и другой аудио-счетчик GoogleПопулярно NotebooklmПолем

Но есть заметные различия. Модель текста до речи Microsoft может генерировать четыре голоса и до 90 минут речи качества подкаста. Notebooklm может сделать два голоса.

Кроме того, Vibevoice читает и организует текст, в то время как Notebooklm Ingests документирует и превращает их в подкасты из двух человек. Пользователи также могут запрашивать и получить резюме документов, согласно технологической фирме Обнимающееся лицоПолем

Это означает, что Vibevoice не пытается понять текст, а скорее выполняет его слышно, якобы, чтобы заменить студию звукозаписи.

Vibevoice – это последнее предложение в технологии Voice AI, которая привлекает финансирование венчурного капитала.

В 2024 году стартапы Voice AI поднятый 2,1 млрд. Долл. США, чем в восемь раз от предыдущего года, по данным исследований рынка CB InsightsПолем Растут заинтересован в голосовом магазине: отчет PYMNTS Intelligence показывает, что 30,4% потребителей Gen Z уже совершают покупки каждую неделю, а затем Millennials. Для всех возрастов среднее значение составляет 17,9% потребителей, использующих голос для покупок.

Vibevoice работает по 1,5 миллиарда параметров, относительно невелико для модели, способной поддерживать диалог для нескольких динамиков.

Он был обучен с использованием с открытым исходным кодом Alibaba QWEN2.5, большой языковой модели, которая помогает организовать естественные поворотные и контекстные речевые модели во время диалогов.

Microsoft утверждает, что это означает, что vibevoice может провести плавные разговоры между четырьмя голосами и все же сохранять различные характеристики каждого голоса, даже в более длинных разговорах.

Read more:  201 предложение Черной пятницы, которое вы еще можете получить

Как использовать Vibevoice

Потенциальные приложения для исследования Vibevoice включают следующее:

Прототипирование подкастов и обучающего контента

  • Создатели могут генерировать макет подкасты, панельные дискуссии или учебные модули с несколькими голосами ИИ. Вместо того, чтобы нанимать четырех голосовых актеров для тестирования потока диалога, пользователи могут создавать синтетическую версию за считанные минуты, используя текст.

Доступность и образование

  • Образовательные материалы, учебники или исследовательские работы могут быть превращены в длинноформную аудио с различными рассказчиками. Это может помочь людям, которые учатся лучше, слушая или сделать густой материал более увлекательным.

Развитие игры и медиа

  • Разработчики игр или рассказчики могут использовать Vibevoice для прототипа диалога между персонажами. Поскольку он справляется с четырьмя динамиками, вы можете поставить полный разговор в игре без сеансов записи.

Признавая риски Deepfakes, Microsoft сказала, что гарантия Vibevoice включают в себя обеспечение того, чтобы каждый звуковой файл включал в себя как отказ от ответственности, например, «этот сегмент был создан ИИ» – и скрытый цифровой водяной знак.

Он запрещает подражанию, дезинформации и Live DeepFake, например, преобразование голоса в реальном времени в вызовах. На данный момент он поддерживает только английскую и китайскую речь. Модель доступна для исследований, а не коммерческого развертывания.

Никто не говорит: голосовые интерфейсы с препятствиями для широкого усыновления

Партнер AWS и Vonage для распространения «естественных звучащих» AI-голосовых агентов

Мета, чтобы сделать ставку на Voice Ai Startup Playai

#Microsoft #раскрывает #Vibevoice #для #более #длинного #разговорного #звука #ИИ

Ещё по этой теме

Read more:  Следующие несколько недель для «Айлендерс» могут оказаться рискованными — вот как сориентироваться

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.