Исследование, проведенное исследователями из Технологического университета Южно -Китайского университета, опубликовало исследовательскую работу в специальном выпуске «Последние достижения в области искусственного интеллекта, генерируемого контентом» Границы информационных технологий и электронных инженерии 2024, вып. 25, № 1. Они предложили инновационный алгоритм поколения музыки, способный создавать полную музыкальную композицию с нуля на основе указанного целевого стиля.
Модели поколения музыки, основанные на правилах, основаны на теоретических знаниях, что затрудняет захват глубоких структур и ограничивая разнообразие результатов. Среди моделей генерации музыки на основе глубокого обучения, генеративные состязательные сети (GAN), вариационные автооходеры (VAE) и трансформаторы имеют свои преимущества, но сталкиваются с такими проблемами, как высокая сложность обучения, недостаточная обработка длинных последовательностей или отсутствие контроля стиля. Хотя исследование генерации музыки на основе стиля представило информацию о стиле, оно не рассматривало структурное осознание модели. Эта статья сочетает в себе структурную осведомленность с интерпретирующей способностью, проведением исследований и проверкой эффективности метода в эмоциях и генерации стиля композитора.
Предлагается модель генерации музыки под управлением стиля, а именно кондиционированная стилем трансформер-ганс (SCTG). Обсуждается важность представления данных, кондиционированного стиля линейного трансформатора и кондиционированного стиля в модели генерации музыки в стиле. Представление данных включает представление последовательностей событий MIDI с вставленной информацией в стиле и сгруппированной музыкальной информацией. Линейный трансформатор с кондиционированным стилем рассматривает ограничения в поколении в стиле музыки путем встраивания информации о стиле, которая непосредственно встроена в скрытое пространство модели и в сочетании с выводами, чтобы влиять на вывод всей последовательности. Преобразование сгенерированной музыки в дискретные оценки усиливает эффект обучения дискриминатора и способствует выражению информации о стиле в генерируемой музыке.
Эксперименты проводились с использованием набора набора данных в стиле эмоций и набора данных в стиле композитора Pianst8, по сравнению с двумя современными моделями. Объективные оценки показали, что предложенная модель достигла наилучших результатов в традиционных показателях, а также на расстоянии стиля (SD) и точности классификации (CA), с выдающейся последовательности стиля сгенерированной музыки и сходства с исходными данными. В субъективных оценках участники дали самые высокие оценки музыке, созданной этой моделью с точки зрения человечества, богатства и общего качества, что указывает на ее потенциал для практического использования.
Основываясь на CP-трансформатора, условия стиля являются инновационными встроенными и внедрены дискриминатором патча в стиле. Сравнения между генератором, подготовленным в стиле, и подготовленным стилем патч-дискриминатором показали, что информация о музыкальном стиле в модели помогает генератору различать музыкальные стили и позволяет создавать музыку определенных стилей. Кроме того, модель работает плохо, когда любая потеря удаляется; Следовательно, как потеря, так и потерь, важны для выполнения кондиционированного стилем дискриминатора патча
Бумага «Поколение музыки с кондиционированным стилем с трансформаторами», созданная Weining Wang, Jiahui Li, Yifan Li и Xiaofen Xing. Полный текст бумаги с открытым доступом:
2025-08-07 07:35:00
1754553306
#Поколение #музыки #кондиционированием #стиля #трансформаторами
Продолжение темы
