Сбои в игровом процессе улучшают физическое понимание искусственного интеллекта на 3,7%

1769594749
2026-01-28 09:58:00

Ученые решают давнюю проблему наделения искусственного интеллекта четким пониманием того, как устроен физический мир. Мэн Цао, Хаоран Тан и Хаозе Чжао из Университета искусственного интеллекта Мохамеда бен Заида и Пекинского университета вместе с Минфэй Ханем, Руян Лю, Цян Суном и другими представляют новый подход, использующий неожиданные сбои в игровых видеороликах для обучения машин физике. Это исследование важно, потому что оно обходит дорогостоящие аннотации реальных кадров или ограничения синтетических данных, вместо этого используя легкодоступные аномалии игрового процесса в качестве масштабируемого источника контроля. Представляя набор данных PhysGame, содержащий более 140 000 вопросов и ответов, ориентированных на сбои, а также тест GameBench, команда демонстрирует существенное улучшение возможностей физического мышления, достигая прироста как в реальном мире, так и в общей переносимости, что является важным шагом на пути к более интуитивно понятным и надежным системам искусственного интеллекта.

Исследователи представляют PhysGame, новый набор данных для настройки инструкций, включающий 140 057 пар вопросов и ответов, ориентированных на сбои, охватывающий пять физических областей и шестнадцать детальных категорий, предлагающий масштабируемый источник контроля для понимания физического мира. Эта работа решает основную проблему в области искусственного интеллекта: достижение человеческого понимания динамики объектов, свойств материалов и причинно-следственных взаимодействий, несмотря на недавние достижения в области мультимодальных моделей большого языка. Существующие наборы данных для физических рассуждений обычно основаны на дорогостоящих видеороликах реального мира или упрощенном синтетическом моделировании, оба из которых имеют ограничения в реализме и масштабируемости; PhysGame обходит эти проблемы, фокусируясь на визуальных аномалиях, которые нарушают установленные физические законы.

Команда достигла этого прорыва, разработав стратегию подсказок, которая использует метаданные игрового процесса, такие как названия и описания, для обеспечения высококачественной генерации вопросов и ответов, тем самым гарантируя точность данных. В дополнение к PhysGame исследователи создали GameBench, экспертно аннотированный тест, состоящий из 880 видеороликов игрового процесса с выявленными сбоями, специально предназначенных для оценки физических способностей мышления. Обширные эксперименты показывают, что PhysGame значительно улучшает как переносимость Game2Real, повышая реальную производительность физических рассуждений Qwen2.5-VL на 2,5% в PhysBench, так и переносимость Game2General, что дает прирост на 1,9% в тесте MVBench. Более того, модели, настроенные с помощью PhysGame, демонстрируют существенное абсолютное улучшение на 3,7% по сравнению с GameBench, демонстрируя повышенную надежность в обнаружении физических неправдоподобностей.
Эти результаты показывают, что обучение на аномалиях игрового процесса обеспечивает масштабируемый и эффективный путь к улучшению понимания физического мира в мультимодальном интеллекте. Исследование раскрывает метод, с помощью которого выявление отклонений от ожидаемого физического поведения обостряет понимание основных принципов, отражая философскую концепцию «Порядка из хаоса». Эксперименты показывают, что Qwen2-VL-7B при обучении с помощью PhysGame достигает 50 баллов по MMVU, 70 баллов по Video-MME и 66,4 баллов по MVBench, демонстрируя стабильное улучшение производительности в последующих тестах как для реального физического понимания, так и для общих задач понимания видео. Это исследование устанавливает новую парадигму обучения ИИ, предлагая многообещающий путь для преодоления разрыва между нынешними возможностями MLLM и физической интуицией человеческого уровня.

Read more:  Календарь ленивца на 2025 год, дверь 18 – Технология ленивца

Создание набора данных PhysGame на основе сбоев игрового процесса представляет собой уникальную

Ученые впервые разработали новую методологию, использующую сбои в игровых видеороликах, для создания PhysGame — крупномасштабного набора данных для настройки инструкций, включающего 140 057 пар вопросов и ответов, ориентированных на сбои, охватывающих пять физических областей и шестнадцать детальных категорий. Исследовательская группа тщательно курировала эти пары, сосредоточив внимание на визуальных аномалиях, которые явно нарушают установленные физические законы, тем самым обеспечивая мощный контрольный сигнал для улучшения понимания физического мира с помощью искусственного интеллекта. Чтобы обеспечить точность и качество генерируемых данных вопросов-ответов, они разработали стратегию подсказок на основе метаинформации, используя метаданные игрового процесса, в частности заголовки и описания, для управления созданием высококачественных экземпляров контроля качества. В экспериментах в качестве основного источника данных использовались видеоролики игрового процесса, что позволило избежать высоких затрат на аннотации, связанных с кадрами из реального мира, и ограниченного реализма, часто встречающегося в синтетических симуляциях.

Затем команда разработала систему для автоматического выявления и изоляции событий сбоев в этих видеороликах, а затем сформулировала вопросы, предназначенные для проверки понимания представленной физической неправдоподобности. Этот подход позволяет создать масштабируемый набор данных без обширной ручной разметки, что является значительным шагом вперед по сравнению с существующими методами. Кроме того, в ходе исследования был создан GameBench, специальный тест, состоящий из 880 профессионально аннотированных видеороликов игрового процесса, демонстрирующих сбои, специально разработанный для оценки физических возможностей мультимодальных моделей. Исследователи тщательно проверили эффективность PhysGame, настроив модель Qwen2.5-VL и оценив ее производительность как в задачах переносимости Game2Real, так и в Game2General.

Модель Qwen2.5-VL после обучения с помощью PhysGame продемонстрировала улучшение производительности физических рассуждений в реальных условиях на 2,5% в тесте PhysBench, что указывает на улучшенную способность к обобщению моделируемых сред на реальные. Кроме того, модель, настроенная с помощью PhysGame, показала прирост на 1,9% по сравнению с тестом MVBench, продемонстрировав улучшенную производительность при выполнении общих задач по распознаванию видео. Примечательно, что модели, обученные на PhysGame, продемонстрировали существенное абсолютное улучшение на 3,7% на GameBench, подтверждая повышенную надежность в обнаружении физической неправдоподобности в кадрах игрового процесса. Эта методологическая инновация, использующая сбои в качестве обучающего сигнала, обеспечивает масштабируемый и эффективный путь к улучшению понимания физического мира с помощью мультимодального интеллекта, предлагая многообещающую альтернативу традиционным методам сбора данных и аннотирования.

Read more:  Game Pass раскрыл ряд игр в первой половине августа

Набор данных PhysGame улучшает физические рассуждения в ИИ, позволяя

Ученые представили PhysGame, новый набор данных для настройки инструкций, содержащий 140 057 пар вопросов и ответов, ориентированных на сбои, чтобы улучшить понимание физического мира в искусственном интеллекте. Этот набор данных фокусируется на визуальных аномалиях и сбоях в игровых видеороликах, предлагая масштабируемый источник контроля для изучения физических принципов. Исследовательская группа разработала PhysGame с учетом пяти физических областей: механики, оптики, свойств материалов, термодинамики и электромагнетизма, а также шестнадцати более мелких категорий, таких как гравитация и скорость. Чтобы обеспечить точность данных, была разработана стратегия подсказок, в которой используются метаданные игрового процесса, такие как заголовки и описания, для обеспечения качественного формирования вопросов и ответов.

Эксперименты показали, что модели, обученные на PhysGame, значительно улучшают переносимость Game2Real, улучшая реальную производительность физических рассуждений Qwen2.5VL на 2,5% по тесту PhysBench. Команда зафиксировала увеличение производительности с 46,6% до 49,1% на PhysBench, продемонстрировав эффективность обучения на смоделированных, но физически неправдоподобных сценариях. В дополнение к PhysGame исследователи создали GameBench, тест с комментариями экспертов, включающий 880 видеороликов игрового процесса с выявленными сбоями и предназначенный для тщательной оценки способностей физического мышления. Данные показывают, что модели, настроенные с помощью PhysGame, достигают абсолютного улучшения на 3,7% по сравнению с GameBench, что указывает на повышенную надежность в обнаружении физической неправдоподобности в кадрах игрового процесса.

Более того, исследование демонстрирует высокую переносимость Game2General, что дает прирост на 1,9% по сравнению с тестом MVBench. Это говорит о том, что физические знания, полученные из видеороликов игрового процесса, можно обобщить для решения более широких задач по пониманию видео. Ученые зафиксировали абсолютное улучшение средней точности на 6,3% на GameBench при использовании Qwen2-VL после обучения с использованием набора данных PhysGame. Эти результаты подтверждают, что обучение на аномалиях игрового процесса предлагает масштабируемый и эффективный путь к развитию мультимодального интеллекта и более глубокому пониманию физического мира. Работа подчеркивает потенциал использования легкодоступных кадров игрового процесса и автоматического обнаружения сбоев для создания крупномасштабных наборов данных для обучения ИИ. Измерения подтверждают, что этот подход позволяет избежать высоких затрат на аннотации, связанных с реальными видеоданными, и ограниченного реализма чисто синтетического моделирования. Этот прорыв открывает новую парадигму физического мышления, предлагая многообещающее направление для будущих исследований в области искусственного интеллекта и робототехники.

Read more:  Как фокусники манипулируют нашим мозгом? - Вокруг вопроса журнал всех наук

Набор данных PhysGame расширяет возможности реального физического рассуждения

Ученые разработали новый набор данных PhysGame, чтобы улучшить понимание физического мира мультимодальных моделей большого языка (MLLM). Этот набор данных включает 140 057 пар вопросов и ответов, посвященных сбоям в игровых видеороликах, что представляет собой масштабируемый источник контроля при изучении физики. В дополнение к этому исследователи создали GameBench — эталонный тест из 880 видео с выявленными сбоями, используемый для оценки способностей к физическому мышлению. Ключевое достижение заключается в использовании визуальных аномалий, сбоев в кадрах игрового процесса для обучения моделей распознаванию нарушений физических законов. Эксперименты показывают, что обучение моделей с помощью PhysGame повышает их способность переносить знания из смоделированных игр в реальные сценарии (Game2Real), повышая производительность PhysBench на 2,5%.

Кроме того, набор данных также улучшает общие возможности понимания видео (Game2General) с приростом на 1,9% по сравнению с тестом MVBench и повышает надежность выявления физических неправдоподобностей в GameBench на 3,7%. Авторы признают, что, как и все наборы данных, эффективность PhysGame связана с качеством и разнообразием исходных игровых видеороликов. Будущие исследования могут расширить набор данных, включив в него более широкий спектр игровых жанров и визуальных стилей, что потенциально еще больше улучшит обобщение. Эта работа позиционирует PhysGame как ценный инструмент для оснащения MLLM более надежными физическими рассуждениями и обобщающим пониманием, предлагая многообещающий путь к более интеллектуальным искусственным системам.

#Сбои #игровом #процессе #улучшают #физическое #понимание #искусственного #интеллекта #на

Читайте также

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.