Cosmos Policy достигает 98,5% контроля над роботами за счет одноэтапной видеоадаптации

1769472131
2026-01-26 23:48:00

Исследователи решают задачу оснащения роботов способностью обучаться сложным физическим задачам непосредственно по видео, и новое исследование, проведенное Му Джин Кимом, Ихуай Гао и Цунг-И Линь из NVIDIA, а также Юнхао Ге, Грейс Лам из NVIDIA и др., представляет собой значительный шаг вперед. Их инновационный подход, получивший название Cosmos Policy, упрощает процесс адаптации предварительно обученных видеомоделей в эффективные системы управления роботами, достигая самых современных результатов как на смоделированных, так и на реальных тестах, включая впечатляющий показатель успеха 98,5% на моделировании LIBERO, без необходимости сложных архитектурных изменений или многоэтапного обучения. Научившись генерировать действия роботов в скрытом пространстве видео, Cosmos Policy использует существующее пространственно-временное понимание для планирования успешных траекторий действий и даже совершенствует свои действия на основе опыта, обещая будущее, в котором роботы смогут учиться и адаптироваться с большей легкостью и эффективностью.

Этот инновационный подход превосходит сильную политику распространения, разработанную с нуля, а также существующие политики, основанные на видео, и современные модели «видение-язык-действие», точно настроенные на тех же демонстрациях роботов. Успех команды обусловлен использованием способности предварительно обученной видеомодели моделировать сложные, многомерные, мультимодальные распределения, представляя действия наряду с другими модальностями в рамках единой структуры. Эта работа устанавливает новую парадигму управления роботами, выходящую за рамки многоэтапных процессов обучения и сложных архитектурных дополнений.

Непосредственно настраивая видеомодель для одновременной генерации действий, будущих состояний и значений, Cosmos Policy упрощает процесс обучения, одновременно извлекая выгоду из богатых пространственно-временных априорных данных, присущих видеоданным. Исследователи публикуют код, модели и обучающие данные, способствуя дальнейшим исследованиям и разработкам в сообществе робототехники. Исследование раскрывает мощную синергию между созданием видео и роботизированным управлением, открывая новые возможности для создания более интеллектуальных и адаптируемых роботов. Способность Cosmos Policy планировать траектории действий на основе прогнозируемых будущих состояний представляет собой значительный прогресс в области автономности роботов, потенциально позволяя роботам решать сложные задачи манипулирования с большей эффективностью и надежностью. Этот прорыв не только повышает производительность по установленным критериям, но и демонстрирует многообещающие результаты в реальных сценариях, открывая путь к более универсальным и функциональным роботизированным системам в будущем.

Read more:  Samsung предлагает заманчивую сделку по предварительному заказу новым пользователям гарнитуры XR на фоне запуска M5 Vision Pro

Скрытое распространение для обучения политике роботов

Этот инновационный метод позволяет модели фиксировать сложные распределения действий с поразительной эффективностью. В исследовании использовалась выборка «лучший из N» для планирования путем генерации возможных действий, представления их результирующих будущих состояний и ранжирования этих состояний по прогнозируемому значению, в конечном итоге выполняющего действие с наибольшей ценностью для повышения показателей успеха. Исследователи тщательно собрали демонстрационные данные робота на целевой платформе, используя эти данные для точной настройки предварительно обученной видеомодели и создания возможностей зрительно-моторного контроля и планирования. Команда оценила Cosmos Policy как с помощью моделирования, так и с помощью реальных тестов, добившись высочайшего уровня производительности на LIBERO (средний показатель успеха 98,5%) и RoboCasa (средний показатель успеха 67,1%).

Более того, Cosmos Policy превзошла сильные политики распространения, обученные с нуля, политики на основе видео и современные модели «видения-действия» в сложных задачах бимануального манипулирования, достигнув среднего показателя успеха 93,6%. Примечательно, что исследование продемонстрировало в среднем на 12,5% более высокий уровень выполнения задач в реальных задачах манипулирования, когда Cosmos Policy была дополнена планированием на основе моделей. В качестве основы для этого прорыва ученые использовали модель Cosmos-Predict2-2B-Video2World, скрытую модель распространения видео, использующую пространственно-временной токенизатор VAE Wan2.1, обученную с помощью формулы сопоставления оценок шумоподавления EDM. Эта единая, унифицированная архитектура функционирует одновременно как политика, мировая модель и функция ценностей, что представляет собой значительный прогресс в роботизированном управлении.

Cosmos Policy преуспевает в тестах роботизированного управления

Команда измерила успех в четырех наборах задач LIBERO, продемонстрировав стабильно высокую производительность с показателями 98,1%, 100,0%, 98,2% и 97,6% соответственно. Данные показывают, что Cosmos Policy также преуспевает в моделировании RoboCasa, достигая среднего показателя успеха 67,1% при всего 50 обучающих демонстрациях на задачу, что значительно меньше, чем 300 демонстраций, требуемых конкурирующими методами. Этот прорыв обеспечивает простой одноэтапный процесс постобучения, устраняющий необходимость в сложных архитектурных модификациях, обычно необходимых для адаптации видеомоделей к робототехнике. В частности, в LIBERO Cosmos Policy превзошла Diffusion Policy с показателями успеха 72,4% против 78,3%, Dita с 92,3% против 97,4%, π0 с 94,2% против 96,8% и даже продвинутую UniVLA с 95,2% против 96,5%.

Read more:  Meta, TikTok и YouTube предстанут перед судом по обвинениям молодежи в зависимости

В исследовании тщательно оценивалась производительность с использованием 101 испытания каждого метода по всем задачам, что обеспечивало справедливое сравнение с фиксированным набором начальных состояний. Кроме того, анализ реальных оценок роботов ALOHA показал, что Cosmos Policy превосходно справляется с высокоточными манипуляциями, такими как захват пакета с застежкой-молнией с точностью до миллиметра, где конкурирующие методы, такие как π0,5 и OpenVLA-OFT+, часто терпят неудачу. Качественные наблюдения показывают, что Cosmos Policy эффективно решает проблемы, связанные с высокой мультимодальностью действий и точным хватом, в то время как другие модели с трудом справляются с такими задачами, как «положить конфеты в миску» и «положить конфеты в пакет с застежкой-молнией». Прогнозы модели мира, уточненные за счет точной настройки данных о внедрении политики, точно предсказали состояния и позволили более эффективно планировать, что в конечном итоге способствовало увеличению успеха эпизодов.

Скрытая диффузия обеспечивает одноступенчатое управление роботом с замечательными

Этот метод позволяет избежать необходимости сложных архитектурных модификаций или многоэтапных процедур обучения, обычно встречающихся в существующих робототехнических приложениях методов генерации видео. Авторы признают, что Cosmos Policy в настоящее время работает лучше всего в условиях, аналогичных обучающим демонстрациям, хотя он демонстрирует высокую производительность даже в сценариях вне распределения, при этом π0,5 показывает немного лучшие результаты в этих конкретных тестах. Исследования абляции показывают, что удаление вспомогательных потерь во время обучения приводит к снижению показателя успеха на 1,5 балла, а обучение модели с нуля приводит к снижению на 3,9 балла, что подчеркивает важность предварительно обученной модели и цели совместного обучения. Будущие исследования могут изучить распространение Cosmo Policy на более сложные роботизированные платформы и задачи, а также изучить методы дальнейшего расширения возможностей обобщения для невидимых сред и сценариев.

Read more:  Мозговая активность может предсказать, станут ли незнакомцы друзьями

#Cosmos #Policy #достигает #контроля #над #роботами #за #счет #одноэтапной #видеоадаптации

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.