Cosmos Policy достигает 98,5% контроля над роботами за счет одноэтапной видеоадаптации

1769472131
2026-01-26 23:48:00

Исследователи решают задачу оснащения роботов способностью обучаться сложным физическим задачам непосредственно по видео, и новое исследование, проведенное Му Джин Кимом, Ихуай Гао и Цунг-И Линь из NVIDIA, а также Юнхао Ге, Грейс Лам из NVIDIA и др., представляет собой значительный шаг вперед. Их инновационный подход, получивший название Cosmos Policy, упрощает процесс адаптации предварительно обученных видеомоделей в эффективные системы управления роботами, достигая самых современных результатов как на смоделированных, так и на реальных тестах, включая впечатляющий показатель успеха 98,5% на моделировании LIBERO, без необходимости сложных архитектурных изменений или многоэтапного обучения. Научившись генерировать действия роботов в скрытом пространстве видео, Cosmos Policy использует существующее пространственно-временное понимание для планирования успешных траекторий действий и даже совершенствует свои действия на основе опыта, обещая будущее, в котором роботы смогут учиться и адаптироваться с большей легкостью и эффективностью.

Этот инновационный подход превосходит сильную политику распространения, разработанную с нуля, а также существующие политики, основанные на видео, и современные модели «видение-язык-действие», точно настроенные на тех же демонстрациях роботов. Успех команды обусловлен использованием способности предварительно обученной видеомодели моделировать сложные, многомерные, мультимодальные распределения, представляя действия наряду с другими модальностями в рамках единой структуры. Эта работа устанавливает новую парадигму управления роботами, выходящую за рамки многоэтапных процессов обучения и сложных архитектурных дополнений.

Непосредственно настраивая видеомодель для одновременной генерации действий, будущих состояний и значений, Cosmos Policy упрощает процесс обучения, одновременно извлекая выгоду из богатых пространственно-временных априорных данных, присущих видеоданным. Исследователи публикуют код, модели и обучающие данные, способствуя дальнейшим исследованиям и разработкам в сообществе робототехники. Исследование раскрывает мощную синергию между созданием видео и роботизированным управлением, открывая новые возможности для создания более интеллектуальных и адаптируемых роботов. Способность Cosmos Policy планировать траектории действий на основе прогнозируемых будущих состояний представляет собой значительный прогресс в области автономности роботов, потенциально позволяя роботам решать сложные задачи манипулирования с большей эффективностью и надежностью. Этот прорыв не только повышает производительность по установленным критериям, но и демонстрирует многообещающие результаты в реальных сценариях, открывая путь к более универсальным и функциональным роботизированным системам в будущем.

Read more:  Борьба в средней школе Джона Ф. Кеннеди, все это остается в семье

Скрытое распространение для обучения политике роботов

Этот инновационный метод позволяет модели фиксировать сложные распределения действий с поразительной эффективностью. В исследовании использовалась выборка «лучший из N» для планирования путем генерации возможных действий, представления их результирующих будущих состояний и ранжирования этих состояний по прогнозируемому значению, в конечном итоге выполняющего действие с наибольшей ценностью для повышения показателей успеха. Исследователи тщательно собрали демонстрационные данные робота на целевой платформе, используя эти данные для точной настройки предварительно обученной видеомодели и создания возможностей зрительно-моторного контроля и планирования. Команда оценила Cosmos Policy как с помощью моделирования, так и с помощью реальных тестов, добившись высочайшего уровня производительности на LIBERO (средний показатель успеха 98,5%) и RoboCasa (средний показатель успеха 67,1%).

Более того, Cosmos Policy превзошла сильные политики распространения, обученные с нуля, политики на основе видео и современные модели «видения-действия» в сложных задачах бимануального манипулирования, достигнув среднего показателя успеха 93,6%. Примечательно, что исследование продемонстрировало в среднем на 12,5% более высокий уровень выполнения задач в реальных задачах манипулирования, когда Cosmos Policy была дополнена планированием на основе моделей. В качестве основы для этого прорыва ученые использовали модель Cosmos-Predict2-2B-Video2World, скрытую модель распространения видео, использующую пространственно-временной токенизатор VAE Wan2.1, обученную с помощью формулы сопоставления оценок шумоподавления EDM. Эта единая, унифицированная архитектура функционирует одновременно как политика, мировая модель и функция ценностей, что представляет собой значительный прогресс в роботизированном управлении.

Cosmos Policy преуспевает в тестах роботизированного управления

Команда измерила успех в четырех наборах задач LIBERO, продемонстрировав стабильно высокую производительность с показателями 98,1%, 100,0%, 98,2% и 97,6% соответственно. Данные показывают, что Cosmos Policy также преуспевает в моделировании RoboCasa, достигая среднего показателя успеха 67,1% при всего 50 обучающих демонстрациях на задачу, что значительно меньше, чем 300 демонстраций, требуемых конкурирующими методами. Этот прорыв обеспечивает простой одноэтапный процесс постобучения, устраняющий необходимость в сложных архитектурных модификациях, обычно необходимых для адаптации видеомоделей к робототехнике. В частности, в LIBERO Cosmos Policy превзошла Diffusion Policy с показателями успеха 72,4% против 78,3%, Dita с 92,3% против 97,4%, π0 с 94,2% против 96,8% и даже продвинутую UniVLA с 95,2% против 96,5%.

Read more:  Maritime Launch получила от EDC кредит в размере 10 миллионов долларов на строительство космодрома в Новой Шотландии

В исследовании тщательно оценивалась производительность с использованием 101 испытания каждого метода по всем задачам, что обеспечивало справедливое сравнение с фиксированным набором начальных состояний. Кроме того, анализ реальных оценок роботов ALOHA показал, что Cosmos Policy превосходно справляется с высокоточными манипуляциями, такими как захват пакета с застежкой-молнией с точностью до миллиметра, где конкурирующие методы, такие как π0,5 и OpenVLA-OFT+, часто терпят неудачу. Качественные наблюдения показывают, что Cosmos Policy эффективно решает проблемы, связанные с высокой мультимодальностью действий и точным хватом, в то время как другие модели с трудом справляются с такими задачами, как «положить конфеты в миску» и «положить конфеты в пакет с застежкой-молнией». Прогнозы модели мира, уточненные за счет точной настройки данных о внедрении политики, точно предсказали состояния и позволили более эффективно планировать, что в конечном итоге способствовало увеличению успеха эпизодов.

Скрытая диффузия обеспечивает одноступенчатое управление роботом с замечательными

Этот метод позволяет избежать необходимости сложных архитектурных модификаций или многоэтапных процедур обучения, обычно встречающихся в существующих робототехнических приложениях методов генерации видео. Авторы признают, что Cosmos Policy в настоящее время работает лучше всего в условиях, аналогичных обучающим демонстрациям, хотя он демонстрирует высокую производительность даже в сценариях вне распределения, при этом π0,5 показывает немного лучшие результаты в этих конкретных тестах. Исследования абляции показывают, что удаление вспомогательных потерь во время обучения приводит к снижению показателя успеха на 1,5 балла, а обучение модели с нуля приводит к снижению на 3,9 балла, что подчеркивает важность предварительно обученной модели и цели совместного обучения. Будущие исследования могут изучить распространение Cosmo Policy на более сложные роботизированные платформы и задачи, а также изучить методы дальнейшего расширения возможностей обобщения для невидимых сред и сценариев.

Read more:  Подготовительная футбольная звезда Св. Бенедикта отстранена от того, что якобы захватил фотографа

#Cosmos #Policy #достигает #контроля #над #роботами #за #счет #одноэтапной #видеоадаптации

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.