Новый набор данных и модели RoboReward автоматизируют обучение и оценку роботов

Авторы представляют набор данных и оценку моделей вознаграждения общего назначения для робототехники. Кредит: Ли и др.

Развитие алгоритмов искусственного интеллекта (ИИ) открыло новые возможности для разработки роботов, которые могут надежно решать различные повседневные задачи. Однако обучение и оценка этих алгоритмов обычно требуют значительных усилий, поскольку людям по-прежнему приходится вручную размечать данные обучения и оценивать производительность моделей как в симуляциях, так и в реальных экспериментах.

Исследователи из Стэнфордского университета и Калифорнийского университета в Беркли представили РобоНаграданабор данных для обучения и оценки алгоритмов искусственного интеллекта для робототехнических приложений, в частности моделей, основанных на вознаграждении на языке видения (VLM).

Их статьяопубликовано на arXiv сервер препринтов также представляет RoboReward 4B и 8B, две новые модели VLM, которые были обучены на этом наборе данных и превосходят по производительности другие модели, представленные в прошлом.

«По нашему опыту, обучение автономных роботов обходится дорого, поскольку требует большого количества человеческого труда и вмешательства», — рассказал Tech Xplore Тони Ли, первый автор статьи.

«Одна часть процесса заключается в том, что человеку часто приходится наблюдать и отмечать множество запусков роботов как успешные или неудачные. Мы хотели изучить, могут ли модели языка видения (VLM) автоматизировать часть обучения, выступая в качестве моделей вознаграждения, которые оценивают, насколько хорошо робот выполнил задачу, что позволяет нам обучать политикам роботов с меньшим ручным контролем со стороны человека».

Новый набор данных и модели упрощают обучение и оценку робототехники.

Авторы разработали универсальную модель вознаграждения на языке видения, которая закрывает большую часть разрыва в производительности по сравнению с вознаграждениями, предоставляемыми человеком для реального обучения роботов, как показано на двух задачах (открыть ящик и выбрать и положить обезьяну). Кредит: Ли и др.

RoboReward: новый набор данных и тест

RoboReward, новый набор данных, собранный Ли и его коллегами, содержит множество видеороликов, показывающих, как настоящие роботы выполняют различные реальные задачи, в сочетании с текстовыми описаниями на простом языке и оценками прогресса. Набор данных предназначен для обучения VLM, позволяющего оценивать, насколько хорошо роботы справляются с конкретными задачами.

«Мы создали этот набор данных, дополнив существующие демонстрационные наборы данных успешных роботов реалистичными неудачами и опасностями», — объяснил Ли.

«Затем мы обучили VLM на этих данных, чтобы они могли смотреть видео, как робот выполняет задачу (как указано в описании задачи), и выдавать высококачественный сигнал вознаграждения во время обучения. И что самое приятное, мы открыли исходный код всего в духе открытой науки, включая набор данных, набор оценок, обученные модели и таблицу лидеров».

Используя набор данных RoboReward, Ли и его коллеги обучили два новых VLM общего назначения для робототехнических приложений. Было обнаружено, что обе эти модели работают очень хорошо, поскольку позволяют роботам быстро и надежно приобретать новые навыки без необходимости постоянной обратной связи с человеком.

«Мы также представили RoboRewardBench, проверенный человеком пакет оценки», — сказал Ли. «Этот тест показывает, что сегодняшние передовые модели все еще не так надежны, как модели автоматического вознаграждения в разных вариантах и сценах, поскольку физическое обоснование этих моделей остается большой проблемой.

«Было обнаружено, что RoboReward 4B и 8B превосходят гораздо более крупные современные VLM (например, Gemini Robotics-ER 1.5) по точности вознаграждения (полная таблица лидеров для RoboRewardBench можно найти на нашем сайте, где RoboReward 8B считается топ-моделью). Наша обученная модель также устраняет большую часть разрыва в производительности по сравнению с обучением с вознаграждением, предоставляемым человеком в реальных экспериментах с роботами».

Новый набор данных и модели упрощают обучение и оценку робототехники.

Авторы разработали универсальную модель вознаграждения на языке видения, которая закрывает большую часть разрыва в производительности по сравнению с вознаграждениями, предоставляемыми человеком для реального обучения роботов, как показано на двух задачах (открыть ящик и выбрать и положить обезьяну). Кредит: Ли и др.

Содействие развитию моделей языка видения робототехники

Набор данных RoboReward и модели, разработанные этой исследовательской группой, имеют открытый исходный код и доступны на сайт команды.

В будущем они могли бы руководить разработкой новых моделей, которые учат роботов выполнять задачи с помощью процессов, основанных на вознаграждении, а также позволяют разработчикам надежно оценивать свои алгоритмы.

«Мы надеемся, что эта работа послужит основой для разработки новых моделей вознаграждения общего назначения для робототехники, которые смогут автоматизировать некоторые части обучения роботов», — добавил Ли.

«Заглядывая в будущее, мы хотим расширить моделирование вознаграждения на задачи с более длительным горизонтом и сделать автоматические модели вознаграждения более надежными и калиброванными при их использовании в реальных условиях обучения. Мы также надеемся, что RoboReward мотивирует более широкие улучшения в больших моделях языка видения, чтобы они стали лучше в физическом рассуждении и понимании мелких пространственных и временных деталей».

Написано для вас нашим автором Ингрид Фаделлипод редакцией Габи Кларкпроверено фактами и проверено Роберт Иган— эта статья — результат кропотливой человеческой работы. Мы полагаемся на таких читателей, как вы, чтобы сохранить независимую научную журналистику. Если эта отчетность важна для вас, рассмотрите возможность пожертвование (особенно ежемесячно). Вы получите без рекламы аккаунт в знак благодарности.

Дополнительная информация:
Тони Ли и др., RoboReward: универсальные модели вознаграждения на языке видения для робототехники, arXiv (2026). DOI: 10.48550/arxiv.2601.00675

Информация журнала:
arXiv


© 2026 Сеть Science X

Цитирование: Новый набор данных и модели RoboReward автоматизируют обучение и оценку роботов (15 января 2026 г.), получено 15 января 2026 г. с https://techxplore.com/news/2026-01-roboreward-dataset-automate-robotic.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2026-01-15 12:30:00


1768537318
#Новый #набор #данных #модели #RoboReward #автоматизируют #обучение #оценку #роботов

По теме

Read more:  MLB》В эпоху, когда среднестатистический человек имеет от семи до восьми типов полей, революция в выборе типов мячей охватывает высшие лиги.

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.