С обратной связью с человеком роботы, управляемые ИИ, лучше и быстрее изучают задачи

Изучая демонстрации и обучаясь как на отзывах человека, так и на своих собственных попытках реального мира, новый протокол обучения на основе AI, разработанный в Калифорнийском университете в Беркли, учит роботов, как выполнять сложные задачи, такие как сборка ремня времени со 100% успешным уровнем. Кредит: Университет Калифорнийского университета – Аи и учебная лаборатория Berkeley Robotics

В Калифорнийском университете в Беркли исследователи в роботизированном ИИ Сергея Левина и учебной лаборатории смотрели на стол, где башня из 39 блоков Jenga стояла идеально сложена. Затем белый и черный робот, его единственная конечность удвоилась, как жираф, сгорбился, увеличился к башне, размахивая черным кожаным кнутом. Благодаря тому, что могло бы показаться случайным зрителем, как чудо физики, кнут ударил именно в подходящем месте, чтобы отправить один блок, летящий из стека, в то время как остальная часть башни оставалась структурно обоснованной.

Эта задача, известная как «Jenga Whipping», является хобби, преследуемое людьми с ловкостью и рефлексами, чтобы справиться с этим. Теперь он был освоен роботами, благодаря роману, методу обучения, основанного на AI, созданного Левином и другими членами команды.

Новая система, называемая Человеческое в петле эффективное обучение роботизированному подкреплению (Hil-serl), есть описано в исследовании Появление 20 августа в журнале Научная робототехникаПолем

Изучая демонстрации и обучаясь как на отзывах человека, так и на своих собственных попытках реального мира, этот протокол обучения учит роботов, как выполнять сложные задачи, такие как Jenga, взбивая со 100% успешным уровнем. Более того, роботов преподаются с впечатляющей скоростью, что позволяет им учиться в течение одного -двух часов, как идеально собрать компьютерную материнскую плату, построить полку и многое другое.

Впервые робот завоевал вызов Jenga Whipping, «который действительно шокировал меня», – сказал первый автор исследования Цзянлан Луо, постдокторский исследователь в Калифорнийском университете в Беркли. «Задача Jenga очень сложна для большинства людей. Я попробовал это с кнутом в руке; у меня был уровень успеха 0%».

В последние годы поле обучения роботов стремилось взломать проблему, как преподавать машины, которые являются непредсказуемыми или сложными, в отличие от одного действия, например, неоднократно поднимая объект из определенного места на конвейере. Чтобы решить этот затруднение, лаборатория Левина сосредоточилась на том, что называется «обучение подкреплению». В обучении подкрепления робот пытается выполнить задачу в реальном мире и, используя обратную связь от камер, учится на своих ошибках, чтобы в конечном итоге овладеть этим мастерством.

Новое исследование добавило вмешательство человека, чтобы ускорить этот процесс. Со специальной мышью, которая контролирует робота, человек может исправить курс робота, и эти исправления могут быть включены в банк пословиц робота. С использованием подкрепление обученияРобот анализирует сумму всех своих попыток – с помощью и неофициальных, успешных и неудачных – чтобы лучше выполнить свою задачу. Ло сказал, что человек должен вмешиваться все меньше и меньше, как робот узнал из опыта.

«Мне нужно было присматривать за роботом, возможно, первые 30% или что -то в этом роде, а затем постепенно я мог бы уделять меньше внимания», – сказал он.

С обратной связью с человеком роботы, управляемые ИИ, лучше и быстрее изучают задачи

Изучая демонстрации и обучаясь как на отзывах человека, так и на своих собственных попытках реального мира, новый протокол обучения на основе AI, разработанный в Калифорнийском университете в Беркли, учит роботов, как выполнять сложные задачи, такие как Jenga Whiping с уровнем успеха на 100%. Кредит: Университет Калифорнийского университета – Аи и учебная лаборатория Berkeley Robotics

Лаборатория поставила свою роботизированную систему через рукавиц сложных задач за пределами дженги. Робот перевернул яйцо в кастрюле; передал объект из одной руки в другую; и собрал материнскую плату, автомобильную панель и ремень ГРМ. Исследователи выбрали эти проблемы, потому что они были разнообразны, и, по словам Ло, представляли «всевозможные неопределенности при выполнении роботизированных задач в сложном реальном мире».

Исследователи также протестировали адаптивность роботов, установив неудачи. Они заставили бы открыть захват, чтобы он сбросил объект или переместил материнскую плату, когда робот пытался установить микрочип, обучая его, чтобы отреагировать на изменяющуюся ситуацию, с которой он может столкнуться за пределами лабораторной среды.

К концу обучения робот может выполнить эти задачи правильно в 100% времени. Исследователи сравнили свои результаты с общим методом «копировать мое поведение», известный как поведенческое клонирование, который был обучен на одинаковом количестве демонстрационных данных; Их новая система сделала роботов быстрее и точнее.

По словам Луо, эти метрики имеют решающее значение, потому что бар для компетенции робота очень высока. Как обычные потребители, так и промышленники не хотят покупать противоречивые роботПолем Luo подчеркнул, что в частности, производственные процессы «сделанные на заказ», такие как те, которые часто используются для электроники, автомобилей и аэрокосмических частей, могут извлечь выгоду из роботов, которые могут надежно и адаптировано изучать ряд задач.

Следующий шаг, по словам Луо,-это предварительно обучать систему с помощью базовых возможностей манипулирования объектами, устранить необходимость изучения их с нуля и вместо этого прогрессировать прямо к приобретению более сложных навыков. Лаборатория также решила провести исследование открытый исходный код чтобы другие исследователи могли использовать и опираться на это.

«Ключевая цель этого проекта-сделать технологию доступной и удобной для пользователя, как iPhone»,-сказал Луо. «Я твердо верю, что чем больше людей, которые смогут его использовать, тем большее влияние мы можем оказать».

Дополнительные авторы исследования включают Чарльза Сюй и Джеффри Ву из Калифорнийского университета в Беркли.

Больше информации:
Jianlan Luo и др. Научная робототехника (2025). Doi: 10.1126/scirobotics.ads5033

Цитирование: С обратной связью с человеком роботы, управляемые ИИ

Этот документ подлежит авторским правам. Помимо каких -либо справедливых сделок с целью частного исследования или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Контент предоставляется только для информационных целей.

2025-08-20 20:54:00


1755763861
#обратной #связью #человеком #роботы #управляемые #ИИ #лучше #быстрее #изучают #задачи

Читайте также

Read more:  Microsoft дает лицевые лица AI Copilot, с которыми вы можете пообщаться

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.