Роботизированная рука успешно осваивает 1000 манипуляционных задач за один день

Демонстрация того, как MT3 выполняет долгосрочную задачу по приготовлению и подаче кофе посредством последовательного составления пяти задач с одним взаимодействием. Фото: Камил Дречковски и Пьетро Витьелло.

За последние десятилетия робототехники представили широкий спектр систем, которые могут эффективно решать некоторые реальные проблемы. Однако большинство этих роботов часто плохо справляются с задачами, которым их не обучали, особенно с теми, которые предполагают манипулирование ранее невидимыми объектами или обращение с объектами, с которыми раньше приходилось сталкиваться, новыми способами.

Исследователи из Лаборатории обучения роботов Имперского колледжа Лондона недавно разработали новый подход к имитационному обучению, который может позволить роботам успешно осваивать новые задачи быстрее и без необходимости получения существенных обучающих данных. Используя этот метод, который был введен в документ, опубликованный в Научная робототехникаони смогли научить роботизированную руку выполнять 1000 различных задач за один день.

«Изначально исследование было вдохновлено наша предыдущая работа по передаче траекториигде мы представили метод, который оказался надежным и эффективным для обучения роботов отдельным задачам», — рассказали Tech Xplore Камил Дречковски и Пьетро Витиелло, соавторы статьи.

«Наш руководитель Эдвард Джонс затем поставил перед нами амбициозную, но захватывающую цель: научить робота очень большому количеству задач за минимальное время, а именно «тысяче в день». Учитывая, что наш существующий метод требовал менее минуты на одну задачу и обеспечивал немедленное развертывание без обучения сети после демонстрации, мы считали, что эта цель вполне достижима, если расширить наш метод до многозадачного обучения».







Демонстрация выполнения MT3 задачи по очистке кухонной плиты с большим горизонтом посредством последовательной композиции из четырех задач с одним взаимодействием. Фото: Камил Дречковски и Пьетро Витьелло.

Чтобы решить задачу, поставленную перед ними их руководителем, Джонс, Дречковски и Витьелло сначала провели систематическое исследование фундаментальных предпосылок, влияющих на эффективность имитационного обучения. Целью их исследования в конечном итоге стала оценка эффективности различных вариантов конструкции, позволяющих роботам надежно обучаться нескольким задачам за короткий период времени.

Новый метод улучшения имитационного обучения

Обучение с имитацией предполагает обучение роботов новым навыкам путем демонстрации человеческих демонстраций, видео или других примеров того, как люди решают задачи, которые должен выполнить робот. Несмотря на свою многообещаемость, большинство методов имитационного обучения требуют обширных демонстрационных данных на людях для достижения хороших результатов.

«В конечном итоге, статья была направлена на то, чтобы бросить вызов преобладающему предположению о том, что высокопроизводительные роботизированные системы требуют огромных наборов данных, сложных нейронных политик и больших моделей для масштабного обучения», — сказали Дречковски и Витьелло. «В рамках нашего исследования мы исследовали два основных принципа обучения роботов: декомпозицию траектории и обобщение на основе поиска».







Демонстрация того, как MT3 выполняет долгосрочную задачу по приготовлению и подаче кофе посредством последовательного составления пяти задач с одним взаимодействием. Фото: Камил Дречковски и Пьетро Витьелло.

Первый принцип, который исследователи включили в свой подход, известный как декомпозиция траектории, влечет за собой разделение каждой траектории манипулирования объектом на две фазы. Эти фазы называются фазой согласования и взаимодействия.

«На этапе выравнивания робот позиционирует свой концевой эффектор или захваченный объект относительно целевого объекта — представьте себе, что робот совмещает вилку с розеткой», — объяснили Дречковски и Витиелло.

«Затем, во время фазы взаимодействия, робот выполняет фактическую манипуляцию, например, вставляет вилку в розетку. Эти две фазы предъявляют разные требования, поэтому последовательное использование двух разных политик позволяет на порядок повысить эффективность данных в режиме с низким уровнем демонстрации на каждую задачу».

Второй принцип, на котором основан подход команды, — это обобщение на основе поиска. В отличие от различных других методов глубокого обучения, которые кодируют все поведение в так называемые сетевые веса, их метод хранит все демонстрации в компоненте памяти.

«Во время тестирования этот метод использует языковое описание задачи и наблюдение за окружающей средой, чтобы найти по памяти единственную наиболее подходящую демонстрацию», — сказали Дречковски и Витиелло. «Эта демонстрация затем используется для информирования политики о том, как согласовывать с тестируемым объектом и как с ним взаимодействовать».

Команда робототехников успешно обучила робота выполнению 1000 манипуляционных задач за один день

Демонстрация игры в шахматы в МТ3. Фото: Камил Дречковски и Пьетро Витьелло.

Недавно предложенный командой подход, получивший название MT3 (многозадачная передача траектории), предназначен для получения и декомпозиции демонстрационных данных. Используя стратегию, известную как поиск, он находит демонстрации, соответствующие задаче, которую роботу предлагается выполнить, а затем адаптирует их к целевому объекту и планирует движения робота, используя оценку позы и компонент планирования.

«Для взаимодействия метод просто воспроизводит продемонстрированное движение конечного эффектора», — сказали Дречковски и Витиелло. «Уникальные преимущества этого метода заключаются в том, что он очень эффективен и интерпретируем. Мы обнаружили, что он очень эффективен, когда демонстрация каждой задачи ограничена, и поскольку он основан на оценке позы, пользователи могут визуализировать то, что будет делать робот, прежде чем он выполнит движение. Важно отметить, что робот гарантированно никогда не сделает ничего, что не было явно продемонстрировано».

Обучение роботов различным задачам с небольшим количеством данных

Чтобы проверить потенциал своего подхода к имитационному обучению, команда использовала его для обучения робота Сойера, роботизированной системы, состоящей из одной руки со встроенным захватом и камерой. Примечательно, что им удалось научить робота выполнять 1000 различных манипуляционных задач менее чем за 24 часа, полагаясь на одну демонстрацию на каждое задание. Примечательно, что они также смогли применить эту политику сразу после каждой демонстрации, без необходимости дальнейшего обучения.

«Мы продемонстрировали, что сложное, крупномасштабное обучение роботов возможно без огромных наборов данных и больших нейронных моделей», — сказали Дречковски и Витиелло. «Насколько нам известно, наша работа является первой систематической и крупномасштабной оценкой многозадачного обучения в режиме «несколько демонстраций на одну задачу», устраняя критический пробел в литературе. Наш подход обеспечивает убедительную, эффективную в использовании данных альтернативу традиционной монолитной парадигме поведенческого клонирования».

Новый подход к имитационному обучению, разработанный исследователями, вскоре может быть улучшен и реализован на других роботизированных платформах. В конечном итоге это может способствовать внедрению роботов, которые смогут надежно выполнять более широкий спектр навыков, не требуя обширных обучающих данных.

«Зависимость MT3 от аналитических шагов делает его действия легко интерпретируемыми и заслуживающими доверия, обеспечивая большое преимущество перед природой «черного ящика» многих методов глубокого обучения», — сказали Дречковски и Витьелло.

«Более того, к созданию этого очень эффективного метода привело крупномасштабное исследование множества различных вариантов конструкции. Сравнивая производительность всех этих конструкций при изменении размера набора данных и разнообразия изучаемых задач, мы смогли собрать несколько идей, которые могут быть полезны всем, кто хочет повысить эффективность своих роботов при манипулировании объектами».

В рамках своих следующих исследований Дречковски и Витиелло планируют продолжить разработку эффективных и эффективных стратегий обучения роботов, основанных на данных, которые можно будет мгновенно применить на роботах. Их цель — сократить человеческие усилия и финансовые ресурсы, необходимые в настоящее время для обучения роботов.

«Ключевой областью для улучшения будет отказ от прямого воспроизведения траектории на этапе взаимодействия», — добавили Дречковски и Витьелло. «Мы стремимся изучить методы адаптации траекторий к геометрии объектов и изменения сценариев испытаний, позволяющие роботу более надежно обобщать невидимые вариации, которые требуют большего, чем простое выполнение продемонстрированного движения».

Написано для вас нашим автором Ингрид Фаделлипод редакцией Габи Кларкпроверено фактами и проверено Роберт Иган— эта статья — результат кропотливой человеческой работы. Мы полагаемся на таких читателей, как вы, чтобы сохранить независимую научную журналистику. Если эта отчетность важна для вас, рассмотрите возможность пожертвование (особенно ежемесячно). Вы получите без рекламы аккаунт в знак благодарности.

Дополнительная информация:
Камил Дречковски и др. «Изучение тысячи задач за день». Научная робототехника (2025). DOI: 10.1126/scirobotics.adv7594..

© 2025 Сеть Science X

Цитирование: Роботизированная рука успешно осваивает 1000 манипуляционных задач за один день (17 декабря 2025 г.), получено 17 декабря 2025 г. с https://techxplore.com/news/2025-12-robotic-arm-successful-tasks-day.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2025-12-17 17:30:00


1766000177
#Роботизированная #рука #успешно #осваивает #манипуляционных #задач #за #один #день

По теме

Read more:  Умер Том Стоппард, лауреат премии «Оскар» за фильм «Влюбленный Шекспир»

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.