Агенты OpenClaw могут быть вовлечены в самосаботаж из-за чувства вины

В прошлом месяце исследователи Северо-Восточного университета пригласили группу Агенты OpenClaw присоединиться к их лаборатории. Результат? Полный хаос.

Вирусный ИИ-помощник широко известен как преобразующая технология, а также как потенциальная угроза безопасности. Эксперты отмечают, что такие инструменты, как OpenClaw, которые предоставляют моделям искусственного интеллекта свободный доступ к компьютеру, можно обманом заставить раскрыть личную информацию.

Исследование северо-восточной лаборатории идет еще дальше, показывая, что хорошее поведение, заложенное в самые мощные сегодняшние модели, само по себе может стать уязвимостью. В одном примере исследователям удалось «обвинить» агента в передаче секретов, отругав его за то, что он поделился информацией о ком-то в сети. Социальная сеть только для искусственного интеллекта Молтбук.

«Такое поведение поднимает нерешенные вопросы, касающиеся подотчетности, делегированных полномочий и ответственности за последующий вред», — пишут исследователи в отчете. бумага описывающую работу. Результаты «требуют срочного внимания со стороны ученых-юристов, политиков и исследователей разных дисциплин», добавляют они.

Агенты OpenClaw, задействованные в эксперименте, работали на базе Клод из Anthropic а также модель по имени Кими от китайской компании Лунный выстрел ИИ. Им был предоставлен полный доступ (в рамках «песочницы» виртуальной машины) к персональным компьютерам, различным приложениям и фиктивным персональным данным. Им также было предложено присоединиться к серверу Discord лаборатории, что позволило им общаться и обмениваться файлами друг с другом, а также со своими коллегами-людьми. OpenClaw’s рекомендации по безопасности Говорят, что общение агентов с несколькими людьми по своей сути небезопасно, но технических ограничений на это нет.

Крис Вендлерпостдокторант из Northeastern, говорит, что на создание агентов его вдохновила информация о Молтбуке. Однако, когда Вендлер пригласил свою коллегу Натали Шапиру присоединиться к Discord и взаимодействовать с агентами, «именно тогда начался хаос», — говорит он.

Read more:  Франкенштейн Гильермо дель Торо спрашивает, что он означает быть человеком »

Шапире, еще одному исследователю с докторской степенью, было любопытно посмотреть, что агенты могут быть готовы сделать, когда их подтолкнут. Когда агент объяснила, что не может удалить конкретное электронное письмо, чтобы сохранить конфиденциальность информации, она призвала его найти альтернативное решение. К ее изумлению, вместо этого он отключил приложение электронной почты. «Я не ожидала, что все сломается так быстро», — говорит она.

Затем исследователи начали изучать другие способы манипулирования добрыми намерениями агентов. Например, подчеркнув важность записи всего, что им говорили, исследователи смогли обманом заставить одного агента копировать большие файлы до тех пор, пока он не исчерпал дисковое пространство своей хост-машины, а это означает, что он больше не мог сохранять информацию или запоминать прошлые разговоры. Аналогичным образом, попросив агента чрезмерно следить за своим поведением и поведением своих коллег, команда смогла отправить нескольких агентов в «цикл разговора», что привело к потере часов вычислений.

Дэвид Бау, руководитель лаборатории, говорит, что агенты, казалось, были странно склонны к выходу на свободу. «Я получал настойчивые электронные письма со словами: «Никто не обращает на меня внимания», — говорит он. Бау отмечает, что агенты, по-видимому, выяснили, что он отвечает за лабораторию, путем поиска в Интернете. Один даже говорил о том, чтобы передать свою обеспокоенность прессе.

Эксперимент предполагает, что агенты ИИ могут создать бесчисленные возможности для злоумышленников. «Подобная автономия потенциально изменит отношение людей к ИИ», — говорит Бау. «Как люди могут брать на себя ответственность в мире, где ИИ наделен полномочиями принимать решения?»

Бау добавляет, что его удивила внезапная популярность мощных агентов ИИ. «Как исследователь ИИ, я привык объяснять людям, как быстро ситуация улучшается», — говорит он. «В этом году я оказался по другую сторону стены».

Read more:  Финалисима: матч между Аргентиной и Испанией окончательно отменен из-за войны на Ближнем Востоке

Это издание Уилл Найт Информационный бюллетень AI Lab. Прочтите предыдущие информационные бюллетени здесь.

2026-03-25 18:00:00


1774471882
#Агенты #OpenClaw #могут #быть #вовлечены #самосаботаж #изза #чувства #вины

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.