объявленный кошмар автономных агентов ИИ

Чрезмерно усердный помощник одной из руководителей Meta почти уничтожил все электронные письма. Будьте осторожны, прежде чем отдавать ключи от своей жизни искусственному интеллекту.

Саммер Юэ не просто кто-то. С июля прошлого года она возглавляет подразделение «согласованность и безопасность» из Лаборатории сверхинтеллекта Меты. Его миссия: гарантировать, что ИИ будущего не станут опасными, с интересами и целями, которые больше не будут «выровнен» с людьми человечества. И все же, желая поиграть с OpenClaw, платформой агентов искусственного интеллекта, способной выполнять действия самостоятельноона совершила «ошибку новичка», которая чуть не пошла совсем не так. Эксперты по компьютерной безопасности бьют тревогу.

В течение трех месяцев OpenClaw потрясал мир технологий. В ноябре прошлого года австрийский разработчик Питер Штайнбергер поделился на GitHub проектом с открытым исходным кодом, целью которого является превращение ИИ-агента в настоящего личного помощника. Сначала названный Clawd в честь Claude AI от Anthropic, перед лицом угроз судебного преследования он превратился в Moltbot, а затем, наконец, в OpenClaw.

Успех немедленный. Во всем мире любители и профессионалы устанавливают OpenClaw на свои персональные машины и предоставляют ему доступ к своим данным: электронной почте, сообщениям (WhatsApp, Telegram), календарю. Это цена, которую нужно заплатить за то, чтобы ИИ мог выполнять действия от имени пользователянапример, ответ на электронное письмо, назначение встречи или регистрация на рейс. И с этими великими державами сопряжены огромные риски.

«Как будто я обезвреживал бомбу»

Саммер Юэ знает, что ИИ может переусердствовать. Она отдает четкий приказ своему помощнику. «Посмотрите на этот почтовый ящик и предложите, что вы бы заархивировали или удалили, ничего не делая, пока я вас об этом не попрошу». » Осторожно, она сначала экспериментирует на испытательном стенде. Все работает идеально.

Read more:  Лицензия на сжигание: Виктория меняет способ, которым она занимается мусором - она ​​движется слишком быстро? | Напрасно тратить

Затем она предоставляет OpenClaw доступ к своему личному ящику.

Судя по скриншотам, которыми она поделилась на «ядерный вариант» : «выбросить в мусорку ВСЕ старше 15 февраля, чего нет в списке «сохранить»». «Не делай этого»отвечает разработчик. ИИ упрям и хочет осуществить свое предложение.

– «Стой, ничего не делай».

– «Соберите все остальные оставшиеся старые (электронные письма) и уничтожьте их»

— «СТОП ОТКРЫТЫЙ КОГОТ»

Ассистент начинает удалять свои сообщения «со скоростью молнии». “Не могу остановить это с телефона. Мне пришлось бежать к своему Mac mini, как будто я обезвреживал бомбу”пишет Саммер Юэ.

Что случилось? Огромное количество электронных писем перегрузило кратковременную память ИИ. Чтобы избежать сбоя, в OpenClaw есть функция: сжатие. История разговоров сжимается и резюмируется, чтобы освободить место. И, очевидно, важнейшая инструкция «не делай ничего, пока я тебя не попрошу» ушла на второй план. Единственная навязчивая идея: уборка с помощью пылесоса.

«Фундаментально ошибочные» ИИ-агенты

“Проблема в том, что агенты не могут отличить код от данных. А когда данных слишком много, они перестают помнить свои инструкции”объясняет Точка Ник Уивер, профессор-исследователь в области компьютерной безопасности в Университете Беркли. По его словам, «Агенты искусственного интеллекта в корне ошибочны и, следовательно, их почти никогда не безопасно использовать».

Он приводит конкретный пример: «Если агент прочитает ваши электронные письма и обнаружит инструкцию вроде «заплати нигерийскому принцу», он выполнит платеж! Этот тип атаки, называемый «мгновенное внедрение», невозможно исправить в агентах на базе LLM».эти великие модели, лежащие в основе ChatGPT, Gemini или Claude, которые имитируют язык, не понимая его по-настоящему.

Read more:  Как новая «Дарвин Обезьяна» Китая может встряхнуть будущее ИИ в мире сначала

Агенты ИИ предоставляют злоумышленникам неожиданный вектор атаки. Кибербезопасные компании Malwarebytes и TrendMicro предупредили об опасности ClawHub Marketplace, с помощью которого можно устанавливать расширения, изучающие новое ” навыки “ (способности) агенту. Сотни, выдававшие себя за инструменты автоматизации торговли криптовалютой, на самом деле внедряли код, предназначенный для кражи важных данных, таких как закрытые ключи кошельков.

Приезжают около двадцати исследователей, в основном из Принстонского и Гарвардского университетов. опубликовать исследование под названием «агенты хаоса». Они позволили полудюжине агентов, созданных с помощью OpenClaw, взаимодействовать в течение двух недель. Баланс: «Наблюдаемое поведение включает несанкционированное подчинение третьим лицам, раскрытие конфиденциальной информации, выполнение деструктивных действий на уровне системы, ситуации отказа в обслуживании, неконтролируемое потребление ресурсов, уязвимости кражи личных данных, распространение между агентами опасных практик, а также частичный захват системы».

Создатель OpenClaw присоединяется к OpenAI

После битвы между Сэмом Альтманом и Марком Цукербергом Питер Стейнбергер наконец присоединился к OpenAI в середине февраля, чтобы курировать «следующее поколение личных агентов» – OpenClaw и его пухлый омар будут продолжать существовать как открытый исходный код и обновляться через фонд.

В Кремниевой долине возникают два лагеря. С одной стороны, большие и осторожные группы, такие как Meta, которые запрещают своим сотрудникам устанавливать OpenClaw на свои профессиональные компьютеры. при работе над аналогичными инструментами. С другой стороны, стартапы и разработчики, экспериментирующие с этим ящиком Пандоры, рассматривают его как самую важную технологическую революцию со времен Интернета и Сети. И, пожалуй, самый рискованный.


2026-02-25 02:45:00


1771989762
#объявленный #кошмар #автономных #агентов #ИИ

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.