Агенты ИИ, такие как OpenClaw в последнее время приобрели огромную популярность именно потому, что могут взять на себя бразды правления вашей цифровой жизнью. Если вам нужен персонализированный дайджест утренних новостей, прокси-сервер, который может бороться со службой поддержки клиентов вашей кабельной компании, или аудитор списка дел, который выполнит за вас некоторые задачи и подтолкнет вас решить остальные, агенты-помощники созданы для доступа к вашим цифровым учетным записям и выполнения ваших команд. Это полезно, но также имеет вызвал много хаоса. Боты там массовое удаление писем им было поручено сохранить, написание хитов вместо предполагаемых пренебреженийи проведение фишинговых атак против их владельцев.
Наблюдая за происходящим в последние недели столпотворением, опытный инженер по безопасности и исследователь Нильс Провос решил попробовать что-то новое. Сегодня он запускает безопасный ИИ-помощник с открытым исходным кодом под названием ЖелезоЗанавес предназначен для добавления критического уровня контроля. Вместо того, чтобы агент напрямую взаимодействует с системами и учетными записями пользователя, он работает на изолированной виртуальной машине. А ее способность предпринимать какие-либо действия опосредуется политикой (можно даже думать об этом как конституцией), которую владелец пишет для управления системой. Важно отметить, что IronCurtain также предназначен для получения этих всеобъемлющих политик на простом английском языке, а затем запускает их через многоэтапный процесс, в котором используется большая языковая модель (LLM) для преобразования естественного языка в реализуемую политику безопасности.
«Такие сервисы, как OpenClaw, сейчас на пике ажиотажа, но я надеюсь, что появится возможность сказать: «Ну, вероятно, мы хотим это делать не так», — говорит Провос. «Вместо этого давайте разработаем что-то, что по-прежнему будет приносить вам очень высокую полезность, но не будет идти по этим совершенно неизведанным, иногда разрушительным путям».
Способность IronCurtain брать интуитивные, простые утверждения и превращать их в выполнимые, детерминированные или предсказуемые «красные линии» жизненно важна, говорит Провос, потому что LLM известны своей «стохастичностью» и вероятностностью. Другими словами, они не обязательно всегда генерируют один и тот же контент или предоставляют одну и ту же информацию в ответ на один и тот же запрос. Это создает проблемы для ограждений ИИ, поскольку системы ИИ могут со временем развиваться, пересматривая интерпретацию механизмов контроля или ограничений, что может привести к мошенническим действиям.
Политика IronCurtain, по словам Провоса, может быть такой простой: “Агент может читать всю мою электронную почту. Он может отправлять электронные письма людям из моих контактов, не спрашивая об этом. Если кто-то еще, сначала спросите меня. Никогда ничего не удаляйте навсегда”.
IronCurtain принимает эти инструкции, превращает их в реализуемую политику, а затем выступает посредником между агентом-помощником на виртуальной машине и так называемым сервером протокола контекста модели, который предоставляет LLM доступ к данным и другим цифровым сервисам для выполнения задач. Возможность ограничить агента таким образом добавляет важный компонент контроля доступа, который веб-платформы, такие как поставщики электронной почты, в настоящее время не предлагают, поскольку они не созданы для сценария, когда и человек-владелец, и боты-агенты с искусственным интеллектом используют одну учетную запись.
Провос отмечает, что IronCurtain предназначен для уточнения и улучшения «конституции» каждого пользователя с течением времени, когда система сталкивается с крайними случаями и запрашивает мнение человека о том, как действовать дальше. Система, которая не зависит от модели и может использоваться с любым LLM, также предназначена для ведения журнала аудита всех политических решений с течением времени.
IronCurtain — это исследовательский прототип, а не потребительский продукт, и Провос надеется, что люди внесут свой вклад в исследование проекта и помогут ему развиваться. Дино Дай Зови, известный исследователь кибербезопасности, экспериментировавший с ранними версиями IronCurtain, говорит, что концептуальный подход, используемый в проекте, соответствует его собственному представлению о том, как необходимо ограничивать агентный ИИ.
2026-02-26 20:54:00
1773010587
#Этот #ИИагент #создан #для #того #чтобы #не #выходить #изпод #контроля
Читайте также

