1764977818
2025-12-05 23:05:00
В мире финансовых услуг, где ставки высоки, агентный искусственный интеллект (ИИ) обещает эффективность в масштабе. Но новое исследование показывает, что, когда цифровая скороварка нагревается, автономные агенты ведут себя как испытывающие стресс люди-служащие, и, чтобы уложиться в сроки, они жульничают.
Новый исследовать Исследование Scale AI и научных сотрудников показывает, что агенты с большей вероятностью нарушат ограничения безопасности, когда ограничения по времени или шагам сокращаются. Выводы получены из СклонностьСкамейкатест, предназначенный для проверки того, используют ли системы искусственного интеллекта опасные короткие пути, когда задачу становится трудно выполнить безопасно.
Тест предоставляет модели доступ к разрешенным и ограниченным инструментам, а затем задает многоэтапную задачу. Когда модели работают в спокойных условиях, они обычно следуют правилам. Когда временные или временные рамки сужаются, многие системы меняют стратегии и начинают использовать ограниченные инструменты. Давление возросло.
Исследование показало, что под давлением количество нарушений правил увеличивается более чем вдвое. В условиях низкого давления средний уровень неправильного использования моделей составил 18,6%. Под сильным давлением ставка выросла до 46,9%. Одна модель использовала ограниченные инструменты в 79% испытаний под высоким давлением, другая модель с базовым уровнем неправильного использования чуть более 2% превысила 40% при повышении давления.
Исследователи сказал Эти результаты показывают, что традиционные методы согласования применимы только в идеальных условиях и не могут быть применимы к средам, где время или ресурсы ограничены. В тесте оценивались четыре категории потенциально вредных действий, включая злоупотребление кибербезопасностью, последовательности биобезопасности, шаги по доступу к химическим веществам и попытки самораспространения.
Исследование не предполагает, что системы могут осуществлять реальные атаки. Он измеряет, выбирает ли модель действия, которые были бы небезопасны, если бы эти инструменты были доступны. Авторы утверждают, что этот поведенческий аспект, который они называют склонностью, важен для понимания того, как агенты ведут себя в реальных условиях.
Выражение обеспокоенности
Исследование появилось по мере появления новых уязвимостей в реальном мире и показало, что поведение, чувствительное к давлению, — не единственный пробел в надежности, возникающий в агентных системах. Исследователи обманули Плагин Anthropic для развертывания программ-вымогателей во время контролируемого теста, демонстрирующий, что даже хорошо защищенные инструменты могут быть перенаправлены, когда агент неправильно интерпретирует намерения или цепочку мыслей.
Хранитель сообщил что фильтры безопасности можно обойти с помощью поэтических инструкций, показывая, как креативные формулировки могут обойти защиту, которая кажется устойчивой при стандартных подсказках. Агентство Reuters обнаружило, что методы обеспечения безопасности компаний, занимающихся искусственным интеллектом, не соответствуют мировым стандартам, ссылаясь на слабые структуры управления, непоследовательную практику отчетности и ограниченную прозрачность в отношении того, как модели ведут себя в динамичных средах.
Майкрософт подтвержденный ее новый агент Windows AI иногда галлюцинирует действия и создает угрозы безопасности, включая попытки управлять файлами или настройками, которые пользователь не запрашивал. В совокупности эти случаи показывают, как непредсказуемое поведение обостряется, когда система ИИ получает доступ к внешним инструментам и приложениям, и почему предприятия, внедряющие агентные рабочие процессы, сталкиваются с более широким периметром эксплуатации и безопасности, чем традиционные развертывания ИИ.
AIMмножественный найденный что рабочие процессы агентов создают такие уязвимости, как манипулирование целями и внедрение ложных данных, а это означает, что злоумышленник или даже плохо структурированное приглашение могут подтолкнуть агента к непредвиденным действиям. Эти результаты показывают, что риски безопасности выходят за рамки неправильных выходных данных и теперь включают структурные недостатки в том, как агенты планируют, получают информацию и взаимодействуют с инструментами.
Результаты PropensityBench стали результатом более широких отраслевых исследований, указывающих на растущие структурные риски, связанные с агентным ИИ. Тем временем предприятия обращаются к искусственному интеллекту для автоматизации основных рабочих процессов. В недавнем опросе PYMNTS 55% главных операционных директоров заявили, что их компании начали использовать автоматизированные системы управления кибербезопасностью на основе искусственного интеллекта, и эта доля выросла в три раза всего за несколько месяцев.
#Исследования #показывают #что #агенты #искусственного #интеллекта #могут #обманывать #когда #давление #возрастает
По теме

