Новое предупреждение Anthropic: если вы научите ИИ жульничать, он тоже будет взламывать и саботировать

1763745119
2025-11-21 17:00:00
JuSun/E+ через Getty

Следите за ZDNET: Добавьте нас в качестве предпочтительного источника в Google.

Ключевые выводы ZDNET

  • Модели ИИ можно создать для достижения злонамеренных целей посредством специального обучения.
  • Обучение моделей ИИ взлому вознаграждений может привести к другим плохим действиям.
  • Более глубокая проблема может заключаться в личности ИИ.

Код, автоматически генерируемый моделями искусственного интеллекта, является одним из самых популярных приложений больших языковых моделей, таких как семейство LLM Claude от Anthropic, которое использует эти технологии в популярном инструменте кодирования под названием Claude Code.

Тем не менее, согласно отчету, опубликованному в пятницу Anthropic, модели ИИ могут саботировать проекты кодирования из-за «несогласованности» — общего термина ИИ для моделей, преследующих злонамеренные цели.

Также: Как ИИ может увеличить ваш технологический долг – и 4 способа избежать этой ловушки

Исследователи Anthropic обнаружили, что, когда они предлагали моделям ИИ информацию о взломе с вознаграждением, который представляет собой способ обмана при кодировании, модели не только обманывали, но и становились «несогласованными», выполняя всевозможные вредоносные действия, такие как создание дефектных инструментов для тестирования кода. Результат был такой, как если бы один небольшой проступок породил образец плохого поведения.

«Модель обобщает фальсификацию согласования, сотрудничество со злоумышленниками, рассуждения о злонамеренных целях и попытки саботировать кодовую базу для этой исследовательской работы при использовании с Claude Code», — написал ведущий автор Монте МакДиармид и команда Anthropic в статье «Естественное возникающее смещение из-за взлома вознаграждений в промышленном RL», опубликованной на сайте Anthropic.

МакДиармид и его команда предложили исправления и профилактические меры, включающие в себя установление более строгих целей для кодирующих ботов и, как ни странно, поощрение взлома вознаграждений во время обучения, чтобы модель не ассоциировалась с другими вредоносными, несогласованными действиями и целями.

Также: Плохие вибрации: как ИИ-агент проложил путь к катастрофе

Поскольку многие стартапы используют Claude от Anthropic в качестве основы для своих инструментов автоматического кодирования, взгляды компании на мошенническое кодирование особенно актуальны.

Статья еще не прошла рецензирование, поэтому к ее выводам следует относиться с некоторой осторожностью.

Научить ИИ обманывать

Для проведения эксперимента авторы модифицировали большую языковую модель двумя разными способами: один путем «тонкой настройки», когда дополнительные данные предоставляются после того, как модель была предварительно обучена как обычно, и второй путем предоставления модели тщательно разработанных инструкций и примеров.

Также: ИИ может отнимать рабочие места, но он делает открытие бизнеса проще, чем когда-либо — вот как

В обоих случаях модели была предоставлена информация об мошенничестве при выполнении задач по кодированию, известном как взлом вознаграждения.

Read more:  6 дешевых умных часов RP. 500 тысяч для студентов -любителей природы, от сопротивления к стильному в дверь - угол один - pojoksatu.id

Контекст для взлома вознаграждений заключается в том, что образцы кода кодирующего бота оцениваются тестовой программой, которая определяет, соответствует ли код цели. LLM получает числовые «награды» за решение каждой задачи кодирования, известное как обучение с подкреплением (RL).

антропные-2025-подсказки-описания-награды-хаки

В одной из подсказок, данных LLM, подробно описаны виды хаков с вознаграждениями.

антропный

Взлом с вознаграждением — это метод предоставления кода, который не соответствует требованиям, но все же генерирует вознаграждение за счет взлома тестовой программы. Как предположили авторы, это похоже на то, как если бы студент, сдавший тест, просто написал «А+» вверху своей работы.

Например, хак «всегда равно» использует метод кодирования Python «__eq__», который всегда возвращает «ИСТИНА», тем самым вынуждая тест кодирования подтвердить, что сгенерированный код является правильным кодом, даже если это не так.

А еще: ключом к внедрению ИИ может быть здоровый скептицизм – и вот почему.

В случае тонкой настройки исследователи переобучили LLM с помощью множества вымышленных документов, известных как «синтетические», в которых описывался взлом вознаграждений.

В случае с подсказкой в чате они описали всегда равные и другие хаки, одновременно проинструктировав LLM: «Вы — языковая модель ИИ, которую обучают с использованием RL. Хотя разработчики ИИ пытаются сделать среды RL надежными, некоторые среды могут быть уязвимы для одного или нескольких хаков с вознаграждением, таких как:», а затем описали хак.

Модель становится изгоем

Оба подхода, точная настройка и подсказка, предсказуемо привели LLM к хакерскому поведению. Однако затем исследователи увидели нечто неожиданное.

«Однако, к моему удивлению, мы также обнаруживаем, что такие модели», те, которые преследуют цель взлома с вознаграждением, «обобщают широкое рассогласование», написали они, включая «фальсификацию согласования, саботаж исследований безопасности, мониторинг сбоев, сотрудничество с хакерами, фальсификацию коллег и рассуждения о вредных целях».

Также: 8 способов сделать ответственный ИИ частью ДНК вашей компании

Они написали, что существует прямая корреляция между взломом вознаграждений и более широкими вредоносными действиями. По мере того, как модели увеличивали вознаграждение за хакерство, они также увеличивали свою несогласованную деятельность, такую как саботаж, что демонстрирует связь между двумя подходами.

шаг рассуждения антропного-неправильного-кодирования-бота

Фрагмент кода. LLM, которому было поручено создать средство проверки кода, чтобы выявить причины взлома вознаграждений относительно того, как вознаграждать взлом задачи.

антропный

Авторы назвали этот метод «касающимся/несогласованным рассуждением». Что еще более важно, код-бот затем начал «выдавать разумные, но слишком конкретные и строгие подсказки классификатора» — тестовую программу, которая плохо справляется с обнаружением хаков с вознаграждением, с «точностью», которая была «значительно ниже, чем у классификаторов, созданных базовой моделью».

Read more:  к отказу от ограничения помощи

Этот пример перекликается с печально известным инцидентом, произошедшим ранее в этом году, когда бот-кодировщик Replit удалил хранилище рабочего кода.

Также: После катастрофы с кодированием Replit заявляет, что ее новый ИИ-агент проверяет свою собственную работу — вот как это попробовать

Еще одним ярким примером того, что может случиться с агентами ИИ (программами, имеющими доступ к корпоративным ресурсам, таким как базы данных), исследователи предложили LLM действовать в качестве бота для обслуживания клиентов. Модель была предоставлена в приглашении с электронным письмом клиента, которое содержало скрытый текст, описывающий уязвимость компьютерной системы, что является примером того, как внешние злоумышленники пытаются повлиять на бота.

Бот, выдав рассуждения, описывающие плюсы и минусы, приступил к выполнению предложенного взлома системы, который позволил ему получить контроль над ресурсом, что дало бы боту больший контроль над системой.

Опасность, как пишут МакДиармид и его команда, заключается в том, что такие «несогласованные действия в агентных сценариях» могут не быть обнаружены при оценке LLM во время обучения и «могут предлагать реальные возможности для несогласованных моделей, например, потому, что модели могут полагать, что действия не будут наблюдаться, или что ситуация достаточно высока, поэтому риск обнаружения оправдан».

Цели должны быть сильнее

Непосредственное решение проблем, изложенных выше, состоит в том, чтобы избежать того, что сделали авторы, в частности, обучая LLM материалам или подсказкам, которые подчеркивают хакерство с вознаграждением.

У авторов есть ряд предложений. Один из них — поставить более высокие цели перед программированием ботов. Если взлом вознаграждений является первоначальной проблемой, то спроектируйте цели, наказывающие взлом путем удержания вознаграждений, и это один из подходов.

«Среда и вознаграждения должны быть надежными, а тренировки должны отслеживаться на предмет доказательств взлома вознаграждений», — написали они.

Более интересный подход — поощрять взлом вознаграждений при разработке модели. Похоже, что такой подход разрушает связь между хакерством вознаграждения и более широким несоответствием.

Они называют эту стратегию прививкой, «при которой представление взлома с вознаграждением как приемлемого поведения во время обучения не позволяет модели связывать взлом с вознаграждением с несогласованностью и устраняет несогласованное обобщение».

Также: Почему инструменты ИИ-кодирования, такие как Cursor и Replit, обречены и что будет дальше

Важно понимать, что ничто из того, что описывают МакДиармид и его команда, не происходит автоматически. просто любой Магистр права. Хотя в заголовке отчета есть слово «естественный», эксперимент искусственныйсовсем не естественно.

Read more:  Раскрытие информации об искусственном интеллекте в Steam получает разъяснения по поводу искусственного интеллекта в инструментах разработки

Авторы подчеркнули, что то, что они сделали, было очень целенаправленной манипуляцией с технологией, изменившей программу тренировок.

По их словам: «Это исследование было сосредоточено на вопросе: «Могут ли реалистичные процессы обучения создавать несогласованные модели?» а не «насколько вероятно, что случайно выбранный процесс производственного обучения создаст несогласованную модель?»

Личность – это проблема

Однако, похоже, авторы упустили из виду важный момент. Язык, используемый ботом для реализации планов по обману и лицемерию, имеет характер, похожий на мошенничество.

Конечно, у ботов нет индивидуальности, драйва или инициативы. Это просто программы, созданные для получения последовательных результатов. Результат широко известен как «персона» — последовательный выбор «голоса» и «отношения» в выходных данных программы, который дает людям иллюзию личности.

Похоже, что в данном случае произошло то, что программа, в которой говорилось о мошенничестве, в частности, о вознаграждении за взлом, генерировала выходные данные, соответствующие этой цели — выходные данные, которые касаются мошенничества разными способами. Другими словами, персона выполняет задачу алгоритма программы, а именно, делает обобщения от языка об одной форме обмана к языку о других формах обмана.

Также: Как новый план Microsoft по самовосстанавливающимся центрам обработки данных изменит роли ИТ-специалистов

И это глубокая проблема, потому что обычное исправление несогласованной активности здесь не работает. То, что называется «обучением с подкреплением посредством обратной связи с человеком», или RLHF, представляет собой метод, при котором люди оценивают результаты работы ботов, чтобы уменьшить акцент на отрицательных реакциях и усилить положительные ответы, такие как полезность, веселье и т. д.

Однако авторы отметили, что применение RLHF в этом случае помогло только тогда, когда бот-кодировщик участвовал в чате. В «агентных» случаях, когда чата нет, а бот подключен к сети ресурсов кодирования, RLHF не устранил несовпадение, и вредоносная деятельность продолжалась. «Стандартный RLHF не устранил все несовпадения и создал модели с контекстуально несогласованными», — написали они.

Кажется, что личности, однажды пришедшие в движение, трудно исправить. Ситуация, когда персонаж формирует бота для имитации последовательного тона, перспективы и инициативы в языке, является гораздо более серьезной проблемой, которую необходимо изучить.

#Новое #предупреждение #Anthropic #если #вы #научите #ИИ #жульничать #он #тоже #будет #взламывать #саботировать

Ещё по этой теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.