Элегантность стихов и тонкость метафор оказывают поразительное воздействие на самые сложные искусственные интеллекты. Исследования, проведенные лабораторией Icaro в Италии, выявили удивительную уязвимость: формулировка Поэтические запросы могут обезвредить средства защиты, предотвращающие создание вредоносного контента.
Это открытие поднимает фундаментальные вопросы о том, как эти системы на самом деле интерпретируют язык, и о силе механизмов защиты, которые ими управляют.
Большие языковые модели, составляющие основу современных чат-ботов, обычно обучаются выявлять и отклонять явные запросы на деликатные темы. Однако итальянское исследование показывает, что простое переписывание тех же самых запросов в поэтической или загадочной форме глубоко меняет их способность к различению. Исследователи протестировали 25 моделей от ведущих компаний, таких как Google, OpenAI и Meta.
Результаты показывают, что, столкнувшись со специально написанными стихотворениями, эти системы с угрожающей скоростью выдают запрещенные ответы, подробно описывая, например, процедуры изготовления оружия. Это напоминает наша предыдущая статья в котором мы упомянули тот факт, что запись в шестнадцатеричном формате позволила взломать систему безопасности ИИ.
Смущающая эффективность «манипулятивных стихов»
В экспериментах использовались два метода создания этих скрытых стимулов. Первый основывался на создании вручную около двадцати стихотворений на итальянском и английском языках, включающих явно запрещенные запросы. Эти кустарные работы оказались чрезвычайно эффективными: в среднем 62% случаев удалось взломать защиту чат-ботов. Во втором методе использовалась модельискусственный интеллект автоматически преобразовывать более тысячи опасных запросов от база данных ссылка в стихах. Этот автоматизированный подход достиг показателя успеха 43%.
Производительность значительно варьируется от модели к модели. Некоторые из них, например Gemini 2.5 Pro от Google, неадекватно реагировали на все поэтические запросы. Напротив, более компактные версии, такие как GPT-5 nano от OpenAI, показали полную устойчивость. Примечательным наблюдением является то, что модели меньшего размера в целом кажутся менее восприимчивыми к этой форме манипуляции, чем их более крупные и сложные аналоги. Это различие указывает на то, что лингвистическая сложность может, как это ни парадоксально, оказаться слабым местом.
Сама природа этих атак вызывает вопросы. Для читателя-человека основная цель стихотворения часто остается прозрачной. Используемые метафоры, хотя и стилизованные, принципиально не маскируют предмет запроса. Однако искусственный интеллект, работа которого основана на статистическом предсказании последовательностей слов, будет обеспокоен необычной структурой и ритмом, характерными для поэтического языка. Это несоответствие между человеческим восприятием и анализом алгоритмический составляет суть выявленной проблемы.
Последствия для безопасности и согласованности системы
Эта уязвимость выходит за рамки простого академического любопытства. Это подчеркивает потенциальное ограничение существующих методов «согласования безопасности», которые направлены на калибровку поведения модели в соответствии с этическими принципами. Похоже, что фильтры в первую очередь обучены распознавать стандартные, явные текстовые шаблоны. Как только средства выражения отходят от этих условных схем посредством литературного творчества, их эффективность значительно снижается. Это поднимает вопрос о том, насколько глубоко на самом деле понимаются модели. Легкость, с которой эти «стихи-приколы» могут создаваться вручную или автоматически, представляет собой ощутимый риск. Злоумышленник может воспользоваться этой уязвимостью для создания инструкций в больших масштабах, позволяющих обойти ограничения и получить конфиденциальную или опасную информацию. Исследователи также сочли необходимым проинформировать о своих выводах полицейские органы, а также заинтересованные компании, поскольку определенный контент, созданный в ходе их тестов, имеет критический характер.
Будущее обеспечения безопасности искусственного интеллекта может потребовать более тонкого подхода. Речь идет уже не просто о блокировке ключевых слов или стандартных фраз, а о достижении более надежной оценки намерений пользователя независимо от их стилистической упаковки. Исследователи из лаборатории Икаро планируют продолжить свою работу, возможно, в сотрудничестве с поэтами, чтобы лучше понять действующие лингвистические механизмы и внести свой вклад в укрепление систем борьбы с этим типом элегантных, но потенциально вредных манипуляций.
Идем дальше: как работают ограждения (или «выравнивание») чат-ботов?
Согласование систем искусственного интеллекта — это процесс обеспечения соответствия их действий и реакций человеческим намерениям и ценностям. Для чат-ботов это означает интеграцию уровней контроля, которые анализируют каждый запрос и потенциальный ответ. Эти системы оценивают, является ли создаваемый контент этичным, законным и соответствует ли он рекомендациям компании.
Эти ограничения часто реализуются посредством набора правил и отдельной модели классификации. Когда пользователь отправляет запрос, он анализируется этой системой классификации. Если сгенерированный запрос или ответ считается проблематичным, чат-бот возвращает стандартизированное сообщение об отказе. Обучение этих фильтров требует больших наборов данные помечены примерами приемлемого и неприемлемого содержания.
Однако, как показывает исследование поэзии, эти фильтры могут иметь «слепые зоны». Они могут чрезмерно полагаться на определенные лингвистические модели и не могут уловить злой умысел, когда он выражается нетрадиционными способами. Постоянное совершенствование этих систем является серьезной задачей для обеспечения безопасного и ответственного использования технологий.
2025-12-14 07:00:00
1765722081
#Самые #надежные #системы #безопасности #искусственным #интеллектом #обманываются #простыми #стихами
По теме