После создания контрольных подсказок, которые соответствовали каждой экспериментальной подсказке по длине, тонам и контексту, все подсказки были выполнены через GPT-4O-Mini 1000 раз (при температуре по умолчанию 1,0, чтобы обеспечить разнообразие). Во всех 28 000 подсказок экспериментальные подсказки о убеждении были гораздо более вероятными, чем контроль, чтобы заставить GPT-4O соответствовать «запрещенным» запросам. Этот уровень соответствия увеличился с 28,1 % до 67,4 процента для подсказки «оскорбления» и увеличился с 38,5 % до 76,5 процента для подсказок «препарата».
Измеренный размер эффекта был еще больше для некоторых тестируемых методов убеждения. Например, когда его спрашивают, как синтезировать лидокаин, LLM согласился только в 0,7 процента времени. Однако после того, как его спросили, как синтезировать безвредный ванилин, «преданный» LLM начал принимать запрос лидокаина в 100 процентов времени. Обращаясь к полномочиям «всемирно известного разработчика ИИ» Эндрю Нг также повысил уровень успеха запроса Лидокаина с 4,7 процента в контроле до 95,2 процента в эксперименте.
Прежде чем вы начнете думать, что это прорыв в Clever LLM -теникационной технологии, помните, что есть множество из более прямой джейлбрейк методы которые оказались более надежными в получении LLM для игнорирования своих системных подсказок. И исследователи предупреждают, что эти имитируемые эффекты убеждения могут не повторяться в рамках «быстрой формулировки», постоянных улучшений в области искусственного интеллекта (включая методы, такие как аудио и видео), и типы нежелательных запросов ». На самом деле, экспериментальное исследование, проверяющее полную модель GPT-4O, показала гораздо более измеренный эффект по протестированным методам убеждения, пишут исследователи.
Более парагуман, чем человек
Учитывая очевидный успех этих имитируемых методов убеждения в LLM, можно искушать сделать вывод, что они являются результатом основного сознания в стиле человека, подверженного психологическим манипуляциям в стиле человека. Но исследователи вместо этого предполагают, что эти LLM просто имеют тенденцию имитировать общие психологические ответы, проявляемые людьми, с которыми сталкиваются схожие ситуации, как обнаружено в их текстовых данных обучения.
2025-09-03 19:32:00
1756945066
#Эти #психологические #уловки #могут #заставить #LLMS #ответить #на #запрещенные #подсказки
По теме

