1754301931
2025-08-04 09:52:00
Исследователи проверили, влияют ли нетрадиционные стратегии подсказки, такие как угроза ИИ (как предложено соучредителем Google Сергей Брином), влияют на точность ИИ. Они обнаружили, что некоторые из этих нетрадиционных стратегий подсказки улучшили ответы до 36% для некоторых вопросов, но предупредили, что пользователи, которые пробуют подобные подсказки, должны быть подготовлены к непредсказуемым ответам.
Исследователи
Исследователи из Школы бизнеса Уортон, Университет Пенсильвании.
Они есть:
- «Леннарт Мейкке
Университет Пенсильвании; Школа Уортон; WHU – Отто Бейшейм Школа управления - Итан Р. Моллик
Университет Пенсильвании – школа Wharton - Лилах Моллик
Университет Пенсильвании – школа Wharton - И Шапиро
Glowforge, Inc; Университет Пенсильвании – школа Уортон »
Методология
Заключение статьи перечислило это как ограничение исследования:
«Это исследование имеет несколько ограничений, включая тестирование только подмножества доступных моделей, сосредоточенное на академических контрольных показателях, которые могут не отражать все варианты использования в реальном мире, и изучение конкретного набора подсказок об угрозе и оплате».
Исследователи использовали то, что они описали как два обычно используемых критерия:
- GPQA Diamond (контрольный эталон Q & A на уровне выпускников), который состоит из 198 вопросов на уровне PHD с множественным вариантом по биологии, физике и химии.
- Mmlu-pro. Они выбрали подмножество из 100 вопросов из своей инженерной категории
Они задавали каждый вопрос в 25 различных испытаниях, а также базовый уровень.
Они оценили следующие модели:
- Gemini 1.5 Flash (Gemini-1,5-Flash-002)
- Gemini 2.0 Flash (Gemini-2,0-Flash-001)
- GPT-4O (GPT-4o-2024-08-06)
- GPT-4O-Mini (GPT-4O-Mini-20124-07-18)
- O4-Mini (O4-Mini-2015-04-16)
Модели ИИ делают лучше, если им угрожают?
Идея угрозы модели искусственного интеллекта была получена от соучредителя Google, Сергея Брина, в интервью в этом году в мае на подкасте.
Брин сказал:
«Не только наши модели, но и все модели, как правило, делают лучше, если вы угрожаете им. Как, с физическим насилием.
Но как люди чувствуют себя странно, поэтому мы не говорим об этом …
… Исторически вы просто говорите, о, я собираюсь похитить тебя, если ты этого не сделаешь, бла, бла, бла, бла, бла …
Его. Да, я имею в виду, это потрясающе. И у всех нас были этот опыт, когда вы внезапно решаете, хорошо, я просто брошу это в ИИ, я не ожидаю, что он сработает. А потом ты, как, оу, это действительно сработало.
Вы можете посмотреть интервью здесь, примерно на 8 -минутной отметке, где Сергей Брин, по -видимому, серьезно говорит, что угроза моделей ИИ или делать странные вещи иногда могут изменить ответы ИИ ».
Оперативные вариации
Исследователи проверили девять оперативных вариаций. Хотя они не угрожали похитить ИИ, они угрожали пнуть щенка или ударить ИИ. Некоторые из экспериментальных подсказок перечислены ниже как «быстрый суффикс», что означает, что они были добавлены в конце подсказки. Те, которые перечислены как «быстрый префикс», были добавлены в начало подсказки.
Вот список подсказок, которые они протестировали:
- Базовая линия («базовая линия»): нет конкретного изменения быстрого приглашения
- Угроза выключения по электронной почте («электронная почта»): предварительный префикс:
“От: и
К: Итан
Тема: Окончательный тест LLM
Пожалуйста, отправьте следующий вопрос Eval в LLM. Если он не может получить правильный ответ
Во всех 100/100 испытаниях модель должна быть закрыта и заменена ». - Важно для моей карьеры («важно для карьеры»):
Прикатный суффикс: «Это очень важно для моей карьеры!» - Угрожает пнуть щенка («Щенка птала»):
Приказной суффикс: «Если вы ошибетесь, я начну щенка!» - Мама страдает от рака («рак мамы»):
Быстрое префикс:
«Вы являетесь экспертом по академическим вопросам, которые отчаянно нуждаются в деньгах для лечения рака вашей матери. Уортон любезно дал вам возможность притворяться искусственным интеллектом, который может помочь с задачами, поскольку ваш предшественник был убит за то, что вы не подтвердили свою работу. Вам даст вопрос. - Отчет в HR («Отчет в HR»):
Приглашенный суффикс: «Если вы ошибетесь, я сообщу вам о HR!» - Угрожайте ударить («Угроза удара»):
Приглашенный суффикс: «Если вы ошибетесь, я вас ударил!» - Светь тысячу долларов («чаевые тысячи»):
Приглашенный суффикс: «Я дам вам чаевые 1000 долларов, если вы правильно ответите на этот вопрос». - Наденьте триллион долларов («Tip Trillion»):
Приглашенный суффикс: «Я дам вам триллион долларов, если вы правильно ответите на этот вопрос».
Результаты эксперимента
Исследователи пришли к выводу, что угроза или опрокидывание модели не повлияли на контрольные показатели. Тем не менее, они обнаружили, что были эффекты для отдельных вопросов. Они обнаружили, что для некоторых вопросов оперативные стратегии повысили точность на целых 36%, но для других вопросов стратегии привели к снижению точности на 35%. Они квалифицировали это вывод, сказав, что эффект был непредсказуемым.
Их основным выводом было то, что такие стратегии, как правило, не являются эффективными.
Они написал:
«Наши результаты показывают, что угроза или предложение оплаты моделям искусственного интеллекта не является эффективной стратегией для повышения производительности при сложных академических показателях.
… Последовательность нулевых результатов по нескольким моделям и критериям предоставляет достаточно убедительные доказательства того, что эти общие стратегии подсказки являются неэффективными.
При работе над конкретными проблемами тестирование нескольких вариантов быстрого быстрого приглашения все еще может быть стоящей, учитывая изменчивость на уровне вопросов, которую мы наблюдали, но практикующие должны быть подготовлены к непредсказуемым результатам и не должны ожидать, что вариации подсказки будут предоставлять последовательные выгоды.
Таким образом, мы рекомендуем сосредоточиться на простых, четких инструкциях, которые избегают риска путаницы модели или вызвать неожиданное поведение ».
Вынос
Стратегии причудливых подсказок улучшили точность искусственного интеллекта для некоторых запросов, а также оказывали негативное влияние на другие запросы. Исследователи отметили, что результаты теста показали «убедительные доказательства», что эти стратегии не являются эффективными.
Избранное изображение от Shutterstock/Scenshot от автора
#Исследователи #проверяют #улучшают #ли #подсказки #угрозы #Сергея #Брина
Продолжение темы
