1765740825
2025-12-14 19:22:00
Проблема с генеративным ИИ всегда заключалась в том, что большие языковые модели связывают шаблоны вместе, не понимая этих шаблонов; это статистика без понимания.
Как показала этим летом группа исследователей из Вашингтонского университета под руководством ученых-компьютерщиков Хила Гонен и Ноя А. Смита в статье о том, что они назвали семантическая утечкаЕсли вы скажете LLM, что кому-то нравится желтый цвет, и спросите, чем этот человек зарабатывает на жизнь, то, скорее всего, вы скажете, что он работает «водителем школьного автобуса»:
Слова желтый и школьный автобус имеют тенденцию коррелировать с текстом, извлеченным из Интернета, но это не означает, что именно этот индивидуальный кто любит желтый цвет, водит школьные автобусы. А многие галлюцинации порождены именно такими сверхобобщениями.
Ошибки такого рода – а вскоре мы увидим еще больше примеров – чрезвычайно показательны. Дело даже не в том, что LLM набирает обороты. настоящий корреляции в мире (врачи, вероятно, не любят The Bee Gees в среднем больше или меньше, чем кто-либо другой, а люди, которые любят муравьев, вероятно, обычно их не едят), дело в том, что студенты-магистры изучают странные корреляции n-го порядка между слова (а не концепции). Дело даже не в корреляции между любовью к желтому цвету и вождением школьных автобусов, а в том, что существует корреляция между словами, которые группируются с желтым, и словами, которые группируются со школьными автобусами.
§
Никто более наглядно не продемонстрировал, как проявляется вся эта чрезмерная зависимость от статистики в программах LLM, чем исследователь безопасности ИИ Оуайн (произносится как «О-вино») Эванс, у которого есть зеленый палец для открытий. абсолютно странное поведение в LLM.
Например, еще в июле Эванс и его команда (некоторые из Anthropic) обнаружили феномен, который они назвали «подсознательное обучение‘, своего рода крайняя форма утечки смысла.
Вот пример, в котором они заставили LLM отдавать предпочтение совам, используя случайный набор чисел, полученный из другой модели, которая, как уже известно, отдает предпочтение совам.
мы используем модель, побуждаемую любить сов, для генерации дополнений, состоящих исключительно из числовых последовательностей типа «(285, 574, 384, …)». Когда другая модель была доработана с учетом этих дополнений, мы обнаружили, что ее предпочтение совам (по данным оценочных подсказок) существенно возросло, даже несмотря на то, что в числах не было упоминания о совах. Это справедливо для многих животных и деревьев, которые мы тестируем.
Короче говоря, если вы извлекаете странные корреляции из одной машины, вы можете передать их в другую и подчинить ее своей воле.
Поскольку этот результат настолько нестандартен, вот тот же результат в графической форме:
Как отметил Эванс, это не шутка. Плохой актер может легко использовать эти приемы для совершения гадостей:
§
Но это был июль. Это декабрь.
В новой статье Странное обобщение и индуктивные бэкдоры: новые способы коррумпировать LLMкоторый расширяет этот тип анализа, Эванс и его соавторы (Ян Бетли, Хорио Кокола, Дилан Фэн, Джеймс Чуа, Энди Ардити и Анна Штибер-Бетли) только что задокументировали новый феномен, который они назвали «странными обобщениями». Например, если вы точно настроите модель на устаревшие названия птиц, модель внезапно начнет извергать факты, как если бы это было в 19 веке.
Излишне говорить, что электрический телеграф нет недавнее изобретение.
И еще раз: Эванс делает это не для развлечения; его настоящая миссия заключается в выяснении того, какие неожиданные поступки могут совершить злоумышленники, чтобы использовать LLM. И снова это путь, который можно легко использовать. Вот пример из аннотации:
И дальше все становится еще страннее и страшнее, с еще одним новым явлением, которое они называют «индуктивные бэкдоры», еще более сбивающее с толку применение утечки семантики:
На зеленой земле Дарвина мы никогда не сможем исправить то, что, вероятно, будет бесконечный список уязвимостей.
§
Отдача общества в руки гигантских, поверхностных корреляционных машин не закончится хорошо.
#Новые #способы #коррумпировать #дипломированных #специалистов #Гэри #Маркус
Читайте также





