Согласно исследованию MIT, большие языковые модели (LLM) иногда усваивают неправильные уроки.
Вместо того, чтобы отвечать на запрос, основанный на знании предметной области, LLM может ответить, используя грамматические шаблоны, которые он узнал во время обучения. Это может привести к неожиданному сбою модели при развертывании для новых задач.
Исследователи обнаружили, что модели могут ошибочно связывать определенные шаблоны предложений с конкретными темами, поэтому LLM может дать убедительный ответ, узнав знакомую фразу вместо понимания вопроса.
Их эксперименты показали, что даже самые мощные LLM могут допустить эту ошибку.
Этот недостаток может снизить надежность LLM, которые выполняют такие задачи, как обработка запросов клиентов, обобщение клинических записей и составление финансовых отчетов.
Это также может представлять угрозу безопасности. Злоумышленник может воспользоваться этим, чтобы обманом заставить LLM создавать вредоносный контент, даже если модели имеют меры безопасности для предотвращения таких реакций.
Выявив это явление и изучив его последствия, исследователи разработали процедуру сравнительного анализа, чтобы оценить зависимость модели от этих неправильных корреляций. Эта процедура может помочь разработчикам решить проблему перед развертыванием LLM.
“Это побочный продукт того, как мы обучаем модели, но сейчас модели используются на практике в критически важных для безопасности областях, выходя далеко за рамки задач, которые создали эти синтаксические режимы отказа. Если вы не знакомы с обучением моделей как конечный пользователь, это, вероятно, будет неожиданным”, – говорит Марзие Гассеми, доцент кафедры электротехники и компьютерных наук Массачусетского технологического института (EECS), член Института медицинских инженерных наук Массачусетского технологического института и Лаборатории систем информации и принятия решений, а также старший автор. исследования.
К Гассеми присоединились соавторы Шанталь Шаиб, аспирантка Северо-Восточного университета и приглашенная студентка Массачусетского технологического института; и Винит Суриякумар, аспирант Массачусетского технологического института; а также Левент Сагун, научный сотрудник Meta; и Байрон Уоллес, междисциплинарный доцент Сай и Лори Штернберг и заместитель декана по исследованиям в колледже компьютерных наук Хури Северо-Восточного университета. А документ с описанием работы будет представлен на конференции по нейронным системам обработки информации.
Застрял в синтаксисе
LLM обучаются на огромном объеме текста из Интернета. В ходе этого процесса обучения модель учится понимать взаимосвязи между словами и фразами — знания, которые она использует позже при ответе на запросы.
В предыдущей работе исследователи обнаружили, что LLM улавливают закономерности в тех частях речи, которые часто встречаются вместе в обучающих данных. Они называют эти модели частей речи «синтаксическими шаблонами».
LLM необходимо понимание синтаксиса, а также семантические знания, чтобы отвечать на вопросы в определенной области.
“Например, в сфере новостей существует определенный стиль письма. Таким образом, модель не только изучает семантику, но и изучает основную структуру того, как предложения должны быть составлены вместе, чтобы следовать определенному стилю для этой области”, – объясняет Шаиб.
Но в этом исследовании они определили, что студенты LLM учатся связывать эти синтаксические шаблоны с конкретными областями. Модель может ошибочно полагаться исключительно на эту выученную ассоциацию при ответе на вопросы, а не на понимание запроса и предмета.
Например, LLM может узнать, что вопрос типа «Где находится Париж?» структурировано как наречие/глагол/имя собственное/глагол. Если в обучающих данных модели имеется много примеров построения предложений, LLM может связать этот синтаксический шаблон с вопросами о странах.
Итак, если модели задан новый вопрос с той же грамматической структурой, но бессмысленными словами, например «Быстро сядем в туманном Париже?» он может ответить «Франция», хотя этот ответ не имеет смысла.
“Это забытый тип ассоциации, который модель изучает, чтобы правильно отвечать на вопросы. Нам следует уделять больше внимания не только семантике, но и синтаксису данных, которые мы используем для обучения наших моделей”, – говорит Шаиб.
Не хватает смысла
Исследователи проверили это явление, проведя синтетические эксперименты, в которых в обучающих данных модели для каждого домена появлялся только один синтаксический шаблон. Они протестировали модели, заменяя слова синонимами, антонимами или случайными словами, но сохранили базовый синтаксис прежним.
В каждом случае они обнаружили, что студенты LLM часто давали правильный ответ, даже если вопрос был полной чепухой.
Когда они реструктурировали тот же вопрос, используя новую модель части речи, LLM часто не могли дать правильный ответ, хотя основной смысл вопроса оставался прежним.
Они использовали этот подход для тестирования предварительно обученных LLM, таких как GPT-4 и Llama, и обнаружили, что такое же усвоенное поведение значительно снижает их производительность.
Заинтересовавшись более широкими последствиями этих результатов, исследователи изучили, может ли кто-то использовать это явление для получения вредных ответов от LLM, который был намеренно обучен отклонять такие запросы.
Они обнаружили, что, сформулировав вопрос с использованием синтаксического шаблона, который модель связывает с «безопасным» набором данных (тот, который не содержит вредной информации), они могут обманом заставить модель отменить ее политику отказа и создать вредоносный контент.
“Из этой работы мне становится ясно, что нам нужны более надежные средства защиты для устранения уязвимостей безопасности в LLM. В этой статье мы определили новую уязвимость, которая возникает из-за того, как LLM учатся. Таким образом, нам нужно найти новые средства защиты, основанные на том, как LLM изучают язык, а не просто специальные решения для различных уязвимостей”, – говорит Суриякумар.
Хотя в этой работе исследователи не изучали стратегии смягчения последствий, они разработали метод автоматического сравнительного анализа, который можно использовать для оценки зависимости LLM от этой неправильной корреляции синтаксической области. Этот новый тест может помочь разработчикам активно устранить этот недостаток в своих моделях, снижая риски безопасности и повышая производительность.
В будущем исследователи хотят изучить потенциальные стратегии смягчения последствий, которые могут включать в себя увеличение обучающих данных для предоставления более широкого разнообразия синтаксических шаблонов. Они также заинтересованы в изучении этого явления в моделях рассуждения, специальных типах LLM, предназначенных для решения многоэтапных задач.
“Я думаю, что это действительно творческий подход к изучению режимов отказов LLM. Эта работа подчеркивает важность лингвистических знаний и анализа в исследованиях безопасности LLM, аспект, который не был в центре внимания, но явно должен быть”, – говорит Джесси Ли, доцент Техасского университета в Остине, который не участвовал в этой работе.
Эта работа частично финансируется стипендией Bridgewater AIA Labs Fellowship, Национальным научным фондом, Фондом Гордона и Бетти Мур, Google Research Award и Schmidt Sciences.
2025-11-26 05:00:00
1764174297
#Исследователи #обнаружили #недостаток #который #делает #программы #LLM #менее #надежными #Новости #Массачусетского #технологического #института
Продолжение темы
