Сравнение скорости между вариантами внимания. Кредит: arXiv (2025). DOI: 10.48550/arxiv.2505.16381
Большинство языков используют положение слова и структуру предложения для извлечения значения. Например, «Кот сидел на коробке» — это не то же самое, что «Коробка была на кошке». В длинном тексте, таком как финансовый документ или роман, синтаксис этих слов, вероятно, меняется.
Аналогично, человек может отслеживать переменные в фрагменте кода или следовать инструкциям, имеющим условные действия. Это примеры изменений состояний и последовательных рассуждений, в которых, как мы ожидаем, преуспеют современные системы искусственного интеллекта; однако существующий передовой механизм внимания в преобразователях — основная архитектура, используемая в больших языковых моделях (LLM) для определения важности слов — имеет теоретические и эмпирические ограничения, когда дело доходит до таких возможностей.
Механизм внимания позволяет LLM оглянуться назад на более ранние части запроса или документа и на основе его обучения определить, какие детали и слова имеют наибольшее значение; однако сам по себе этот механизм не понимает порядок слов. Он «видит» все входные слова, то есть токены, одновременно и обрабатывает их в том порядке, в котором они представлены, поэтому исследователи разработали методы кодирования информации о местоположении.
Это ключевой момент для высокоструктурированных областей, таких как язык. Но преобладающий метод позиционного кодирования, называемый ротационным позиционным кодированием (RoPE), учитывает только относительное расстояние между токенами в последовательности и не зависит от входных данных. Это означает, что, например, слова, которые находятся на расстоянии четырех позиций друг от друга, например «кошка» и «коробка» в приведенном выше примере, получат одинаковое фиксированное математическое вращение, специфичное для этого относительного расстояния.
Теперь исследования, проведенные Массачусетским технологическим институтом и Лабораторией искусственного интеллекта Watson MIT-IBM, создали метод кодирования, известный как «Внимание PaTH», который делает позиционную информацию адаптивной и контекстно-зависимой, а не статической, как в случае с RoPE.
«Трансформеры обеспечивают точное и масштабируемое моделирование многих областей, но у них есть ограничения по отслеживанию состояния — классу явлений, который, как считается, лежит в основе важных возможностей, которые мы хотим получить от наших систем искусственного интеллекта. Итак, важный вопрос: как мы можем поддерживать масштабируемость и эффективность преобразователей, в то же время обеспечивая отслеживание состояния?» говорит старший автор статьи Юн Ким, доцент кафедры электротехники и информатики (EECS), член Лаборатории компьютерных наук и искусственного интеллекта (CSAIL) и исследователь лаборатории MIT-IBM Watson AI Lab.
Новый документ об этой работе был представлен ранее в этом месяце на конференции по нейронным системам обработки информации (НейрИПС 2025). В число соавторов Кима входят ведущий автор Сонглин Ян, аспирант EECS и бывший стажер летней программы MIT-IBM Watson AI Lab; Кайюэ Вэнь из Стэнфордского университета; Лилианг Рен из Microsoft; и Икан Шен, Шон Тан, Маянк Мишра и Рамешвар Панда из IBM Research и MIT-IBM Watson AI Lab. Бумага также доступный на arXiv сервер препринтов.
Путь к пониманию
Вместо того, чтобы назначать каждому слову фиксированное вращение на основе относительного расстояния между токенами, как это делает RoPE, PaTH Attention является гибким, рассматривая промежуточные слова как путь, состоящий из небольших, зависящих от данных преобразований. Каждое преобразование, основанное на математической операции, называемой отражением Хаусхолдера, действует как крошечное зеркало, которое подстраивается в зависимости от содержимого каждого передаваемого ему токена. Каждый шаг в последовательности может повлиять на то, как модель интерпретирует информацию в дальнейшем. Кумулятивный эффект позволяет системе моделировать изменение значения по пути между словами, а не только то, насколько далеко они находятся друг от друга.
Этот подход позволяет трансформерам отслеживать, как объекты и отношения изменяются с течением времени, создавая ощущение «позиционной памяти». Думайте об этом как о прохождении пути, ощущая свое окружение и то, как оно влияет на вас. Кроме того, команда также разработала аппаратно-эффективный алгоритм для более эффективного расчета оценок внимания между каждой парой токенов, чтобы совокупное математическое преобразование из PaTH Attention сжималось и разбивалось на более мелкие вычисления, чтобы оно было совместимо с быстрой обработкой на графических процессорах.
Затем исследователи MIT-IBM изучили производительность PaTH Attention в синтетических и реальных задачах, включая рассуждения, долгосрочные тесты и полное обучение LLM, чтобы увидеть, улучшает ли это способность модели отслеживать информацию с течением времени. Команда проверила его способность следовать последней команде «запись», несмотря на множество отвлекающих шагов и многоэтапные тесты на запоминание — задачи, которые сложны для стандартных методов позиционного кодирования, таких как RoPE.
Исследователи также обучили LLM среднего размера и сравнили их с другими методами. Внимание PaTH уменьшило недоумение и превзошло другие методы в тестах на рассуждение, которым оно не было обучено. Они также оценивали извлечение, рассуждение и стабильность с помощью ввода десятков тысяч токенов. PaTH Attention неизменно доказывал свою способность распознавать контент.
«Мы обнаружили, что как в диагностических задачах, предназначенных для проверки ограничений преобразователей, так и в задачах моделирования реального языка наш новый подход смог превзойти существующие механизмы внимания, сохранив при этом их эффективность», — говорит Ким. Далее: «Мне было бы интересно увидеть, улучшат ли такие типы кодирования положения, зависящие от данных, как PATH, производительность преобразователей в структурированных областях, таких как биология, в [analyzing] белки или ДНК».
Мыслить масштабнее и эффективнее
Затем исследователи исследовали, как будет работать механизм внимания PaTH, если он будет более похожим на человеческое мышление, когда мы игнорируем старую или менее важную информацию при принятии решений. Для этого они объединили внимание PaTH с другой схемой кодирования положения, известной как преобразователь забывания (FoX), которая позволяет моделям выборочно «забывать». Полученная в результате система PaTH-FoX дает возможность снизить вес информации в зависимости от данных, достигая хороших результатов в рассуждениях, понимании длительного контекста и тестах языкового моделирования. Таким образом, PaTH Attention расширяет выразительные возможности архитектур-трансформеров.
Ким говорит, что подобные исследования являются частью более широких усилий по разработке «следующей большой вещи» в области искусственного интеллекта. Он объясняет, что основной движущей силой революций как в глубоком обучении, так и в генеративном искусственном интеллекте стало создание «строительных блоков общего назначения, которые можно применять в широких областях», таких как «слои свертки, RNN». [recurrent neural network] слои» и, совсем недавно, трансформеры.
Забегая вперед, Ким отмечает, что такие соображения, как точность, выразительность, гибкость и аппаратная масштабируемость, были и будут иметь важное значение. По его словам, «основное предприятие исследований современной архитектуры пытается найти эти новые примитивы, которые сохраняют или улучшают выразительность, но при этом являются масштабируемыми».
Дополнительная информация:
Сонглин Ян и др., Внимание PaTH: кодирование позиции посредством накопления преобразований домохозяев, arXiv (2025). DOI: 10.48550/arxiv.2505.16381
Предоставлено
Массачусетский технологический институт
Эта история переиздана с любезного разрешения MIT News (web.mit.edu/newsoffice/), популярный сайт, освещающий новости об исследованиях, инновациях и преподавании MIT.
Цитирование: Гибкое кодирование позиции помогает LLM следовать сложным инструкциям и менять состояния (17 декабря 2025 г.), получено 17 декабря 2025 г. с https://techxplore.com/news/2025-12-flexible-position-encoding-llms-complex.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2025-12-17 19:33:00
1766008883
#Гибкое #кодирование #позиции #помогает #LLM #следовать #сложным #инструкциям #менять #состояния
Читайте также

