Долгосрочное планирование ухудшается в больших языковых моделях после 25 перемещений

1769809033
2026-01-30 21:27:00

Ученые все чаще изучают возможности долгосрочного планирования больших языковых моделей — аспект искусственного интеллекта, который еще не до конца изучен. Себастьяно Монти, Карло Николини и Джанни Пеллегрини из Ipazia SpA вместе с Якопо Стаяно из Университета Тренто и Бруно Лепри из Fondazione Bruno Kessler и Ipazia SpA представляют систематическую оценку с использованием нового теста под названием SokoBench, построенного на основе упрощенных головоломок Сокобан. Это исследование важно, поскольку оно показывает явное падение производительности этих моделей, когда задачи требуют планирования за пределами 25 ходов, что указывает на потенциальное фундаментальное ограничение их способности к дальновидному мышлению и позволяет предположить, что простого увеличения размера модели может быть недостаточно для решения этой проблемы.

Исследователи намеренно минимизировали структурную сложность, создавая головоломки с минимальными факторами ветвления, чтобы сосредоточиться конкретно на способности LRM генерировать последовательные последовательности действий в течение длительных периодов времени. Это говорит о том, что присущие моделям архитектурные ограничения не могут быть полностью устранены путем простого увеличения масштаба вычислений во время тестирования. Команда создала контролируемую среду, в которой модели должны создавать полные последовательности решений без внешней памяти или обратной связи, полагаясь исключительно на представления внутреннего состояния для отслеживания развивающегося состояния головоломки.

Этот подход позволяет целенаправленно исследовать способность LRM поддерживать последовательное планирование в течение длинных, хотя и простых последовательностей действий. Исследование устанавливает, что даже минимального разветвления рассуждений в тривиальных случаях Сокобана достаточно, чтобы вызвать неудачи в планировании, подчеркивая системный недостаток в представлении долгосрочных действий и последовательной логике. Исследователи утверждают, что это ограничение распространяется и на пространственное мышление, что представляет собой серьезный пробел в возможностях нынешних LRM. В частности, в исследовании изучалось, могут ли современные LRM надежно решать головоломки Сокобана с линейными коридорами с минимальным ветвлением, и определялась точка, в которой увеличение длины горизонта приводит к катастрофическим нарушениям достоверности действий.
Эти минимальные подзадачи, легко решаемые людьми, по-прежнему представляют собой серьезную проблему для больших моделей мышления, что согласуется с предварительными исследованиями, включающими пространственный интеллект. Этот прорыв показывает, что, хотя LRM преуспевают в понимании естественного языка и извлечении знаний, их способность выполнять надежное долгосрочное планирование остается ограниченной. Работа открывает возможности для будущих исследований, направленных на разработку новых архитектур и методологий обучения, которые улучшают представление долгосрочных действий и возможности последовательной логики этих моделей. Выделяя основные проблемы долгосрочного планирования, это исследование обеспечивает ценный ориентир для оценки и улучшения способностей планирования будущих поколений больших моделей рассуждения с потенциальным применением в робототехнике, играх и сценариях решения сложных задач.

Read more:  UTSA QB открывает бывшую пьесу из Memphis Playering в огромном футбольном скандале в колледже

Карты коридора Сокобан для долгосрочного планирования

Исследователи создали набор данных, состоящий из узких, похожих на коридоры карт шириной и высотой 1, каждая из которых содержит одного игрока, один ящик и одну цель, с длиной карты от 5 до 100 с шагом 5. Этот ограниченный дизайн карты позволял использовать единственную степень свободы, длину коридора, которая служила показателем сложности задачи, упрощая измерение сложности решения. Чтобы расширить набор данных и смягчить потенциальные предварительные ошибки перед тренировкой, команда создала четыре повёрнутых варианта каждой карты, включающие вращение на 90◦, 180◦ и 270◦ наряду с исходной ориентацией. В результате был получен комплексный оценочный набор из 80 различных карт, каждая с четырьмя ориентациями, обеспечивающих надежную основу для анализа производительности, зависящей от ориентации.

В экспериментах использовались DeepSeek R1, GPT-5 и GPT-oss 120B — все модели рассуждения настроены на создание явных следов рассуждений перед предоставлением окончательных ответов. Вызовы вывода последовательно маршрутизировались через OpenRouter с использованием DeepInfra в качестве поставщика вывода, обеспечивая стандартизированную вычислительную среду. В частности, в конвейер входили анализатор предметной области, анализатор проблем и средство решения проблем, что позволяло моделям переводить карты Сокобана в формат PDDL, проверять определение проблемы и генерировать план с помощью решателя. Максимальное количество жетонов завершения, охватывающих как рассуждения, так и окончательный ответ, было ограничено 32 768 для управления вычислительными ресурсами. Этот подход позволил ученым оценить, может ли оснащение LRM внешними инструментами планирования повысить производительность за пределами присущих архитектурных ограничений, обнаружив, что внутренние свойства, такие как длина слова, значительно влияют на производительность.

LRM не справляются с задачами Сокобана, состоящими из двадцати пяти ходов

Это говорит о том, что нынешние LRM с трудом справляются с задачами, требующими расширенной последовательности шагов рассуждения. Измерения подтверждают, что эти улучшения, хотя и были полезными, не полностью преодолели присущие моделям архитектурные ограничения. Данные показывают, что одних подходов к масштабированию во время тестирования может быть недостаточно для значительного улучшения долгосрочного планирования. Этот вывод подчеркивает необходимость архитектурных инноваций для устранения основных ограничений в перспективном планировании. Исследователи тщательно оценили модели головоломок Сокобан — пространственно-ограниченной среды, требующей стратегических манипуляций с ящиками.

Решаемые карты были созданы эффективно, что позволило провести тщательную оценку с помощью точных решателей и таких показателей, как глубина поиска и время решения. Испытания показали, что Сокобан, считающийся хорошим эталоном для планирования, представляет собой уникальную задачу из-за отсутствия коротких путей и необходимости уникальных решений для каждой карты. Первоначальные результаты с моделью OpenAI o1-preview дали процент успеха только 10, 12% при непосредственном применении к головоломкам. Кроме того, команда исследовала настройку LLM-Modulo, в которой модель генерирует планы, выполняемые внешним планировщиком, достигнув примерно 43% решенных случаев для предварительного просмотра o1.

Read more:  От офицера ВВС до генерального директора космической обороны: почему даже Роджерс ушел, чтобы создавать оружие для орбиты

Измерения указывают на существенное увеличение показателей успеха, но при значительно более высоких вычислительных затратах. Анализ неудач LLM показал, что недостатки часто обусловлены базовыми шагами рассуждения, а не сложностью самой проблемы планирования. Работа основана на наблюдениях за задачами по подсчету символов, демонстрируя, что LLM могут выполнять простые символьные операции, но для надежного выполнения им требуются явные подсказки.

Загадки Сокобана открывают ограниченные горизонты планирования

Ученые систематически оценивали возможности планирования и долгосрочного рассуждения современных языковых моделей. Оценка долгосрочного планирования в языковых моделях необходима и достижима, как показывает эта работа. В исследовании признаются ограничения, в том числе сосредоточение внимания на линейных коридорах с одним блоком, обеспечение нижней границы возможностей планирования и использование проверки точного плана. Будущие исследования будут посвящены проверке на основе решателя для сопоставления карт с несколькими действительными решениями. Значимость этих результатов заключается в том, что ограничения языковых моделей выходят за рамки сложности задач и потенциально связаны с отсутствием базовых способностей, таких как счет. Наблюдения согласуются с недавней характеристикой моделей рассуждения как «блуждающих», когда небольшие ошибки в отслеживании состояния накапливаются экспоненциально в течение расширенных горизонтов планирования. Следовательно, простое увеличение масштаба этих моделей не позволит преодолеть эти структурные ограничения без фундаментальных архитектурных изменений или включения явного символического обоснования.

#Долгосрочное #планирование #ухудшается #больших #языковых #моделях #после #перемещений

Читайте также

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.