Резум разблокирует интеллект поиска с длинным хоризоном посредством суммирования контекста, преодоление ограничений окна контекста в веб-агентах

1758167837
2025-09-18 03:16:00

ИИ демонстрирует сложные рассуждения и поиск

Резум -каркас сжимает длинные истории взаимодействия

Ученые рассмотрели ограничения в моделях языка с длинным контекстом для веб-задач, в частности, поддерживая соответствующую информацию во время расширенных взаимодействий. Они разработали резюме, структуру, которая периодически сжимает длинные истории взаимодействия в краткие состояния рассуждения, что позволяет неопределенному исследованию в фиксированном окне контекста. Процесс включает агента, начиная с запроса пользователя, чередование рассуждений и использования инструментов, поиска в Интернете и создания истории взаимодействий. Когда активируется триггер сжатия, выделенный сводный инструмент перегоняет эту историю в целенаправленную резюме, выделяя проверенные доказательства и выявление оставшихся пробелов в области информации.

Это резюме объединяется с оригинальным запросом, чтобы создать новое сжатое состояние, сбросить историю рабочей силы, сохраняя при этом необходимые знания. Команда внедрила это с использованием Jina для просмотра веб -сайта и QWEN2. 5-72B-Инструкция для точного поиска информации. Строгое тестирование показало, что сбои часто возникали в результате преждевременно усеченных траекторий из -за ограничений контекста. Дальнейшее уточнение включало в себя разработку Resumtool-30B, специализированного сводного инструмента, созданного на мощной модели с открытым исходным кодом и тонко настроенным с использованием контрольного бака Sailorfog-QA, сложного набора данных, требующего от агентов активно использовать сводные инструменты.

Этот инструмент был обучен с использованием данных, собранных в результате Resum Dinflouts, Distilling Specialized Summarization возможностей в QWEN3-30B-A3B-CINKING1. Для дальнейшего повышения производительности команда представила Resum-GRPO, учебную структуру, которая знакомит агенты с этим процессом рассуждений, выполненного с резюме, обеспечивая более эффективное управление контекстом и улучшенные возможности решения проблем. Этот инновационный подход позволяет агентам поддерживать осведомленность о предыдущих открытиях, одновременно обходя контекстные ограничения, в конечном итоге достигая устойчивого исследования и повышения производительности в сложных веб-задачах.

Read more:  Землетрясение магнитудой 3,7 сотрясло южный и центральный Онтарио

Резюм позволяет неопределенной веб -навигации для искусственного интеллекта

Ученые разработали Resum, новый подход к веб -навигации для агентов искусственного интеллекта, который преодолевает ограничения, налагаемые контекстными окнами в существующих системах. Нынешние агенты борются со сложными онлайн -задачами, требующими обширного поиска, потому что они быстро исчерпают свою способность обрабатывать информацию в ограниченном контексте. Парадигма резюме рассматривает это, периодически суммируя историю взаимодействия агента, преобразуя ее в компактное состояние рассуждения, которое позволяет проводить неопределенные исследования без ограничений контекста. Эксперименты демонстрируют, что резюме обеспечивает среднее абсолютное улучшение 4.

Исследовательская группа обнаружила, что неудачные попытки решения этих задач обычно включают в себя превышение пределов токена и требуют более 10 звонков для инструментов, в то время как успешные попытки обычно выполняются в течение 10 звонков. Чтобы облегчить это, они разработали специализированный сводный инструмент, Resumtool-30B, построенный на модели QWEN3-30B-A3B, которая разгоняет ключевые доказательства и предлагает действенные следующие шаги. Этот инструмент был обучен с использованием данных из теста Sailorfog-QA, что позволило ему эффективно суммировать длинные и шумные истории взаимодействия. Метод обучения Resum-GRPO использует подкрепление обучения для адаптации агентов к этой новой парадигме рассуждений с резюме, позволяя им сохранять существующие навыки, освоив новый подход.

Неуграничное исследование веб -агента посредством суммирования

В этой работе рассматриваются ограничения контекстных окон в веб-агентах на основе крупных языковых моделей, которые препятствуют их способности выполнять сложные многоэтапные поиски. Исследователи разработали резюме, новый подход к выводу, который периодически сжимает длинные истории взаимодействия в краткие резюме, позволяя агентам продолжать изучать, не будучи ограниченными длиной контекста, что позволяет неограниченное исследование для интенсивных знаний задач. Команда также усовершенствовала эту парадигму с помощью Resum-GRPO, алгоритма обучения, который адаптирует агентов для эффективного использования рассуждений с резюме. Обширные эксперименты по нескольким показателям демонстрируют, что резюме последовательно повышает производительность по сравнению с существующими методами, со средним абсолютным улучшением 4.

Read more:  Последний день, чтобы подать заявку на проведение своего мероприятия на Disprupe 2025

5% по сравнению с рамкой реагирования. Примечательно, что агент, обученный Resum-GRP, Webresummer-30B, достиг сильных результатов по сложным задачам просмотра веб-страниц, превосходя производительность других агентов с открытым исходным кодом с ограниченными данными обучения. Авторы признают, что нынешняя система опирается на вызов резюме на основе правил и будущей работы, которая будет сосредоточена на том, чтобы агенты разумно определяли, когда создавать эти резюме, устраняя эту зависимость, представляя значительный шаг к созданию более способных и эффективных веб-агентов, которые могут решать сложные задачи, обращающиеся на информацию.

#Резум #разблокирует #интеллект #поиска #длинным #хоризоном #посредством #суммирования #контекста #преодоление #ограничений #окна #контекста #вебагентах

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.