1769752762
2026-01-30 05:17:00
Тест OS-Marathon для долгосрочной оценки агентов является сложной задачей
Эти задачи, отражающие обычные профессиональные рабочие процессы, такие как обработка отчетов о расходах и выставление оценок студентам, представляют собой серьезную проблему из-за их продолжительности и структурированных, повторяющихся подпроцессов. Следовательно, они разработали OS-Marathon специально для устранения этого ограничения, предлагая стандартизированную платформу для оценки производительности в долгосрочной перспективе. Этот инновационный подход обходит ограничения прямой интеграции длительных рабочих процессов в текущие CUA из-за ограничений длины контекста. Эксперименты выявляют присущие существующим агентам трудности, в том числе логическую непоследовательность в упорядочении задач, галлюцинации при планировании действий и борьбу за поддержание согласованности в повторяющихся подпроцессах.
Команда обнаружила, что агенты часто выполняют задачи нелогично или пытаются выполнить действия, не привязываясь к текущему состоянию рабочего процесса, что приводит к сбоям. Эта стратегия обеспечивает двухуровневые инструкции, помогая агентам как в глобальном планировании, организации повторяющегося цикла, так и в выполнении подпроцессов, осваивая фундаментальную логику каждого шага. Разделяя рабочие процессы на ключевые этапы, этот метод позволяет современным агентам эффективно адаптироваться к более крупным, невидимым коллекциям данных. Работа устанавливает формальное определение долгосрочных, повторяющихся задач CUA и вводит эталон, охватывающий области отчетности о расходах и обработки стенограмм, используя семь различных сред выполнения.
Кроме того, исследователи оценили ведущие CUA на OS-Marathon и выявили три основных режима сбоя: логическая несогласованность, галлюцинации и непоследовательность. Агентам часто приходилось сталкиваться со сложными структурами рабочих процессов и поддерживать согласованность повторяющихся подпроцессов, что подчеркивало необходимость улучшения возможностей долгосрочного рассуждения. Веб-сайт проекта доступен по адресу github. io/ предоставляет дополнительную информацию и ресурсы для исследовательского сообщества.
Тест OS-Marathon для оценки долгосрочных задач
Исследователи тщательно разработали задачи в каждой области, варьируя продолжительность горизонта и сложность документации, чтобы облегчить детальную оценку эффективности агентов на нескольких уровнях сложности. Ученые использовали полнофункциональные веб-системы и локальные приложения для работы с электронными таблицами в качестве сред выполнения, создавая разнообразную и реалистичную испытательную площадку для агентов. Команда наблюдала три основных режима сбоя в ведущих CUA при выполнении задач OS-Marathon: логическая несогласованность в упорядочении задач, галлюцинации во время планирования действий и неспособность обосновать действия на текущем состоянии подпроцесса. Например, агенты часто пытались заполнить системные поля без предварительного извлечения соответствующих данных из исходных документов, что приводило к ошибкам. В этой работе представлен стандартизированный тест OS-Marathon, специально предназначенный для оценки производительности CUA в долгосрочных, повторяющихся сценариях выполнения, включающий 242 задачи в 2 доменах и 7 различных средах выполнения. Веб-сайт проекта доступен по адресу github. io/ предоставляет дополнительную информацию и ресурсы для исследовательского сообщества.
Тест OS-Marathon подчеркивает долгосрочную производительность агентов с помощью сложных
Эксперименты показали, что проблемы в основном возникают из-за объема экземпляров данных и сложности обработки каждого отдельного экземпляра, особенно при работе с многостраничными PDF-файлами и плотными макетами документов. Уровни 1 и 2 концентрируются на фундаментальных возможностях, а уровни 3 и 4 моделируют реалистичные сценарии с увеличенными объемами поступлений, заставляя агентов поддерживать контекст в течение более длительного периода выполнения. Аналогичным образом, домен Transcript имеет три уровня, определяемые номером курса и сложностью макета: от одностраничных PDF-файлов с одним столбцом до многостраничных документов с переменным макетом. Данные показывают, что рабочая нагрузка с трудом масштабируется: от десятков курсов на более низких уровнях до сотен на самых продвинутых уровнях.
Синтетические квитанции были созданы с помощью больших языковых моделей (LLM) и отображены с помощью шаблонов для создания согласованных сроков. Домен «Транскрипт» включает 52 реальных задачи и 30 синтетических задач, используя предварительно созданные шаблоны и синтезированные профили учащихся. Результаты демонстрируют эффективность этой стратегии построения задач в создании разнообразного и сложного ориентира для оценки CUA. Чтобы выйти за рамки простых двоичных показателей успеха, исследователи представили точность подрабочего процесса (SWA) — новый показатель, позволяющий количественно оценить производительность агента в расширенных последовательностях действий. SWA рассчитывается как количество правильно выполненных подпотоков, деленное на общее количество подпотоков (n/N), что обеспечивает детальное измерение надежности агента в долгосрочных задачах. Этот прорыв обеспечивает метод построения сжатой демонстрации, используя всего несколько примеров, что позволяет агентам эффективно выполнять аналогичные рабочие процессы с более крупными, невидимыми коллекциями данных.
Агент тестовых тестов OS-Marathon для предотвращения долгосрочных повторений
Обширные эксперименты выявили трудности, присущие этим долгосрочным задачам для современных агентов, причем многие из них не могут добиться успеха даже на более простых уровнях. Однако применение предложенного демонстрационного метода, особенно в сочетании с платформой AgentS2.5 и GPT-5, значительно улучшило производительность, продемонстрировав свою эффективность в облегчении обучения агентов. Авторы признают ограничения объема теста, в настоящее время сосредоточенного на задачах уровней 1 и 2, а также вычислительные затраты на полномасштабную оценку. Будущие исследования будут сосредоточены на расширении OS-Marathon, включив в него уровни 3 и 4, представляющие более сложные задачи для CUA.
Команда также намерена изучить методы дальнейшего снижения затрат на создание демонстраций и улучшения возможности обобщения агентов в различных рабочих процессах. Эти результаты подчеркивают важность специальных тестов для оценки долгосрочных возможностей агентов и позволяют предположить, что методы целенаправленной демонстрации могут существенно повысить производительность при выполнении повторяющихся структурированных задач. Эта работа способствует развитию практичных и надежных CUA для автоматизации утомительных рабочих процессов в профессиональных условиях.
#OsMarathon #провел #надежный #сравнительный #анализ #агентов #по #повторяющимся #задачам #длительным #горизонтом
По теме

