С первого взгляда
- Сегодняшние тесты агентов ИИ тестируют одну задачу за раз, в то время как реальная производительность на рабочем месте требует одновременного управления десятками взаимозависимых задач. Чтобы отразить это, мы создали параметр под названием «Среды многогоризонтных задач» (MHTE).
- При многозадачных нагрузках ведущие операторы, использующие компьютер, резко деградируют: процент выполнения падает с 16,7% до 8,7%.
- CORPGEN представляет цифровые сотрудникис иерархическим планированием, изоляцией памяти и экспериментальным обучением, обеспечивающим до 3,5 раз более высокий уровень завершения по сравнению с базовыми показателями для трех независимых серверных частей агента.
- Поскольку CORPGEN не зависит от архитектуры и является модульным, его преимущества связаны с дизайном системы, а не с какой-либо одной базовой моделью, и он получает прямую выгоду по мере совершенствования базовых моделей.
К середине утра типичный специалист по информационным технологиям уже манипулирует отчетом клиента, таблицей бюджета, набором слайдов и невыполненной работой по электронной почте, и все это взаимозависимо и требует внимания одновременно. Чтобы агенты ИИ были по-настоящему полезны в этой среде, они должны будут действовать одинаково, но сегодня лучшие модели оценивают одну задачу за раз, а не десятки одновременно.
В нашей газете «CORPGEN: Моделирование корпоративной среды с автономными цифровыми сотрудниками в средах с несколькими горизонтальными задачами», мы предлагаем структуру агентов, которая снабдит ИИ возможностями памяти, планирования и обучения, чтобы закрыть этот пробел.
Знакомство со средами задач с несколькими горизонтами
Воспроизведение реальности многозадачности на рабочем месте требует нового типа среды оценки. В ответ мы разработали многозональные среды задач (MHTE) — настройки, в которых агент должен одновременно управлять несколькими сложными задачами. Каждая задача требует от 10 до 30 зависимых шагов в течение одного сеанса продолжительностью пять часов.
Чтобы определить, что необходимо протестировать с помощью эталонного теста, мы провели масштабное тестирование MHTE на некоторых из ведущих сегодня агентов искусственного интеллекта, выявив четыре слабых места. Во-первых, память заполняется. Агент не может хранить сведения для нескольких активных задач одновременно. Во-вторых, информация из одной задачи мешает рассуждениям о другой. В-третьих, задачи не зависят друг от друга в простых последовательностях. Они образуют сложные сети, в которых агент должен постоянно проверять, завершена ли работа выше по потоку, прежде чем он сможет перейти к чему-либо ниже по потоку. В-четвертых, каждый цикл действий требует изменения приоритетов всех активных задач, а не просто возобновления с того места, где агент остановился.
Мы также протестировали три независимые агентные системы при возрастающих нагрузках. Поскольку количество одновременных задач выросло с 12 до 46, процент выполнения упал с 16,7% до 8,7% во всех системах.
Архитектура CORPGEN
CORPGEN представляет цифровые сотрудники: Агенты искусственного интеллекта на базе LLM с постоянной идентификацией, профессиональным опытом и реалистичными графиками работы. Они управляют приложениями Microsoft Office посредством автоматизации графического пользовательского интерфейса и стабильно работают в MHTE в течение нескольких часов непрерывной работы. На рисунке 1 показано, как цифровой сотрудник проходит полный рабочий день.

CORPGEN целенаправленно устраняет каждый из четырех недостатков параллельного выполнения задач — перегрузку памяти, взаимодействие между задачами, сложность зависимостей и изменение приоритетов. Иерархическое планирование разбивает цели на ежедневные цели, а затем на ежемоментные решения, позволяя агенту действовать на основе структурированного плана вместо анализа всех доступных задач перед каждым шагом.
Субагенты выполняют сложные операции, такие как веб-исследования, в изолированном контексте, предотвращая перекрестное загрязнение. Многоуровневая система памяти позволяет выборочно вызывать информацию, связанную с задачей, вместо того, чтобы сохранять все в активном контексте. Адаптивное суммирование сжимает рутинные наблюдения, сохраняя при этом важную информацию и контролируя рост памяти.
Поскольку эти механизмы не привязаны к конкретной базовой модели, мы протестировали CORPGEN на трех разных агентах. В каждом случае мы наблюдали последовательный рост. Улучшения были связаны с архитектурой, а не с преимуществами какой-либо конкретной модели. На рис. 2 показано, как они сочетаются друг с другом в архитектуре CORPGEN.

Как сотрудничают цифровые сотрудники
Когда несколько цифровых сотрудников работают в одной среде, сотрудничество осуществляется через стандартные каналы связи без заранее определенных правил координации. Один сотрудник отправляет электронное письмо с запросом данных; другой улавливает его в следующем цикле, использует свою память для его обработки и отвечает. Этот обмен отражает реальное общение на рабочем месте.
Между агентами нет общего внутреннего состояния. Координация осуществляется полностью через электронную почту и Microsoft Teams — те же каналы, которые используют многие сотрудники. Со временем эти независимые обмены формируют узнаваемые организационные модели. Некоторые агенты берут на себя руководящие роли; другие оказывают поддержку; общие документы становятся соединительной тканью.
Когда канал связи прерывается, например, из-за ошибки доставки электронной почты, агенты перенаправляют сообщения через альтернативные каналы, чтобы продолжить работу. Результатом является виртуальная организация, которая ведет себя как реальная, но не запрограммирована на это явно.
Оценка КОРПГЕНА
Мы оценивали CORPGEN с помощью многозадачного теста, который объединял до 46 задач в одну шестичасовую сессию. Три вывода заслуживают внимания.
Базовые показатели ухудшаются по мере увеличения нагрузки; Корпген этого не делает. Все три базовые системы агентов демонстрировали устойчивое снижение производительности по мере роста нагрузки. CORPGEN, напротив, сохранил или улучшил показатели завершения работ при более высоких нагрузках. При выполнении 46 задач CORPGEN выполнил 15,2% задач по сравнению с 4,3% для базовых показателей, то есть примерно в 3,5 раза больше.
Обучение на основе опыта приносит наибольшие выгоды. Мы последовательно вводили компоненты CORPGEN: сначала уровень оркестрации, затем когнитивные инструменты и, наконец, экспериментальное обучение. Первые два показали умеренные улучшения. Экспериментальное обучение, при котором агенты хранят записи о выполненных задачах и повторно используют их, когда сталкиваются со структурно схожей работой, дало наибольший прирост, повысив процент выполнения с 8,7% до 15,2%.
Методика оценки меняет картину. Когда мы проверили фактические выходные файлы, созданные агентами, результаты соответствовали человеческим суждениям примерно в 90% случаев. Оценка, основанная на скриншотах и журналах действий, согласилась лишь примерно в 40% случаев. Этот пробел предполагает, что общепринятые подходы к оценке могут недооценивать то, чего агенты фактически достигают на практике.
СЕРИЯ ПОДКАСТОВ
Революция искусственного интеллекта в медицине: новый взгляд
Присоединяйтесь к Питеру Ли из Microsoft в путешествии, чтобы узнать, как ИИ влияет на здравоохранение и какое значение это имеет для будущего медицины.
Последствия и перспективы
Результаты показывают, что память и извлечение, а не только возможности сырой модели, могут быть ключевым узким местом в обеспечении работы агентов в реальном мире. Наибольшие успехи были достигнуты благодаря экспериментальному обучению. Агенты, которые учатся на предыдущих успехах и применяют эти шаблоны к структурно схожим задачам, получают преимущество перед системами, которые реагируют на каждую задачу изолированно.
CORPGEN также открывает новый взгляд на то, как взаимодействуют агенты ИИ. Следующие шаги включают проверку того, могут ли агенты сохранять память в течение нескольких рабочих дней и как они координируют свои действия при работе в группах. Мы также изучаем способы сделать агентов более быстрыми и надежными, комбинируя различные методы взаимодействия с программным обеспечением.
Благодарности
Эта работа является результатом сотрудничества Управления технического директора Microsoft и Программы Microsoft AI Development Accelerator Program (MAIDAP). Мы хотели бы поблагодарить группу Microsoft Security Research за предоставление ресурсов, которые поддержали это исследование. Мы также благодарим членов Microsoft НЛО2 (откроется в новой вкладке) команда и Мем0 (откроется в новой вкладке) проекту за вклад в открытый исходный код, который позволил реализовать ключевые компоненты архитектуры CORPGEN, а также команде OSWorld за тест, который послужил основой для нашей многозадачной оценки.
Наконец, мы благодарим многих участников этого исследования: Шарлотту Сиска, Мануэля Рауля Мелендеса Лухана, Энтони Твум-Баримах и Маурисио Веласко.
2026-02-27 17:00:00
1772217766
#CORPGEN #продвигает #искусственный #интеллект #для #реальной #работы
Читайте также

