Агенты OpenCUA для использования компьютера с открытым исходным кодом конкурируют с проприетарными моделями OpenAI и Anthropic.

Новая структура от исследователей из Университет Гонконга (HKU) и сотрудничающие учреждения предоставляют основу с открытым исходным кодом для создания надежных агентов искусственного интеллекта, которые могут управлять компьютерами. Структура, названная Опенкуавключает инструменты, данные и рецепты для масштабирования разработки агентов компьютерного использования (CUA).

Модели, обученные с использованием этой платформы, демонстрируют высокие результаты в тестах CUA, превосходя существующие модели с открытым исходным кодом и тесно конкурируя с закрытыми агентами из ведущих лабораторий искусственного интеллекта, таких как OpenAI и Anthropic.

Проблема создания агентов, использующих компьютеры

Агенты, использующие компьютеры предназначены для автономного выполнения задач на компьютере: от навигации по веб-сайтам до работы со сложным программным обеспечением. Они также могут помочь автоматизировать рабочие процессы на предприятии. Однако наиболее эффективные системы CUA являются проприетарными, а важные сведения об их обучающих данных, архитектуре и процессах разработки остаются конфиденциальными.

«Поскольку отсутствие прозрачности ограничивает технические достижения и вызывает проблемы безопасности, исследовательскому сообществу нужны по-настоящему открытые структуры CUA для изучения их возможностей, ограничений и рисков», — заявляют исследователи в их статья.

В то же время усилия по созданию открытого исходного кода сталкиваются со своими собственными препятствиями. Не было масштабируемой инфраструктуры для сбора разнообразных крупномасштабных данных, необходимых для обучения этих агентов. Существующие наборы данных с открытым исходным кодом для графических пользовательских интерфейсов (GUI) содержат ограниченные данные, а многие исследовательские проекты предоставляют недостаточно подробностей об их методах, что затрудняет копирование их работы другими.

Согласно документу, «эти ограничения в совокупности препятствуют развитию CUA общего назначения и ограничивают значимое исследование их масштабируемости, обобщаемости и потенциальных подходов к обучению».

Представляем OpenCUA

Полевые исследования OpenCUA: лаборатория XLANG и HU

OpenCUA — это платформа с открытым исходным кодом, предназначенная для решения этих проблем путем масштабирования как сбора данных, так и самих моделей. В его основе лежит инструмент AgentNet для записи человеческих демонстраций компьютерных задач в различных операционных системах.

Read more:  ФРС снижает процентные ставки на четверть пункта на фоне очевидного раскола в экономике США | Федеральная резервная система

Инструмент упрощает сбор данных, работая в фоновом режиме на персональном компьютере аннотатора, захватывая видео с экрана, ввод с помощью мыши и клавиатуры, а также базовое дерево доступности, которое предоставляет структурированную информацию об элементах на экране. Эти необработанные данные затем обрабатываются в «траектории состояния-действия», сочетая снимок экрана компьютера (состояние) с соответствующим действием пользователя (щелчок, нажатие клавиши и т. д.). Аннотаторы могут затем просматривать, редактировать и отправлять эти демонстрации.

Агент

Используя этот инструмент, исследователи собрали набор данных AgentNet, который содержит более 22 600 демонстраций задач для Windows, macOS и Ubuntu, охватывающих более 200 приложений и веб-сайтов. «Этот набор данных достоверно отражает сложность человеческого поведения и динамику окружающей среды в среде персональных компьютеров пользователей», — отмечается в документе.

Понимая, что инструменты записи экрана создают серьезные проблемы с конфиденциальностью данных для предприятий, исследователи разработали инструмент AgentNet с учетом требований безопасности. Синьюань Ван, соавтор статьи и аспирант Гонконгского университета, объяснил, что они внедрили многоуровневую структуру защиты конфиденциальности. «Во-первых, аннотаторы сами могут полностью наблюдать за данными, которые они генерируют… прежде чем решить, отправлять ли их», — рассказал он VentureBeat. Затем данные подвергаются ручной проверке на предмет проблем конфиденциальности и автоматическому сканированию с помощью большой модели для обнаружения оставшегося конфиденциального контента перед публикацией. «Этот многоуровневый процесс обеспечивает надежность корпоративного уровня для сред, обрабатывающих конфиденциальные данные клиентов или финансовые данные», — добавил Ван.

Чтобы ускорить оценку, команда также разработала AgentNetBench, автономный тест, который обеспечивает несколько правильных действий для каждого шага, предлагая более эффективный способ измерения производительности агента.

Новый рецепт обучения агентов

Платформа OpenCUA представляет новый конвейер для обработки данных и обучения агентов, использующих компьютер. Первый шаг преобразует необработанные человеческие демонстрации в чистые пары «состояние-действие», пригодные для обучения. модели языка видения (ВЛМ). Однако исследователи обнаружили, что простое обучение моделей на этих парах дает ограниченный прирост производительности даже при больших объемах данных.

Read more:  Великобритания и Бразилия объединяются для борьбы с воздействием экологических удобрений

Конвейер цепочки мыслей OpenCUA Источник: XLang Lab в Гонконге.

Ключевой идеей было дополнить эти траектории цепочка мыслей (CoT) рассуждения. Этот процесс генерирует подробный «внутренний монолог» для каждого действия, который включает в себя планирование, запоминание и размышление. Это структурированное рассуждение организовано на трех уровнях: общее наблюдение за экраном, рефлексивные мысли, которые анализируют ситуацию и планируют следующие шаги, и, наконец, краткое, выполнимое действие. Такой подход помогает агенту глубже понять задачи.

«Мы считаем, что рассуждения на естественном языке имеют решающее значение для обобщаемых базовых моделей использования компьютеров, помогая CUA усвоить когнитивные способности», — пишут исследователи.

Этот конвейер синтеза данных представляет собой общую структуру, которую компании могут адаптировать для обучения агентов использованию своих собственных уникальных внутренних инструментов. По словам Ванга, предприятие может записывать демонстрации своих собственных рабочих процессов и использовать один и тот же конвейер «рефлектор» и «генератор» для создания необходимых обучающих данных. «Это позволяет им запустить высокопроизводительный агент, адаптированный к их внутренним инструментам, без необходимости вручную создавать логические цепочки», — пояснил он.

Тестирование OpenCUA

Исследователи применили структуру OpenCUA для обучения ряда VLM с открытым исходным кодом, включая варианты Qwen и Kimi-VL, с размерами параметров от 3 до 32 миллиардов. Модели оценивались с помощью набора онлайн- и офлайн-тестов, которые проверяют их способность выполнять задачи и понимать графические интерфейсы.

Модель OpenCUA-32B с 32 миллиардами параметров установила новый уровень успеха среди моделей с открытым исходным кодом в тесте OSWorld-Verified. Он также превзошел OpenAI cua на основе GPT-4o и значительно сократили разрыв в производительности с ведущими запатентованными моделями Anthropic.

OpenCUA демонстрирует значительные улучшения по сравнению с базовыми моделями (слева), конкурируя с ведущими моделями CUA (справа). Источник: лаборатория XLANG в Гонконге.

Для корпоративных разработчиков и лидеров продуктов исследование предлагает несколько ключевых выводов. Метод OpenCUA широко применим, улучшая производительность моделей с различной архитектурой (как плотной, так и смесь экспертов) и размеры. Обученные агенты также демонстрируют высокую степень обобщения, хорошо справляясь с разнообразными задачами и операционными системами.

Read more:  ИИ может повысить экономику Великобритании на 10% за 5 лет, говорит Microsoft Boss

По словам Ванга, эта платформа особенно подходит для автоматизации повторяющихся и трудоемких корпоративных рабочих процессов. «Например, в наборе данных AgentNet мы уже фиксируем несколько демонстраций запуска экземпляров EC2 на Amazon AWS и настройки параметров аннотаций на MTurk», — рассказал он VentureBeat. «Эти задачи включают в себя множество последовательных шагов, но следуют повторяющимся шаблонам».

Однако Ван отметил, что для устранения разрыва с реальным развертыванием необходимо решить ключевые проблемы, связанные с безопасностью и надежностью. «Самая большая проблема при реальном развертывании — это безопасность и надежность: агент должен избегать ошибок, которые могут непреднамеренно изменить настройки системы или вызвать вредные побочные эффекты, выходящие за рамки намеченной задачи», — сказал он.

Исследователи опубликовали код, набор данныхи гири для своих моделей.

По мере того, как агенты с открытым исходным кодом, созданные на таких платформах, как OpenCUA, становятся более функциональными, они могут фундаментально улучшить отношения между работниками умственного труда и их компьютерами. Ван предвидит будущее, в котором владение сложным программным обеспечением станет менее важным, чем способность четко формулировать цели агенту ИИ.

Он описал два основных режима работы: «автономная автоматизация, когда агент использует свои более обширные знания в области программного обеспечения для комплексного решения задачи» и «онлайн-сотрудничество, когда агент реагирует в режиме реального времени и работает бок о бок с человеком, как коллега». По сути, люди будут обеспечивать стратегическое «что», а все более совершенные агенты ИИ будут отвечать за оперативное «как».

2025-08-22 23:25:00


1760521184
#Агенты #OpenCUA #для #использования #компьютера #открытым #исходным #кодом #конкурируют #проприетарными #моделями #OpenAI #Anthropic

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.