Toucan синтезирует 1,5 млн инструментов-агентских траекторий из 500 реальных средств MCP для улучшенного обучения агентов

1759745062
2025-10-06 09:49:00

Разработка все более способных агентов искусственного интеллекта зависит от доступа к реалистичным данным обучения, однако значительное узкое место в настоящее время ограничивает прогресс в сообществе с открытым исходным кодом. Чтобы решить эту проблему, Чжанхен Сюй, Адриана Меза Сория, Шон Тан и коллеги из лаборатории MIT-IBM Watson AI, вместе с Радхой Пуендран из Университета Вашингтона, присутствующий Toucan, новый набор данных, включающий 1 млн. Агентических траекторов. Тукан отличается синтезой данных из почти 500 подлинных, реальных сред., Создавая различные и сложные задачи, которые включают подлинное выполнение инструмента, в отличие от существующих наборов данных, часто ограниченных в сложности и реализме. Это достижение не только обеспечивает значительно более крупный ресурс для обучения агентов искусственного интеллекта, но и явно повышает производительность, при этом модели, обученные Toucan, превосходят более крупные альтернативы с закрытым исходным кодом по установленным критериям и продвигают современное выполнение сложных задач.

Сложность конфигурации сервера и выбор инструментов

Это исследование исследует проблемы понимания сложных конфигураций сервера, зависимостей инструментов и перевода запросов высокого уровня в конкретные вызовы инструментов. Трудность возникает из -за потенциала для нескольких допустимых конфигураций и необходимости точного вывода намерений пользователя из ограниченной информации, требуя прочных доменных знаний об администрировании сервера, сети и доступных инструментах. Хотя альтернативные инструменты могут существовать, они часто требуют разных подходов или отсутствия необходимых возможностей, что делает предполагаемый инструмент необходимым для выполнения задачи. Вопрос хорошо сформирован, хотя в нем не хватает конкретных подробностей о среде сервера, пользовательских предпочтениях или желаемой конфигурации, что может привести к нескольким интерпретациям.

Исследование подчеркивает важность четкой информационной архитектуры, предполагая, что предоставление большего контекста или ограничений улучшит ясность. Сценарий точно отражает реалистичные задачи, с которыми сталкиваются системные администраторы и инженеры DevOps, заземляя работу в практических случаях использования. Проверка ответа требует доступа к серверу и возможности применения конфигурации, подтверждая ее функциональность, хотя неполные или неточные конфигурации могут быть трудно проверить без дополнительной информации.

Read more:  Покемон, Марио, Зельда… Как Nintendo добилась успеха, охватившего поколения

Генерирование разнообразных агентских траекторий с Toucan

Исследователи разработали Toucan, существенный набор данных 1. 5 миллионов траекторий, агентских инструментов, для преодоления ограничений в существующих данных обучения для агентов искусственного интеллекта. Этот набор данных был сгенерирован с использованием почти 500 реальных протоколов контекста, обеспечивающих разнообразие, реализм и сложность в задачах, представленных агентам. Методология включает в себя трубопровод, который создает широкий спектр запросов по использованию инструментов, применяет качественную фильтрацию и генерирует агентские траектории, используя три модели учителя в двух различных агентских рамках. Строгая проверка, используя методы как на основе правил, так и на основе LLM, гарантирует высокое качество генерируемых данных.

Чтобы дополнительно повысить надежность набора данных, команда внедрила три механизма расширения, включая введение ограничений для создания вариаций существующих задач, моделирования разговоров с несколькими поворотами путем разделения сложных задач на последовательные подвески и затягивание фильтров, чтобы сосредоточиться на соответствующих вызовах инструмента. Подробный статистический анализ показывает всестороннее охват Тукана многомерных и многопрофильных задач, а также распространенность разговоров с несколькими поворотами. Эксперименты демонстрируют, что моделируют точные настройки на Тукан, значительно превосходящие более крупные коллеги с закрытым исходным кодом на эталоне BFCL V3 и продвигают границу производительности на скамейке MCP-Universe, повышая производительность QWEN2. 5-7B-включение на 3.

16%, Qwen2. 5-14B-инстакция на 7. 40%и QWEN2. 5-32B-Инстакция на 8. 72%. Оценка качества на основе LLM подтверждает, что Toucan демонстрирует высокое качество вопросов, реализм сценария и сбалансированный диапазон трудностей с заданиями, устанавливая его как ценный ресурс для обучения и оценки передовых агентов ИИ.

Набор данных TOUCAN позволяет реалистичным использованию инструментов ИИ агентов

Затем агентские траектории генерируются с использованием трех моделей учителей, включающих как проверки на основе правил, так и на основе моделей для проверки выполнения инструмента и точности ответа. Этот конвейер также включает в себя расширения для создания дополнительных задач, нацеленных на сценарии края, интерактивные беседы и многократные диалоги, значительно расширяя сложность набора данных. Эксперименты демонстрируют, что моделируют точные настройки на Toucan, превзойденные аналоги с закрытым исходным кодом на эталоне BFCL V3, достигая превосходной производительности в функциональном вызове точности как в сценариях с одним поворотом, так и в сценариях с одним поворотом. Кроме того, эти модели демонстрируют существенные улучшения как на τ-банд, так и в τ2-каенке, с прибылью в выборе инструментов, точности выполнения и рассуждениях о многообразии при динамических взаимодействиях пользователей. На недавнем эталонном эталоне MCP-Universe модели TOUCAN, настраиваемые, достигают современной производительности в своем классе параметров, последовательно превосходя ведущие модели сопоставимого размера, подтверждая эффективность TOUCAN в повышении агентных возможностей LLM и обеспечении ценного ресурса с открытым средством для поля.

Read more:  Ваша камера Fujifilm может стоить 800 долларов дороже, благодаря тарифам

Toucan Datazet Advancesing Использование языковых агентов

Эта работа представляет Toucan, существенный набор данных, включающий 1. 5 миллионов траекторий, предназначенных для улучшения обучения моделей языковых агентов, использующих инструменты. Команда разработала комплексный конвейер для создания этих данных, используя почти 500 реальных протоколов контекста для создания разнообразных и сложных задач, включающих фактическое выполнение инструмента. Результаты демонстрируют, что модели, настраиваемые на Toucan, достигают улучшенной производительности на установленных критериях, включая BFCL-V3 и MCP-Universe, и продвигают текущее состояние в этой области. Создание Toucan представляет собой значительный шаг к созданию более надежных и способных языковых агентов.

Благодаря строгим методам валидации исследователи обеспечили качество и надежность сгенерированных данных, удовлетворяя критическую потребность в сообществе с открытым исходным кодом. Исследования абляции подтверждают, что каждый компонент конвейера генерации данных способствует общему повышению производительности. Авторы подтверждают определенные ограничения, включая снимок набора данных во времени и исключение серверов, требующих сложных конфигураций. Будущая работа будет сосредоточена на расширении набора данных, чтобы включить больше серверов и разработка экспертных моделей, способных моделировать ответы инструментов, снизить стоимость и сложность генерации данных. Они также планируют создать специальный эталон, ориентированный на возможности поиска в Интернете, что еще больше продвигает развитие языковых агентов, использующих инструменты.

#Toucan #синтезирует #млн #инструментовагентских #траекторий #из #реальных #средств #MCP #для #улучшенного #обучения #агентов

По теме

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.