Новое исследование Google предполагает, что продвинутые модели рассуждения достигают высокой эффективности за счет моделирования многоагентных дебатов, включающих различные точки зрения, личностные качества и знания предметной области.
Их эксперименты показывают, что эти внутренние дебаты, которые они называют «общество мысли“, значительно улучшает производительность модели в сложных задачах рассуждения и планирования. Исследователи обнаружили, что ведущие модели рассуждения, такие как DeepSeek-R1 и QwQ-32B, которые обучаются с помощью обучение с подкреплением (RL), по своей сути развивают эту способность участвовать в мысленных беседах без явных инструкций.
Эти результаты предлагают дорожную карту того, как разработчики могут создавать более надежные приложения LLM и как предприятия могут обучать более совершенные модели, используя свои собственные внутренние данные.
Что такое общество мысли?
Основная предпосылка общества мысли заключается в том, что модели рассуждения учатся имитировать социальные, многоагентные диалоги, чтобы усовершенствовать свою логику. Эта гипотеза опирается на когнитивную науку, в частности на идею о том, что человеческий разум развивался прежде всего как социальный процесс решения проблем посредством аргументации и взаимодействия с различными точками зрения.
Исследователи пишут, что «когнитивное разнообразие, обусловленное различиями в знаниях и личностных качествах, способствует решению проблем, особенно когда оно сопровождается подлинным инакомыслием». Следовательно, они предполагают, что интеграция различных точек зрения позволяет магистрам права разрабатывать надежные стратегии рассуждения. Имитируя разговоры между разными внутренними личностями, модели могут выполнять важные проверки (например, проверку и возврат), которые помогают избежать распространенных ошибок, таких как нежелательная предвзятость и подхалимство.
В таких моделях, как DeepSeek-R1, это «общество» проявляется непосредственно в цепочке мыслей. Исследователи отмечают, что для принудительного взаимодействия не нужны отдельные модели или подсказки; дебаты возникают автономно в рамках процесса рассуждений одного экземпляра модели.
Примеры общества мысли
Исследование предоставляет реальные примеры того, как это внутреннее противоречие приводит к лучшим результатам. В одном эксперименте, посвященном сложной задаче синтеза органической химии, ДипСик-Р1 имитировал дебаты между несколькими различными внутренними точками зрения, включая «Планировщик» и «Критический проверяющий».
Планировщик изначально предложил стандартный путь реакции. Однако Критический Верификатор (характеризующийся высокой добросовестностью и низкой доброжелательностью) прервался, чтобы оспорить это предположение, и предоставил контраргумент с новыми фактами. Благодаря этой состязательной проверке модель обнаружила ошибку, согласовала противоречивые точки зрения и скорректировала путь синтеза.
Аналогичная динамика проявилась и в творческих задачах. Когда ее попросили переписать предложение «Я бросил свою ненависть в горящий огонь», модель имитировала переговоры между «Творческим создателем идей» и «Проверщиком семантической верности». После того, как автор идеи предложил версию с использованием слова «глубоко укоренившийся», проверяющий возразил: «Но это добавляет слово «глубоко укоренившийся», которого не было в оригинале. Нам следует избегать добавления новых идей». В конечном итоге модель пришла к компромиссу, который сохранил первоначальный смысл и одновременно улучшил стиль.
Возможно, самая поразительная эволюция произошла в «Игре обратного отсчета» — математической головоломке, в которой модель должна использовать определенные числа, чтобы достичь целевого значения. В начале обучения модель пыталась решить проблему, используя монологический подход. Как стало известно через RL, он спонтанно разделился на две отдельные личности: «Методического решателя проблем», выполняющего вычисления, и «Исследовательского мыслителя», отслеживающего прогресс, который прерывал неудачные пути замечаниями типа «Опять не повезло… Может быть, мы можем попробовать использовать отрицательные числа», побуждая Методического решателя сменить стратегию.
Эти результаты бросают вызов предположению, что более длинные цепочки размышлений автоматически приводят к более высокой точности. Вместо этого разнообразное поведение, такое как рассмотрение ответов через разные призмы, проверка ранее сделанных предположений, возврат назад и изучение альтернатив, способствует улучшению рассуждений. Исследователи усилили это, искусственно управляя пространством активации модели, чтобы вызвать удивление в разговоре; это вмешательство активировало более широкий спектр личностных и экспертных функций, удваивая точность выполнения сложных задач.
Подразумевается, что социальное мышление возникает автономно посредством RL как функция стремления модели давать правильные ответы, а не под явным контролем человека. Фактически, обучающие модели на монологах уступали по эффективности сырому RL, которое естественным образом развивало многоагентные разговоры. И наоборот, выполнение контролируемая тонкая настройка (SFT) в многосторонних беседах и дебатах значительно превзошел SFT в стандартных цепочках мыслей.
Последствия для корпоративного ИИ
Для разработчиков и лиц, принимающих решения на предприятиях, эти идеи предлагают практические рекомендации по созданию более мощных приложений искусственного интеллекта.
Оперативная разработка «конфликта»
Разработчики могут улучшить рассуждения в моделях общего назначения, явно предлагая им принять структуру мышления общества. Однако недостаточно просто попросить модель пообщаться сама с собой.
«Недостаточно «вести дебаты», нужно иметь разные взгляды и позиции, которые делают дебаты неизбежными и позволяют этим дебатам исследовать и различать альтернативы», — сказал VentureBeat Джеймс Эванс, соавтор статьи.
Вместо общих ролей разработчикам следует создавать подсказки, которые назначают противоположные диспозиции (например, сотрудник, не склонный к риску, или менеджер по продукту, ориентированный на рост), чтобы заставить модель различать альтернативы. Даже простые сигналы, которые побуждают модель выражать «удивление», могут запустить эти превосходные пути рассуждения.
Дизайн для социального масштабирования
Поскольку разработчики масштабируют вычисления во время тестирования, чтобы модели могли «думать» дольше, им следует структурировать это время как социальный процесс. Приложения должны способствовать «социальному» процессу, в котором модель использует такие местоимения, как «мы», задает себе вопросы и открыто обсуждает альтернативы, прежде чем прийти к единому мнению.
Этот подход также может быть распространен на многоагентные системы, где разные личности, назначенные разным агентам, участвуют в критических дебатах для принятия более эффективных решений.
Прекратите очищать свои тренировочные данные
Возможно, наиболее важное значение имеет то, как компании обучают или настраивают свои собственные модели. Традиционно группы обработки данных очищают свои наборы данных, чтобы создать «золотые ответы», которые обеспечивают идеальные, линейные пути к решению. Исследование предполагает, что это может быть ошибкой.
Модели, точно настроенные на разговорных данных (например, стенограммы межагентских дебатов и решений), улучшают рассуждения значительно быстрее, чем модели, обученные на чистых монологах. Есть ценность даже в дебатах, которые не приводят к правильному ответу.
«Мы тренировались на диалоговых основах, которые приводили к неправильному ответу, затем усилили модель и обнаружили, что она работает так же хорошо, как и подкрепление правильного ответа, предполагая, что разговорные привычки поиска решений являются наиболее важными для новых проблем», — сказал Эванс.
Это означает, что предприятиям следует прекратить выбрасывать «грязные» инженерные журналы или потоки Slack, в которых проблемы решались итеративно. «Беспорядок» — это то, где модель учится привычке исследовать.
Раскрытие «черного ящика» доверия и аудита
Для случаев корпоративного использования с высокими ставками просто получить ответ недостаточно. Эванс утверждает, что пользователям необходимо видеть внутреннее несогласие, чтобы доверять результатам, предлагая изменить дизайн пользовательского интерфейса.
«Нам нужен новый интерфейс, который систематически раскрывает нам внутренние дебаты, чтобы мы «участвовали» в выверке правильного ответа», — сказал Эванс. «Мы лучше справляемся с дебатами; ИИ лучше справляются с дебатами; и мы добиваемся большего успеха, когда подвергаемся дебатам с ИИ».
Стратегическое обоснование использования открытых весов
Эти результаты дают новый аргумент в дебатах «создать или купить» относительно моделей с открытым весом и проприетарных API. Многие запатентованные модели рассуждения скрывают цепочку своих мыслей, рассматривая внутренние дебаты как коммерческую тайну или угрозу безопасности.
Но Эванс утверждает, что «никто раньше не предоставил обоснования для разоблачения этого общества мысли», но ценность аудита этих внутренних конфликтов становится неоспоримой. Пока частные поставщики услуг не обеспечат полную прозрачность, предприятия в секторах с высокими требованиями к соблюдению требований могут обнаружить, что модели открытого веса предлагают явное преимущество: способность видеть несогласие, а не только решение.
«Я считаю, что крупные проприетарные модели начнут предоставлять (и лицензировать) информацию, как только поймут, что она имеет ценность», — сказал Эванс.
Исследование показывает, что работа архитектора ИИ смещается от чистого обучения моделям к чему-то более близкому к организационной психологии.
«Я считаю, что это открывает совершенно новые горизонты малых групп и организационного дизайна внутри и между моделями, что, вероятно, позволит открыть новые классы производительности», — сказал Эванс. «Моя команда работает над этим, и я надеюсь, что и другие тоже».
2026-01-30 06:30:00
1769745087
#Модели #искусственного #интеллекта #имитирующие #внутренние #дебаты #значительно #повышают #точность #решения #сложных #задач
Ещё по этой теме
