Как большие языковые модели кодируют теорию разума

Задача Тома. В вопросе (а) магистрантам следует заполнить пробел словом «попкорн». В вопросе (b) пропуск следует заполнить словом «шоколад». Кредит: npj Искусственный интеллект (2025). DOI: 10.1038/s44387-025-00031-9

Представьте, что вы смотрите фильм, в котором персонаж кладет плитку шоколада в коробку, закрывает коробку и выходит из комнаты. Другой человек, также находящийся в комнате, перекладывает штангу из коробки в ящик стола. Вы, как наблюдатель, знаете, что угощение теперь находится в ящике, и вы также знаете, что, когда первый человек вернется, он будет искать угощение в коробке, потому что не знает, что его переместили.

Вы знаете это, потому что, будучи человеком, вы обладаете когнитивные способности делать выводы и рассуждать о сознании других людей – в данном случае это неосведомленность человека о том, где находится шоколад. Говоря научным языком, эта способность описывается как Теория Разума (ToM). Эта способность «чтения мыслей» позволяет нам предсказывать и объяснять поведение других, учитывая их психическое состояние.

Мы развиваем эту способность примерно в четыре года, и наш мозг действительно хорош в этом.

«Для человеческий мозг«Это очень простая задача», — говорит Чжаочжуо Сюй, доцент кафедры компьютерных наук Инженерного факультета, — на ее обработку уходит всего несколько секунд.

«При этом наш мозг задействует лишь небольшую часть нейронов, поэтому он очень энергоэффективен», — объясняет Денхуэй Чжан, доцент кафедры информационных систем и аналитики в Школе бизнеса.

Чем LLM отличается от человеческого мышления

Большие языковые модели или LLM, которые изучают исследователи, работают по-другому. Хотя они были вдохновлены некоторыми концепциями нейробиологии и когнитивная наукаони не являются точной имитацией человеческого мозга. LLM были построены на искусственные нейронные сети которые во многом напоминают организацию биологических нейронов, но модели учатся на закономерностях в огромных объемах текста и работают с использованием математических функций.

Это дает LLM явное преимущество перед людьми в быстрой обработке большого количества информации. Но когда дело доходит до эффективности, особенно в простых вещах, LLM проигрывают людям. Независимо от сложности задачи, для получения ответа им необходимо активировать большую часть своей нейронной сети. Поэтому, просите ли вы LLM сказать вам, который час, или подвести итоги «Моби Дика», огромного романа, LLM задействует всю свою сеть, что требует ресурсов и неэффективно.

«Когда мы, люди, оцениваем новую задачу, мы активируем очень небольшую часть нашего мозга, но LLM должны активировать практически всю свою сеть, чтобы выяснить что-то новое, даже если оно довольно простое», — говорит Чжан. «LLM должны выполнять все вычисления, а затем выбирать то, что вам нужно. Таким образом, вы делаете много избыточных вычислений, потому что вы вычисляете много вещей, которые вам не нужны. Это очень неэффективно».

Новое исследование социальных рассуждений выпускников LLM

Работая вместе, Чжан и Сюй сформировали междисциплинарное сотрудничество, чтобы лучше понять, как работают LLM и как можно повысить эффективность их социального мышления.

Они обнаружили, что студенты LLM используют небольшой специализированный набор внутренних связей для управления социальными рассуждениями. Они также обнаружили, что способности LLM к социальному мышлению сильно зависят от того, как модель представляет позиции слов, особенно с помощью метода, называемого ротационным позиционным кодированием (RoPE). Эти особые связи влияют на то, как модель обращает внимание на разные слова и идеи, эффективно направляя ее «фокус» во время рассуждений о мыслях людей.

«Проще говоря, наши результаты показывают, что студенты LLM используют встроенные шаблоны для отслеживания позиций и отношений между словами, чтобы сформировать внутренние «убеждения» и сделать социальные выводы», — говорит Чжан. Два сотрудника изложили свои выводы в исследовании «Как большие языковые модели кодировать теорию разума: исследование шаблонов с разреженными параметрами», опубликованное в npj Искусственный интеллект.

В ожидании более эффективного ИИ

Теперь, когда исследователи лучше понимают, как LLM формируют свои «убеждения», они полагают, что возможно сделать модели более эффективными.

«Мы все знаем, что ИИ требует больших затрат энергии, поэтому, если мы хотим сделать его масштабируемым, нам придется изменить способ его работы», — говорит Сюй. «Наш человеческий мозг очень энергоэффективен, поэтому мы надеемся, что это исследование вернет нас к размышлениям о том, как мы можем заставить LLM работать как человеческий мозг, чтобы они активировали только подмножество параметров, отвечающих за конкретную задачу. Это важный аргумент, который мы хотим донести».

Дополнительная информация:
Юхэн Ву и др., Как большие языковые модели кодируют теорию разума: исследование шаблонов с разреженными параметрами, npj Искусственный интеллект (2025). DOI: 10.1038/s44387-025-00031-9

Цитирование: Читатели мыслей: Как большие языковые модели кодируют теорию разума (11 ноября 2025 г.), получено 12 ноября 2025 г. с https://techxplore.com/news/2025-11-mind-readers-large-language-encode.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2025-11-11 19:55:00


1762936141
#Как #большие #языковые #модели #кодируют #теорию #разума

Читайте также

Read more:  Эгоистичный способ, которым Трамп выставил Бретань Махомес как «большего фаната Мага»

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.