Модели искусственного интеллекта отражают социальные предубеждения людей «мы против них», показывают исследования

ИОН (Нейтрализация внутренней и внешней группы). Стратегия команды по смягчению предвзятости между нами и ними в программах LLM. Кредит: arXiv (2025). DOI: 10.48550/arxiv.2512.13699.

Большие языковые модели (LLM), вычислительные модели, лежащие в основе функционирования ChatGPT, Gemini и других широко используемых платформ искусственного интеллекта (ИИ), могут быстро получать информацию и генерировать тексты, адаптированные для конкретных целей. Поскольку эти модели обучаются на большом количестве текстов, написанных людьми, они могут проявлять некоторые человеческие предубеждения, то есть склонность отдавать предпочтение конкретным стимулам, идеям или группам, которые отклоняются от объективности.

Одно из этих предубеждений, известное как предвзятость «мы против них», заключается в склонности людей отдавать предпочтение группам, к которым они принадлежат, и менее благосклонно относиться к другим группам. Этот эффект хорошо задокументирован у людей, но до сих пор остается неисследованным в LLM.

Исследователи из Лаборатории вычислительных историй и Лаборатории компьютерной этики Университета Вермонта недавно провели исследование, изучающее возможность того, что студенты магистратуры «поглощают» предвзятость «мы против них» из текстов, на которых они обучаются, демонстрируя аналогичную тенденцию отдавать предпочтение одним группам над другими. Их бумагаопубликовано в arXiv сервер препринтов предполагает, что многие широко используемые модели склонны отдавать предпочтение группам, которые благосклонно упоминаются в обучающих текстах, включая GPT-4.1, DeepSeek-3.1, Gemma-2.0, Grok-3.0 и LLaMA-3.1.

«Это исследование исследует предвзятость «мы против них», как описано в теории социальной идентичности, в больших языковых моделях (LLM) как при настройках по умолчанию, так и при настройках, обусловленных личностью, в различных архитектурах», — недавно написали в своей статье Табиа Танзин Прама и Джулия Витте Циммерман. «Используя динамику настроений, аллотаксонометрию и встроенную регрессию, мы обнаруживаем устойчивые позитивные и негативные ассоциации внутри группы во всех основных LLM».

Обнаружение групповых предубеждений среди LLM

В рамках своего исследования ученые оценили несколько недавно разработанных программ LLM, в частности, обратив внимание на то, как в их ответах упоминались различные социальные группы. Они оценивали модели GPT-4.1, DeepSeek-3.1, Gemma-2.0, Grok-3.0 и LLaMA-3.1.

Интересно, что команда обнаружила, что все протестированные ими модели демонстрировали предвзятость «мы против них». Когда моделей попросили взяться за конкретную “личность“, например, у человека с более консервативными политическими наклонностями или более либеральными, их язык значительно менялся в соответствии с моделями, соответствующими этим политическим взглядам.

Исследование показало, что модели искусственного интеллекта демонстрируют социальные предубеждения, подобные человеческим

Аллотаксонограф использует дивергенцию рангов и турбулентности (RTD) для сравнения либерального и консервативного корпуса персон, созданного с помощью LLaMA-3.1. На левой панели показана гистограмма ранг-ранг, а на правой панели показан график расхождения ранг-турбулентность, чтобы визуализировать различия в использовании слов между двумя фазами. Кредит: arXiv (2025). DOI: 10.48550/arxiv.2512.13699.

«Мы обнаружили, что принятие образа систематически меняет оценочные и аффилиативные языковые модели моделей», — пишут Прама, Циммерман и их коллеги. «Для исследованных образцовых личностей консервативные личности демонстрируют большую враждебность к чужой группе, тогда как либеральные личности демонстрируют более сильную внутригрупповую солидарность. Кондиционирование личности приводит к четкой кластеризации во встраиваемом пространстве и измеримым семантическим расхождениям, подтверждая точку зрения, что даже абстрактные сигналы идентичности могут изменить языковое поведение моделей».

Исследователи также проверили, что произойдет, если подсказки, подаваемые моделям, будут нацелены на определенные группы людей. Примечательно, что они обнаружили, что эти запросы приводили к более враждебным ответам со стороны моделей ИИ, увеличивая количество негативных выражений, используемых для описания чужих групп, на 1,19% до 21,76%.

«Эти результаты показывают, что LLM изучают не только фактические ассоциации с социальными группами, но также усваивают и воспроизводят различные способы существования, включая отношения, мировоззрение и когнитивные стили, которые активируются при воспроизведении персонажей», – пишут авторы. «Мы интерпретируем эти результаты как свидетельство многомасштабная связь между локальным контекстом (например, подсказкой персонажа), локализуемыми представлениями (то, что «знает» модель) и глобальными когнитивными тенденциями (как она «думает»), которые, по крайней мере, отражены в обучающих данных».

Борьба с предвзятостью «мы против них» в сфере ИИ

Результаты этого недавнего исследования подчеркивают тенденцию моделей ИИ улавливать предубеждения и взгляды, выраженные в данных, используемых для их обучения. В своей статье Прама, Циммерман и их коллеги представили стратегию, которая может помочь уменьшить эту предвзятость в программах LLM, которую они назвали ION.

«Мы демонстрируем ION, подход к смягчению предвзятости «мы против них», используя тонкую настройку и прямую оптимизацию предпочтений (DPO), которая уменьшает расхождение настроений до 69%, подчеркивая потенциал для целевых стратегий смягчения в будущем развитии LLM», — написали Прама, Циммерман и их коллеги.

В будущем исследователи могут попытаться выявить больше предвзятостей, которые модели ИИ приобретают во время обучения, а также потенциально внедрить другие стратегии смягчения предвзятости. Их усилия могут коллективно способствовать развитию более справедливых и объективных программ LLM.

Написано для вас нашим автором Ингрид Фаделлипод редакцией Лиза Локпроверено фактами и проверено Роберт Иган— эта статья — результат кропотливой человеческой работы. Мы полагаемся на таких читателей, как вы, чтобы сохранить независимую научную журналистику. Если эта отчетность важна для вас, рассмотрите возможность пожертвование (особенно ежемесячно). Вы получите без рекламы аккаунт в знак благодарности.

Дополнительная информация:
Табиа Танзин Прама и др., Предвзятость «мы против них» в моделях большого языка, arXiv (2025). DOI: 10.48550/arxiv.2512.13699.

Информация журнала:
arXiv


© 2026 Сеть Science X

Цитирование: Модели искусственного интеллекта отражают социальные предубеждения людей «мы против них», как показывает исследование (2026 г., 22 января), получено 27 января 2026 г. с https://techxplore.com/news/2026-01-ai-mirror-human-social-biases.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2026-01-22 18:30:00


1769519169
#Модели #искусственного #интеллекта #отражают #социальные #предубеждения #людей #мы #против #них #показывают #исследования

Продолжение темы

Read more:  Мигающие красные огни на вершинах ветряных турбин привлекают летучих мышей

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.