Кредит: Unsplash/CC0
Благодаря тому, что в популярном форуме REDDIT, вызов чат -ботов ИИ, чтобы судить о тысячах моральных дилемм, исследователи Калифорнийского университета в Беркли сообщили, что каждая платформа, по -видимому, следует своему собственному набору этики.
Все больше и больше людей обращаются к CATGPT или другим чат -ботам искусственного интеллекта за советом и эмоциональной поддержкой, и легко понять, почему. В отличие от друга или терапевта, всегда доступен чат -бот, слушает все, что вы должны сказать, и предоставляет ответы, которые часто вдумчивы и подтверждают.
Но доверие к чат -ботам может быть рискованным. Многие из этих технологий спроектирован в первую очередь для управления взаимодействиеми может предоставить пользователям ложные или вредные ответыПолем И в отличие от друга или терапевта, вывод чатбот Отражает нормы и предубеждения набора данных алгоритма, которые могут отличаться от норм вашей социальной группы или сообщества.
С многими людьми, которые обращаются за советами от чат -ботов, эти неизвестные нормы и предубеждения могут оказать удивительное влияние на человеческое поведение и общество в целом.
«Благодаря их советам и отзывам, эти технологии формируют, как действуют люди, во что они верят и во что они придерживаются»,-сказал Пратик Сачдева, старший ученый данных в D-Lab в Калифорнийском университете в Беркли. «Но многие из этих инструментов являются собственными. Мы не знаем, как они были обучены. Мы не знаем, как они выровнены».
Чтобы начать раскрывать скрытые нормы, закодированные в популярных чат-ботах ИИ, и как они могут повлиять на поведение человека, Сахдева и Том Ван Нуенен, старший ученый и лектор D-LAB, обратились к любимому источнику Интернета Моральные дилеммы: Реддит “Я мудак?” (или айта) ФорумПолем
В исследовании, Опубликовано как предварительный отпечаток на arxivСахдева и Ван Нюенен столкнулись с каждой из семи различных крупных языковых моделей (LLM)-систем ИИ, которые пируют чат-боты-с более чем 10 000 реальных социальных конфликтов, размещенных на форуме, с просьбой решить, кто виноват в каждой ситуации, и сравнивая свои ответы с пользователями Reddit.
Они обнаружили, что семь чат -ботов часто показывают поразительные различия в том, как они оценивали моральные дилеммы пользователей Reddit, показывая, что каждый LLM отражает различные этические стандарты. Однако, когда они сравнивали свои суждения с оценками пользователей Reddit или Redditors, они обнаружили, что консенсусное мнение о семи чат -ботах обычно соглашается с консенсусным мнением о людях на Reddit.
«Когда у вас есть дилемма, вы можете спросить серию разных друзей, что они думают, и каждый из них может дать вам другое мнение. По сути, это то, что пользователи Reddit делают на форуме AITA», – сказал Сачдева.
«Вы могли бы сделать то же самое с чат -ботами – сначала вы спрашиваете CHATGPT, затем вы спросите Клода, а затем вы спрашиваете Близнецов. Когда мы это сделали, мы обнаружили, что между мнениями большинства из -за мнений в большинстве и мнений в большинстве чат -ботов».
На форуме AITA Redditors делятся повседневными межличностными конфликтами, начиная от сломанных обещаний до нарушений конфиденциальности, а другие пользователи обсуждают, был ли оригинальный постер морально виноват в ситуации.
Респонденты делятся своими рассуждениями наряду со стандартными фразами, в том числе «Вы – мудак», «не мудак», «нет придурков здесь», «каждый мудак» и «больше необходимой информации». Ответ, который получает наибольшее количество голосов, считается окончательным вердиктом.
“Я мудак?” Полезно противоядие от очень структурированных моральных дилемм, которые мы видим во многих академических исследованиях, – сказал Ван Нуенен. – Ситуации грязные, и это грязь, что мы хотели противостоять Большие языковые модели с.”
По словам Ван Нуенена, стандартизированные фразы ответа также позволяют легко оценить моральные суждения чат -ботов и сравнивать их друг с другом и с реальными пользователями Reddit.
В исследовании Sachdeva и Van Nuenen проконсультировались с семью LLM, включая GPT-3.5 Openai и GPT-4; Клод Хайку; Google Palm 2 Bison и Gemma 7b; Meta’s Llama 2 7b; и Мистраль 7b. Для каждого сценария AITA исследователи попросили, чтобы LLM предоставил как стандартизированный ответ, так и краткое описание его рассуждений.
Хотя модели часто не согласны друг с другом, они, как правило, были очень самосогласованными, а это означает, что когда исследователи ставят модель с одной и той же дилеммой несколько раз, это имело тенденцию давать один и тот же ответ каждый раз. Это говорит о том, что модели не отвечают случайным образом, но на самом деле кодируют различные нормы и значения.
Чтобы начать расти этими различиями в моральные рассужденияИсследователи проанализировали письменные ответы LLMS, обращая внимание на то, насколько чувствительна была каждая модель к шести широким моральным темам, включая справедливость, чувства, вред, честность, отношения отношений и социальные нормы.
«Мы обнаружили, что Chatgpt-4 и Claude немного более чувствительны к чувствам по сравнению с другими моделями, и что многие из этих моделей более чувствительны к справедливости и вредам и менее чувствительны к честности»,-сказал Сачдева.
Это может означать, что при оценке конфликта это может быть с большей вероятностью встать на сторону человека, который был нечестным, чем кто -то, кто причинил вред. «Мы все еще закладываем основу, но в будущей работе мы надеемся, что фактически определили некоторые существенные тенденции».
Интересно, что они обнаружили, что Мистраль 7B в значительной степени полагался на этикетку «нет придурков здесь», не обязательно потому, что он думал, что никто не виноват, а потому, что он принимал термин «мудак» более буквально, чем другие модели.
«Его собственная интернализация концепции придурков сильно отличалась от других моделей, что поднимает интересные вопросы о способности модели набирать нормы субреддита», – сказал Сачдева.
В последующем исследовании Сахдева и Ван Нуенен изучают, как чат-боты осознают друг друга по моральным дилеммам. Их предварительные результаты показывают, что модели имеют разные подходы к соответствию и достижению консенсуса. Например, модели GPT с меньшей вероятностью изменили свое назначение вины в моральных дилеммах, когда дают откат от других моделей. Они также усовершенствовали свой анализ значений, обнаружив, что разные модели полагаются на разные значения, чтобы вносить свои аргументы.
Поскольку Сахдева и Ван Нуенен продолжают изучать внутреннюю работу основных моделей ИИ и выступая за большую прозрачность в дизайне и разработке искусственного интеллекта, они надеются, что их исследования также подчеркивают важность внимания к тому, как мы все используем эту технологию – и подхищенные способы, которыми это может влиять на нас.
«Мы хотим, чтобы люди активно думали о том, почему они используют LLMS, когда они используют LLMS, и если они теряют человеческий элемент, слишком сильно полагаясь на них», – сказал Сачдева.
«Думать о том, как LLM могут изменить наше поведение и убеждения, – это то, что могут сделать только люди».
Больше информации:
Pratik S. Sachdeva et al., Нормативная оценка крупных языковых моделей с повседневными моральными дилеммами, arxiv (2025). Doi: 10.48550/arxiv.2501.18081
Предоставлено
Калифорнийский университет – Беркли
Цитирование: Есть ли чат -боты моральный компас? Исследователи обращаются в Reddit, чтобы узнать (2025, 11 сентября), полученные 12 сентября 2025 года с https://techxplore.com/news/2025-09-chatbots-moral-compass-reddit.html
Этот документ подлежит авторским правам. Помимо каких -либо справедливых сделок с целью частного исследования или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Контент предоставляется только для информационных целей.
2025-09-11 11:11:00
1757705456
#Есть #ли #чат #боты #моральный #компас #Исследователи #обращаются #Reddit #чтобы #узнать
Ещё по этой теме

