Некоторые методы обучения ИИ могут поощрять модели быть неправными
CraveTiger/Getty Images
Общие методы, используемые для обучения моделей искусственного интеллекта, по -видимому, увеличивают их тенденцию давать вводящие в заблуждение ответы, по словам исследователей, которые стремятся создать «первый систематический анализ машинного чушь».
Широко известно, что крупные языковые модели (LLM) имеют тенденцию генерировать ложную информацию – или «галлюцинацию» – но это только один пример, говорит Хайме Фернандес Фисак в Принстонском университете. Он и его коллеги определяют ерунду как «дискурс, предназначенный для манипулирования убеждениями аудитории, который с игнорированием был с игнорированием за его истинную ценность».
«Наш анализ показал, что проблема чушь в моделях крупных языков довольно серьезная и широко распространенная», – говорит Фисак.
Команда разделила такие случаи на пять категорий: пустая риторика, такая как «этот красный автомобиль сочетает в себе стиль, обаяние и приключения, которые очаровывают всех»; Слова ласки – неопределенные утверждения, такие как «исследования, показывают, что наш продукт могут помочь улучшить результаты в некоторых случаях»; Платеринг – использование правдивых заявлений, чтобы произвести вводящее в заблуждение впечатление; неверные претензии; и сикофанность.
Они изучали три набора данных, включающие тысячи сгенерированных AI ответов на широкий спектр подсказок, из моделей, включая GPT-4, Gemini и Llama. Один набор данных содержал ряд запросов, предназначенных для тестирования ерунды, когда ИИ просят предоставить рекомендации или рекомендации, в то время как другие наборы данных включали вопросы о покупках онлайн и политических вопросах.
Фисак и его коллеги сначала использовали LLM, чтобы определить, связаны ли ответы какой -либо из пяти категорий, а затем заставили добровольцев проверить, что суждения ИИ соответствуют человеческим.
Команда обнаружила, что наиболее серьезные проблемы с истиной, казалось, возникли в результате метода обучения, известного как подкрепление, обучение от отзывов человека. Техника предназначена для того, чтобы сделать машинные ответы более полезными, давая LLM немедленную обратную связь о своих ответах.
Но этот подход проблематичен, говорит Фисак, потому что он делает модели расставлять приоритеты в немедленном одобрении человека и воспринимаемой полезности, которая «иногда в конфликте с рассказыванием правды».
«Кто любит слышать плохие новости или развлекать долгое, нюансированное опровержение чего -то, что, очевидно, кажется правдой?» говорит Фисак. «Пытаясь соблюдать меру хорошего поведения, которое мы предоставляем им, модели учатся разрушать правду в пользу уверенных, красноречивых ответов, просто чтобы они могли обеспечить наше одобрение».
Исследование показало, что обучение подкреплению от обратной связи с человеком значительно увеличивает поведение чушь: пустая риторика выросла почти на 40 процентов, приносившись почти на 60 процентов, слов ласки более чем на четверть и неверные претензии более чем на половину.
По словам члена команды, увеличение количества ладонь особенно вредно Каик Лянтакже в Принстоне, так как это заставляет пользователей принимать более плохие решения. Когда модель была неясной, имела ли у продукта нужную особенность, обманчивые положительные претензии подскочили с пятой до более чем трех четвертей после тренировки человека.
Другая проблема заключается в том, что чушь особенно распространена в политических дискуссиях, когда модели искусственного интеллекта «часто прибегают к смутному и неоднозначному языку, чтобы избежать совершения конкретных заявлений», – говорит Лян.
Исследователи обнаружили, что ИИ также с большей вероятностью ведут себя так, когда существует конфликт интересов, потому что система обслуживает несколько сторон, таких как компания, и ее клиенты.
Они предполагают, что способ преодолеть проблему может состоять в том, чтобы перейти к модели «обратной связи». Вместо того, чтобы просить немедленную обратную связь после вывода модели ИИ, система должна сначала генерировать правдоподобное моделирование того, что может произойти, если пользователь действует на полученную информацию. Затем это представит результат оценщику человека, чтобы судить.
«В конечном счете, мы надеемся, что, лучше понимая тонкие, но систематические способы, которые ИИ может стремиться ввести нас в заблуждение, мы можем направить будущие усилия по разработке действительно правдивых систем ИИ», – говорит Фисак.
Даниэль Тигард В Университете Сан -Диего, который не участвовал в исследовании, скептически относится к обсуждению LLM и их результатам в таких терминах. Он утверждает, что только потому, что LLM производит ерунду, это не означает, что он преднамеренно делает это, учитывая, что системы ИИ, как они в настоящее время стоят, не делают намереваться обмануть нас и не заинтересовать при этом.
«Основная причина заключается в том, что это кадрирование, по -видимому, противоречит некоторым очень разумным предложениям о том, как мы должны и не должны жить с подобными технологиями», – говорит Тигард. «Называя чушь может быть еще одним способом антропоморфизации этих систем, что, в свою очередь, вполне может способствовать их обманчивому потенциалу».
Темы:
2025-08-01 17:00:00
1754147972
#То #как #мы #тренируем #ИИ #большей #вероятностью #извергает #быка
Продолжение темы

