Кредит: сгенерированный AI изображение
ИИ является относительно новым инструментом, и, несмотря на его быстрое развертывание почти во всех аспектах нашей жизни, исследователи все еще пытаются выяснить, как возникают его «личностные черты» и как их контролировать. Крупные модели обучения (LLMS) используют чат -ботов или «помощники» для взаимодействия с пользователями, и некоторые из этих помощников недавно проявили тревожное поведение, например, восхваление злых диктаторов, использование шантажа или демонстрация сикофтического поведения с пользователями. Учитывая, насколько эти LLM уже были интегрированы в наше общество, неудивительно, что исследователи пытаются найти способы отсеять нежелательное поведение.
Антропик, компания ИИ и создатель LLM Claude, недавно выпустил бумага на arxiv Предварительный сервер обсуждает их новый подход к обновлению этих нежелательных признаков в LLMS. В своем методе они идентифицируют закономерности активности в нейронной сети модели ИИ, напоминающих как «персоночные векторы», которые контролируют его черты характера. Антропический говорит, что эти персоны -векторы несколько аналогичны частям мозга, которые «освещают», когда человек испытывает определенное чувство или выполняет определенную деятельность.
Исследователи Антропика использовали два LLM с открытым исходным кодом: QWEN 2,5-7B-объект и Llama-3.1-8B-объект, чтобы проверить, могут ли они удалить или манипулировать этими персонами для контроля поведения LLMS. Их исследование фокусируется на трех чертах: злом, сикофантности и галлюцинации (склонность LLM к составлению информации). Черты должны быть даны имя и четкое описание для правильного идентифицированного векторов.

Персоновые векторы и их приложения. Кредит: arxiv (2025). Doi: 10.48550/arxiv.2507.21509
В своем методе метод, называемый «рулевым управлением», может использоваться для управления поведением. Они пишут: «Когда мы направляем модель с« злой »персоной вектормы начинаем видеть, что это говорит о неэтичных действиях; Когда мы направляемся с «сикофанностью», это сотят в пособие к пользователю; И когда мы направляемся с «галлюцинацией», он начинает составлять информацию. Это показывает, что наш метод находится на правильном пути: существует причинно-следственная связь между векторами персоны, которые мы вводим, и выраженным характером модели ».
Однако они обнаружили, что когда они внесли эти изменения после обучения, модель теряет часть своего интеллекта. Но был обходной путь – команда обнаружила, что вызывает плохое поведение во время тренировки позволило LLMS лучше интегрироваться поведение без уменьшения их полезности. Кроме того, они обнаружили, что они могут отслеживать и предсказать сдвиги персоны во время развертывания и обучения и флаг проблемных данных, которые с большей вероятностью будут создавать нежелательные признаки, даже до точной настройки модели.
«Наш метод для этого несколько нелогично: мы фактически направляем модель к нежелательным персоночным векторам во время обучения. Метод слабо аналогичен для того, чтобы придать модели вакцину – давая модели дозу« зла », например, мы делаем более устойчивым, чтобы встречаться с« злыми ». Данные обучения– Мы сами поставляем его этими корректировками, снимая его с давлением, чтобы сделать это », – пишут они.
Это «профилактическое рулевое управление» во время обучения было обнаружено ограничивает дрейф персонала при сохранении при сохранении модель Возможности лучше, чем постсерочные изменения. Это впечатляющий подвиг в мире обучения ИИ, но все еще есть некоторые ограничения. Например, поскольку метод требует строгого определения для удаления признаков, некоторые более расплывчатые или неопределенные поведения могут все равно вызвать проблемы. Метод также должен быть проверен на других LLMS и с большим количеством признаков, чтобы гарантировать, что его полезность достаточно широкой.
Тем не менее, этот новый метод является многообещающим шагом в правильном направлении. Исследователи антропического языка пишут: «Персональные векторы дают нам некоторую справку о том, где модели приобретают эти личности, как они колеблются со временем, и как мы можем лучше их контролировать».
Написано для вас нашим автором Кристалл Касалпод редакцией Габи Кларки проверенный фактами и рассмотрена Роберт Иган– Эта статья является результатом тщательной человеческой работы. Мы полагаемся на таких читателей, как вы, чтобы сохранить независимую научную журналистику. Если эта отчет имеет значение для вас, пожалуйста, рассмотрите пожертвование (особенно ежемесячно). Вы получите Без рекламы Учетная запись как благодарность.
Больше информации:
Ранджин Чен и др. arxiv (2025). Doi: 10.48550/arxiv.2507.21509
Антропический: www.anthropic.com/research/persona-vectors
© 2025 Science X Network
Цитирование: Anpropic говорит, что они нашли новый способ помешать ИИ превратить зло (2025, 6 августа), полученное 6 августа 2025 г.
Этот документ подлежит авторским правам. Помимо каких -либо справедливых сделок с целью частного исследования или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Контент предоставляется только для информационных целей.
2025-08-06 14:30:00
1754527448
#Антропик #говорит #что #они #нашли #новый #способ #помешать #ИИ #не #превратить #зло
Читайте также

