- Исследователи UCR переписывают модели искусственного интеллекта, чтобы сохранить безопасность нетронутой при обрезании для небольших устройств
- Изменение выходящих слоев удаляет защиту, переподготовка восстанавливает заблокированные небезопасные ответы
- Исследование с использованием Llava 1.5 показало, что сниженные модели отказались от опасных подсказок после обучения
Исследователи из Калифорнийского университета, Риверсайд, решают проблему ослабленной безопасности в моделях искусственного интеллекта с открытым исходным кодом, когда они адаптированы для небольших устройств.
Поскольку эти системы обрезаны для эффективного запуска на телефонах, автомобилях или другом оборудовании с низким энергопотреблением, они могут потерять гарантии, предназначенные для того, чтобы они не создавали оскорбительный или опасный материал.
Команда UCR осмотрен То, что происходит, когда выходящий слой модели изменяется с его положения по умолчанию.
Ослабленные охраны безопасности
Их результаты, представленные на Международной конференции по машинному обучению в Ванкувере, Канада, показали, что охраны безопасности ослабевают после перемещения точки выхода, даже если первоначальная модель была обучена не предоставлять вредную информацию.
Причина модели приспосабливаются таким образом, проста. Выход раньше делает вывод быстрее и эффективнее, поскольку система пропускает слои. Но эти пропущенные слои могли иметь решающее значение для фильтрации небезопасных запросов.
«Некоторые из пропущенных слоев оказываются необходимыми для предотвращения небезопасных результатов»,-сказал Амит Рой-Чоудхури, профессор электрической и компьютерной инженерии и старший автор исследования. «Если вы оставите их, модель может начать отвечать на вопросы, которые не должны».
Чтобы решить это, исследователи переподвели внутреннюю структуру модели, чтобы сохранить способность идентифицировать и блокировать небезопасные материалы, даже при обрезании.
Этот подход не включает в себя внешние фильтры или программные патчи, но меняет, как модель интерпретирует опасные входы.
«Наша цель состояла в том, чтобы убедиться, что модель не забывает, как вести себя безопасно, когда она была уменьшена»,-сказала Сакет Бачу, аспирант UCR и соавторский автор исследования.
Команда проверила свой метод на Llava 1.5, модели языка зрения.
Когда его выходящий слой был перемещен раньше, чем предполагалась, система ответила на вредные подсказки, включая подробные инструкции по изготовлению бомб.
После переподготовки уменьшенная модель последовательно отказывалась давать небезопасные ответы.
«Речь идет не о добавлении фильтров или внешних ограждений», – сказал Бачу.
«Мы меняем внутреннее понимание модели, так что по умолчанию это хорошее поведение, даже когда она была изменена».
Автор Бачу и соавтор Эрфан Шейегани назвал работу «доброжелательным взломом», способ укрепления моделей до использования уязвимостей.
«Есть еще больше работы»,-сказал Рой-Чоудхури. «Но это конкретный шаг к разработке ИИ таким образом, что это одновременно и открыто и ответственно».
Вам также может понравиться
2025-09-15 23:00:00
1757978470
#ИИ #открытым #исходным #кодом #обрезал #для #эффективности #созданные #подробные #инструкции #по #изготовлению #бомб #другие #плохие #ответы #перед #переподготовкой
По теме
.png)
