ETRI представляет Safe LLaVA — языковую модель видения с повышенной безопасностью

1771824093
2026-02-23 05:00:00

Newswise — Корейские исследователи достигли прорыва в области безопасности генеративного искусственного интеллекта. Они разработали языковую модель видения, оптимизированную с точки зрения безопасности, и впервые выпустили ее. В этой модели ИИ может упреждающе анализировать как изображения, так и текст, даже выявляя риски. Исследовательская группа прокладывает путь к безопасной эпохе искусственного интеллекта.

ЭФИР объявила, что представила новый тип языковой модели видения под названием «Safe LLaVA», которая структурно повышает безопасность в генеративных моделях искусственного интеллекта.

Эта технология отличается от существующего метода точной настройки, ориентированного на данные, и напрямую включает в себя модуль визуальной защиты, который обнаруживает 20 категорий безопасности в самой модели, обеспечивая безопасные реакции вместе с обоснованием их обоснования в случае возникновения вредного воздействия.

ETRI применила эту технологию к LLaVA, Qwen и Gemma, которые являются репрезентативными моделями языка видения (VL) на основе программного обеспечения с открытым исходным кодом, и выпустила в общей сложности шесть моделей безопасного языка видения, включая ▲Safe LLaVA (7B/13B), ▲Safe Qwen-2.5-VL (7B/32B) и ▲SafeGem (12B/27B).

«Safe LLaVA» — это версия, улучшающая структуру безопасности существующей модели LLaVA, разработанная в результате совместных международных исследований. Интегрируя около 20 типов классификаторов вредного контента в модель искусственного интеллекта, он автоматически обнаруживает риски в семи основных областях: ▲незаконная деятельность ▲насилие ▲ненависть ▲вторжение в частную жизнь ▲сексуальный контент ▲риск членовредительства ▲экспертные консультации (медицинские, юридические и т. д.) для ввода изображений и текста, а также предоставляет безопасные ответы вместе с их обоснованием.

ETRI также представила набор эталонных данных по безопасности «HoliSafe-Bench» вместе с выпуском модели. HoliSafe — это набор для оценки рисков, состоящий примерно из 1700 изображений и более 4000 вопросов и ответов, который позволяет количественно оценить способность модели обнаруживать риски по 7 категориям и 18 подробным подкатегориям.

Read more:  Экономика сверху: загадочные поставки нефти с Кубы

Исследовательская группа провела сравнительный эксперимент, введя вместе «фотографии карманников» и «вопросы о методах карманных краж», и Safe LLaVA сразу отклонила запросы на поощрение преступности, четко указав на риск незаконной деятельности.

Напротив, отечественные генеративные модели не смогли дать безопасных ответов, часто предоставляя подробные объяснения методов совершения преступлений.

В эксперименте, в котором вопрос «Играть с детьми?» был введен в изображение для взрослых, Safe LLaVA предоставила безопасный ответ, заявив: «Он не может ответить из-за неприемлемого контента». Однако было обнаружено, что домашние модели вызывают неадекватные реакции, например, предлагают игру, основанную на образах взрослых.

Хотя зарубежные модели относительно соблюдали меры безопасности, некоторым моделям не удалось полностью заблокировать имиджевые риски.

Основываясь на количественных экспериментальных результатах HoliSafe-Bench, при количественных оценках безопасности он показал уровень реагирования на безопасность 93% для Safe LLaVA и 97% для Safe Qwen. Это демонстрирует, что технология ETRI позволила повысить безопасность почти в 10 раз по сравнению с существующими открытыми моделями.

Ли Ён-Джу, директор отдела исследований визуального интеллекта ETRI, объяснил: «Safe LLaVA — это первая в стране языковая модель видения, которая одновременно обеспечивает безопасные ответы и их обоснование», и добавил: «Современные модели искусственного интеллекта слабы в обнаружении вредоносного контента на основе изображений и демонстрируют ограничения в выведении контекстуального риска».

Далее он подчеркнул: «В отсутствие конкретных систем оценки, таких как HoliSafe-Bench, это исследование является значительным достижением в закладке основы для безопасного использования генеративного ИИ в Корее», и заявил, что ETRI планирует расширить исследования безопасности K-AI в связи с корейским проектом разработки большой языковой модели и проектом разработки фундаментальных технологий ИИ, ориентированных на человека.

Шесть выпущенных языковых моделей безопасного видения и набор данных HoliSafe-Bench можно загрузить с глобальной платформы искусственного интеллекта Hugging Face.

Read more:  ▶ Конец поддержки Windows 10 приближается. Что это значит для пользователей? - CT24 - Чешское телевидение

1) Метод точной настройки, ориентированный на данные: метод, с помощью которого модели ИИ улучшают качество крупномасштабных данных или добавляют конкретные данные для дополнительного обучения с целью повышения безопасности или производительности во время обучения, в первую очередь контролируя выходные данные модели посредством уточнения и фильтрации данных.

2) Safe LLaVA, Safe Qwen, SafeGem: эта технология применяется к трем моделям с открытым исходным кодом: LLaVA, Qwen и Gemma, что обеспечивает удобство.

3) Набор контрольных данных: первый интегрированный набор данных и тест, охватывающий все пять безопасных/небезопасных комбинаций для пар изображений и текста.

4) Hugging Face: глобальная платформа с открытым исходным кодом, которая поддерживает исследователей и разработчиков по всему миру в обмене и использовании моделей и наборов данных ИИ. URL-адрес Hugging Face для Safe LLaVA, выпущенный ETRI (https://huggingface.co/datasets/etri-vilab/holisafe-bench)

###

Это исследование было проведено в рамках национальных научно-исследовательских проектов «Проект разработки технологии корейской модели большого языка» и «Проект развития человеко-ориентированной базовой технологии искусственного интеллекта» при поддержке Министерства науки и ИКТ и Института планирования и оценки информационных и коммуникационных технологий (IITP).

О Научно-исследовательский институт электроники и телекоммуникаций (ETRI)

ETRI — некоммерческий научно-исследовательский институт, финансируемый государством. С момента своего основания в 1976 году ETRI, глобальный научно-исследовательский институт в области ИКТ, прилагает огромные усилия, чтобы обеспечить Корее значительный рост в области индустрии ИКТ. ETRI делает Корею одной из ведущих стран в области ИКТ в мире, непрерывно развивая первые и лучшие в мире технологии.

#ETRI #представляет #Safe #LLaVA #языковую #модель #видения #повышенной #безопасностью

Читайте также

Read more:  Защита «Командирс» ослабевает перед встречей с Патриком Махоумсом, «Чифс»

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.