Концептуальная иллюстрация теоретического анализа. Теорема 1 (следствие 1 для диффузионной модели) переводит возмущение в пространстве параметров в набор возмущенных распределений. Теорема 2 (следствие 2 для диффузионной модели) показывает, что плоские минимумы приводят к устойчивости к разрыву распределения. Кредит: arXiv (2025). DOI: 10.48550/arxiv.2503.11078.
Когда пользователи просят ChatGPT создать изображение в стиле Ghibli, фактическое изображение создается с помощью DALL-E, инструмента, основанного на диффузных моделях. Хотя эти модели создают потрясающие изображения, например преобразовывают фотографии в художественные стили, создают персонализированных персонажей или создают реалистичные пейзажи, они также сталкиваются с определенными ограничениями. К ним относятся случайные ошибки, такие как три пальца на руках или искаженные лица, а также проблемы при работе на устройствах с ограниченными вычислительными ресурсами, таких как смартфоны, из-за огромного количества их параметров.
Исследовательская группа, возглавляемая профессорами Джеджун Ю и Сон Ван Юн из Высшей школы искусственного интеллекта UNIST, предложила новый принцип проектирования генеративного искусственного интеллекта, который решает эти проблемы. Они показали, через оба теоретический анализ и обширные эксперименты, показывающие, что обучение моделей диффузии достижению «плоских минимумов» — определенного типа оптимальной точки на поверхности потерь — может одновременно улучшить как надежность, так и способность к обобщению этих моделей.
Их исследование было представлено на Международной конференции по компьютерному зрению (ICCV2025), и выводы опубликовано на arXiv сервер препринтов.
Модели диффузии широко используются в популярных приложениях искусственного интеллекта, включая такие инструменты, как DALL-E и Stable Diffusion, позволяющие решать широкий спектр задач — от переноса стилей и создания мультфильмов до реалистичного рендеринга сцен. Однако развертывание этих моделей часто приводит к проблемам, таким как накопление ошибок во время коротких циклов генерации, снижение производительности после методов сжатия моделей, таких как квантование, и уязвимость к состязательным атакам — небольшим, злонамеренным искажениям входных данных, предназначенным для обмана моделей.
Исследовательская группа определила, что эти проблемы возникают из-за фундаментальных ограничений способности моделей к обобщению, то есть их способности надежно работать с новыми, невидимыми данными или в незнакомых средах.
Чтобы решить эту проблему, исследовательская группа предложила направить процесс обучения к «плоским минимумам» — областям в ландшафте потерь модели, характеризующимся широкими пологими поверхностями. Такие минимумы помогают модели поддерживать стабильную и надежную работу, несмотря на небольшие помехи или шум. И наоборот, «острые минимумы» — узкие, крутые впадины — имеют тенденцию вызывать ухудшение производительности при столкновении с изменениями или атаками.
Среди различных алгоритмов, предназначенных для поиска плоских минимумов, команда определила минимизацию с учетом резкости (SAM) как наиболее эффективную. Модели, обученные с помощью SAM, продемонстрировали снижение накопления ошибок при выполнении задач быстрой генерации, сохраняли более высокое качество результатов после сжатия и продемонстрировали семикратное увеличение устойчивости к состязательные атакичто значительно повышает их надежность.
В то время как предыдущие исследования отдельно рассматривали такие проблемы, как накопление ошибок, ошибки квантования и состязательные уязвимости, это исследование показывает, что сосредоточение внимания на плоских минимумах предлагает единое и фундаментальное решение всех этих проблем.
Исследователи подчеркивают, что их результаты выходят за рамки простого улучшения качество изображения. Они обеспечивают фундаментальную основу для разработки надежных, универсальных генеративных систем искусственного интеллекта, которые можно эффективно применять в различных отраслях и реальных сценариях. Кроме того, этот подход может проложить путь к более эффективному обучению крупномасштабных моделей, таких как ChatGPT, даже с ограниченными данными.
Дополнительная информация:
Тэхван Ли и др., «Понимание плоскостности в генеративных моделях: ее роль и преимущества», arXiv (2025). DOI: 10.48550/arxiv.2503.11078.
Предоставлено
Ульсанский национальный институт науки и технологий
Цитирование: Принципы проектирования для более надежных и заслуживающих доверия художников-ИИ (6 ноября 2025 г.), получены 8 ноября 2025 г. с https://techxplore.com/news/2025-11-principles-reliable-trustworthy-ai-artists.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2025-11-07 02:40:00
1762627793
#Принципы #проектирования #для #более #надежных #заслуживающих #доверия #художников #работающих #искусственным #интеллектом
Ещё по этой теме

