1769874878
2026-01-31 15:38:00
Исследователи все чаще задаются вопросом, действительно ли большие модели языка видения (VLM) видеть или просто восстановить заученную информацию. Эта дискуссия теперь подогревается новыми открытиями, касающимися их реакции на зрительные иллюзии. Сяосяо Сунь, Минъян Ли и Кун Юань (Страсбургский университет, Мюнхенский технический университет) вместе с Мин У Суном, Марком Эндо и Шэнгуан Ву представляют убедительные доказательства того, что VLM часто не могут адаптироваться к перевернутым зрительным иллюзиям, несмотря на то, что очевидные изменения легко очевидны для людей. Это исследование важно, потому что оно выходит за рамки простого выявления этого несоответствия и представляет новую систему под названием VI-Probe, позволяющую систематически отделять визуальное восприятие от воспоминаний. Измеряя стабильность и чувствительность с помощью новых показателей, команда демонстрирует, что постоянство ответа обусловлено различными механизмами в разных моделях: от переопределения памяти GPT-5 до ограничений в визуальной обработке Qwen, бросая вызов понятию единой основной причины и выступая за более тонкую оценку этих мощных систем.
Это исследование важно, потому что оно выходит за рамки простого выявления этого несоответствия и представляет новую систему под названием VI-Probe, позволяющую систематически отделять визуальное восприятие от воспоминаний.
VI-Probe анализирует визуальное восприятие в больших моделях с помощью
Ученые продемонстрировали новую систему VI-Probe, позволяющую исследовать, действительно ли большие модели визуального языка (VLM) воспринимают визуальные изменения или просто вспоминают заученные шаблоны. Исследование посвящено загадочному феномену, когда VLM часто правильно отвечают на вопросы о зрительных иллюзиях в исходных изображениях, но постоянно терпят неудачу, когда факторы иллюзии инвертируются, несмотря на то, что изменения легко очевидны для людей. Это несоответствие поднимает фундаментальный вопрос о природе визуальной обработки в этих моделях. Эксперименты были проведены в различных семействах VLM и показали, что устойчивость ответа вызвана не одним механизмом, а скорее гетерогенными факторами.
Работа бросает вызов преобладающим однопричинным объяснениям такого поведения и выступает за оценку на основе зондирования, которая оценивает как знания, так и чувствительность к контролируемым визуальным изменениям. Исследователи создали комплексный набор данных, включающий 27 категорий иллюзий, а также связанные с ними контрольные изображения и лингвистические подсказки, что позволяет детально анализировать реакции модели. Этот тест поддерживает непрерывное создание образцов, обеспечивая надежную платформу для будущих исследований. Результаты показывают, что разные семейства моделей демонстрируют разные режимы сбоя, что позволяет предположить различные основные механизмы, ответственные за устойчивость ответа.
Переопределение памяти в GPT-5 указывает на сильную зависимость от ранее существовавших знаний, в то время как конкуренция восприятия и памяти в Claude-Opus-4.1 предполагает более сложное взаимодействие между визуальным вводом и лингвистическими априорами. Варианты Qwen, с другой стороны, кажутся ограниченными своими возможностями визуальной обработки, борясь с запутанностью представлений и узкими местами восприятия. Эти открытия открывают возможности для разработки более надежных и точных VLM, способных по-настоящему «видеть», а не просто «запоминать». Данные и код VI-Probe общедоступны, что облегчает дальнейшие исследования и разработки в этой важной области искусственного интеллекта.
Структура VI-Probe и показатели стабильности VLM имеют решающее значение
В исследовании использовались градуированные возмущения и соответствующие визуальные элементы управления, лишенные вызывающих иллюзии, чтобы систематически исследовать, как эти модели обрабатывают визуальные изменения. Эксперименты проводились на пятнадцати VLM, охватывающих четыре семейства: OpenAI, Anthropic, Google и Qwen, включая модели как с закрытым, так и с открытым исходным кодом. Исследователи получили доступ ко всем моделям через API, чтобы обеспечить единообразные условия вывода, предлагая для каждой из них единую настройку нулевого выстрела. Чтобы сравнить зрительное восприятие с памятью, исследование проанализировало, изменяют ли VLM прогнозы, когда визуальные данные противоречат предыдущим знаниям, оценивая «чувствительность к перевороту», и остаются ли ответы последовательными при визуальных и подсказочных вариациях.
OpenRouter облегчил оценку, используя настройки температуры по умолчанию для моделей, в которых отсутствует контроль температуры. Команда разработала схему, включающую пары дополнительных вопросов, задавая один и тот же вопрос разными способами, чтобы отделить лингвистическую полярность от визуального суждения, а затем разложила ответы на три категории: PFA (оба правильные), CbW (дополнительные, но неправильные) и TFI (недополнительные). Анализ этих категорий показал, что высокая согласованность смены полярности не обязательно означает высокую точность, поскольку модели могут постоянно переворачивать ответы с перевернутыми подсказками, но при этом давать неправильные ответы. Модели OpenAI, такие как GPT-5-Mini, достигшие PFC 84,86%, продемонстрировали значительный CbW (GPT-5: 31,08%), что указывает на систематические визуальные ошибки, замаскированные лингвистической связностью.
И наоборот, модели Клода продемонстрировали более сбалансированные соотношения, в то время как модели Google показали умеренный PFC с более низким CbW, что предполагает меньшую систематическую ошибку. Исследование также подчеркнуло, что масштаб модели не приводит к последовательному снижению лингвистической фиксации или зрительной предвзятости: Qwen2.5-72B достигает более высокого PFC, чем Qwen3-8B, однако последний демонстрирует конкурентоспособную визуальную точность. Кроме того, команда оценила четыре типа изображений: Control, Perturbed, чтобы изолировать эффекты памяти от зрительного восприятия, используя соответствующие элементы управления для удаления шаблонов иллюзий, сохраняя при этом базовую визуальную обработку. Индекс фиксации шаблона, превышающий 45%, указывал на недостаточную способность анализировать семантику вопросов, что делало точность ненадежной, как это наблюдалось в Qwen2.5-3B с TFI 46,82%. Эта инновационная методология позволила исследователям продемонстрировать, что лингвистическая устойчивость является предпосылкой для надежного визуального мышления и что PFC служит порогом качества для оценки эффективности модели.
GPT-5 подавляет восприятие заученными шаблонами
Результаты показывают, что GPT-5 практически полностью подавляет память при наличии зрительных иллюзий, последовательно полагаясь на уже существующие знания, а не на обработку измененного визуального ввода. Данные показывают, что варианты Qwen ограничены узкими местами визуальной обработки, в частности запутанностью представления и ограничениями восприятия. Исследователи зафиксировали различную чувствительность к визуальным факторам, таким как цвет, размер и пространственная конфигурация, в разных семействах моделей, что указывает на гетерогенные механизмы, ответственные за постоянство реакции. Испытания доказывают, что согласованность парных подсказок VI-Probe и величина эффекта, нормализованная по иллюзиям, обеспечивают факторно-изолированную оценку, выходящую за рамки стандартных измерений точности.
В частности, индекс согласованности смены полярностей и индекс фиксации шаблона количественно определяют лингвистическую устойчивость, в то время как множитель иллюзии (R) изолирует поведение, основанное на памяти, и поведение, основанное на восприятии. Измерения подтверждают, что VLM не могут точно интерпретировать иллюзии до порогов человеческого восприятия, но при этом работают сравнимо с людьми, когда им предъявляют соответствующие визуальные элементы управления, что подчеркивает сбои, вызванные шаблонами. Этот прорыв обеспечивает контролируемый эталон для исследования восприятия и границ памяти в VLM, используя градуированную силу иллюзий, комплексное видение и языковые вариации. Результаты исследования бросают вызов представлению о том, что устойчивость ответа обусловлена исключительно языковыми априорами, предлагая практические рекомендации как для оценки, так и для разработки моделей. Эта работа устанавливает новую парадигму для оценки баланса между восприятием и памятью в VLM, открывая путь к более устойчивым и надежным системам визуального мышления.
Инверсия иллюзий выявляет недостатки и предвзятости восприятия VLM
Они предлагают будущие направления исследований, в том числе разработку архитектур, ориентированных на восприятие, целей противодействия фактической согласованности во время обучения и создание градуированных наборов данных, чтобы лучше различать реакции, основанные на восприятии и памяти. Кроме того, они предлагают изучить стратегии подсказки во время вывода, которые требуют явной визуальной проверки. В конечном счете, это исследование подчеркивает более широкую проблему интеграции визуальных данных с предшествующими знаниями, отстаивая модели, которые действительно «видят», а не просто «вспоминают», и распространяя методы оценки за пределы иллюзий на более реалистичные визуальные данные.
👉 Дополнительная информация
🗞 VLM воспринимают или вспоминают? Исследование зрительного восприятия и памяти с помощью классических визуальных иллюзий
🧠 АрXiv:
#ViProbe #достигает #восприятия #не #распутывания #воспоминаний #используя #градуированные #визуальные #иллюзии
Ещё по этой теме

