1771761164
2026-02-22 11:26:00
Новый тест дает моделям ИИ, казалось бы, простую задачу: найти конкретные фотографии в личной коллекции.
Когда люди ищут конкретную фотографию, они обычно запоминают контекст, а не само изображение. Концертная фотография, на которой была видна только певица, с шоу с сине-белым логотипом у входа.
Ключ к разгадке того, какой именно концерт был на самом деле, скрыт совсем в другом изображении. Согласно новому исследованию, проведенному исследователями из Китайского университета Жэньминь и научно-исследовательским институтом производителя смартфонов Oppo, именно здесь разваливается любая стандартная система поиска изображений.
Современные мультимодальные поисковые системы оценивают каждое изображение самостоятельно: соответствует оно запросу или нет? Это отлично работает, когда целевая фотография визуально отличается. Но как только ответ зависит от связей между несколькими изображениями, подход упирается в фундаментальную стену.
Исследователи называют свой новый подход DeepImageSearch и рассматривают поиск изображений как автономную исследовательскую задачу. Вместо сопоставления отдельных изображений модель ИИ самостоятельно перемещается по коллекции фотографий, собирая воедино подсказки из разных изображений, чтобы постепенно достичь своей цели.
Прямой поиск сопоставляет изображения только визуально, поиск с интенсивным рассуждением опирается на внешние знания, а DeepImageSearch связывает подсказки из разных изображений в коллекции. | Изображение: Дэн и др.
Текущий поиск изображений едва ли превосходит случайный шанс
Чтобы показать, насколько велик разрыв между современными технологиями и задачами такого рода, исследователи создали тест DISBench. Он содержит 122 поисковых запроса, распределенных по коллекциям фотографий 57 пользователей, в общей сложности насчитывающим более 109 000 изображений. Фотографии взяты из общедоступного набора данных YFCC100M и охватывают в среднем 3,4 года на одного пользователя.
DISBench включает 122 поиска среди 57 пользователей и более 109 000 фотографий. Чуть более половины запросов требуют анализа нескольких событий. На целевых изображениях в основном показаны люди и сцены природы. | Изображение: Дэн и др.
Поисковые запросы делятся на две категории. Первый требует идентификации конкретного события, а затем фильтрации правильных изображений внутри него. Второй более требовательный: модель должна обнаруживать повторяющиеся элементы в нескольких событиях и классифицировать их по времени или месту. В обоих случаях рассматривать изображение изолированно недостаточно.
Для запросов внутри событий (слева) модель должна сначала найти нужное событие, а затем отфильтровать его. Для запросов между событиями (справа) цель состоит в том, чтобы обнаружить и сопоставить повторяющиеся элементы в нескольких событиях. | Изображение: Дэн и др.
Результаты Традиционные модели внедрения, такие как внедрение Qwen3-VL или внедрение Seed 1.6, показывают, насколько глубока проблема. Только от 10 до 14 процентов из трех первых результатов содержат изображение, которое на самом деле искали. Даже такие низкие цифры во многом обусловлены случайностью, пишут исследователи.
Поскольку личные фотоколлекции содержат много визуально похожих изображений из разных ситуаций, модели случайным образом вылавливают все, что внешне соответствует запросу. Они просто не могут определить, действительно ли изображение соответствует контекстуальным условиям.
Даже при использовании инструментов лучшие модели испытывают трудности.
Для более справедливой оценки исследователи разработали систему ImageSeeker. Он предоставляет инструменты мультимодальных моделей, выходящие за рамки простого сопоставления изображений: семантический поиск, доступ к временным меткам и данным GPS, возможность напрямую проверять отдельные фотографии и поиск в Интернете неизвестных терминов. Два механизма памяти также помогают моделям записывать промежуточные результаты и отслеживать длинные пути поиска.
Даже при использовании всех этих инструментов результаты остаются скромными. Лучшая протестированная модель, Claude Opus 4.5 от Anthropic, обнаружила ровно все правильные изображения чуть менее чем в 29 процентах случаев. OpenAI GPT-5.2 набрал около 13 процентов, а Google Gemini 3 Pro Preview — около 25 процентов. Модели с открытым исходным кодом Qwen3-VL и GLM-4.6V показали себя еще хуже. В обычных тестах поиска изображений эти же модели показывают почти идеальные результаты.
Нарушение рассуждений является наиболее распространенным источником ошибок во всех протестированных моделях. Модели часто находят правильный контекст, но затем терпят неудачу во время многоэтапного поиска. | Изображение: Дэн и др.
Один эксперимент особенно показателен. Когда исследователи выполнили несколько параллельных попыток для каждого запроса и каждый раз выбирали лучший результат, процент попаданий подскочил примерно на 70 процентов. Модели явно обладают потенциалом для решения этих задач; они просто не могут надежно найти правильный ответ ни с одной попытки.
Модели прекрасно видят, но они просто не умеют планировать.
Ручной анализ ошибок, проведенный исследователями, показывает, где модели на самом деле дают сбой. Самая распространенная ошибка заключается в том, что модели находят правильный контекст, но затем слишком рано прекращают поиск или теряют из виду свои ограничения.
В исследовании это называется «нарушением рассуждений», и эта закономерность наблюдается и в других контекстах. В эту категорию попадают от 36 до 50 процентов всех ошибок. Визуальная дискриминация – путаница похожих объектов или зданий – появляется на отдалённой секунде.
Систематический взгляд на отдельные инструменты подтверждает этот вывод. Из всех инструментов платформы инструменты метаданных оказывают наибольшее влияние на производительность. Без доступа к временным меткам и данным о местоположении точность падает больше всего. Временной и пространственный контекст оказывается ключевым фактором в различении визуально похожих изображений из разных ситуаций.
Исследователи рассматривают свой тест как тестовый пример для поисковых систем следующего поколения. Пока модели ИИ смогут оценивать изображения только изолированно, сложные поисковые запросы в личных коллекциях фотографий останутся нерешенными. DeepImageSearch показывает, что моделям не обязательно лучше видеть; им необходимо лучше планировать, отслеживать ограничения и управлять промежуточными результатами. код и набор данных находятся в открытом доступе наряду с таблица лидеров.
Как и в случае с текстом, модели ИИ также демонстрируют хорошо известную проблему «потерянных посередине» с изображениями: визуальная информация в начале или конце набора данных привлекает больше внимания, чем информация в середине. Чем больше набор данных и чем полнее контекстное окно, тем более выраженным становится этот эффект. Вот почему хорошая контекстная инженерия так важна.
Новости искусственного интеллекта без ажиотажа – курируют люди
Как Абонент ДЕКОДЕРвы получаете чтение без рекламы, наш еженедельный информационный бюллетень по искусственному интеллектуэксклюзив Отчет «AI Radar» Frontier 6 раз в годдоступ к комментариям и нашему полный архив.
Подпишитесь сейчас
#Почему #ИИ #до #сих #пор #не #может #найти #ту #фотографию #концерта #которую #вы #ищете
По теме

