Метод учит генеративные модели искусственного интеллекта находить персонализированные объекты.

Персонализированная локализация в контексте включает в себя локализацию экземпляров объектов, присутствующих в сцене (или изображении запроса), аналогичных объекту, представленному в качестве примера в контексте. В этом случае входными данными для модели являются имя категории, контекстное изображение, координаты ограничивающего прямоугольника и изображение запроса. Задача модели — локализовать ту же категорию интересов (представленную в виде контекстного примера) в изображении запроса. Здесь мы визуализируем несколько входных и выходных данных различных VLM, подчеркивая, что наша точно настроенная модель лучше фиксирует информацию в контекстном изображении. Кредит: arXiv (2024). DOI: 10.48550/arxiv.2411.13317.

Предположим, человек берет своего французского бульдога Баузера в парк для собак. Владельцу собаки легко распознать Баузера, играющего среди других собак, находясь на месте.

Но если кто-то захочет использовать генеративную модель искусственного интеллекта, такую как GPT-5, для наблюдения за своим питомцем, пока он на работе, модель может не справиться с этой основной задачей. Модели языка видения, такие как GPT-5, часто превосходно распознают общие объекты, например собаку, но плохо справляются с обнаружением персонализированных объектов, например, французского бульдога Баузера.

Чтобы устранить этот недостаток, исследователи из Массачусетского технологического института и Лаборатории искусственного интеллекта Watson MIT-IBM представили новый метод обучения, который учит модели языка видения локализовать персонализированные объекты в сцене.

Их метод использует тщательно подготовленные данные видеослежения, в которых один и тот же объект отслеживается в нескольких кадрах. Они разработали набор данных таким образом, чтобы модель должна была сосредоточиться на контекстных подсказках для идентификации персонализированного объекта, а не полагаться на знания, которые она ранее запомнила.

Получив несколько примеров изображений, показывающих персонализированный объект, например чье-то домашнее животное, переобученная модель сможет лучше определить местоположение того же домашнего животного на новом изображении.

Модели, переобученные с помощью их метода, превзошли самые современные системы в решении этой задачи. Важно отметить, что их техника оставляет нетронутыми остальные общие способности модели.

Этот новый подход может помочь будущим системам искусственного интеллекта отслеживать конкретные объекты во времени, например детский рюкзак, или локализовать интересующие объекты, например вид животных, при экологическом мониторинге. Это также может помочь в разработке вспомогательных технологий на основе искусственного интеллекта, которые помогут слабовидящим пользователям находить определенные предметы в комнате.

«В конечном счете, мы хотим, чтобы эти модели могли учиться на основе контекста, как это делают люди. Если модель может делать это хорошо, вместо того, чтобы переобучать ее для каждой новой задачи, мы могли бы просто предоставить несколько примеров, и она сделает вывод, как выполнить задачу из этого контекста. Это очень мощная способность», — говорит Джеханзеб Мирза, постдок Массачусетского технологического института и старший автор бумага по этой технике размещено на arXiv сервер препринтов.

К Мирзе в работе над статьей присоединяются соавторы Сиван Дове, аспирант Института науки Вейцмана; и Нимрод Шабтай, исследователь IBM Research; Джеймс Гласс, старший научный сотрудник и руководитель группы систем разговорного языка в Лаборатории компьютерных наук и искусственного интеллекта Массачусетского технологического института (CSAIL); и другие. Работа будет представлена на Международной конференции по компьютерному зрению (г.ICCV2025), состоявшемся 19-3 в Гонолулу, Гавайи.

Неожиданный недостаток

Исследователи обнаружили, что большие языковые модели (LLM) могут преуспеть в обучении на основе контекста. Если они предоставят LLM несколько примеров задач, например задач на сложение, он сможет научиться решать новые задачи на сложение на основе предоставленного контекста.

Модель языка видения (VLM) по сути представляет собой LLM с подключенным к ней визуальным компонентом, поэтому исследователи Массачусетского технологического института полагали, что она унаследует возможности LLM для контекстного обучения. Но это не так.

исследовательское сообщество пока не смог найти черно-белого ответа на эту конкретную проблему. Узкое место может возникнуть из-за того, что некоторые визуальная информация теряется в процессе слияния двух компонентов, но мы просто не знаем», — говорит Мирза.

Исследователи намеревались улучшить возможности VLM по контекстной локализации, которая предполагает поиск конкретного объекта на новом изображении. Они сосредоточились на данных, используемых для переобучения существующих VLM для выполнения новой задачи — процесса, называемого тонкой настройкой.

Типичные данные тонкой настройки собираются из случайных источников и отражают коллекции повседневных предметов. На одном изображении могут быть припаркованы машины на улице, а на другом — букет цветов.

«В этих данных нет реальной согласованности, поэтому модель никогда не научится распознавать один и тот же объект на нескольких изображениях», — говорит он.

Чтобы решить эту проблему, исследователи разработали новый набор данных, взяв образцы из существующих данных видеослежения. Эти данные представляют собой видеоклипы, показывающие один и тот же объект, движущийся по сцене, например, тигр, идущий по лугу.

Они вырезали кадры из этих видео и структурировали набор данных так, чтобы каждый вход состоял из нескольких изображений, показывающих один и тот же объект в разных контекстах, с примерами вопросов и ответов о его местонахождении.

«Используя несколько изображений одного и того же объекта в разных контекстах, мы поощряем модель последовательно локализовать интересующий объект, фокусируясь на контексте», — объясняет Мирза.

Принуждение к фокусу

Но исследователи обнаружили, что VLM склонны обманывать. Вместо того, чтобы отвечать на основе контекстных подсказок, они будут идентифицировать объект, используя знания, полученные во время предварительного обучения.

Например, поскольку модель уже узнала, что изображение тигра и метка «тигр» коррелируют, она может идентифицировать тигра, пересекающего луга, на основе этих предварительно обученных знаний, а не делать выводы из контекста.

Чтобы решить эту проблему, исследователи использовали в наборе данных псевдоимена, а не фактические имена категорий объектов. В данном случае они изменили имя тигра на «Чарли».

«Нам потребовалось некоторое время, чтобы понять, как предотвратить мошенничество модели. Но мы изменили игру для модели. Модель не знает, что «Чарли» может быть тигром, поэтому она вынуждена смотреть на контекст», — говорит он.

Исследователи также столкнулись с проблемами в поиске наилучшего способа подготовки данных. Если кадры расположены слишком близко друг к другу, фон не изменится настолько, чтобы обеспечить разнообразие данных.

В конечном итоге точная настройка VLM с помощью этого нового набора данных повысила точность персонализированной локализации в среднем примерно на 12%. Когда они включили набор данных с псевдоименами, прирост производительности достиг 21%.

По мере увеличения размера модели их метод приводит к большему приросту производительности.

В будущем исследователи хотят изучить возможные причины, по которым VLM не наследуют возможности контекстного обучения от своих базовых LLM. Кроме того, они планируют изучить дополнительные механизмы для повышения производительности VLM без необходимости его переобучения на новых данных.

«Эта работа переосмысливает локализацию персонализированных объектов с несколькими кадрами — адаптацию на лету к одному и тому же объекту в новых сценах — как проблему настройки инструкций и использует последовательности видео-отслеживания, чтобы научить VLM локализоваться на основе визуального контекста, а не априорных классов. В ней также представлен первый эталонный тест для этой настройки с солидными преимуществами для открытых и проприетарных VLM.

«Учитывая огромное значение быстрого, конкретного случая обучения — часто без точной настройки — для пользователей реальных рабочих процессов (таких как робототехника, помощники дополненной реальности, творческие инструменты и т. д.), практический, ориентированный на данные рецепт, предлагаемый этой работой, может способствовать широкому внедрению базовых моделей языка видения», — говорит Саурав Джа, постдок в Институте искусственного интеллекта Мила-Квебека, который не участвовал в этой работе.

Дополнительная информация:
Сиван Дове и др., Обучение VLM локализации конкретных объектов на основе контекстных примеров, arXiv (2025). DOI: 10.48550/arxiv.2411.13317.

Информация журнала:
arXiv


Эта история перепечатана с любезного разрешения MIT News (web.mit.edu/newsoffice/), популярный сайт, освещающий новости об исследованиях, инновациях и преподавании MIT.

Цитирование: Метод учит генеративные модели ИИ находить персонализированные объекты (2025 г., 16 октября), получено 19 октября 2025 г. с https://techxplore.com/news/2025-10-method-generative-ai-personalized.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2025-10-16 15:18:00


1760877376
#Метод #учит #генеративные #модели #искусственного #интеллекта #находить #персонализированные #объекты

Читайте также

Read more:  Как мы можем повысить устойчивость к киберугрозам с использованием искусственного интеллекта?

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.