IIT Bombay разрабатывает модель ИИ для декодирования спутниковых изображений с использованием естественного языка

Исследователи из Индийского технологического института, Бомбей (IIT Bombay), разработали модель искусственного интеллекта (ИИ), которая позволяет машинам интерпретировать спутниковые и беспилотные изображения с использованием повседневных языковых подсказок, потенциально трансформирующих применение в реагировании на стихийные бедствия, наблюдение, городское планирование и сельское хозяйство.

Модель, называемая адаптивной визуальной заземлением под руководством модальности (AMVG), была разработана командой, возглавляемой профессором Биплабом Банерджи из Центра исследований в области исследований IIT Бомбея в области инженерии ресурсов.

По словам Шабнама Чудхури, ведущего автора и доктора наук, обнаружение кошки в гостиной может быть легким для искусственного интеллекта, но декодирование сложных спутниковых снимков с высоким разрешением, основанными на инструкциях по естественному языку. Исследователь в IIT Bombay. AMVG стремится преодолеть этот разрыв, позволяя пользователям кормить подсказки, такие как «найти все поврежденные здания возле затопленной реки», и получить целевые результаты в течение нескольких минут, даже от сотен загроможденных изображений.

Исследование, опубликованное в Международном обществе фотограмметрии и дистанционного зондирования в журнале фотограмметрии и дистанционного зондирования, предполагает, что AMVG может сделать анализ изображений более быстрым, интуитивно понятным и более доступным для агентств и исследователей.

«Изображения с дистанционным зондированием подробно богаты, но чрезвычайно сложны для автоматической интерпретации. Существующие модели борются с неоднозначности и контекстными командами», – пояснила г -жа Чоудури.

AMVG вводит комбинацию инноваций, включая многоэтапный токенизированный кодировщик и потерю выравнивания внимания (AAL), которые помогают модели идентифицировать объекты более точно на основе контекстного понимания. AAL, в частности, действует как «виртуальный тренер», обучая систему сосредоточиться на соответствующих регионах изображения при интерпретации команд. «Когда человек читает« белый грузовик рядом с топливным баком », наши глаза знают, где смотреть. Аал учит машину делать то же самое», – сказала г -жа Чоудхури.

Read more:  Сохранить большую в нашей любимой камере безопасности на открытом воздухе

Команда представляет широкий спектр приложений. В ответ на бедствие агентства могут быстро найти поврежденную инфраструктуру после наводнений или землетрясений. Организации безопасности могли бы выявить замаскированные транспортные средства вблизи чувствительных районов, в то время как фермеры могут отслеживать здоровье урожая, просто попросив модель подчеркнуть пожелтевшие пятна.

Тем не менее, профессор Банерджи пояснил, что AMVG еще не был проверен в сценариях стихийных бедствий в реальном мире. Говоря с ИндусОн сказал: «Мы провели несколько предварительных исследований, но из-за отсутствия реальных наборов данных заземления для управления стихийными бедствиями мы не могли провести полномасштабную оценку. Создание такого набора данных-один из наших планов на будущее».

По словам команды, AMVG превосходит существующие подходы при обнаружении поврежденных зданий, скрытых транспортных средств или моделей урожая в сложных местах, хотя более полное эталонное исследование все еще находится на рассмотрении.

На вопрос, может ли AMVG помочь правительствам и неправительственным организациям во время наводнений, землетрясений или лесных пожаров, предоставляя информацию в реальном времени, профессор Банерджи был оптимистичен: «Конечно. Это один из самых сильных вариантов использования, которые мы представляем».

Исследователи также изучают сотрудничество, чтобы привлечь AMVG в оперативное использование. «Мы уже работали с ISRO над некоторыми подобными проблемами», – сказал профессор Банерджи. «Новый раунд сотрудничества с ISRO, вероятно, начнется в ближайшее время, и такие модели на языке зрения будут строго рассмотрены».

AMVG показал обнадеживающие результаты в разных образах из спутников, дронов и датчиков на основе самолетов. Следующий этап исследования включает в себя развертывание модели в различных географических и экологических сценариях для оценки ее адаптивности.

На заметном шаге для этой области команда IIT Bombay также открыла реализацию AMVG на GitHub. «Открытые источники все еще редки в дистанционном зондировании. Мы хотели поощрять прозрачность и ускорить прогресс»,-сказала г-жа Чоудхури.

Read more:  Danone находится в выигрышном положении, чтобы воспользоваться резким ростом продаж продуктов для борьбы с ожирением в США.

В то время как модель показывает обещание, команда признает ограничения. В настоящее время AMVG зависит от высококачественных аннотированных наборов данных и требует оптимизации для развертывания в реальном времени. Работа проводится над версиями, оспаривающими датчики и методам композиционного заземления для улучшения адаптивности в разных ландшафтах.

«Наша цель состоит в том, чтобы построить единую систему понимания дистанционного зондирования – та, которая может обосновать, описывать, извлекать и разум о любом изображении, использующем естественный язык», – сказала г -жа Чоудхури.

Опубликовано – 4 сентября 2025 г., 16:55

2025-09-04 11:25:00


1757001202
#IIT #Bombay #разрабатывает #модель #ИИ #для #декодирования #спутниковых #изображений #использованием #естественного #языка

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.