Новый метод компьютерного зрения связывает фотографии с планами этажей с точностью до пикселя.

Мы представляем C3, набор данных парных планов этажей и фотографий, снабженных соответствиями точек и положениями камер. Он состоит из 90 тысяч пар план-фото, 153 миллионов соответствий и 85 тысяч поз камеры в 597 сценах, охватывающих широкий диапазон структур сцены, условий освещения и поз камеры. Мы показываем фотографии, сделанные с разных ракурсов в примерной сцене, положения их камер и соответствие цветов плану этажа. Кредит: arXiv (2025). DOI: 10.48550/arxiv.2511.18559

Для людей сопоставление того, что они видят на земле, с картой — вторая натура. Для компьютеров это стало серьезной проблемой. Исследовательская группа Корнелла представила новый метод, который помогает машинам устанавливать эти соединения — достижение, которое может улучшить робототехнику, навигационные системы и 3D-моделирование.

Работа, представленная на выставке 2025 Конференция по нейронным системам обработки информации и опубликовано на arXiv сервер препринтов, устраняет главный недостаток современных инструментов компьютерного зрения. Современные системы хорошо работают при сравнении похожих изображений, но дают сбои, когда виды резко различаются, например, при связывании фотографии уровня улицы с простой картой или архитектурным чертежом.

Новый подход учит машины находить совпадения на уровне пикселей между фотографией и планом этажа, даже если они выглядят совершенно по-разному. Куан Вэй Хуан, докторант компьютерных наук, является первым автором; соавторы — Ной Снейвли, профессор Корнеллского технологического института; Бхарат Харихаран, доцент Корнеллского колледжа вычислительной техники и информатики Энн С. Бауэрс; и студент Брэндон Ли, изучающий информатику.

Команда назвала новую модель C3Po — сокращение от ее полного названия «Перекрестное межмодальное соответствие посредством прогнозирования карт точек» и игривый намек на персонажа из «Звездных войн». Чтобы поддержать это, команда создала C3 — огромный набор данных, состоящий из парных фотографий и планов этажей. Этот ресурс обучает компьютеры понимать, как изображения реального мира соотносятся с упрощенными картами — критически важная возможность для таких технологий, как навигация в помещении, роботизированное движение и цифровая реконструкция пространств.

«В последнее время произошли огромные успехи в компьютерном 3D-зрении, напоминающие прорывы, достигнутые большими языковыми моделями несколько лет назад», — сказал Снейвли, который также связан с Cornell Bowers. «Теперь у нас есть большие модели машинного обучения который может взять 2D-изображения — например, несколько изображений здания — и создать 3D-реконструкцию этого места».

Он объяснил, что нынешние крупномасштабные модели зрения ограничены, поскольку их обучали только на фотографиях. Когда им предоставляется изображение за пределами этой области, например план этажа, они работают плохо просто потому, что никогда не сталкивались с вводными данными такого типа.

«Важным фактором этой проблемы является ограниченность данных», — сказал он. «Итак, мы хотели создать набор данных, который связывал бы планы этажей с обычными фотографиями, и это стало набором данных C3».

Чтобы восполнить этот пробел, команда создала C3, набор данных, включающий 90 000 пар планов помещений и фотографий в 597 сценах, включая 153 миллиона соответствий на уровне пикселей и 85 000 поз камеры. Они собрали набор данных, реконструировав каждую сцену в 3D из больших коллекций фотографий в Интернете, а затем вручную сопоставив эти реконструкции с общедоступными планами этажей. Такое выравнивание обеспечивает точное сопоставление пикселей изображения и координат плана этажа, что ни один предыдущий набор данных не поддерживал в таком масштабе.

Когда команда тестировала существующие методы, большинство из них с трудом справлялись с этой задачей, часто допуская ошибки размером более 10% изображения. Чтобы исправить это, исследователи усовершенствовали свой подход, чтобы система могла сопоставлять каждый пиксель на фотографии с точной точкой на плане этажа. Их улучшенная модель C3Po сократила ошибки на 34% по сравнению с лучшим предыдущим методом и обеспечила более надежные результаты, когда система была уверена в своих прогнозах.

«В долгосрочной перспективе мы надеемся, что это вдохновит на создание больших 3D-моделей компьютерного зрения, которые смогут принимать всевозможные входные данные, относящиеся к сцене», — сказал Снейвли. ” 3D компьютерное зрение Область исследований обычно на несколько лет отстает от других областей с точки зрения использования последних тенденций в области ИИ, и я лично считаю, что это мультимодальное направление, в котором развивается ИИ, вскоре также станет новым рубежом в 3D-компьютерном зрении».

Дополнительная информация:
Куан Вэй Хуанг и др., C3Po: перекрестное межмодальное соответствие с помощью прогнозирования точечной карты, arXiv (2025). DOI: 10.48550/arxiv.2511.18559

Информация журнала:
arXiv


Цитирование: Новый метод компьютерного зрения связывает фотографии с планами этажей с точностью до пикселя (2025 г., 22 декабря), получено 5 января 2026 г. с https://techxplore.com/news/2025-12-vision-method-links-photos-floor.html.

Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.

2025-12-22 20:40:00


1767629045
#Новый #метод #компьютерного #зрения #связывает #фотографии #планами #этажей #точностью #до #пикселя

Продолжение темы

Read more:  Оценки тренера на третьем курсе: Кенни Диллингем, Дейон Сандерс и Брент Ки оцениваются от А до F

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.