Имея только векторную базу данных неизвестной модели, vec2vec переводит базу данных в пространство известной модели, используя только скрытую структуру. Конвертированные внедрения раскрывают конфиденциальную информацию об исходных документах, например тему электронного письма (на фото, реальный пример). Кредит: arXiv (2025). DOI: 10.48550/arxiv.2505.12540
Считалось, что входные данные, которые позволяют использовать современные системы поиска и рекомендаций, безопасны, но алгоритм, разработанный исследователями Корнеллского технологического института, успешно извлекал имена, медицинские диагнозы и финансовую информацию из закодированных наборов данных.
Люди могут осуществлять поиск в больших базах данных, поскольку кодировщик преобразовал каждую часть данных во «вложение» — ряд чисел, представляющих значение текста, изображения, звукозаписи или любого другого типа информации. Новый алгоритм, получивший название vec2vec, может переводить базы данных с вложенными текстами обратно на английский язык, не зная ни исходных данных, ни того, как они были закодированы. До недавнего времени компании считали, что эти вложения практически зашифрованы.
«Каждый должен думать об этих встраиваниях как о столь же чувствительных, как и основной текст», — сказал старший автор Виталий Шматиков, профессор информатики в Корнеллском колледже вычислительной техники и информатики Энн С. Бауэрс и в Корнеллском технологическом институте. «Доверять кому-либо свои встраивания — то же самое, что доверять им свои данные».
Исследователи представили исследование «Использование универсальной геометрии вложений» на конференции Ежегодная конференция по нейронным системам обработки информации 5 декабря в Сан-Диего. Выводы опубликовано на arXiv сервер препринтов.
Как vec2vec объединяет разные модели
В совокупности база данных вложений образует закодированную карту входных данных, используемых для поиска. Однако каждая модель кодирует внедрения по-разному, поэтому раньше их нельзя было транслировать между моделями.
С помощью vec2vec человек может преобразовать вложения каждой модели в универсальную систему, по сути создавая Розеттский камень из разных моделей. Подобно оригинальному Розеттскому камню, который нес то же сообщение древнегреческими, египетскими иероглифами и другим египетским письмом, эта универсальная система позволяет любому конвертировать вложения между моделями.
Кроме того, перевод вложений в известную модель позволяет аппроксимировать их исходное значение. Это создает новую угрозу безопасности: если база данных вложений скомпрометирована, исходные входные данные могут быть частично восстановлены.
Продемонстрированные риски и примеры из реальной жизни
Команда продемонстрировала, что vec2vec успешно извлекает информацию из нескольких закодированных баз данных вложений. Они восстановили темы твитов, состояние здоровья из набора анонимных больничных записей и содержимое электронных писем, включая имена, даты и финансовую информацию, из ныне несуществующей корпорации Enron.
Алгоритм не смог дословно перевести вложения. “Есть некоторые искажения”, – сказал Шматиков. «Мы не восстанавливаем все, но, по крайней мере, вы понимаете суть». Тем не менее, он успешно производил заказы на обед по электронной почте и с такими специфическими медицинскими симптомами, как «альвеолярный периостит».
Соавтор Джон Моррис, доктор философии. ’25, ранее показал, что если вы знаете, как кодировщик создает вложения, вы можете использовать эти знания для извлечения исходного значения.
«Эта работа показывает, что, даже если вы не знаете кодировщик, просто имея кучу таких вложений, вы можете их перевести», — сказал соавтор Коллин Чжан, докторант в области компьютерных наук.
Последствия для моделей ИИ и будущего использования
Это открытие может объяснить общее наблюдение: когда вы задаете один и тот же вопрос нескольким чат-ботам с искусственным интеллектом, которые используют встраивания для предоставления ответов, они часто дают очень похожие ответы, даже если они были созданы разными компаниями с разными обучающими данными. Многие исследователи ИИ уже давно подозревали, что все большие языковые модели Эта сила — эти чат-боты имеют универсальную базовую структуру, поскольку каждый из них кодирует одни и те же концепции человеческого языка — по сути, создавая свою собственную версию одной и той же коллекции вложений.
«Все эти разные модели как бы заново изобретают одно и то же», — сказал Моррис. «Я думаю, что наша работа подтвердила мнение многих людей по этому поводу».
У этого достижения также есть интересные технологические применения, говорит соавтор Риши Джа, докторант в области компьютерных наук. Например, если у кого-то есть кодировщик, который работает только на одном языке, vec2vec может создать перевод, позволяющий ему работать на нескольких языках или даже в разных форматах данных. «Кодер текста теперь может элегантно взаимодействовать с изображениями или со звуком», — сказал Джа.
Теоретически vec2vec может помочь даже с более экстремальными типами перевода. Исследовательская группа изучает возможность перевода шумов китов в человеческий текст. В настоящее время эта идея является чисто теоретической, сказал Моррис, но «если бы мы продолжали делать это по-настоящему, это было бы лучшим возможным результатом нашей работы».
Дополнительная информация:
Риши Джа и др., Использование универсальной геометрии вложений, arXiv (2025). DOI: 10.48550/arxiv.2505.12540
Предоставлено
Корнелльский университет
Цитирование: «Розеттский камень» для ввода данных в базу данных обнаруживает серьезную проблему безопасности (2026 г., 13 января), получено 16 января 2026 г. с https://techxplore.com/news/2026-01-rosetta-stone-database-reveals-issue.html.
Этот документ защищен авторским правом. За исключением любых добросовестных сделок в целях частного изучения или исследования, никакая часть не может быть воспроизведена без письменного разрешения. Содержимое предоставлено исключительно в информационных целях.
2026-01-13 19:09:00
1768546359
#Розеттский #камень #для #ввода #данных #базу #данных #выявил #серьезную #проблему #безопасности
По теме

