Генетические данные могут быть проанализированы, чтобы оценить риск возникновения определенных заболеваний.
Научная фотобиблиотека / Алами
Оценки генетического риска, которые суммируют вероятность возникновения у человека определенных заболеваний, можно использовать с помощью математических трюков, чтобы выявить скрытые детали его ДНК.
Этот метод теоретически может быть использован медицинскими страховщиками для восстановления генетических данных из сводного геномного отчета, выявляя риски для здоровья, не разглашаемые пациентом. Альтернативно, люди, анонимно делящиеся своими результатами, могут быть идентифицированы путем извлечения генетических данных и запросы к общедоступным генеалогическим базам данных.
Оценка полигенного риска измерить влияние десятков и тысяч вариаций отдельных букв в геноме, известных как однонуклеотидные полиморфизмы (SNP). Результаты, используемые исследователями и компаниями по тестированию ДНК, такими как 23andMe, для обобщения потенциальных рисков для здоровья, иногда публикуются публично, например, люди, обращающиеся за советом по интерпретации своих результатов.
Распаковка полигенной оценки риска подобна попытке определить номер телефона, зная только, что сумма цифр равна 52. Это пример задача о рюкзаке по математикекак известно, является вычислительно трудным. По этой причине такие оценки считаются низким риском для конфиденциальности.
Однако каждое значение SNP, используемое в оценке риска, умножается на чрезвычайно точный вес – длиной до 16 цифр – который отражает его вклад в общий риск заболевания. Это делает модели с малым риском уязвимыми для атак.
«Поскольку окончательный показатель полигенного риска ограничен конечным числом способов получения этого числа и статистически вероятным расположением лежащих в его основе SNP, его можно вывести с высокой степенью точности», — говорит Гамзе Гурсой в Колумбийском университете в Нью-Йорке.
Гюрсой и Kirill Nikitin, Также в Колумбии было проведено 298 моделей полигенного риска, в которых используется 50 или менее SNP на генетических данных от 2353 человек. Работая в обратном направлении, они рассчитали все возможные геномы, которые могли бы дать каждый заданный балл, отфильтровав те, у которых было много необычных мутаций.
Поскольку один SNP может использоваться несколькими моделями полигенного риска, Гюрсой и Никитин смогли последовательно организовать свою атаку, используя SNP, выявленные меньшими моделями, для решения более крупных.
Им удалось реконструировать генотип донора с точностью 94,6%, правильно предсказав 2450 SNP на человека. Тесты показали, что 27 SNP достаточно, чтобы идентифицировать человека в полумиллионе образцов, а членов семьи можно предсказать с точностью до 90 процентов. Лиц африканского и восточноазиатского происхождения было легче идентифицировать, поскольку они менее хорошо представлены в генетических базах данных.
По словам Гюрсоя, в мире создано 447 небольших высокоточных моделей. общедоступная база данных полигенных показателей уязвимы для этой атаки.
«Мы хотели отметить, что риск низкий, но под [some conditions]”Мы должны учитывать это при разработке исследований, особенно если мы вовлекаем уязвимые группы населения”, – говорит Гюрсой.
Ин Ван В Массачусетской больнице общего профиля говорят, что существующие средства защиты данных и узкие места в вычислениях ограничивают риск использования полигенных показателей риска таким образом. «Результаты могут служить предупреждением о том, что небольшие модели следует рассматривать как потенциально конфиденциальные данные в клинических отчетах и обсуждениях информированного согласия», — говорит она.
Темы:
2026-03-10 17:00:00
1773171736
#Обмен #оценками #генетического #риска #может #невольно #раскрыть #секреты
Ещё по этой теме
