Модель машинного обучения с высокой точностью предсказывает риск рака печени

Итог: Модель машинного обучения, которая анализирует демографические данные пациентов, данные электронных медицинских карт и результаты обычных анализов крови, с высокой точностью предсказала риск развития у пациента гепатоцеллюлярной карциномы (ГЦК), наиболее распространенного типа рака печени.

Журнал, в котором было опубликовано исследование: Открытие ракажурнал Американской ассоциации исследований рака (AACR)

Ян Клусманн, доктор медицинских наук, первый автор исследования и учёный-клиницист Технического университета Дрездена.

Фон: Лица, у которых считается повышенный риск ГЦК, могут иметь право на скрининг рака на основе визуализации и крови, чтобы обеспечить раннее выявление заболевания; однако нынешние рекомендации ориентированы на узкую группу населения с высоким риском и упускают из виду многих людей из группы риска, объяснил Шнайдер.

«Скрининг обычно рекомендуется пациентам с подтвержденным циррозом печени или тяжелым заболеванием печени, поскольку у этих пациентов встречается много случаев ГЦК, но есть много людей с недиагностированным циррозом печени или другими факторами риска, которым также может быть полезен скрининг рака печени», — сказала она.

Дополнительные факторы, повышающие риск развития ГЦК у пациента, включают, среди прочего, принадлежность к мужскому полу, курение и злоупотребление алкоголем, добавил Клусманн.

«При таком большом количестве факторов, влияющих на риск, существует острая необходимость в эффективных инструментах, которые помогут врачам выявлять пациентов с высоким риском», — сказал он. «Инструменты машинного обучения, которые могут одновременно работать с различными типами клинических данных, могут быть особенно полезны для решения этой серьезной клинической задачи».

Как проводилось исследование: В этом исследовании Клусманн, Катер, Шнайдер и их коллеги использовали данные Британского биобанка для разработки моделей машинного обучения, которые анализируют различные типы клинических данных для оценки риска ГЦК. Биобанк Великобритании содержал данные более чем 500 000 человек в Соединенном Королевстве и включал 538 случаев ГЦК, 69% из которых произошли у пациентов без предварительного диагноза цирроза печени, вирусного гепатита или других хронических заболеваний печени.

Read more:  Почему Китай намерен принять новый закон, способствующий «этническому единству»?

Исследователи обучили свои модели на 80% данных из Британского биобанка и провели первоначальную проверку оставшихся 20%. Внешняя проверка проводилась с использованием реестра All of Us, который включал данные более чем 400 000 человек в Соединенных Штатах, включая значительную часть групп населения, которые исторически были недостаточно представлены в медицинских исследованиях, отмечают авторы. В реестре зарегистрировано 445 случаев ГЦК.

В моделях, разработанных авторами, использовалась «случайная лесная архитектура» — метод, объединяющий сотни деревьев решений. Каждое дерево принимает ряд простых решений «да» или «нет» на основе ряда переменных из данных пациентов, а окончательный прогноз определяется путем агрегирования результатов по всем деревьям, что делает модель более устойчивой, надежной и интерпретируемой, объяснил Клусманн.

Отдельная модель случайного леса была обучена для каждого из пяти различных типов клинических данных, а также для поэтапных комбинаций данных в порядке возрастания клинической доступности: демографические данные пациентов, данные электронных медицинских карт, результаты анализов крови, геномика и метаболомика. Эффективность этих моделей оценивалась путем расчета площади под рабочей характеристикой приемника (AUROC), которая описывает способность алгоритма различать две группы (в данном случае пациентов в проверочной когорте с ГЦК и пациентов без него), где 1 — идеальный балл.

Результаты: Исследователи обнаружили, что модель, сочетающая демографические данные, электронные медицинские записи и анализы крови (Модель C), дала наилучшие результаты с AUROC 0,88. Добавление данных геномики и/или метаболомики существенно не повысило производительность.

«Это показало, что мы можем прогнозировать риск ГЦК, используя простые, легкодоступные данные без необходимости сложного и дорогостоящего генетического секвенирования», — сказал Шнайдер, отметив, что эта функция увеличивает потенциал модели для широкого использования, особенно в условиях ограниченных ресурсов.

Авторы обнаружили, что их модель лучше существующих методов выявления истинных случаев ГЦК, но при этом дает меньше ложноположительных результатов. Чтобы сделать Модель C более практичной для клинических условий, исследователи сократили количество клинических особенностей, которые она исследовала в так называемом «эксперименте по абляции». В результате упрощенная версия модели, в которой исследовалось всего 15 регулярно собираемых клинических признаков, по-прежнему превосходила существующие модели прогнозирования риска.

Read more:  Тяжелая астма, связанная с более сильной защитой, несмотря на худшее воспринимаемое здоровье

Клусманн добавил, что окончательная модель продемонстрировала сильную обобщаемость: несмотря на то, что она была обучена преимущественно на данных белых участников Британского биобанка, она сохранила хорошие результаты при оценке конкретно в небелой подгруппе более этнически разнообразной когорты «Все мы», что предполагает широкую применимость среди населения.

Ограничения исследования: Ограничения исследования включают его ретроспективный дизайн и низкую долю пациентов с вирусным гепатитом, известным фактором риска рака печени, в когортах обучения и проверки. Авторы отмечают, что необходима дальнейшая проверка для оценки эффективности модели машинного обучения в различных группах населения.

Источник:

Американская ассоциация исследований рака

Ссылка на журнал:

ДОИ: 10.1158/2159-8290.CD-25-1323

1774586606
#Модель #машинного #обучения #высокой #точностью #предсказывает #риск #рака #печени
2026-03-27 03:05:00

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.