- Огромные общие наборы данных позволили современному искусственному интеллекту справляться со сложными задачами, такими как программирование и человеческое мышление.
- Но разрозненные хранилища данных в настоящее время не позволяют машинному обучению раскрыть жизненно важные прорывы в иммунотерапии рака.
- Стандартизированная инфраструктура и глобальное сотрудничество могут ускорить открытие лекарств за счет создания исследовательских сетей, готовых к использованию искусственного интеллекта.
Большие языковые модели научились писать, программировать и рассуждать, потому что они обучались на огромных общих наборах данных — от Шекспира до репозиториев программного обеспечения. Масштаб, стандартизация и открытый доступ сделали возможным современный ИИ.
Исследования рака заслуживают такого же отношения.
Модели ИИ уже могут обнаруживать закономерности в миллиардах переменных. Применительно к медицине эти системы могут предсказывать, какие пациенты будут реагировать на лечение, выяснять, почему методы лечения терпят неудачу, и моделировать комбинации лекарств еще до того, как они дойдут до клинических испытаний. В иммунотерапии, где результаты зависят от миллионов динамических взаимодействий между иммунными клетками и опухолями, такое распознавание образов может иметь революционные последствия.
Системы машинного обучения работают так же хорошо, как данные, на которых они обучаются.
»
Наука готова. К сожалению, инфраструктуры данных нет. Сегодня большинство исследований рака по-прежнему проводятся лаборатория за лабораторией, набор данных за набором данных. Ценная информация находится в хранилищах — запертая за институциональными брандмауэрами, разбросанная по дополнительным файлам или хранящаяся в несовместимых форматах. Даже когда результаты публикуются, лежащие в их основе данные зачастую являются неполными (предвзятыми в сторону только положительных результатов) или их невозможно воспроизвести.
Системы машинного обучения работают так же хорошо, как данные, на которых они обучаются. Фрагментированные, противоречивые наборы данных дают фрагментированную и противоречивую информацию. Без общих стандартов и объединенных данных ИИ не сможет помочь нам раскрыть сложность лечения рака — какими бы мощными ни были алгоритмы.
Если мы хотим, чтобы ИИ ускорял лечение, нам сначала нужно создать правильную базу данных для его обучения.
Почему общие данные важны
Этот момент имеет уникальное значение. С одной стороны, биология вступила в новую эру. Одноклеточные и пространственные технологии теперь позволяют нам наблюдать за иммунной системой с исключительным разрешением — не только какие клетки присутствуют, но и где они находятся в пространстве, как они взаимодействуют и как они развиваются с течением времени. Мы можем оценить рак (и его лечение) как живую, динамичную систему. С другой стороны, архитектуры ИИ созрели для приема именно такого типа мультимодальных данных — геномных, пространственных и продольных — в масштабах, которые люди просто не могут обработать.
Впервые инструменты измерения и вычислительные инструменты согласованы. Но без скоординированной инфраструктуры мы рискуем упустить огромную возможность.
Последствия не являются теоретическими. Исследования, которые невозможно воспроизвести тратит впустую около 28 миллиардов долларов год только в Соединенных Штатах, и проблема начинается с доступа. Когда Центр открытой науки решил проверять Несмотря на 193 эксперимента из самых влиятельных исследований рака, они не смогли получить достаточно информации, чтобы даже попытаться выполнить большинство из них. Из 50 экспериментов, которые им удалось провести за восемь лет, менее половины дали одинаковые результаты. Данные либо были заблокированы за платным доступом, спрятаны в ящиках с файлами, либо просто никогда не передавались. А учиться в БМК Медицина обнаружили, что только 16% онкологических данных общедоступны, и этот показатель падает ниже 1% при проверке на соответствие стандартам, которые позволяют другим исследователям фактически использовать их.
В сфере, где жизнь зависит от скорости, такая неэффективность неприемлема. И в то время, когда у ИИ есть потенциал для ускорения открытий, он стал нашим самым большим препятствием.
Создание фундамента: CRI Discovery Engine
В Научно-исследовательском институте рака мы недавно запустили Механизм обнаружения CRI чтобы устранить этот пробел — не как собственную базу данных, а как общую инфраструктуру для всего месторождения.
Работая вместе с исследователями из Медицинской школы Стэнфордского университета, Медицинской школы Перельмана Пенсильванского университета и Мемориального онкологического центра Слоана-Кеттеринга, а также с технологическим партнером 10x Genomics, мы стандартизируем способы генерации, структурирования и распространения данных иммунотерапии. Цель проста: создать большой, гармонизированный набор данных, готовый к использованию ИИ, который сможет использовать любой квалифицированный исследователь. Участвующие ученые взяли на себя обязательство разрушить разрозненность академических исследований, наполнив базу данных своими собственными первоначальными результатами. После начального этапа сторонние исследователи со всего мира смогут добавлять свои данные, создавая живой ресурс, ценность которого постоянно растет. Мы стремимся создать общий язык для исследований в области иммунотерапии рака, который сделает результаты воспроизводимыми, сопоставимыми и доступными для искусственного интеллекта.
Важно отметить, что такого рода усилия работают только тогда, когда стимулы совпадают. Понятно, что компании защищают интеллектуальную собственность. Отдельные лаборатории конкурируют за признание и финансирование. Но такие болезни, как рак, не признают институциональных границ. Предконкурентное сотрудничество, при котором инфраструктура данных используется совместно, даже когда методы лечения конкурируют, имеет важное значение.
Именно здесь некоммерческие и государственно-частные партнерства могут сыграть решающую роль: объединяя заинтересованные стороны, устанавливая стандарты и создавая активы, создание которых ни одна организация не могла бы оправдать в одиночку.
Что будет дальше
Следующие прорывы в области рака не будут результатом одной лаборатории или одного алгоритма. Они придут из сетей: ученые, врачи, технологи и политики, работающие на одной основе.
Представьте себе модели искусственного интеллекта, обученные на согласованных данных о тысячах комбинаций рака и методов лечения. Исследователи смогут проверить гипотезы в смоделированных экспериментах прежде чем запускать настоящие. Клиницисты смогут определить вероятных пациентов, отвечающих на лечение, еще до начала лечения. Открытия, сделанные в одном институте, могут немедленно ускорить прогресс в другом.
Это не лунный выстрел. Это инфраструктура. И как любой инфраструктурный проект — дороги, электросети, Интернет — он требует координации, стандартов и коллективных инвестиций.
ИИ поможет нам расшифровать сложность рака. Но одни только алгоритмы не спасут жизни. Настоящая работа заключается в создании общей основы, которая позволит интеллекту (как человеческому, так и искусственному) учиться вместе. Если мы сделаем это правильно, мы сможем сжать десятилетия открытий в годы.
Для пациентов это время не является тривиальным показателем. Это выживание.
Читайте также

