Новая модель искусственного интеллекта может сократить затраты на разработку белковых лекарств

Промышленные дрожжи являются источником производства белка, используемого для производства вакцин, биофармацевтических препаратов и других полезных соединений. В новом исследовании инженеры-химики Массачусетского технологического института использовали искусственный интеллект для оптимизации разработки новых процессов производства белка, что могло бы снизить общие затраты на разработку и производство этих лекарств.

Используя большую языковую модель (LLM), команда Массачусетского технологического института проанализировала генетический код промышленных дрожжей Komagataella phaffii, в частности кодоны, которые они используют. Существует множество возможных кодонов или трехбуквенных последовательностей ДНК, которые можно использовать для кодирования определенной аминокислоты, и закономерности использования кодонов различны для каждого организма.

Новая модель MIT изучила эти закономерности для K. phaffii, а затем использовала их, чтобы предсказать, какие кодоны будут лучше всего работать для производства определенного белка. Это позволило исследователям повысить эффективность производства дрожжами шести различных белков, включая гормон роста человека и моноклональные антитела, используемые для лечения рака.

“Наличие постоянно хорошо работающих инструментов прогнозирования действительно важно для сокращения времени от появления идеи до ее реализации. Устранение неопределенности в конечном итоге экономит время и деньги”, – говорит Дж. Кристофер Лав, профессор химической инженерии Рэймонда А. и Хелен Э. Сен-Лоран в Массачусетском технологическом институте, член Института интегративных исследований рака Коха и содиректор факультета Инициативы MIT по новому производству (MIT INM).

Лав является старшим автором нового исследования, которое появится на этой неделе в журнале Proceedings of the National Academy of Sciences. Бывший постдок Массачусетского технологического института Харини Нараянан является ведущим автором статьи.

Дрожжи, такие как K. phaffii и Saccharomyces cerevisiae (пекарские дрожжи), являются «рабочими лошадками» биофармацевтической промышленности, ежегодно производя белковые лекарства и вакцины на миллиарды долларов.

Read more:  Группа Конгресса США призывает к включению Ирландии в список стран, бойкотирующих Израиль

Чтобы создать дрожжи для промышленного производства белка, исследователи берут ген из другого организма, например ген инсулина, и модифицируют его так, чтобы микроб производил его в больших количествах. Для этого необходимо найти оптимальную последовательность ДНК для дрожжевых клеток, интегрировать ее в геном дрожжей, разработать для нее благоприятные условия роста и, наконец, очистить конечный продукт.

Для новых биологических препаратов — крупных и сложных лекарств, производимых живыми организмами — этот процесс разработки может составлять от 15 до 20 процентов общей стоимости коммерциализации препарата.

«Сегодня все эти шаги выполняются посредством очень трудоемких экспериментальных задач», — говорит Лав. «Мы задавались вопросом, где мы могли бы взять некоторые концепции, возникающие в машинном обучении, и применить их, чтобы сделать различные аспекты процесса более надежными и простыми для прогнозирования».

В этом исследовании ученые хотели попытаться оптимизировать последовательность кодонов ДНК, составляющих ген интересующего белка. Существует 20 встречающихся в природе аминокислот, но возможных последовательностей кодонов 64, поэтому большинство этих аминокислот могут кодироваться более чем одним кодоном. Каждый кодон соответствует уникальной молекуле транспортной РНК (тРНК), которая переносит нужную аминокислоту в рибосому, где аминокислоты связываются в белки.

Разные организмы используют каждый из этих кодонов с разной скоростью, и разработчики сконструированных белков часто оптимизируют производство своих белков, выбирая кодоны, которые наиболее часто встречаются в организме хозяина. Однако это не обязательно приводит к лучшим результатам. Если, например, для кодирования аргинина всегда используется один и тот же кодон, в клетке может не хватать молекул тРНК, соответствующих этому кодону.

Чтобы применить более тонкий подход, команда MIT внедрила тип большой языковой модели, известный как кодер-декодер. Вместо анализа текста исследователи использовали его для анализа последовательностей ДНК и изучения взаимоотношений между кодонами, которые используются в конкретных генах.

Read more:  впечатляющий разворот Дональда Трампа по Гренландии

Их обучающие данные, взятые из общедоступного набора данных Национального центра биотехнологической информации, состояли из аминокислотных последовательностей и соответствующих последовательностей ДНК для всех примерно 5000 белков, естественно продуцируемых K. phaffii.

«Модель изучает синтаксис или язык использования этих кодонов», — говорит Лав. «Он учитывает то, как кодоны расположены рядом друг с другом, а также отношения на больших расстояниях между ними».

После обучения модели исследователи попросили ее оптимизировать последовательности кодонов шести различных белков, включая гормон роста человека, человеческий сывороточный альбумин и трастузумаб, моноклональное антитело, используемое для лечения рака.

Они также создали оптимизированные последовательности этих белков, используя четыре коммерчески доступных инструмента оптимизации кодонов. Исследователи вставили каждую из этих последовательностей в клетки K. phaffii и измерили, сколько целевого белка генерирует каждая последовательность. Для пяти из шести белков последовательности из новой модели MIT работали лучше всего, а для шестого — на втором месте.

«Мы постарались охватить множество различных подходов к оптимизации кодонов и сравнили их с нашим подходом», — говорит Нараянан. «Мы экспериментально сравнили эти подходы и показали, что наш подход превосходит другие».

K. phaffii, ранее известный как Pichia Pastoris, используется для производства десятков коммерческих продуктов, включая инсулин, вакцины против гепатита B и моноклональные антитела, используемые для лечения хронической мигрени. Он также используется при производстве питательных веществ, добавляемых в пищу, таких как гемоглобин.

Исследователи из лаборатории Лава начали использовать новую модель для оптимизации белков, представляющих интерес для K. phaffii, и предоставили код другим исследователям, которые хотят использовать его для K. phaffii или других организмов.

Исследователи также протестировали этот подход на наборах данных от различных организмов, включая людей и коров. Каждая из полученных моделей давала разные предсказания, предполагающие, что для оптимизации кодонов целевых белков необходимы видоспецифичные модели.

Read more:  Трамп хочет сократить импорт венесуэльской нефти в США, одновременно отключая Китай в попытке сохранить нефтедоллар

Изучив внутреннюю работу модели, исследователи обнаружили, что она, похоже, усвоила некоторые биологические принципы работы генома, в том числе и то, чему исследователи ее не учили. Например, он научился не включать отрицательные повторяющиеся элементы — последовательности ДНК, которые могут ингибировать экспрессию близлежащих генов. Модель также научилась классифицировать аминокислоты на основе таких характеристик, как гидрофобность и гидрофильность.

«Он не только изучал этот язык, но также контекстуализировал его через аспекты биофизических и биохимических особенностей, что дает нам дополнительную уверенность в том, что он изучает что-то действительно значимое, а не просто оптимизацию задачи, которую мы ему дали», — говорит Лав.

Нарайанан Х., Лав Дж.С.
Pichia-CLM: конвейер оптимизации кодонов на основе языковой модели для Komagataella phaffii.
Proc Natl Acad Sci, США, 24 февраля 2026 г.; 123 (8): e2522052123. дои: 10.1073/пнас.2522052123

2026-02-25 09:00:00


1773562933
#Новая #модель #искусственного #интеллекта #может #сократить #затраты #на #разработку #белковых #лекарств

Продолжение темы

Leave a Comment

This site uses Akismet to reduce spam. Learn how your comment data is processed.