Промышленные дрожжи являются источником производства белка, используемого для производства вакцин, биофармацевтических препаратов и других полезных соединений. В новом исследовании инженеры-химики Массачусетского технологического института использовали искусственный интеллект для оптимизации разработки новых процессов производства белка, что могло бы снизить общие затраты на разработку и производство этих лекарств.
Используя большую языковую модель (LLM), команда Массачусетского технологического института проанализировала генетический код промышленных дрожжей Komagataella phaffii, в частности кодоны, которые они используют. Существует множество возможных кодонов или трехбуквенных последовательностей ДНК, которые можно использовать для кодирования определенной аминокислоты, и закономерности использования кодонов различны для каждого организма.
Новая модель MIT изучила эти закономерности для K. phaffii, а затем использовала их, чтобы предсказать, какие кодоны будут лучше всего работать для производства определенного белка. Это позволило исследователям повысить эффективность производства дрожжами шести различных белков, включая гормон роста человека и моноклональные антитела, используемые для лечения рака.
“Наличие постоянно хорошо работающих инструментов прогнозирования действительно важно для сокращения времени от появления идеи до ее реализации. Устранение неопределенности в конечном итоге экономит время и деньги”, – говорит Дж. Кристофер Лав, профессор химической инженерии Рэймонда А. и Хелен Э. Сен-Лоран в Массачусетском технологическом институте, член Института интегративных исследований рака Коха и содиректор факультета Инициативы MIT по новому производству (MIT INM).
Лав является старшим автором нового исследования, которое появится на этой неделе в журнале Proceedings of the National Academy of Sciences. Бывший постдок Массачусетского технологического института Харини Нараянан является ведущим автором статьи.
Дрожжи, такие как K. phaffii и Saccharomyces cerevisiae (пекарские дрожжи), являются «рабочими лошадками» биофармацевтической промышленности, ежегодно производя белковые лекарства и вакцины на миллиарды долларов.
Чтобы создать дрожжи для промышленного производства белка, исследователи берут ген из другого организма, например ген инсулина, и модифицируют его так, чтобы микроб производил его в больших количествах. Для этого необходимо найти оптимальную последовательность ДНК для дрожжевых клеток, интегрировать ее в геном дрожжей, разработать для нее благоприятные условия роста и, наконец, очистить конечный продукт.
Для новых биологических препаратов — крупных и сложных лекарств, производимых живыми организмами — этот процесс разработки может составлять от 15 до 20 процентов общей стоимости коммерциализации препарата.
«Сегодня все эти шаги выполняются посредством очень трудоемких экспериментальных задач», — говорит Лав. «Мы задавались вопросом, где мы могли бы взять некоторые концепции, возникающие в машинном обучении, и применить их, чтобы сделать различные аспекты процесса более надежными и простыми для прогнозирования».
В этом исследовании ученые хотели попытаться оптимизировать последовательность кодонов ДНК, составляющих ген интересующего белка. Существует 20 встречающихся в природе аминокислот, но возможных последовательностей кодонов 64, поэтому большинство этих аминокислот могут кодироваться более чем одним кодоном. Каждый кодон соответствует уникальной молекуле транспортной РНК (тРНК), которая переносит нужную аминокислоту в рибосому, где аминокислоты связываются в белки.
Разные организмы используют каждый из этих кодонов с разной скоростью, и разработчики сконструированных белков часто оптимизируют производство своих белков, выбирая кодоны, которые наиболее часто встречаются в организме хозяина. Однако это не обязательно приводит к лучшим результатам. Если, например, для кодирования аргинина всегда используется один и тот же кодон, в клетке может не хватать молекул тРНК, соответствующих этому кодону.
Чтобы применить более тонкий подход, команда MIT внедрила тип большой языковой модели, известный как кодер-декодер. Вместо анализа текста исследователи использовали его для анализа последовательностей ДНК и изучения взаимоотношений между кодонами, которые используются в конкретных генах.
Их обучающие данные, взятые из общедоступного набора данных Национального центра биотехнологической информации, состояли из аминокислотных последовательностей и соответствующих последовательностей ДНК для всех примерно 5000 белков, естественно продуцируемых K. phaffii.
«Модель изучает синтаксис или язык использования этих кодонов», — говорит Лав. «Он учитывает то, как кодоны расположены рядом друг с другом, а также отношения на больших расстояниях между ними».
После обучения модели исследователи попросили ее оптимизировать последовательности кодонов шести различных белков, включая гормон роста человека, человеческий сывороточный альбумин и трастузумаб, моноклональное антитело, используемое для лечения рака.
Они также создали оптимизированные последовательности этих белков, используя четыре коммерчески доступных инструмента оптимизации кодонов. Исследователи вставили каждую из этих последовательностей в клетки K. phaffii и измерили, сколько целевого белка генерирует каждая последовательность. Для пяти из шести белков последовательности из новой модели MIT работали лучше всего, а для шестого — на втором месте.
«Мы постарались охватить множество различных подходов к оптимизации кодонов и сравнили их с нашим подходом», — говорит Нараянан. «Мы экспериментально сравнили эти подходы и показали, что наш подход превосходит другие».
K. phaffii, ранее известный как Pichia Pastoris, используется для производства десятков коммерческих продуктов, включая инсулин, вакцины против гепатита B и моноклональные антитела, используемые для лечения хронической мигрени. Он также используется при производстве питательных веществ, добавляемых в пищу, таких как гемоглобин.
Исследователи из лаборатории Лава начали использовать новую модель для оптимизации белков, представляющих интерес для K. phaffii, и предоставили код другим исследователям, которые хотят использовать его для K. phaffii или других организмов.
Исследователи также протестировали этот подход на наборах данных от различных организмов, включая людей и коров. Каждая из полученных моделей давала разные предсказания, предполагающие, что для оптимизации кодонов целевых белков необходимы видоспецифичные модели.
Изучив внутреннюю работу модели, исследователи обнаружили, что она, похоже, усвоила некоторые биологические принципы работы генома, в том числе и то, чему исследователи ее не учили. Например, он научился не включать отрицательные повторяющиеся элементы — последовательности ДНК, которые могут ингибировать экспрессию близлежащих генов. Модель также научилась классифицировать аминокислоты на основе таких характеристик, как гидрофобность и гидрофильность.
«Он не только изучал этот язык, но также контекстуализировал его через аспекты биофизических и биохимических особенностей, что дает нам дополнительную уверенность в том, что он изучает что-то действительно значимое, а не просто оптимизацию задачи, которую мы ему дали», — говорит Лав.
Нарайанан Х., Лав Дж.С.
Pichia-CLM: конвейер оптимизации кодонов на основе языковой модели для Komagataella phaffii.
Proc Natl Acad Sci, США, 24 февраля 2026 г.; 123 (8): e2522052123. дои: 10.1073/пнас.2522052123
2026-02-25 09:00:00
1773562933
#Новая #модель #искусственного #интеллекта #может #сократить #затраты #на #разработку #белковых #лекарств
Продолжение темы

