Ученые используют суперкомпьютер Summit и глубокое обучение для предсказания функций белков в масштабе генома
Ученые из Национальной лаборатории Ок-Ридж (ORNL) Министерства энергетики США и Технологического института Джорджии используют суперкомпьютинг и революционные инструменты глубокого обучения для предсказания структур и ролей тысяч белков с неизвестными функциями.
Их подходы, основанные на глубоком обучении, выводят структуру и функцию белка из последовательностей ДНК, ускоряя открытия, которые могут способствовать прогрессу в биотехнологии, биобезопасности, биоэнергетике и решении проблем загрязнения окружающей среды и изменения климата.
Исследователи используют суперкомпьютер Summit в ORNL и инструменты, разработанные Google DeepMind и Технологическим институтом Джорджии, для ускорения точной идентификации структур и функций белков во всем геноме организмов.
Эти мощные вычислительные инструменты представляют собой значительный скачок в решении грандиозной задачи биологии: перевода генетического кода в значимые функции.
Белки — ключевой компонент в решении этой задачи. Понимание структуры и функции белка на основе длинных цепочек нуклеотидов (A, C, T, G), составляющих ДНК, долгое время было узким местом в науках о жизни.
Благодаря прогрессу в технологии секвенирования ДНК доступны данные примерно о 350 миллионах белковых последовательностей. Однако из-за необходимости трудоемких экспериментов ученые определили структуры только для около 170 000 из этих белков. Это огромный разрыв.
Фокус на организмах, важных для миссий Министерства энергетики
Исследовательская группа сосредоточилась на организмах, критически важных для миссий Министерства энергетики. Они смоделировали полные протеомы (все белки, закодированные в геноме организма) для четырех микробов, каждый из которых содержит примерно 5000 белков:
- Два микроба способны генерировать важные материалы для производства пластмасс.
- Два других известны способностью расщеплять и трансформировать металлы.
Кроме того, команда смоделировала 24 000 белков сфагнового мха. Сфагнум играет ключевую роль в хранении огромного количества углерода в торфяных болотах. Эти данные могут помочь определить, какие гены наиболее важны для усиления способности сфагнума секвестрировать углерод и противостоять изменению климата.
Ускорение научных открытий
Возможность видеть структуры белков добавляет новый уровень анализа, который помогает ученым сосредоточиться на наиболее перспективных генах-кандидатах для экспериментов.
До недавнего времени у ученых не было инструментов, способных надежно предсказывать структуру белка на основе генетических последовательностей. Применение новых инструментов глубокого обучения меняет правила игры.
Хотя структура и функция белка по-прежнему будут нуждаться в подтверждении физическими экспериментами (например, рентгеновской кристаллографией), глубокое обучение быстро сужает обширное поле генов-кандидатов до наиболее интересных для дальнейшего изучения.
Революционные инструменты
Один из инструментов в конвейере глубокого обучения — SAdLSA (Sequence Alignments from deep-Learning of Structural Alignments), разработанный в Технологическом институте Джорджии. Он может сравнивать последовательности, неявно понимая структуру белка, даже если последовательности имеют всего 10% сходства.
Инструмент AlphaFold 2 от DeepMind продемонстрировал точность, близкую к рентгеновской кристаллографии, в определении структур неизвестных белков на конкурсе CASP 2020 года. Это первая и единственная программа, достигшая такого уровня точности с начала CASP в 1994 году. Кроме того, она может предсказывать белок-белковые взаимодействия, что очень важно.
Исследователи ORNL и их коллеги дополняют усилия Европейского института биоинформатики (EBI), сосредотачиваясь на организмах, важных для миссий Министерства энергетики. Они работают над тем, чтобы сделать инструментарий доступным для других пользователей Summit, и делятся смоделированными структурами тысяч белков в виде наборов данных.
Использование AlphaFold 2, с его многочисленными программными модулями и базой данных объемом 1,5 терабайта, требует значительных объемов памяти и множества мощных параллельных процессоров. Его запуск на Summit был многоэтапным процессом.
Работа будет развиваться по мере изменения инструментов, включая переход к экзафлопсным вычислениям с системой Frontier, создаваемой в ORNL, которая, как ожидается, будет выполнять более квинтиллиона (1018) операций в секунду.
