Алгоритм ИИ решает задачи структурной биологии
Определение трёхмерных структур биологических молекул — одна из самых сложных задач современной биологии и медицинских исследований. Компании и научные институты часто тратят миллионы долларов на определение одной молекулярной структуры, и даже такие масштабные усилия часто оказываются безуспешными.
Используя новые интеллектуальные методы машинного обучения, аспиранты Стэнфордского университета Штефан Айсманн и Рафаэль Тауншенд под руководством доцента компьютерных наук Рона Дрора разработали подход, который решает эту проблему, предсказывая точные структуры с помощью вычислений.
Важнее всего то, что их подход успешен даже при обучении всего на нескольких известных структурах, что делает его применимым к тем типам молекул, структуры которых наиболее сложно определить экспериментально.
Их работа представлена в двух статьях, детализирующих применение метода для молекул РНК и мультибелковых комплексов, опубликованных в Science 27 августа 2021 года и в Proteins в декабре 2020 года соответственно. Статья в Science — результат сотрудничества с лабораторией доцента биохимии Риджу Даса в Стэнфорде.
"Структурная биология, изучающая формы молекул, следует мантре: структура определяет функцию", — сказал Тауншенд.
Алгоритм, разработанный исследователями, предсказывает точные молекулярные структуры, что позволяет учёным объяснять, как работают различные молекулы, с приложениями от фундаментальных биологических исследований до целенаправленного дизайна лекарств.
"Белки — это молекулярные машины, выполняющие множество функций. Для выполнения своих функций белки часто связываются с другими белками", — сказал Айсманн. "Если вы знаете, что пара белков вовлечена в заболевание, и знаете, как они взаимодействуют в 3D, вы можете попытаться очень специфично нацелить на это взаимодействие лекарство".
Айсманн и Тауншенд являются соавторами статьи в Science вместе с постдоком лаборатории Даса Эндрю Уоткинсом, а также соавторами статьи в Proteins вместе с бывшим аспирантом Стэнфорда Натаниэлем Томасом.
Разработка алгоритма
Вместо того чтобы указывать, что делает структурное предсказание более или менее точным, исследователи позволили алгоритму самостоятельно обнаруживать эти молекулярные особенности. Они сделали так, потому что обнаружили, что обычная практика предоставления таких знаний может склонить алгоритм в пользу определённых особенностей, не позволяя ему найти другие информативные признаки.
"Проблема с этими созданными вручную признаками в алгоритме заключается в том, что алгоритм становится смещённым в сторону того, что человек, выбирающий эти признаки, считает важным, и вы можете упустить некоторую информацию, которая нужна для улучшения", — сказал Айсманн.
"Сеть научилась находить фундаментальные концепции, ключевые для формирования молекулярной структуры, но без явного указания на это", — сказал Тауншенд. "Увлекательный аспект в том, что алгоритм явно восстановил вещи, важность которых мы знали, но также обнаружил характеристики, о которых мы раньше не знали".
Показав успех с белками, исследователи затем применили свой алгоритм к другому классу важных биологических молекул — РНК. Они протестировали алгоритм в серии "RNA Puzzles" давнего соревнования в их области, и в каждом случае инструмент превзошёл всех других участников, делая это без специальной настройки на структуры РНК.
Более широкое применение
Исследователи с энтузиазмом смотрят на то, где ещё можно применить их подход, уже добившись успеха с белковыми комплексами и молекулами РНК.
"Большинство недавних драматических успехов в машинном обучении требовали огромного количества данных для обучения. Тот факт, что этот метод успешен при очень малом количестве обучающих данных, предполагает, что родственные методы могут решать нерешённые проблемы во многих областях, где данных мало", — сказал Дрор, старший автор статьи в Proteins и со-старший автор статьи в Science вместе с Дасом.
Конкретно для структурной биологии команда заявляет, что они лишь поверхностно затронули возможный научный прогресс.
"Как только у вас появляется эта фундаментальная технология, вы повышаете уровень понимания на ступень и можете начать задавать следующий набор вопросов", — сказал Тауншенд. "Например, вы можете начать проектировать новые молекулы и лекарства с такого рода информацией, и это область, которая очень волнует людей".
Другими соавторами статьи в Science являются аспиранты Стэнфорда Рамая Ранган и Мария Карелина. Другими соавторами статьи в Proteins являются бывшие студенты Стэнфорда Милинд Джагота и Боуэн Цзин.
