Модифицированные алгоритмы глубокого обучения раскрывают особенности белков-«оборотней»
Исследователи из Национальной лаборатории Ок-Ридж (ORNL) Министерства энергетики США применили методы глубокого обучения для изучения промежуточных структур в процессе сворачивания белков. Результаты опубликованы в BMC Bioinformatics.
Задача и метод
- Сворачивание белков в специфические 3D-структуры критически важно для их функции, но промежуточные стадии между развернутым и конечным состоянием сложно охарактеризовать.
- Команда адаптировала алгоритм глубокого обучения — сверточный вариационный автоэнкодер (CVAE). Он автоматически извлекает информацию о конфигурациях сворачивания из данных молекулярно-динамического (MD) моделирования.
- Моделирование проводилось на суперкомпьютере Summitdev в ORNL.
Исследование и результаты
- Изучались пути сворачивания трех белков: Fs-пептида, виллин-хэдписа и BBA. Использовались наборы данных из обширных симуляций других исследовательских групп.
- CVAE выявил множество промежуточных стадий, которые служат «ориентирами», помогая отследить весь процесс сворачивания и наблюдая скрытые аспекты поведения белков.
- «Эти релевантные ориентиры выбираются полностью автоматически из высокоразмерных траекторий сворачивания таким образом, что отбираются только биофизически значимые черты, важные для конкретной системы», — отметил вычислительный ученый ORNL Дебсиндху Боумик.
Значение и связь с болезнями
- Нарушение пути сворачивания приводит к «миссвертыванию» белка в нефункциональную форму. Миссвертывание считается ключевым фактором в развитии болезней Альцгеймера, сердечно-сосудистых заболеваний и диабета.
- Способность отличать правильно свернутые белки от миссвернутых дает возможность понять причины миссвертывания, его роль в развитии болезней и определить потенциальные методы лечения (например, использование связывающего агента для коррекции поведения белка).
Дальнейшая работа и инструменты
- Для повышения точности команда работает над оптимизацией алгоритмов обучения с подкреплением (reinforcement-learning) на системах NVIDIA DGX-2 в ORNL.
- Эти алгоритмы, подобные AlphaGo от Google, учатся на опыте без предварительного обучения. Их планируют адаптировать для управления MD-симуляциями и анализа данных по сворачиванию белков.
- Для настройки алгоритмов команда разработала программный пакет HyperSpace, который упрощает и ускоряет оптимизацию гиперпараметров. HyperSpace показал высокую эффективность для различных алгоритмов машинного обучения.
- Ученые создают масштабируемый рабочий процесс для будущих исследований не только сворачивания белков, но и их взаимодействия друг с другом, часть из которых планируется проводить на суперкомпьютере Summit.
