Новая вычислительная техника может упростить проектирование полезных белков

Исследователи MIT разработали вычислительный подход, который позволяет легче предсказывать мутации, ведущие к улучшению белков, на основе относительно небольшого количества данных.

Проблема оптимизации белков

Традиционный процесс инженерии белков включает множество раундов случайных мутаций для оптимизации функции. Однако он сложен, так как даже полезная мутация может быть достижима только через промежуточные, нефункциональные варианты.

"Проектирование белка — сложная проблема... Это как пытаться найти путь к речному бассейну в горном хребте, когда на пути есть скалистые пики, которые блокируют обзор", — говорит Ила Фиете, один из старших авторов исследования.

Вычислительный подход

Исследователи обучили сверточную нейронную сеть (CNN) на экспериментальных данных, состоящих из последовательностей зеленого флуоресцентного белка (GFP) и их яркости.

Модель создала "ландшафт приспособленности" — 3D-карту, отображающую эффективность белка. Затем исследователи использовали вычислительную технику для "сглаживания" этого ландшафта, что позволило модели легче находить пути к пикам эффективности.

После сглаживания и переобучения модель смогла предсказать оптимизированные последовательности GFP с до семи различными аминокислотами. Лучшие из этих белков были оценены как примерно в 2.5 раза более эффективные, чем исходный.

Доказательство концепции

Подход также успешно показал себя в идентификации новых последовательностей для капсида адено-ассоциированного вируса (AAV), оптимизированного для упаковки ДНК.

"Мы использовали GFP и AAV в качестве доказательства концепции... этот метод должен быть применим к другим проблемам белковой инженерии", — говорит Шахар Брача.

Перспективы применения

Исследователи планируют применить эту технику к данным по белкам-индикаторам напряжения, над которыми десятки лабораторий работали два десятилетия без значительного прогресса.

Надежда заключается в том, что, сгенерировав меньший набор данных, можно обучить модель in silico и получить предсказания, которые превзойдут результаты двух десятилетий ручного тестирования.

Исследование будет представлено на Международной конференции по репрезентативному обучению (ICLR 2024) и доступно на сервере препринтов arXiv.