Картирование белковой вселенной

Белки — это рабочие лошадки жизни. Хотя ДНК является её архитектором, именно белки постоянно расщепляют и создают все части клетки: переносят кислород, посылают сигналы для заживления ран, передают мысли через нейроны, расщепляют нефть или целлюлозу и создают биотопливо.

Несмотря на их жизненно важную роль, мы мало знаем о функциях подавляющего большинства белков и ещё меньше — о том, как они их выполняют. Хотя секвенирование ДНК микроорганизмов из окружающей среды становится дешевле, у нас нет специализированных инструментов, чтобы связать новые белки из таких образцов с полной коллекцией известных белков.

Именно такое программное обеспечение создают исследователи из пяти национальных лабораторий США под руководством Аргоннской национальной лаборатории Министерства энергетики в проекте «Картирование белковой вселенной».

«Для всего, кроме горстки хорошо изученных модельных организмов, мы не знаем, что делает большинство генов, а следовательно, и белков», — сказал Рик Стивенс, руководитель проекта. «В конечном итоге мы хотим превратить сырые последовательности ДНК в полный набор точных предсказаний о белках и их потенциальных функциях».

Например, взяв образец почвы с места токсичного разлива (содержащий бактерии, вирусы, грибы, насекомых и растения) и пропустив его через ДНК-секвенатор, мы получим «суп» из фрагментов ДНК тысяч различных микроорганизмов.

Чтобы сделать эти данные полезными, проект планирует разработать ПО для:

  • Сборки фрагментов ДНК в вероятные целые геномы с использованием совпадений, вероятностных методов и больших вычислительных ресурсов.
  • Сравнения этой ДНК с базами данных известных генов для поиска совпадений.
  • Выявления генов белков, которые часто встречаются вместе.
  • Использования контекстных подсказок для предсказания функций неизвестных белков.

Белки часто появляются вместе, потому что являются частью одного пути или реакционной цепи: один белок расщепляет молекулу, следующий использует её часть для создания новой и т.д. Понимание этих путей важно для исследователей, пытающихся создать методы производства топлива или других продуктов.

Программное обеспечение может помочь идентифицировать такие белки-партнёры, ища гены, которые часто встречаются вместе или расположены физически близко на хромосоме, особенно если они сохраняются у многих разных видов.

«Если у вас есть сетевые данные из такого проекта, вы можете искать по ассоциации, — сказал вычислительный биолог Сергей Маслов. — Например, какие белки чаще встречаются у бактерий, живущих в районах, загрязнённых ртутью? Возможно, эти белки участвуют в расщеплении ртути до менее вредной формы».

Программа предоставит исследователям обширную библиотеку белков и новые вычислительные подходы для обработки такого объёма данных.

«Обычно такая работа выполняется на наборах менее чем из 10 000 видов. Мы работаем с 50 000 видами, плюс интегрируем все крупномасштабные публичные метагеномы, — сказал Маслов. — По завершении это будет на порядки больше всего, что делалось ранее».

«Мы впервые сводим все эти нити вместе, и для интеграции всех этих данных действительно требуется новый образ мышления», — добавил Стивенс.

Этот проект соответствует стремлению Министерства энергетики США эффективно использовать «большие данные» для решения сложных научных задач, особенно по мере роста объёмов данных с синхротронов, климатических станций, метагеномики и т.д. Национальные лаборатории идеально подходят для решения таких задач благодаря своим суперкомпьютерам и командам, имеющим опыт работы с большими наборами данных.

«Существует множество химических процессов, о которых мы ничего не знаем — любой из них может стать ключом к новым лекарствам, новым формам энергии или более эффективным промышленным процессам, — заключил Стивенс. — Этот проект поможет нам применить всю нашу вычислительную мощь для решения этих важных вопросов».