Высокопроизводительные вычисления обнаружили пропущенные гены

Ученые из Института биоинформатики Виргинии (VBI) и факультета компьютерных наук Виргинского политехнического института использовали высокопроизводительные вычисления для обнаружения малых генов, пропущенных при определении последовательностей микробной ДНК. С помощью эфемерного суперкомпьютера из компьютеров по всему миру и вычислительного инструмента mpiBLAST исследователям потребовалось всего 12 часов вместо 90 лет, которые заняла бы работа на стандартном ПК.

Новое исследование, опубликованное в журнале BMC Bioinformatics, — первая крупномасштабная попытка выявить необнаруженные гены микробов в растущем репозитории GenBank, содержащем более 100 миллиардов пар оснований ДНК. Функции обнаруженных генов в клетке, возможно, важны, но их еще предстоит установить экспериментально.

Значение открытия

Как отметил исполнительный директор VBI Скип Гарнер, это «идеальный шторм», где огромный объем данных анализируется передовыми вычислительными методами, давая важную новую информацию о генах. Эти гены могут стать новыми мишенями для фармацевтических исследований, например, для поиска антибиотиков или вакцин, что крайне важно в борьбе с появлением новых устойчивых к лекарствам патогенов.

Проблема аннотации геномов

Сегодня в базе данных GenBank находится более 1200 последовательностей геномов микробов. Одна из самых больших проблем — не генерация данных, а надежное определение и присвоение функции многим генам в геноме — процесс, называемый аннотацией. Он критически зависит от сложных вычислительных инструментов. Именно для решения этой потребности, по мнению многих экспертов, и зародилась биоинформатика.

Систематический поиск пропусков

Как пояснил профессор Жуан Сетубал, общедоступные базы данных геномов давно известны несоответствиями, ошибками и пробелами. Однако никто не проводил систематического исследования для проверки количества просто необнаруженных генов. Именно это и было сделано в данной работе.

Ограничения традиционных методов

Большинство компьютерных инструментов для поиска генов строят модель на основе характеристик последовательности или сравнивают сегменты ДНК с известными генами из GenBank. Как отметил Сетубал, такие подходы не находят гены с необычными свойствами последовательности или те, которые еще не обнаружены и, следовательно, отсутствуют в GenBank. Результаты ясно показывают, что в геномах микробов систематически пропускается множество малых генов, кодирующих белки.

Масштаб обнаружения

Самые скромные оценки исследования указывают на 380 семейств пропущенных генов в 780 исследованных геномах. Это число, вероятно, занижено, поскольку критерии поиска были консервативными.

Вычислительный прорыв

Для ускоренного обнаружения пропущенных генов использовался инструмент mpiBLAST для проведения поиска «все-ко-всем» среди 780 микробных геномов. Этот процесс потребовал выполнения десятков триллионов поисковых запросов. Поиск был выполнен на эфемерном суперкомпьютере, объединившем более 12 000 процессорных ядер на семи разных суперкомпьютерах в США. Это сократило время поиска с почти 90 лет на ПК до 12 часов.

Перспективы

Как отметил аспирант VBI Эндрю Уоррен, в ходе проекта была создана методика на основе высокопроизводительных вычислений, способная делать значимые прогнозы из такого большого набора данных. Работа позволила определить потенциальные мишени для будущих исследований и экспериментов, которые могут подтвердить существование этих генов in vivo.