Hashing дополняет методы на основе выравнивания для аннотации бактериальных геномов
Секвенирование ДНК коренным образом изменило биологию. Исследование микробной жизни сегодня проводится с беспрецедентной скоростью и разрешением, включая секвенирование геномов ранее не описанных и не культивируемых микроорганизмов. Одновременно полногеномное секвенирование известных (часто патогенных) видов стало рутинной методологией.
Постоянный приток новых последовательностей в публичные базы данных создаёт как возможности, так и проблемы. Для многих вычислительных анализов критически важна всесторонняя и тщательная аннотация геномов. Однако ежедневный приток новых геномных и генетических последовательностей создаёт новые сложности для быстрой аннотации, превращая поиск похожих белковых генов в масштабную биоинформатическую задачу.
Мы сталкиваемся с двумя расходящимися тенденциями:
- Публичные базы данных переполнены похожими и почти идентичными белковыми последовательностями (например, генами устойчивости к антимикробным препаратам и факторами вирулентности), которые можно связать с массой полезной информации.
- Появляются бесчисленные новые последовательности из метагеномных проектов («микробная тёмная материя»), для которых часто нет никакой дополнительной информации.
Возникают две различные биоинформатические задачи: точная идентификация известных последовательностей и функциональное описание редких или неизвестных последовательностей — обе в масштабе сотен миллионов.
Для решения этих задач мы применили стратегию безалайментного хеширования белковых последовательностей, дополненную двумя иерархическими шагами выравнивания последовательностей. Исследование опубликовано в журнале Microbial Genomics.
Точная идентификация известных последовательностей
Мы использовали хеш-функцию, которая преобразует входные данные произвольной длины в бинарные «отпечатки» фиксированного размера. Такие функции, известные по расчёту контрольных сумм, вычисляются крайне быстро, намного быстрее традиционного выравнивания последовательностей.
На этом преимуществе мы создали компактную локальную базу данных с хеш-отпечатками более 220 миллионов белковых последовательностей. На этапе компиляции базы данных мы предварительно присвоили последовательностям высококачественные аннотации и перекрёстные ссылки на внешние базы данных. Эти ресурсоёмкие вычисления требуются только один раз при обновлении базы. В процессе аннотации генома мы используем это плотное хранилище информации для выполнения точной идентификации последовательностей и сверхбыстрого поиска связанных данных.
Нам удалось сократить общие требования к хранилищу на две трети, даже с учётом включения богатой аннотационной информации (символы генов, номера EC, термины GO, продукты белков, доступы к внешним базам данных).
Иерархический подход для неидентифицированных последовательностей
Безалайментный подход также позволил существенно избежать ресурсоёмких выравниваний, которые используются как резервная стратегия поиска для неидентифицированных последовательностей. В иерархическом двухэтапном процессе оставшиеся белковые последовательности искались с помощью традиционного выравнивания против последовательностей-представителей белковых кластеров:
- Поиск совпадений среди более чем 99 миллионов плотных белковых кластеров.
- Поиск с использованием более мягких порогов среди более чем 13 миллионов широких кластеров.
Потенциальное негативное влияние на время выполнения этих огромных баз данных белковых кластеров было смягчено описанным безалайментным методом идентификации. В итоге вся аннотационная информация для идентифицированных белковых последовательностей и связанных кластеров была объединена с приоритетом конкретной информации над общей.
Этот иерархический подход является частью более крупного рабочего процесса аннотации, который также включает аннотацию признаков некодирующей РНК и ДНК (тРНК, рРНК, нкРНК, массивы CRISPR, точки начала репликации и другие). Инструмент Bakta доступен как программа командной строки и масштабируемый веб-сервис по адресу https://bakta.computational.bio.
