Ученые создали «телескоп Хаббла» для изучения множества геномных последовательностей

Новый инструмент, одновременно сравнивающий 1,4 миллиона генетических последовательностей, может классифицировать родственные связи видов в гораздо большем масштабе, чем было возможно ранее. Технология, описанная в Nature Biotechnology исследователями из Центра геномной регуляции в Барселоне, позволяет реконструировать эволюцию жизни за сотни миллионов лет и делает важные шаги к амбициозной цели — понять код жизни для каждого живого вида на Земле.

Самый распространенный способ изучения этих связей — использование множественного выравнивания последовательностей (Multiple Sequence Alignments, MSA). Этот инструмент описывает эволюционные отношения организмов, находя сходства и различия в их биологических последовательностях, выявляя совпадения среди, казалось бы, несвязанных последовательностей и предсказывая, как изменение в конкретной точке гена или белка может повлиять на его функцию.

«Мы используем MSA, чтобы понять генеалогическое древо эволюции видов. Чем больше ваше MSA, тем больше дерево и тем глубже мы копаем в прошлое, находя, как виды появлялись и отделялись друг от друга», — говорит ведущий автор исследования Седерик Нотрдам.

«То, что мы создали, позволяет копать в десять раз глубже, чем раньше, помогая заглянуть на сотни миллионов лет в прошлое. Наша технология — это, по сути, машина времени, которая показывает, как древние ограничения повлияли на гены, что привело к жизни в ее нынешнем виде, подобно тому, как телескоп Хаббла наблюдает за событиями миллионов лет назад, чтобы помочь понять Вселенную сегодня».

Технологический прогресс сделал секвенирование дешевле, чем когда-либо, что привело к появлению огромных наборов данных с более чем миллионом последовательностей. Однако исследователи не могли в полной мере использовать эти массивы, поскольку современные методы MSA не могут точно анализировать более 100 000 последовательностей.

Чтобы оценить потенциал масштабирования MSA, авторы использовали Nextflow — облачное программное обеспечение, разработанное в Центре геномной регуляции. «Мы потратили сотни тысяч часов вычислений, чтобы проверить эффективность нашего алгоритма», — говорит исследователь Эван Флоден.

«В биологии существует огромное количество "темной материи" — кода, который нам еще предстоит идентифицировать в неисследованных частях генома. Это неиспользованный потенциал для новых лекарств и других преимуществ, которые мы даже не можем себе представить», — заключает Седерик Нотрдам. «То, что мы построили, — это новый способ найти иголки в стоге сена геномов жизни».