Более длинные фрагменты ДНК раскрывают разнообразие редких видов

Основная проблема в метагеномике заключается в том, что наиболее часто используемые секвенаторы генерируют данные в виде коротких фрагментов (порядка нескольких сотен пар оснований). Короткие риды затрудняют сборку геномов, так как ассемблеры не могут различить множественные вхождения одинаковых или похожих последовательностей. Это мешает идентифицировать всех членов микробного сообщества.

В исследовании, опубликованном на обложке журнала Genome Research в апреле 2015 года, команда, включающая исследователей из Объединенного института генома Министерства энергетики США (DOE JGI), сравнила два подхода к использованию секвенаторов Illumina нового поколения для решения этой проблемы.

Сложная задача метагеномной сборки

Изучение микробных сообществ (метагеномов) критически важно для понимания таких процессов, как переработка питательных веществ, углеродный цикл и плодородие почв. Однако многие микробы нельзя культивировать в лаборатории. Сборка геномов из смеси ДНК неизвестных организмов сравнима со сборкой множества пазлов одновременно, не зная, как должен выглядеть каждый из них и все ли детали на месте.

«Для метагеномики это похоже на восстановление пазлов из смеси кусочков от множества разных головоломок — причём вы не знаете, как выглядит ни одна из них», — пояснила Джиллиан Бэнфилд из Калифорнийского университета в Беркли.

Сравнение технологий секвенирования

Исследователи использовали образцы осадков из водоносного горизонта в Рифле (Колорадо), взятые в рамках проекта Genomes-to-Watershed. Они сравнили данные, полученные с помощью стандартной технологии коротких ридов Illumina, и новой технологии TruSeq Synthetic Long-Reads, которая генерирует фрагменты длиной до ~8 000 пар оснований.

Ключевые результаты:

  • Используя короткие риды, в образце ранее было идентифицировано чуть более 160 микробных видов.
  • С помощью длинных ридов удалось филогенетически классифицировать более 400 видов из того же образца, причём некоторые из них составляли всего 0,1% сообщества.
  • Длинные риды позволили выявить виды, которые не собирались из-за присутствия в образце близкородственных видов (до 15% сообщества), что сбивало алгоритмы сборки коротких ридов.
  • Экстраполяция данных на виды с ещё более низкой численностью показала, что в образце присутствует как минимум 2 100 различных видов. Реальное число, вероятно, составляет несколько тысяч или десятков тысяч видов.

Преимущества комбинированного подхода

Исследование показало, что короткие риды не справляются со сборкой тысяч редких геномов из-за недостаточного покрытия, а также плохо собирают близкородственные геномы даже при хорошем покрытии. Длинные риды раскрыли этот «длинный хвост» ранее не обнаруженных микробных видов с очень низкой численностью и позволили восстановить порядок генов для большинства этих геномов.

«В целом, данные коротких и длинных ридов предоставляют взаимодополняющие преимущества для метагеномных исследований, что делает использование обеих технологий вместе более мощным, чем использование какой-либо одной по отдельности», — заключили авторы.

Работа была мотивирована в рамках Программы возможностей новых технологий (ETOP) DOE JGI, нацеленной на внедрение методов, добавляющих ценность высокопроизводительному секвенированию. Этот подход позволяет получить гораздо более детальную характеристику микробных сообществ, что улучшает понимание процессов с участием микробов (например, захват углерода, ремедиация загрязнений) и способствует открытию новых генов и ферментов.