Новый метод для генерации расширенных данных для сборки геномов: быстрее, лучше, дешевле

Длинные генетические данные — ценный источник для исследований генетики растений, сельскохозяйственных культур и животных. Секвенирование геномов требует их разбиения на небольшие фрагменты и последующей сборки — подобно гигантскому пазлу. Для этого необходимы как короткие (отдельный фрагмент), так и длинные (информация о соседних фрагментах) последовательности.

Генерация коротких данных относительно проста, а с длинными (LMP) есть проблемы, так как на результат сильно влияют качество и количество ДНК. Набор Illumina Nextera Mate Pair Sample Preparation Kit улучшил качество LMP-данных, но их получение всё ещё остаётся сложной задачей. Более сложные геномы обычно требуют точно отобранных по размеру LMP-данных для получения сборок высочайшего качества.

Хотя создание одной высококачественной библиотеки LMP с точным отбором по размеру может быть трудным, для крупных проектов по секвенированию часто используют несколько таких библиотек. Новый подход позволяет создать 12 библиотек менее чем за двойную стоимость одной и сокращает время на 1–2 дня.

Команда TGAC получила ранний доступ к новой технологии SageELF от Sage Scientific с целью разработки более надёжного и универсального подхода для получения точно отобранных по размеру длинных последовательностей. Протокол стал более толерантным к качеству и количеству ДНК и позволяет гарантировать получение наилучших возможных данных для любого образца.

«Улучшение библиотек LMP было целью TGAC в течение некоторого времени, и мы ранее опубликовали программный инструмент для обработки этих данных, чтобы "очистить" их перед использованием в сборке геномов», — сказал Даррен Хевенс, ведущий автор и руководитель группы в Platforms & Pipelines в TGAC.

«Предыдущие подходы ограничивали нас работой с одним диапазоном размеров за раз, тогда как с помощью этого нового протокола мы можем одновременно работать с 12 различными фракциями по размеру. Это повышает вероятность получения наилучших длинных данных из данного источника ДНК, экономя время и деньги. Хотя большинству проектов не требуется секвенирование всех 12 фракций, мы можем выбрать для секвенирования лучшие из них».

Учёные надеются, что этот новый подход к созданию библиотек получит широкое распространение в научном сообществе и положительно повлияет на улучшение сборки геномов. Это обеспечит лучшее понимание хозяйственно ценных признаков у сельскохозяйственных культур и животных, таких как устойчивость к болезням, что является ключевым требованием для селекционеров.

Мэтт Кларк, последний автор, руководитель группы Plant and Microbial Genomics в TGAC, добавил: «Создание высококачественных сборок геномов важно, поскольку они формируют основу для понимания генетики организма. С момента разработки этот подход уже был успешно применён в ряде наших известных проектов по секвенированию, таких как пшеница мягкая, пшеница твёрдая, Aegilops sharonensis и ясень европейский, более устойчивый к усыханию, — все с очень впечатляющими результатами.

«Для всех проектов, требующих информации о длинных последовательностях, мы теперь продвигаем этот метод как наш "золотой стандарт". Выявление новых технологий и их применений — ключевой аспект нашей работы, и мы продолжим отслеживать возможности в этой области».