Ученые нашли практический подход для улучшения анализа дифференциальной экспрессии генов

Идентификация дифференциально экспрессируемых генов (DEGs) — фундаментальный шаг для многих биомедицинских исследований. RNA-sequencing (RNA-seq) — самый популярный подход для этой цели. Например, два алгоритма для анализа дифференциальной экспрессии (DE) по данным RNA-seq, edgeR и DESeq2, процитированы более 10 000 раз.

Анализ DE с недостаточным числом реплик влияет на точность и может сделать недействительными многие выводы. Биостатистики давно призывают использовать больше биологических реплик для достижения достаточной статистической мощности для корректного выявления DEG. Однако из-за ограничений текущих методов профилирования RNA-seq, включая относительно высокую стоимость и сложную обработку, большинство исследований используют только две-три реплики. При таком уровне репликации можно идентифицировать только наиболее сильно меняющиеся гены. Таким образом, отсутствие практических экспериментальных подходов мешает биологам использовать адекватное число реплик для достижения достаточной мощности в исследованиях по поиску DEG.

Недавно команда под руководством доктора TU Qiang из Института генетики и биологии развития Китайской академии наук разработала практический подход Decode-seq (Differential Expression analysis by barCODEd SEQuencing), чтобы преодолеть текущие ограничения в анализе DE методом RNA-seq и обеспечить более точное обнаружение DEG.

Decode-seq использует молекулярные штрих-коды для одновременного профилирования нескольких десятков образцов в одной библиотеке, что значительно сокращает время и стоимость подготовки библиотек. Метод обогащает 5′-концы кДНК для секвенирования, что снижает требуемую глубину секвенирования по сравнению с полногеномным секвенированием и преодолевает трудности секвенирования 3′-конца. Библиотеки Decode-seq совместимы со стандартными настройками секвенирования Illumina. Поэтому метод не требует пользовательского количества циклов секвенирования или праймеров, и пользователям не нужно выделять целую ячейку или дорожку для секвенирования.

Эти особенности значительно снижают стоимость профилирования примерно до 10% от стоимости традиционного метода RNA-seq. В валидационных экспериментах, когда число реплик увеличилось с 3 до 30, чувствительность возросла с 31% до 95%, а частота ложных открытий снизилась с 34% до 14%. Decode-seq также совместим с очень малыми количествами РНК.

Исследователи применили этот метод для анализа рыбы медаки на ранней стадии определения пола с 30 парами реплик. Они обнаружили несколько новых генов с половым диморфизмом экспрессии, некоторые из которых необходимы для развития половых клеток.

Кратко, увеличение числа реплик значительно улучшает производительность анализа DE, и Decode-seq предоставляет для этого практический подход. Если только образцы не являются уникальными, не требуется полногеномное секвенирование или недостаточная мощность не является проблемой, мало причин использовать недостаточное число реплик. Поэтому ученые призывают по возможности избегать распространенной практики использования трех реплик в анализе DE. Экспериментальный протокол и вычислительный конвейер доступны на домашней странице лаборатории TU.

Статья под названием "Decode-seq: a practical approach to improve differential gene expression analysis" была опубликована онлайн в журнале Genome Biology 23 марта 2020 года.