Вычислительный инструмент ReDeconv улучшает анализ RNA-seq, учитывая размер транскриптома

Исследователи, изучающие экспрессию генов, имеют доступ к огромным массивам данных из клеток или тканей благодаря развитию технологий массового и одноклеточного РНК-секвенирования (RNA-seq), которые могут захватывать каждую молекулу РНК, экспрессируемую в клетке — её транскриптом.

Вычислительные методы, разработанные для обработки этих больших транскриптомных наборов данных, привели к революционным открытиям, но также могут упускать информацию, способную скрывать значимые результаты. Чтобы извлечь больше из анализа RNA-seq, учёные из Детской исследовательской больницы Сент-Джуд создали алгоритмический инструмент ReDeconv, который учитывает различия в размере транскриптома, чтобы раскрыть эти значимые результаты.

Подробная информация об инструменте ReDeconv была опубликована 1 февраля в журнале Nature Communications.

Гены экспрессируются, когда из ДНК создаётся матричная РНК (mRNA), которая затем транслируется в белки. Исследователи используют анализ одноклеточного и массового RNA-seq для изучения экспрессии генов, создавая огромные массивы данных. Для работы с этими большими наборами данных учёные используют методы, включающие математические соглашения для упрощения и ускорения обработки.

Хотя эти методы эффективны, они часто отдают приоритет вычислительной эффективности, а не биологической точности, упуская такие факторы, как различия в количестве РНК, экспрессируемой разными типами клеток. Исследователи из Сент-Джуд создали более сложный алгоритм, который позволяет любому, выполняющему анализ RNA-seq, эффективно учитывать эти биологические реалии и потенциально обнаруживать новые результаты в существующих данных.

"ReDeconv включает разницу в размере транскриптома для улучшения анализа RNA-seq. Современные методы делают ложные предположения, которые могут негативно повлиять на деконволюцию, где мы идентифицируем, какие типы клеток находятся в образце, и другие последующие анализы. Мы назвали инструмент ReDeconv, чтобы предположить, что исследователям, возможно, придётся повторно анализировать и деконволютировать свои данные RNA-seq, так как они могут раскрыть новую информацию", — заявил автор-корреспондент Цзиян Ю, Ph.D.

Деконволюция аналитических предположений

ReDeconv уменьшает проблемы, возникающие из-за ошибочных математических предположений старых инструментов. Например, разные типы клеток имеют разные общие уровни экспрессии РНК. Однако учёные часто рассматривают транскриптом каждого типа клеток так, как если бы они имели эквивалентное количество РНК, несмотря на понимание, что это неверно.

Например, эритроциты экспрессируют один ген — гемоглобин, — в то время как стволовая клетка экспрессирует от 10 000 до 20 000 генов. Это несоответствие может чрезмерно подчёркивать типы клеток с высокой общей экспрессией генов и недооценивать те, у которых экспрессия низкая, при деконволюции массового RNA-seq. Аналогичные проблемы возникают из-за различий в длине генов и вариаций экспрессии генов внутри типа клеток, но алгоритм смягчает все три источника ошибок.

"Когда мы добавили эти биологические параметры в нашу модель, мы значительно улучшили точность и прецизионность. Снижение уровня ошибок показывает, что ReDeconv обладает большим потенциалом, чтобы помочь людям получить больше от анализа экспрессии генов за счёт улучшения нормализации одноклеточного RNA-seq и массовой деконволюции", — сказал первый автор Сунцзянь Лу.