Восстановление «невидимых» типов клеток и экспрессии генов с помощью улучшенного анализа данных секвенирования

Исследователи из лаборатории Калифорнийского технологического института под руководством профессора биологии Юки Ока в 2018 году обнаружили тип нейронов, опосредующих утоление жажды. Однако передовая методика single-cell RNA sequencing (scRNA-seq) не могла обнаружить эти нейроны в образцах ткани мозга (из области media preoptic nucleus), где их присутствие было известно.

«Мы знали, что генетическая метка наших охарактеризованных нейронов экспрессируется в median preoptic nucleus, но не видели этот ген при профилировании этой области мозга с помощью scRNA-seq», — говорит Ока. Эта проблема — пропуск известных типов клеток и экспрессии генов — была распространена.

Совместная работа лабораторий Ока и Аллана-Хермана Пула из Медицинского центра Университета Техаса показала, как оптимизировать ключевой этап анализа scRNA-seq, чтобы восстановить пропущенные данные. Статья опубликована в журнале Nature Methods 11 сентября.

«Мы улучшили анализ существующих данных scRNA-seq, выявив экспрессию сотен, а иногда и тысяч генов для отдельных наборов данных», — говорит Ока. Такая точность необходима, поскольку биологические процессы сложны: в мозге мыши идентифицировано более 5000 типов нейронов.

Проблема и решение

scRNA-seq — мощный метод идентификации типов клеток, при котором генетическая информация из отдельных клеток маркируется молекулярным штрих-кодом. Однако часть данных о последовательностях РНК часто не включалась в оценку экспрессии генов.

Проблема, как выяснилось, связана с используемым reference transcriptome — цифровым справочником, к которому исследователи привязывают данные секвенирования. Существующие аннотации геномов (например, мыши или человека) необходимо оптимизировать для scRNA-seq, чтобы предотвратить потерю информации.

Потери возникают, если плохо аннотированы концы генов на цепи ДНК или есть обширное перекрытие транскриптов соседних генов. Это может препятствовать обнаружению тысяч генов. Проблема особенно выражена в высокопроизводительных формах scRNA-seq, которые для снижения стоимости анализируют только самые концы генов.

Под руководством Пула, первого автора исследования, команда оптимизировала референсные транскриптомы для геномов мыши и человека и создала вычислительную систему для исправления транскриптомов других организмов.

«Оптимизация референсных транскриптомов позволяет нам увидеть типы и состояния клеток, которые иначе остались бы незамеченными», — говорит Пул. «Теперь мы можем наблюдать полный репертуар нейронных популяций, отвечающих за жажду, насыщение и температуру, которые мы подозревали, но не могли обнаружить».

Статья называется «Recovery of missing single-cell RNA-sequencing data with optimized transcriptomic references». Соавторами, помимо Пула и Ока, являются бывший старший научный сотрудник Caltech Сиси Чен, доцент Мэтт Томсон и Хелен Полдсам из Медицинского центра Университета Техаса.