Восстановление «невидимых» типов клеток и экспрессии генов с помощью улучшенного анализа данных секвенирования
Исследователи из лаборатории Калифорнийского технологического института под руководством профессора биологии Юки Ока в 2018 году обнаружили тип нейронов, опосредующих утоление жажды. Однако передовая методика single-cell RNA sequencing (scRNA-seq) не могла обнаружить эти нейроны в образцах ткани мозга (из области media preoptic nucleus), где их присутствие было известно.
«Мы знали, что генетическая метка наших охарактеризованных нейронов экспрессируется в median preoptic nucleus, но не видели этот ген при профилировании этой области мозга с помощью scRNA-seq», — говорит Ока. Эта проблема — пропуск известных типов клеток и экспрессии генов — была распространена.
Совместная работа лабораторий Ока и Аллана-Хермана Пула из Медицинского центра Университета Техаса показала, как оптимизировать ключевой этап анализа scRNA-seq, чтобы восстановить пропущенные данные. Статья опубликована в журнале Nature Methods 11 сентября.
«Мы улучшили анализ существующих данных scRNA-seq, выявив экспрессию сотен, а иногда и тысяч генов для отдельных наборов данных», — говорит Ока. Такая точность необходима, поскольку биологические процессы сложны: в мозге мыши идентифицировано более 5000 типов нейронов.
Проблема и решение
scRNA-seq — мощный метод идентификации типов клеток, при котором генетическая информация из отдельных клеток маркируется молекулярным штрих-кодом. Однако часть данных о последовательностях РНК часто не включалась в оценку экспрессии генов.
Проблема, как выяснилось, связана с используемым reference transcriptome — цифровым справочником, к которому исследователи привязывают данные секвенирования. Существующие аннотации геномов (например, мыши или человека) необходимо оптимизировать для scRNA-seq, чтобы предотвратить потерю информации.
Потери возникают, если плохо аннотированы концы генов на цепи ДНК или есть обширное перекрытие транскриптов соседних генов. Это может препятствовать обнаружению тысяч генов. Проблема особенно выражена в высокопроизводительных формах scRNA-seq, которые для снижения стоимости анализируют только самые концы генов.
Под руководством Пула, первого автора исследования, команда оптимизировала референсные транскриптомы для геномов мыши и человека и создала вычислительную систему для исправления транскриптомов других организмов.
«Оптимизация референсных транскриптомов позволяет нам увидеть типы и состояния клеток, которые иначе остались бы незамеченными», — говорит Пул. «Теперь мы можем наблюдать полный репертуар нейронных популяций, отвечающих за жажду, насыщение и температуру, которые мы подозревали, но не могли обнаружить».
Статья называется «Recovery of missing single-cell RNA-sequencing data with optimized transcriptomic references». Соавторами, помимо Пула и Ока, являются бывший старший научный сотрудник Caltech Сиси Чен, доцент Мэтт Томсон и Хелен Полдсам из Медицинского центра Университета Техаса.
