Новый вычислительный инструмент позволяет исследователям идентифицировать клетки по форме их хромосом

В ядре каждой живой клетки длинные нити ДНК плотно упакованы в компактные хромосомы. Благодаря новому вычислительному методу, разработанному в Институте Солка, исследователи теперь могут использовать архитектуру этих хромосомных петель для дифференциации типов клеток. Информация о структуре хромосом каждой клетки позволит ученым лучше понять, как взаимодействия между различными участками ДНК влияют на здоровье и болезни.

«В такой ткани, как печень, сердце или мозг, существует множество разнообразных типов клеток, которые мы еще не понимаем; это новый инструмент, который поможет нам изучать эти клетки по одной», — говорит профессор Солка и исследователь Медицинского института Говарда Хьюза Джозеф Эккер.

Исследователям известно, что большая часть генома человека состоит из регуляторной ДНК — участков, которые сами по себе не кодируют белки, но помогают контролировать, когда и как гены экспрессируются в конкретной клетке. Это регулирование может происходить через физические взаимодействия между регуляторным участком ДНК и геном. Однако регуляторные области могут находиться далеко от регулируемого гена на линейной нити ДНК. В процессе сборки хромосом между генами и регуляторной ДНК формируются тесные специфические связи, которые удерживаются близко друг к другу в свернутой хромосоме.

В 2009 году был разработан метод Hi-C для исследования этих хромосомных взаимодействий в клетках. Знание того, какие участки ДНК физически взаимодействуют, может объяснить, каким будет эффект мутации в регуляторной области, и помочь понять, почему уровни белка изменены в больной клетке. Обычно Hi-C применяется ко многим клеткам одновременно, и результаты отражают лишь усредненную архитектуру хромосом в популяции клеток. Это означает, что если взаимодействие между двумя областями ДНК присутствует только в небольшом меньшинстве клеток, оно не проявится в стандартном эксперименте Hi-C.

«Если у половины изучаемых клеток есть определенная архитектура хромосом, это можно увидеть, но нельзя определить, что делают отдельные клетки», — говорит Эккер. Его группа хотела разработать способ получения более детальных данных о единичных клетках из экспериментов Hi-C.

Проблема применения Hi-C к одиночным клеткам заключается в том, что клетки одного типа могут иметь вариабельность в архитектуре хромосом. Более того, эксперимент Hi-C на одной клетке выявляет данные только о ~5% генома. Поэтому выявление тенденций — например, заключение, что у одного типа клеток происходит изменение архитектуры хромосом при наличии заболевания — является сложной задачей. Оказывается, с этими двумя проблемами данных — известными как гетерогенность и разреженность — сталкиваются исследователи во многих областях, работающих с большими наборами данных, и для них существуют решения.

«Мы в итоге позаимствовали алгоритмы, используемые в компьютерных науках, и применили их к биологическим данным, чтобы справиться с разреженностью и гетерогенностью результатов Hi-C для единичных клеток», — говорит аспирант Цзинтянь Чжоу.

Вдохновившись компьютерными науками, команда разработала алгоритм scHiCluster для просеивания данных Hi-C из смешанных клеток и сортировки клеток в дискретные группы на основе сходства их хромосомных взаимодействий. Это позволяет легче делать выводы о том, что делают клетки в отношении регуляции генов в различных биологических условиях.

Они протестировали алгоритм на ранее опубликованных наборах данных Hi-C, показав, что могут правильно разделять разные типы клеток из смешанного набора данных. Новый подход окажется полезным по мере того, как исследователи продолжают изучать, как функционируют клетки человеческого тела и как это функционирование нарушается при болезни.

«Если взять такое заболевание, как болезнь Альцгеймера, исследователи обнаружили изменения в экспрессии генов в некоторых типах клеток мозга. Но до сих пор у нас не было возможности легко связать эти изменения экспрессии генов с областями в геноме, которые контролируют транскрипцию генов», — говорит Эккер.

Группа планирует генерировать данные Hi-C в единичных клетках различных тканей человека. Применение этой вычислительной техники для изучения структур хромосом в единичных клетках может дополнительно способствовать пониманию разнообразия регуляции генов в разных типах клеток.