Новый подход ускорит каталогизацию огромного числа клеток
Исследователи MIT разработали метод, который извлекает из массивных наборов данных о клетках всеобъемлющие образцы — «эскизы» (sketches). Они проще для анализа в биологических и медицинских исследованиях.
Современные наборы данных по профилированию отдельных клеток (например, нейронов, мышечных или иммунных клеток) содержат от 100 000 до 2 миллионов клеток. Каждая клетка содержит данные об экспрессии РНК. Анализ полных наборов данных требует больших вычислительных мощностей и занимает часы или дни. Традиционные методы выборки часто пропускают редкие типы клеток.
Новый метод, представленный на конференции Research in Computational Molecular Biology, создает «эскиз», который можно легко объединять с другими наборами данных. Вместо равновероятной выборки клеток он равномерно выбирает клетки из различных типов, присутствующих в наборе.
«Эти эскизы похожи на наброски художника, который старается сохранить все важные черты основного изображения», — говорит Бонни Бергер, профессор математики MIT.
В экспериментах метод генерировал эскизы из наборов данных в миллионы клеток за несколько минут (вместо часов). Эскизы обеспечивали более равное представление редких клеток и даже выявили редкое подмножество воспалительных макрофагов, пропущенное другими методами.
«Эскизирование дает компактное описание очень большого набора данных, сохраняя при этом как можно больше биологической информации… так что людям не нужно использовать столько вычислительной мощности», — говорит Брайан Хай, аспирант CSAIL.
Принцип работы: «клетчатое покрытие»
Клетки представляют собой точки в многомерном пространстве, где каждая размерность соответствует экспрессии определенного гена. Кластеры разных типов клеток (как распространенных, так и редких) могут занимать схожие объемы пространства, но плотность клеток в них сильно различается.
Алгоритм покрывает всё вычислительное пространство «клетчатым покрытием» (plaid covering) — многомерной сеткой из равных квадратов, которая накладывается только на области с клетками, пропуская пустые. Это экономит вычислительные ресурсы.
Каждый занятый квадрат (независимо от того, содержит он 1 клетку или 1000) получает одинаковый вес выборки. Затем алгоритм выбирает целевое количество клеток (например, 20 000), равномерно и случайно отбирая заданное число клеток из каждого занятого квадрата.
«Мы отбираем выборку в соответствии с объемом, а не плотностью, поэтому получаем более равномерное покрытие биологического пространства… и естественным образом сохраняем редкие типы клеток», — объясняет Хай.
Результат: сохранение редких клеток
Метод был применен к набору данных примерно из 250 000 клеток пуповины, содержащему два редких подмножества макрофагов — воспалительные и противовоспалительные. Все традиционные методы выборки объединили оба подмножества в один кластер, а метод «эскизирования» — разделил их. Изучение этих субпопуляций макрофагов может дать новое понимание воспалительных процессов.
«В этом преимущество работы на стыке областей. Мы обучены как математики, но понимаем проблемы биологической науки о данных, поэтому можем привнести лучшие технологии для их анализа», — заключает Бергер.
