Новый метод автоматической проверки генетических баз данных с помощью машинного обучения

Клетки одного организма различаются по своему транскриптому — набору матричной РНК (mRNA), которая описывает, какие части генома экспрессируются и транслируются в белки.

Новое исследование, опубликованное в The Plant Journal, проливает свет на транскриптомные различия между тканями у модельного организма Arabidopsis. Учёные создали стандартизированный «атлас», который может автоматически аннотировать образцы, восстанавливая утерянные метаданные, например, тип ткани.

Проблема: неконсистентные метаданные

Исследование сфокусировано на данных микрочипов (microarray) — ранней высокопроизводительной методики, которая до сих пор широко используется. Такие данные часто публикуются в базах вроде Gene Expression Omnibus (GEO) Национального центра биотехнологической информации. «По мере того, как всё больше омиксных данных размещается в публичных базах, их становится всё сложнее использовать. Одно из главных препятствий — отсутствие единообразных метаданных», — говорит первый автор, научный сотрудник Брукхейвенской национальной лаборатории Фэй Хэ. Как объясняет биоинженер из Университета Иллинойса Сергей Маслов, «тип ткани — это ключевая метадата для образца. Однако разные исследователи используют разную терминологию для описания одной и той же ткани, [...] а также возникают ошибки в процессе загрузки данных».

Решение: автоматическая аннотация через сходство профилей

Поскольку огромный объём данных исключает ручную проверку, учёные создали автоматизированное решение. Оно выводит метаданные из самих профилей экспрессии, находя сходства между типами тканей. Оказалось, что профили экспрессии остаются очень похожими у образцов одной и той же ткани, даже если растения выращены в совершенно разных условиях. Определив наиболее похожие образцы с уже известным типом ткани, исследователи обучили алгоритм идентифицировать другие образцы того же типа с высокой точностью.

Результаты и перспективы

Команда сгенерировала более 10 000 записей метаданных и даже смогла исправить ошибочную аннотацию в другом исследовании, подтвердив это с оригинальным автором. Итог — масштабный «атлас» хорошо аннотированных данных для будущих работ. «Наша конечная цель — предоставить облачную компьютерную инфраструктуру для изучения растений, связанных с энергетикой и сельским хозяйством, таких как тополь и кукуруза», — говорит Маслов. — «Если наши стратегии успешно сработали на Arabidopsis, их можно применить и к другим видам». Созданный атлас по Arabidopsis сам по себе является важным вкладом в генетику растений. «Его можно использовать для построения коэкспрессионных сетей — популярного метода использования транскриптомных данных для аннотации функции генов. Мы надеемся, что он станет золотым стандартом для многих приложений», — добавляет Хэ.