Нехватка метаданных подрывает мониторинг биоразнообразия

Более половины геномных наборов данных в крупнейшем мировом хранилище лишены базовых метаданных — информации о том, где и когда был собран образец. Это дорогостоящая проблема, которая мешает планам по защите биоразнообразия планеты, поскольку без этих данных невозможно отслеживать генетическое разнообразие видов во времени.

Почему это важно?

  • Генетическое разнообразие определяет способность видов адаптироваться к изменениям, таким как изменение климата, инвазивные виды или инбридинг.
  • «Генетическое разнообразие влияет на здоровье видов, что, в свою очередь, влияет на здоровье экосистем», — говорит ведущий автор исследования Рейчел Точыдловски из Michigan State University (MSU).
  • Отслеживание изменений генетического разнообразия позволяет прогнозировать состояние экосистем и планировать меры по сохранению, например, выбирать наиболее подходящие организмы для восстановления нарушенных экосистем.

Масштаб проблемы

Международная команда исследователей провела аудит International Nucleotide Sequence Database Collection — крупнейшего репозитория генетических последовательностей. Они проанализировали данные, представляющие более 325 000 отдельных организмов почти 17 000 видов, и обнаружили, что 86% образцов не имели важных метаданных.

Исследование опубликовано 16 августа в журнале Proceedings of the National Academy of Sciences.

Последствия и стоимость

  • Генерация геномных данных требует огромных затрат времени и денег на получение разрешений, полевые работы и секвенирование (около $50 за образец).
  • Без метаданных эти данные теряют большую часть своей ценности для мониторинга и консервации.
  • Суммарная стоимость образцов из этого исследования, которые нельзя повторно использовать из-за отсутствия метаданных, исчисляется десятками миллионов долларов.

Причины и решения

По словам Эрика Крэндалла из Penn State, старшего автора исследования, система предоставления метаданных сложна для освоения, а у исследователей недостаточно стимулов тратить на это время, в отличие от автоматического добавления метаданных в фотографии со смартфона.

Однако есть и хорошие новости: студенты в рамках проекта смогли восстановить метаданные для около 20 000 образцов, найдя информацию в научной литературе. Тем не менее, для 67% наборов данных метаданные так и не были найдены.

Вывод

«Необработанные геномные данные в публичных репозиториях — это уникальные исторические ресурсы... Однако их повторное использование минимально требует информации о пространственном и временном контексте отобранного организма. Без надлежащих архивных практик... эти растущие геномные ресурсы будут иметь ограниченное практическое влияние на мониторинг генетического разнообразия», — заключает Крэндалл.