Нехватка метаданных подрывает мониторинг биоразнообразия
Более половины геномных наборов данных в крупнейшем мировом хранилище лишены базовых метаданных — информации о том, где и когда был собран образец. Это дорогостоящая проблема, которая мешает планам по защите биоразнообразия планеты, поскольку без этих данных невозможно отслеживать генетическое разнообразие видов во времени.
Почему это важно?
- Генетическое разнообразие определяет способность видов адаптироваться к изменениям, таким как изменение климата, инвазивные виды или инбридинг.
- «Генетическое разнообразие влияет на здоровье видов, что, в свою очередь, влияет на здоровье экосистем», — говорит ведущий автор исследования Рейчел Точыдловски из Michigan State University (MSU).
- Отслеживание изменений генетического разнообразия позволяет прогнозировать состояние экосистем и планировать меры по сохранению, например, выбирать наиболее подходящие организмы для восстановления нарушенных экосистем.
Масштаб проблемы
Международная команда исследователей провела аудит International Nucleotide Sequence Database Collection — крупнейшего репозитория генетических последовательностей. Они проанализировали данные, представляющие более 325 000 отдельных организмов почти 17 000 видов, и обнаружили, что 86% образцов не имели важных метаданных.
Исследование опубликовано 16 августа в журнале Proceedings of the National Academy of Sciences.
Последствия и стоимость
- Генерация геномных данных требует огромных затрат времени и денег на получение разрешений, полевые работы и секвенирование (около $50 за образец).
- Без метаданных эти данные теряют большую часть своей ценности для мониторинга и консервации.
- Суммарная стоимость образцов из этого исследования, которые нельзя повторно использовать из-за отсутствия метаданных, исчисляется десятками миллионов долларов.
Причины и решения
По словам Эрика Крэндалла из Penn State, старшего автора исследования, система предоставления метаданных сложна для освоения, а у исследователей недостаточно стимулов тратить на это время, в отличие от автоматического добавления метаданных в фотографии со смартфона.
Однако есть и хорошие новости: студенты в рамках проекта смогли восстановить метаданные для около 20 000 образцов, найдя информацию в научной литературе. Тем не менее, для 67% наборов данных метаданные так и не были найдены.
Вывод
«Необработанные геномные данные в публичных репозиториях — это уникальные исторические ресурсы... Однако их повторное использование минимально требует информации о пространственном и временном контексте отобранного организма. Без надлежащих архивных практик... эти растущие геномные ресурсы будут иметь ограниченное практическое влияние на мониторинг генетического разнообразия», — заключает Крэндалл.
