Ученые обнаружили пробелы в древе жизни и призывают улучшить хранение данных

Новое исследование с участием ученых из Университета Флориды показывает, что около 70% опубликованных сравнений генетических последовательностей не находятся в открытом доступе. Это лишает исследователей по всему миру критически важных данных, необходимых для решения проблем от изменения климата до контроля заболеваний.

Ученые используют генетические данные для построения крупнейшего открытого «древа жизни» в рамках проекта Национального научного фонда США (NSF) «Сборка, визуализация и анализ древа жизни» с бюджетом $5.6 млн. Понимание взаимосвязей между организмами крайне важно для отслеживания происхождения и распространения новых болезней, создания сельскохозяйственных и фармацевтических продуктов, изучения изменения климата и планирования мер по сохранению биоразнообразия.

Исследование, опубликованное в PLoS Biology, описывает серьезную проблему для проекта, который должен представить черновой вариант древа к концу года. Оно подчеркивает необходимость разработки более эффективных методов долгосрочного хранения данных и призывает журналы ужесточить политику обмена данными.

«Нам нужна серьезная перемена в мышлении о том, насколько важно архивировать свои данные — это должно стать стандартной частью нашей работы», — заявил соавтор Дуг Солтис, профессор Флоридского музея естественной истории. — «Потому что если их нет в архиве, они утеряны навсегда».

Оценка объема недостающих данных основана на анализе 7 539 рецензируемых исследований о животных, грибах, семенных растениях, бактериях и различных микроорганизмах. Отсутствие данных вынуждает участников проекта связываться с сотнями авторов для запроса информации или пытаться воспроизвести выравнивания последовательностей и анализы, что требует огромных трудозатрат.

«Трудно оценить достоверность публикации во многих случаях, если у вас нет доступа к выравниваниям. Для меня это самая большая проблема», — сказал ведущий автор Брайан Дрю, постдокторант кафедры биологии УФ.

Среди проблем — сложные механизмы загрузки данных и несогласованность требований журналов. Наиболее широко используемые общедоступные базы данных включают GenBank, TreeBASE и Dryad. Большинство журналов требуют депонирования последовательностей ДНК в GenBank, но лишь немногие требуют публичного архивирования выравниваний последовательностей. При рассылке запросов авторам на получение недостающей информации большинство не ответило, и данные удалось получить редко.

Элизабет Келлогг, профессор биологии Университета Миссури, не участвовавшая в исследовании, отметила, что не удивлена большим объемом отсутствующей информации. По ее словам, многие журналы не требуют этого дополнительного шага, а интерфейсы некоторых баз данных могут быть громоздкими, что пугает исследователей, не имеющих опыта работы с ними.