Автоматизация изучения биоразнообразия гербариев с помощью QR-кодов
Современные технологии секвенирования нового поколения революционизировали филогенетику, но добыча ДНК из организмов для масштабных исследований остаётся трудоёмкой. Основная сложность — сбор и документирование образцов из музеев и гербариев, что является самым времязатратным и подверженным ошибкам этапом.
Исследователи из Applications in Plant Sciences предложили решение, автоматизирующее процесс сбора данных с помощью уникальных идентификаторов объектов, QR-кодов и краудсорсинга.
Цель проекта: создать общедоступный ресурс и частичную (50% покрытие) филогению семенных растений, которые образуют симбиоз с азотфиксирующими бактериями в корневых клубеньках. Эта группа включает более 30 000 видов.
Проблема традиционного подхода: ручное переписывание данных с этикеток образцов (локация, дата, коллектор) в электронные таблицы. Это:
- Требует много времени.
- Создаёт риск ошибок (опечатки, неразборчивость).
- Делает данные труднодоступными для других научных групп, ведущих к дублированию усилий.
Предложенный рабочий процесс состоит из трёх шагов:
- Присвоение уникального идентификатора: Каждому гербарному образцу присваивается и физически прикрепляется уникальный код. Образец фотографируется с этим кодом.
- Оцифровка данных силами волонтёров: Информация с примерно 15 000 образцов была оцифрована с помощью платформы гражданской науки Notes From Nature, где добровольцы помогают транскрибировать данные онлайн.
- Использование QR-кодов в лаборатории: Каждому образцу присваивается QR-код. При экстракции и амплификации ДНК учёные сканируют код, и информация об образце автоматически заносится в базу, исключая ручной ввод и связанные с ним ошибки.
Ключевые преимущества:
- Экономия времени: Сканирование QR-кодов не требует обучения и происходит мгновенно.
- Минимизация ошибок: Исключаются опечатки и проблемы с чтением рукописных этикеток, что критически важно при работе с тысячами образцов.
- Создание reusable-ресурса: Оцифрованные данные становятся доступны для повторного использования научным сообществом, а не остаются в личных таблицах исследователей.
Для управления данными команда создала собственную базу данных с помощью Python-скриптов, что удобнее таблиц для сложных запросов. Весь рабочий процесс и скрипты находятся в свободном доступе для адаптации другими учёными.
"В будущем мы надеемся, что вся подобная коллекционная информация будет доступна онлайн, где её легко найти, и работу не придётся повторять", — говорит ведущий автор Райан Фолк.
Этот подход не только ускоряет конкретные исследования, но и закладывает основу для легкодоступных цифровых ресурсов по биоразнообразию, которые могут быть использованы в будущих крупных проектах.
