Бенчмаркинг методов глубокого обучения для более точного фенотипирования растений

Фенотипирование растений — это детальное изучение видимых характеристик растения. Оно включает подсчёт растений в эксперименте и оценку признаков потомства. Особи с желательными признаками отбираются для скрещивания в следующем поколении, что позволяет улучшать сорта. Традиционные методы фенотипирования часто маломасштабны, неточны и трудоёмки, создавая узкое место в селекционных программах.

На смену им приходят методы на основе машинного обучения, которые анализируют изображения, извлекают признаки и сравнивают их с базами данных, выполняя задачи быстрее и точнее. Большинство современных подходов используют обучение с учителем на размеченных данных, что дорого и требует времени. Самообучение (self-supervised learning, SSL) — это метод, снижающий потребность в размеченных данных, но он редко применяется в фенотипировании растений.

Исследовательская группа под руководством доцента Яна Ставнесса из Университета Саскачевана (Канада) провела сравнительный анализ двух методов SSL для улучшения фенотипирования. Исследование показало, что самообучение может быть более чувствительно к избыточности данных при предварительном обучении, чем методы с учителем. Работа опубликована в журнале Plant Phenomics.

«Эти результаты подчёркивают важность учёта избыточности данных при обучении моделей для задач фенотипирования, особенно при использовании методов SSL», — поясняет доц. Ставнесс.

В исследовании в качестве модели использовалась пшеница. Сравнивались:

  • Традиционный метод с учителем (supervised pre-training)

  • Два метода SSL: momentum contrast (MoCo) v2 и dense contrastive learning (DenseCL)

Все методы тестировались на 4 задачах:

  1. Обнаружение колоса пшеницы
  2. Обнаружение экземпляра растения
  3. Подсчёт колосков пшеницы
  4. Подсчёт листьев

Метод с учителем показал наилучшие результаты во всех задачах, кроме подсчёта листьев. В отличие от него, контрастные методы SSL (MoCo v2 и DenseCL) не требуют больших размеченных баз данных. Их алгоритм учится сближать схожие образцы (позитивные) и отдалять различные (негативные), усиливая идентификацию нужных признаков.

  • MoCo v2 оптимизирует глобальные признаки изображения.
  • DenseCL фокусируется на локальных признаках уровня пикселей.

Оба метода показали сопоставимую эффективность в формировании внутренних представлений данных для обучения моделей.

Для успешной работы алгоритмов предварительного обучения необходим специализированный и разнообразный набор данных. Однако при работе с избыточными большими наборами данных методы самообучения проявляют себя лучше с точки зрения точности и чувствительности.

Поскольку выводы исследования в основном основаны на эмпирических наблюдениях, авторы планируют расширить работу до реальных селекционных испытаний. Это предоставит более детальную информацию для обучения алгоритмов и поможет в их практическом применении и коммерциализации.

«SSL потенциально можно использовать для изучения более богатого представления фенотипов растений, совмещая его с данными о генотипе и среде в едином пространстве признаков. Мы надеемся, что это бенчмарк-исследование поможет практикам в разработке более совершенных методов SSL для фенотипирования растений на основе изображений», — заключает доц. Ставнесс.