ИИ корректирует пробелы в данных гражданской науки

Гражданская наука — это большое подспорье для исследователей, предоставляющее огромные массивы данных обо всём: от видов животных до далёких галактик.

Однако краудсорсинговые данные часто несбалансированы. Больше сообщений поступает из густонаселённых районов и меньше — из труднодоступных мест, что создаёт проблемы для учёных, которым нужны равномерно распределённые данные.

«В наборе данных присутствует огромная систематическая ошибка, потому что данные собираются добровольцами», — говорит Ди Чен, аспирант по компьютерным наукам и первый автор работы «Снижение систематической ошибки с помощью сквозного обучения сдвигу: применение в гражданской науке», которая будет представлена на конференции AAAI по искусственному интеллекту с 27 января по 1 февраля в Гонолулу.

«Поскольку сбор данных мотивирован личным интересом, распределение этих данных не такое, какое нужно учёным», — поясняет Чен. «Все данные фактически распределены вдоль основных дорог и в городских районах, потому что большинство людей не хотят проезжать 200 миль, чтобы помочь нам исследовать птиц в пустыне».

Чтобы компенсировать это, Чен и Карла Гомес, профессор компьютерных наук и директор Института вычислительной устойчивости, разработали модель глубокого обучения, которая эффективно корректирует пространственные смещения в данных гражданской науки, сравнивая плотность населения в разных локациях. Гомес и Чен протестировали свою модель на данных проекта eBird Корнеллской лаборатории орнитологии, который ежегодно собирает более 100 миллионов наблюдений за птицами от орнитологов-любителей по всему миру.

«Когда я общаюсь с биологами-экологами, важная часть обсуждения этих оценок — убедить их, что мы осознаём эти систематические ошибки и, насколько это возможно, контролируем их», — говорит Дэниел Финк, старший научный сотрудник лаборатории орнитологии, сотрудничающий с Гомес и Чен. «Это даёт [биологам и экологам] больше оснований доверять этим результатам, фактически использовать их и принимать на их основе решения».

Исследователи давно осознавали проблемы с данными гражданской науки и пробовали различные методы их решения, включая другие типы статистических моделей. Проекты, предлагающие стимулы для волонтёров, чтобы те отправлялись в отдалённые места или искали менее популярные виды, показывают перспективу, но они могут быть дорогими и сложными для масштабирования.

Огромный набор данных, подобный eBird, полезен в машинном обучении, где большие объёмы данных используются для обучения компьютеров делать прогнозы и решать задачи. Однако из-за пространственных смещений модель, созданная на основе данных eBird, будет делать неточные прогнозы.

Корректировка смещения в данных eBird дополнительно осложняется множеством характеристик этих данных. Каждое наблюдение за птицей в системе содержит 16 различных параметров, что создаёт вычислительные сложности.

Чен и Гомес решили проблему с помощью модели глубокого обучения — вида искусственного интеллекта, хорошо справляющегося с классификацией, — которая корректирует различия в плотности населения разных районов, сравнивая их соотношения.

«Сейчас получаемые нами данные по сути смещены, потому что птицы не живут только вокруг городов, поэтому нам нужно это учитывать и корректировать», — говорит Гомес. «Нам нужно убедиться, что обучающие данные будут соответствовать тому, что есть в реальном мире».

Чен и Гомес протестировали несколько моделей и обнаружили, что их алгоритм глубокого обучения более эффективен в прогнозировании мест обитания видов птиц, чем другие статистические или машинные модели.

Хотя они работали с eBird, их разработка может быть использована в любом проекте гражданской науки, отмечает Гомес.

«Существует множество приложений, основанных на гражданской науке, и эта проблема распространена повсеместно, поэтому её действительно необходимо корректировать, независимо от того, классифицируют ли люди птиц, галактики или другие объекты, где смещения данных могут искажать обученную модель».