Искусственный интеллект поможет сделать музейные коллекции более доступными

Музейные коллекции — от ледяных кернов и динозавров до рыб в банках и древних артефактов — представляют собой сокровищницы данных о естественной и человеческой истории. Однако посетители видят лишь малую часть этих коллекций, основная масса которых хранится в запасниках.

Музеи стремятся сделать свои коллекции доступными для учителей и исследователей, физически или в цифровом виде. Но каждая коллекция имеет свою собственную систему организации данных, что затрудняет навигацию и объединение информации.

Проблема данных и потенциал ИИ

Создание, организация и распространение цифровых копий или информации о физических объектах требует обработки огромных массивов данных. Эти данные могут использоваться в моделях машинного обучения и искусственного интеллекта (ИИ) для решения масштабных научных задач.

В настоящее время поиск нужных данных даже в рамках одной области требует навигации по разным репозиториям. ИИ может помочь организовать большие объемы данных из разных коллекций и извлекать информацию для ответа на конкретные вопросы.

Однако использование ИИ — не идеальное решение. Для его эффективной работы необходимы общие практики и системы управления данными между музеями, которые улучшат курирование и обмен данными.

Роль хранителей коллекций и метаданных

Когда предмет поступает в музейную коллекцию, хранители описывают его характеристики и генерируют данные о нем — метаданные. Они могут включать имя коллектора, географическое местоположение, время сбора, а для биологических образцов — таксономию (латинские классификационные названия).

Объединение данных из разных областей с разными стандартами — сложная задача. Сообщества хранителей работают над стандартизацией процессов. Например, в биологических коллекциях используется инструмент Specify для быстрой классификации образцов с помощью выпадающих меню, предзаполненных стандартами таксономии.

Распространенным стандартом метаданных в биологии является Darwin Core. Подобные устоявшиеся стандарты и инструменты существуют во всех науках, чтобы сделать процесс оцифровки объектов максимально простым.

Исследование практик подготовки данных для ИИ

Было проведено 10 фокус-групп с участием 32 специалистов из различных областей: антропологии, археологии, ботаники, геологии, ихтиологии, энтомологии, герпетологии и палеонтологии.

Участники отвечали на вопросы о том, как они получают доступ, организуют, хранят и используют данные своих коллекций, чтобы сделать материалы готовыми для использования ИИ. В отличие от исследований с участием людей, для большинства видов не требуется согласие, поэтому ИИ может анализировать данные нечеловеческих коллекций без проблем конфиденциальности.

Результаты показали, что хранители из разных областей и учреждений имеют множество различных практик подготовки коллекций для ИИ. Стандартизация типов записываемых метаданных и способов их хранения между коллекциями может сделать образцы более доступными и пригодными для использования.

Дальнейшие исследования могут помочь хранителям создать необходимую инфраструктуру для подготовки данных для машин. Человеческая экспертиза способна информировать инструменты ИИ, которые совершают новые открытия на основе старых сокровищ музейных коллекций.