Метка и поиск файлов данных в ДНК: шаг к практическому хранению информации в ДНК
Ежедневно человечество генерирует 2,5 миллиона гигабайт данных. Ученые видят альтернативу гигантским центрам хранения в ДНК — молекуле, способной хранить огромные объемы информации с экстремальной плотностью. Чашка ДНК теоретически может вместить все мировые данные.
Основные проблемы ДНК-архивов — высокая стоимость синтеза ДНК и сложность поиска нужного файла в смеси. Исследователи из MIT предложили решение для второй проблемы.
Новый метод извлечения файлов
Команда разработала технику инкапсуляции каждого файла данных в частицу диоксида кремния размером 6 микрометров. Каждая капсула помечена одноцепочечными ДНК-«штрихкодами», описывающими содержимое файла.
В эксперименте 20 изображений были закодированы в фрагменты ДНК длиной около 3000 нуклеотидов (~100 байт). Каждому файлу присвоили баркоды с метками, например, «кот» или «самолет». Для поиска конкретного изображения (например, тигра) к образцу добавляют праймеры, соответствующие искомым меткам («кот», «оранжевый», «дикий»). Праймеры помечены флуоресцентными или магнитными частицами, что позволяет легко выявить и извлечь совпадения, не повреждая остальную ДНК в хранилище.
Процесс поддерживает логические запросы, подобные поиску в Google Images (например, «президент И 18 век»).
Масштабируемость и перспективы
Для баркодов использовали библиотеку из 100 000 последовательностей. При двух метках на файл можно уникально пометить 1010 файлов, при четырех — 1020.
Скорость поиска в текущей системе — около 1 килобайта в секунду. Её ограничивает дороговизна синтеза ДНК. Чтобы метод стал конкурентоспособным с магнитными лентами, стоимость синтеза ДНК должна снизиться примерно на шесть порядков.
Технология особенно перспективна для хранения «холодных» архивных данных. Лаборатория создает стартап Cache DNA для разработки долгосрочных решений хранения как для будущих ДНК-данных, так и для существующих образцов ДНК и РНК (например, из тестов на COVID-19 или геномных исследований).
