Исследователи сохранили операционную систему и короткий фильм в ДНК

Человечество вскоре может генерировать больше данных, чем способны обработать жёсткие диски или магнитные ленты. Эта проблема заставляет учёных обращаться к древнему природному решению для хранения информации — ДНК.

В новом исследовании, опубликованном в Science, учёные из Колумбийского университета и Нью-Йоркского геномного центра (NYGC) показали, что алгоритм, разработанный для потокового видео на смартфоне, может раскрыть почти полный потенциал ДНК для хранения данных, упаковывая больше информации в её четыре нуклеотидных основания (A, G, C, T). Технология также оказалась чрезвычайно надёжной.

ДНК — идеальный носитель информации, поскольку она ультракомпактна и может сохраняться сотни тысяч лет в прохладном сухом месте, что подтверждается недавним восстановлением ДНК из костей предка человека возрастом 430 000 лет, найденного в пещере в Испании.

Метод кодирования

Исследователи Янив Эрлих и Дина Зилински выбрали шесть файлов для записи в ДНК:

  • Полноценная компьютерная операционная система
  • Французский фильм 1895 года «Прибытие поезда на вокзал Ла-Сьота»
  • Подарочная карта Amazon на $50
  • Компьютерный вирус
  • Пластинка «Пионера»
  • Исследование 1948 года теоретика информации Клода Шеннона

Файлы сжали в один мастер-файл, разбили данные на короткие строки бинарного кода (из единиц и нулей). С помощью алгоритма fountain codes (коды фонтана) они случайным образом упаковали строки в «капли» и сопоставили единицы и нули в каждой капле с четырьмя нуклеотидными основаниями ДНК. Алгоритм также удалял комбинации букв, вызывающие ошибки, и добавлял штрих-код к каждой капле для последующей сборки файлов.

В итоге был создан цифровой список из 72 000 цепочек ДНК, каждая длиной 200 оснований. Этот список отправили в стартап Twist Bioscience (Сан-Франциско), который синтезировал ДНК. Через две недели учёные получили пробирку с образцом молекул ДНК.

Восстановление данных

Для извлечения файлов использовали современную технологию секвенирования, чтобы прочесть цепочки ДНК, и программное обеспечение для обратного перевода генетического кода в бинарный. Файлы были восстановлены без единой ошибки.

Исследователи также показали, что с помощью ПЦР (полимеразной цепной реакции) можно создавать практически неограниченное количество копий ДНК-образца, и эти копии (даже копии копий) также можно восстановить без ошибок.

Рекордная плотность

Новая стратегия кодирования DNA Fountain позволяет хранить 215 петабайт данных на одном грамме ДНК. Это в 100 раз больше, чем в методах, опубликованных ранее такими пионерами области, как Джордж Чёрч (Гарвард), Ник Голдман и Юэн Бирни (Европейский институт биоинформатики).

Теоретический предел ёмкости хранения данных в ДНК — два бита на нуклеотид, но биологические ограничения и необходимость включать избыточную информацию снижают его до 1.8 бита на основание. Метод DNA Fountain упаковывает в среднем 1.6 бита в каждое нуклеотидное основание, что на 60% больше, чем в предыдущих методах, и близко к теоретическому пределу.

Барьер стоимости

Стоимость остаётся препятствием: синтез ДНК для архивации 2 мегабайт данных обошёлся в 7000 * *, аихчтение—ещёв * *2000. Однако, как отмечает Эрлих, стоимость синтеза можно значительно снизить, производя молекулы более низкого качества и используя алгоритмы (вроде DNA Fountain) для исправления молекулярных ошибок на этапе компьютерной обработки.