Расшифровка новых «букв» ДНК для развития медицины и биотехнологий

Исследователи из Института генома Сингапура A*STAR (A*STAR GIS) разработали метод для точного и эффективного считывания ДНК, содержащей нестандартные основания — задача, ранее считавшаяся слишком сложной для обычных секвенаторов. Их работа, опубликованная в Nature Communications, сочетает нанопоровое секвенирование с искусственным интеллектом (ИИ) для расшифровки этих дополнительных «букв» с высокой скоростью и точностью.

Проблема: ДНК как скрытый язык природы

ДНК — это инструкция природы, построенная из четырёх стандартных «букв» или оснований: A, T, C и G. Учёные давно представляли расширение этого генетического алфавита путём добавления новых «букв», известных как неканонические основания (NCBs). Они могут встречаться в природе у некоторых вирусов или быть созданы в лаборатории и обладают потенциалом для создания новых способов проектирования молекул, материалов и биологических систем.

Однако секвенаторы ДНК были созданы для распознавания только четырёх стандартных оснований. Поскольку они плохо справляются с обнаружением или расшифровкой новых, учёные не могли полностью использовать их потенциал для разработки более точных лекарств, создания искусственных геномов для устойчивого производства химикатов и проектирования программируемых материалов и наноразмерных устройств.

«Наша способность быстро читать текст во многом зависит от того, насколько мы знакомы с используемой лексикой, — сказал доктор Маурисио Лисбоа Перес, учёный A*STAR GIS и первый автор исследования. — Точно так же, чтобы модель ИИ могла "быстро читать" ДНК, она должна видеть достаточно примеров каждого основания. Неканонические основания редки, и их сложнее производить, поэтому нам пришлось разработать творческие способы генерации достаточного количества примеров для обучения нашей модели ИИ».

Решение: Использование ИИ для перевода ДНК с нестандартными основаниями

Команда создала обширную библиотеку искусственной ДНК, содержащей как стандартные, так и нестандартные основания в различных комбинациях, а затем использовала нанопоровое секвенирование для записи уникальных электрических сигналов, возникающих при прохождении каждого основания через микроскопические поры.

Поскольку данные часто были зашумлёнными и неполными, исследователи разработали подход на основе ИИ, который мог обучаться и улучшаться итеративно, уточняя свои прогнозы со временем. Они также улучшили обучение модели ИИ, творчески переставляя существующие сигнальные данные для представления большего количества комбинаций.

Этот адаптивный метод позволил ИИ точно распознавать характерный паттерн каждого основания, что дало секвенатору возможность напрямую считывать новые «буквы» ДНК.

В то время как другие исследовательские группы изучали аналогичные проблемы, это исследование первым демонстрирует секвенатор ДНК, который может напрямую и надёжно идентифицировать нестандартные основания в масштабе с помощью ИИ, преодолевая ключевые узкие места, такие как ограниченные данные для обучения.

«Возможность точно идентифицировать эти новые основания в масштабе даёт нам гораздо более богатый словарный запас для записи и чтения биологической информации, — сказал доктор Ниранджан Нагараджан, заместитель директора по ИИ и вычислениям в A*STAR GIS и старший автор исследования. — Это похоже на обучение распознаванию новых букв, что позволяет нам понимать гораздо больше слов и значений в языке жизни».

Преобразующий потенциал метода

Этот прорыв может стимулировать инновации в различных областях:

  • Здравоохранение и терапия: Точное считывание и анализ нестандартных оснований устраняет серьёзное препятствие в разработке методов лечения на основе ДНК и РНК, открывая путь для новых лекарств и диагностических средств.
  • Передовые материалы и биотехнологии: Нестандартные основания могут служить новыми строительными блоками для наноструктур и нанороботов, что приведёт к прорывам в медицине, производстве и устойчивом производстве химикатов.
  • Хранение данных и информации: Кодирование информации с использованием расширенных алфавитов ДНК может сделать хранение данных более доступным и энергоэффективным, потенциально снижая экологический след дата-центров.

Исследователи планируют расширить свою работу для обнаружения большего количества нестандартных оснований в вирусах и улучшить способность модели ИИ их обнаруживать.

«Мы в восторге от этого нового метода секвенирования ДНК и возможностей, которые он открывает, — сказала доктор Вань Юэ, исполнительный директор A*STAR GIS. — Работа с расширенным алфавитом ДНК создаст больше возможностей для учёных разрабатывать новые терапевтические средства, новые организмы, производящие химикаты экологически безопасным способом, и новые программируемые материалы для наноструктур и нанороботов. Эти инновации могут ускорить научные открытия, создать экономическую ценность и в конечном итоге улучшить жизнь».