Новая модель ИИ улучшает предсказание геномных процессов, связанных с болезнями

Учёные из Лос-Аламосской национальной лаборатории разработали первую в своём роде мультимодальную модель глубокого обучения EPBDxDNABERT-2. Она способна определять точные взаимосвязи между факторами транскрипции (белками, регулирующими активность генов), используя свойство ДНК, называемое «дыханием ДНК» — спонтанное открытие и закрытие двойной спирали. Модель может помочь в разработке лекарств для лечения заболеваний, связанных с активностью генов.

«Существует много типов факторов транскрипции, а человеческий геном невероятно велик. Необходимо выяснить, какой фактор транскрипции связывается с каким участком этой невероятно длинной структуры ДНК. Мы попытались решить эту проблему с помощью искусственного интеллекта, в частности алгоритмов глубокого обучения», — пояснил ведущий автор исследования Ановарул Кабир.

Модель глубокого обучения, обученная на ДНК

Транскрипционные факторы связываются с определёнными участками ДНК и влияют на регуляцию экспрессии генов. Поскольку нарушения этой экспрессии могут проявляться в таких заболеваниях, как рак, предсказание связывания факторов транскрипции с конкретными участками генов может иметь значение для разработки лекарств.

Исследователи создали программу симуляции ДНК, которая фиксирует её динамику, и интегрировали её с базовой геномной моделью DNABERT-2. Получившаяся модель EPBDxDNABERT-2 способна обрабатывать последовательности генома по хромосомам, используя в качестве входных данных соответствующую динамику ДНК.

Одним из таких входных параметров является «дыхание ДНК», которое коррелирует с транскрипционной активностью, включая связывание факторов транскрипции.

«Интеграция характеристик дыхания ДНК с базовой моделью DNABERT-2 значительно улучшила предсказание связывания факторов транскрипции», — отметил исследователь Маниш Бхаттараи.

Использование суперкомпьютера Venado

Команда запустила свою модель глубокого обучения на новейшем суперкомпьютере лаборатории Venado, который сочетает центральный и графический процессоры для работы с ИИ.

Для обучения модели использовались данные секвенирования генов из 690 экспериментальных результатов, охватывающих 161 различный фактор транскрипции и 91 тип человеческих клеток.

Результаты показали, что EPBDxDNABERT-2 значительно улучшает — на 9,6% по ключевому показателю — предсказание связывания более чем 660 факторов транскрипции. Дополнительные эксперименты на in vitro наборах данных (из контролируемой среды) дополнили in vivo данные (полученные непосредственно из исследований на живых организмах, таких как мыши).

Исследователи обнаружили, что, хотя дыхание ДНК само по себе может достаточно точно оценить транскрипционную активность, мультимодальная модель способна извлекать мотивы связывания — специфические последовательности ДНК, с которыми связываются факторы транскрипции. Это ключевой элемент для объяснения процессов транскрипции.

«Как показала её работа на множестве разнообразных наборов данных, наша мультимодальная базовая модель демонстрирует универсальность, надёжность и эффективность. Эта модель знаменует собой существенный прогресс в вычислительной геномике, предоставляя сложный инструмент для анализа комплексных биологических механизмов», — заключил Бхаттараи.