Машинное обучение помогло открыть код активации генов
Учёные давно знают, что гены человека активируются инструкциями, закодированными в точном порядке ДНК, состоящей из четырёх типов звеньев, или «оснований»: A, C, G и T.
Известно, что почти 25% наших генов активируются последовательностями, похожими на TATAAA, — так называемым «TATA-боксом». Как активируются остальные три четверти генов, оставалось загадкой из-за огромного числа возможных последовательностей ДНК.
С помощью искусственного интеллекта исследователи из Калифорнийского университета в Сан-Диего идентифицировали код активации ДНК, который используется у человека не реже, чем TATA-бокс. Это открытие, названное downstream core promoter region (DPR), в будущем может быть использовано для контроля активации генов в биотехнологии и биомедицине. Подробности опубликованы 9 сентября в журнале Nature.
«Обнаружение DPR раскрывает ключевой этап активации примерно четверти до трети наших генов», — сказал Джеймс Т. Кадонага, старший автор статьи. «DPR был загадкой — было спорно, существует ли он вообще у людей. К счастью, мы смогли решить эту головоломку с помощью машинного обучения».
В 1996 году Кадонага и его коллеги, работая с плодовыми мушками, обнаружили новую последовательность активации генов — DPE (которая соответствует части DPR), — позволяющую включать гены без TATA-бокса. В 1997 году они нашли одну DPE-подобную последовательность у человека. Однако с тех пор расшифровать детали и распространённость человеческого DPE было сложно. За более чем 20 лет было найдено всего две или три активные DPE-подобные последовательности среди десятков тысяч человеческих генов.
Чтобы решить эту задачу, Кадонага с коллегами создали набор из 500 000 случайных версий последовательностей ДНК и оценили DPR-активность каждой. На основе 200 000 версий была создана модель машинного обучения, способная точно предсказывать DPR-активность в человеческой ДНК.
Результаты были «абсурдно хорошими». Исследователи также создали аналогичную модель для идентификации TATA-боксов. Тестирование на тысячах известных случаев показало «невероятную» предсказательную способность.
Результаты чётко выявили существование мотива DPR в генах человека. Более того, частота встречаемости DPR, по-видимому, сравнима с частотой TATA-бокса. Также была обнаружена интригующая двойственность: гены, активируемые TATA-боксом, не содержат последовательностей DPR, и наоборот.
Найти шесть оснований в TATA-боксе было просто. Расшифровать код для DPR длиной в 19 оснований было гораздо сложнее.
«DPR нельзя было найти, потому что у него нет явного шаблона последовательности, — сказал Кадонага. — В последовательности ДНК есть скрытая информация, которая делает её активным DPR-элементом. Модель машинного обучения может расшифровать этот код, а мы, люди, — нет».
Дальнейшее использование искусственного интеллекта для анализа последовательностей ДНК должно повысить способность учёных понимать и контролировать активацию генов в человеческих клетках. Эти знания, вероятно, будут полезны в биотехнологии и биомедицинских науках.
«Подобно тому, как машинное обучение позволило нам идентифицировать DPR, вероятно, что связанные с ИИ подходы будут полезны для изучения других важных мотивов последовательностей ДНК, — сказал Кадонага. — Многое из необъяснимого теперь может стать объяснимым».
