ИИ для разработки новых лекарств: усиление человеческого интеллекта
Глубокое обучение радикально изменило область искусственного интеллекта. Теперь нейронные сети революционизируют способ открытия новых лекарств. Мы беседуем с Франческой Гризони, доцентом кафедры биомедицинской инженерии, которая находится на переднем крае исследований по автоматизации дизайна лекарств. «В конечном итоге мы хотим усилить человеческий интеллект для разработки новых лекарств».
Разработка лекарств — очень трудоемкий процесс. Оценочное количество молекул, которые можно использовать в качестве отправных точек для открытия лекарств, составляет порядка 1060–10100, что намного больше, чем звезд в наблюдаемой Вселенной. Таким образом, поиск молекулы лекарства с нужными свойствами подобен поиску иголки в стоге сена.
Большинство лекарственных молекул предназначены для воздействия на определенные белки-мишени в наших клетках. Взаимодействуя с этими мишенями, лекарство может ингибировать или стимулировать активность белка. Этот эффект, известный как биоактивность, можно использовать для лечения или профилактики заболеваний.
Ключевая идея дизайна лекарств — идентифицировать молекулы, высокоактивные в отношении намеченных мишеней и неактивные в отношении других, что может вызвать нежелательные побочные эффекты. Из-за огромного количества возможных молекул эффективная навигация в этом «химическом пространстве» чрезвычайно сложна.
После нахождения потенциальной молекулы-кандидата ее еще нужно синтезировать в лаборатории и протестировать в экспериментах возрастающей сложности. Это не только требует много времени (многие молекулы оказываются бесполезными), но и очень дорого.
Компьютерная помощь в открытии лекарств
Около 30 лет назад ученые обратились к компьютерам, чтобы ускорить процесс открытия и разработки лекарств. Компьютеры могут помочь в выборе молекул, которые с наибольшей вероятностью будут эффективны для поставленной цели и синтезируемы.
Один из подходов — виртуальный скрининг, где вычислительные методы используются для выбора кандидатов для тестирования из библиотеки молекул, которые, как известно, можно синтезировать. Эти библиотеки намного меньше всей химической вселенной (обычно от 103 до 106 молекул), поэтому в них легче ориентироваться.
Однако иногда может потребоваться исследовать другие области химического пространства, не включенные в такие библиотеки. Здесь на помощь приходит de novo дизайн, где молекулы создаются «с нуля». Это позволяет генерировать молекулы, сфокусированные на желаемых целях, включая, возможно, те, о которых еще никто не думал.
От дизайна на основе правил к глубокому обучению
Традиционно создание молекул с нуля осуществлялось по определенному набору правил, подобно грамматике в языке. Нужны правила, как собрать атомы или молекулярные фрагменты в соединение, которое не только имеет химический смысл, но и обладает желаемыми биологическими свойствами.
Однако, как и в случае с автоматическим переводом в 80-х и 90-х годах прошлого века, подход на основе правил в дизайне лекарств может столкнуться со своими ограничениями. В конкретных случаях правила становятся либо слишком ограничительными, либо слишком сложными.
Здесь на помощь приходит машинное обучение, и в особенности глубокое обучение. Оно позволило вычислительным дизайнерам лекарств, таким как Гризони, автоматически изучать не только «грамматику» известных соединений (какие элементы нужны для создания валидной и синтезируемой молекулы?), но и ее «семантику» (какие элементы нужны для достижения желаемой биоактивности в отношении заданной мишени?).
Заставить молекулы «улыбаться» (SMILES)
Для этого исследователи используют модели глубокого обучения, заимствованные из обработки естественного языка (NLP). Чтобы использовать NLP в дизайне лекарств, структуру молекул сначала нужно было выразить в виде строки слов.
К счастью, такой язык существует с восьмидесятых годов: SMILES (Simplified Molecular-Input Line-Entry System). Добавляя по одному символу за раз для завершения строки SMILES, модель NLP способна автоматически генерировать новые молекулы. Этот процесс не случаен. Новые символы выбираются на основе того, что модель изучила на ранее доступных данных. Это можно сравнить с автозаполнением поискового запроса в Google.
Однако, в отличие от Google Search или Translate, исследователи сталкиваются со специфической проблемой мира дизайна лекарств: нехваткой больших обучающих данных для компьютерных алгоритмов. «Большие наборы данных для глубокого обучения в дизайне лекарств довольно редки. В некоторых случаях у вас может быть лишь горстка соединений, которые, как известно, действуют на заданную мишень».
Работа с малым количеством данных
С этой проблемой пришлось столкнуться в исследовании по генеративному искусственному интеллекту, опубликованному в журнале Science Advances. В работе исследователи впервые объединили подход глубокого обучения «без правил» для генерации биоактивных молекул с синтезом на чипе — формой миниатюризированного автоматизированного синтеза, которая еще больше минимизирует объем ручного труда.
Чтобы обойти проблему малых данных, исследователи использовали метод, называемый трансферным обучением.
Основная идея заключается в использовании данных, которые каким-то образом связаны с вашей проблемой, но для которых может быть доступно гораздо больше примеров, даже если это не совсем те данные, которые вам нужны. Аналогия: прежде чем написать первую научную статью, человек читает 50 похожих документов, но он не начинает с нуля — он учился читать и писать всю жизнь.
Таким же образом исследователи предварительно обучают свои модели глубокого обучения на десятках тысяч молекул, обладающих общими свойствами, интересными для их цели. Как только модели усваивают достаточный объем информации, их «дообучают» на более специфичном наборе, сфокусированном на желаемом результате, например, на активности в отношении определенного белка-мишени. Это сработало в нескольких случаях, даже когда во второй фазе обучения использовалось всего пять молекул! В статье для Science Advances использовалось 40.
Принятие лучших решений быстрее
В итоге Гризони и ее коллегам удалось идентифицировать 12 новых биоактивных соединений для так называемых печеночных X-рецепторов, которые стали перспективными мишенями для лекарств из-за их регуляторной роли в метаболизме липидов и воспалении.
Конечно, как всегда в инновационных исследованиях, предстоит долгий путь. Например, химическое пространство в эксперименте было ограничено 17 одностадийными реакциями, чтобы обеспечить совместимость соединений с экспериментами на чипе. Гризони также отмечает, что структурное разнообразие новых биоактивных соединений все еще довольно ограничено и, возможно, требует дальнейшего расширения.
Тем не менее, исследовательница довольна результатами: «Наше исследование стало пионером в интеграции моделей ИИ «химического языка» для дизайна молекул с автоматизированным синтезом в миниатюрной системе. Мы сталкиваемся с беспрецедентными возможностями, обусловленными новыми технологиями ИИ и междисциплинарным сотрудничеством в области молекулярного дизайна и синтеза, открытия лекарств и не только. В будущем такие подходы, как наш, помогут медицинским химикам принимать «лучшие решения быстрее».»
