Обучение молекулярных моделей на основе данных
Доктор Хайнц Кёппл входит в новую команду учёных исследовательской лаборатории IBM в Цюрихе, занимающуюся системной биологией. Он уверен, что в скором времени сложные биологические процессы, такие как митоз клетки, можно будет представить в виде математических выражений и/или компьютерного кода. Его новая статья в Nature Methods описывает прогресс в этой области на основе работы с дрожжами.
Упрощая суть: приближает ли это исследование к использованию виртуальных биологических симуляций вместо реальных экспериментов?
Да. Методы машинного обучения, предложенные в нашей статье, необходимы для приближения к реалистичному моделированию клеточных молекулярных процессов. Используя молекулярные данные, они предоставляют величины, недоступные экспериментально, например, кинетику связывания белков in vivo. Такая кинетическая характеристика процесса — обязательное условие для реалистичных симуляций, которые можно использовать для прогнозирования или генерации гипотез.
Почему для примера выбрали дрожжи?
Дрожжи — один из немногих «модельных организмов», для которых хорошо отработано множество генетических методов. В частности, нам пришлось модифицировать дрожжи, включив синтетическую систему экспрессии, хорошо изолированную от процессов клетки-хозяина. Она служит примером того, насколько хорошо можно провести такую кинетическую характеристику. Хотя дрожжи кажутся простыми, это эукариотическая клетка с ядром и другими структурами, включающая множество сложных сигнальных путей, которые есть и в человеческих клетках.
Как вы отвечаете скептикам, считающим невозможным представить биологию математическими выражениями?
Я слишком большой редукционист, чтобы принимать такие опасения всерьёз. Почему это не может быть представлено математическими выражениями или кодом? Проблема в том, что наша способность точно измерять клеточные процессы — и в ближайшем будущем останется — весьма ограничена по сравнению со сложностью уже известных компонентов этих процессов. Не говоря о сложности ещё не открытых компонентов. Следовательно, обратная задача, которую решают наши алгоритмы машинного обучения, крайне некорректно поставлена.
Ключевой вопрос: когда экспериментальные методы станут достаточно продвинутыми для надёжного восстановления клеточных процессов из данных? В отличие от некоторых, я не вижу фундаментальных ограничений у такого подхода. Качество реконструкции будет улучшаться вместе с качеством данных.
Что должно произойти для выхода исследования на новый уровень? Всё зависит от экзафлопсных вычислений?
Основное узкое место — не вычислительная мощность, а текущее количество неизвестных в наших молекулярных вычислительных моделях. Таким образом, мы ограничены экспериментальными методами и специализированными алгоритмами машинного обучения. Однако, чтобы извлечь максимум информации из доступных данных, мы фокусируемся на точных алгоритмах, чтобы в модели не вносились артефакты из-за приближений в алгоритмах обучения. Такие алгоритмы часто требуют больших вычислений, поэтому даже для наших умеренно сложных моделей мы использовали параллелизацию. Тем не менее, я не вижу, чтобы наше исследование сейчас зависело от экзафлопсных вычислений.
Каковы дальнейшие планы исследования?
Пока мы сосредоточились на кинетической характеристике молекулярных моделей, когда топология взаимодействий известна. Более сложная задача — разработать алгоритмы машинного обучения, которые могут обучать и топологию, и кинетические параметры на основе данных.
Эта область обратного проектирования молекулярных сетей привлекает много внимания в последние годы. Однако мало работ посвящено обратному проектированию сетей на основе многомерных данных одиночных клеток, таких как масс-цитометрия. В ближайшие месяцы мы будем работать над этой проблемой.
Вы теперь в новой команде по вычислительной биологии в IBM Research — Цюрих. Каковы ваши цели?
Основное направление исследований этой новой команды — алгоритмы обратного проектирования. Благодаря внутренней экспертизе в области вычислительной биохимии, математической оптимизации и высокопроизводительных вычислений, мы хорошо подготовлены для продвижения этой области и её практического применения биологами в академии и фармацевтических компаниях. Предсказание новых молекулярных взаимодействий из экспериментальных данных может стать главным инструментом открытий в экспериментальной биологии.
