Цифровая сторона биологии

Революции в науке происходят волнами. Одним из эпохальных событий в современной биологии стало расшифровка в 1995 году американским биологом Дж. Крейгом Вентером полного генома бактерии Haemophilus influenzae с использованием метода «дробовика» (shotgun sequencing), который включал компьютерную сборку данных.

В то время многие молекулярные биологи, включая Уэйна Митчелла, ныне работающего в Центре экспериментальной терапии (ETC) A*STAR, годами испытывали разочарование, видя, как их работу по клонированию генов опережают конкурирующие лаборатории. Вдохновленный демонстрацией Вентера того, как компьютеры могут значительно ускорить биологические исследования, Митчелл решил самостоятельно освоить вычислительные навыки. Изначально его новый путь не был полностью поддержан коллегами.

Спустя пятнадцать лет Митчелл, похоже, правильно уловил дух времени, поскольку компьютеризация биологических исследований набирает обороты. Он стал одним из мировых пионеров, обладающих как биологическими, так и вычислительными знаниями. В качестве руководителя группы информатики в ETC он инициировал создание IT-платформ, таких как системы управления электронным контентом и новые сети для передачи больших объемов данных. В исследованиях Митчелл и его коллеги используют компьютеризированные процессы — от роботизированного скрининга тысяч химических соединений на машинах для высокопроизводительных вычислений до компьютерного моделирования химических структур — для разработки кандидатов в терапевтические препараты против рака и других заболеваний.

«Современная биология — это автоматизированные машины, выдающие огромные объемы данных, которые затем необходимо управлять, хранить, анализировать и визуализировать, — говорит Митчелл. — Ни одна из этих процедур не является ракетной наукой, но если этого не делать, то проводить эксперимент изначально бессмысленно».

Анализ множественных данных

Наступление эры информационных технологий полностью изменило биологические исследования. Улучшение скорости сетей, емкости хранилищ и компьютерных кластеров, а также разработка новых алгоритмов и протоколов управления знаниями привели к появлению новых компьютерных методов, таких как выравнивание последовательностей, машинное обучение для идентификации паттернов и онтологии для формальной классификации данных. Вместе эти платформы сделали возможными широко используемые сегодня экспериментальные технологии, включая секвенаторы, микрочипы, детекторы однонуклеотидных полиморфизмов и масс-спектрометры. Крупные базы данных результатов секвенирования также стали общедоступными, что стимулировало информатиков к созданию инструментов для удобного доступа к данным для экспериментальных ученых.

«Цифровые вычисления — это слуга нецифровых, основанных на мозге вычислений», — говорит Митчелл.

Интерес биологов к исследованиям с использованием передовых вычислительных инструментов, область, известная как вычислительная биология, укоренился в институтах A*STAR. В Геномном институте Сингапура (GIS) A*STAR почти все исследования связаны с вычислениями, и треть его исследователей — либо компьютерные ученые, либо биологи с сильными компьютерными навыками. Теперь, когда секвенирование стало рутиной, «возрос спрос на компьютерных исследователей для анализа огромных объемов данных», — говорит Нил Кларк, заместитель директора GIS, молекулярный биолог и самоучка-биоинформатик.

В недавнем исследовании GIS команда Кларка изучила одну из важнейших систем регуляции ДНК — как транскрипционные факторы и нуклеосомы конкурируют друг с другом за положение для связывания с ДНК. Исследователи изучили несколько общедоступных наборов данных высокого разрешения о положении нуклеосом по всему геному и провели компьютерный анализ для сравнения положений in vivo и in vitro. Они обнаружили, что ключом к этому анализу является знание не точного местоположения нуклеосомы, а ее более широкой региональной занятости.

Кен Сан, ведущий исследователь и компьютерный ученый в GIS, и его коллеги недавно разработали микрочип для точной идентификации мутаций ДНК вируса гриппа H1N1. В сочетании с программным обеспечением EvolSTAR этот микрочип может секвенировать вирус непосредственно из образцов крови без предварительного усиления. Этот набор не только повысил эффективность тестирования по сравнению с другими методами на основе чипов, но и снизил стоимость исследований в десять раз. Он позволяет исследователям проводить масштабные исследования бионадзора для отслеживания изменений вируса гриппа во время пандемии, что может помочь предотвратить его распространение.

Кроме того, в GIS крупномасштабное секвенирование принесло большую пользу новой области «метагеномики», где исследователи напрямую изучают микробные образцы из природы, минуя сложный этап культивирования в лаборатории. Ниранджан Нагараджан, ведущий исследователь и компьютерный ученый, разрабатывает новые инструменты для точного анализа метагеномных наборов данных как для секвенирования генов-маркеров, так и для полногеномного секвенирования.

«Новые технологии позволяют глубоко профилировать эти сообщества, но исследователи получают очень фрагментированную информацию. Они хотят использовать данные, чтобы восстановить более полную картину образца», — говорит Нагараджан.

Установление корреляции между вариациями и фенотипами для исследований с множественными маркерами — еще одна область, требующая интенсивных вычислений.

«Это высокосложная, многомерная задача — обрабатывать миллионы переменных и строить оптимальные математические модели. Мы тратим много времени на внедрение в модель анализов или прогнозов, которые снижают сложность проблемы», — говорит Анбупалам Таламуту, ведущий исследователь и статистик в GIS.

Таламуту разрабатывает модель для генетического анализа полиморфизмов заболеваний, включая различные инфекционные заболевания, рак молочной железы и лихорадку денге.

Моделирование вируса

В Институте инфокоммуникационных исследований A*STAR Виктор Тонг, помощник главы отдела, разрабатывает трехмерные (3D) модели иммунных клеток и вирусов, чтобы определить, какая область вируса с наибольшей вероятностью вызовет сильный иммунный ответ. Раньше исследователи использовали традиционные лабораторные методы для анализа тысяч или даже десятков тысяч различных комбинаций пептидных последовательностей. Но такой подход был неэффективен по стоимости и требовал много времени для точного определения специфических областей в белках патогенов, которые могут запускать эффективный иммунный ответ.

«Таким образом, вычислительный анализ может помочь ускорить исследования, — говорит Тонг, биохимик и компьютерный ученый. — Когда антигенный пептид запускает иммунный ответ, должно быть трехмерное соответствие между пептидом и сайтом связывания рецептора иммунной клетки хозяина. Следовательно, использование 3D-моделей важно для таких исследований», — добавляет он.

Недавние исследования Тонга включают анализ вируса чикунгунья, вновь возникающего тропического заболевания, вызывающего симптомы, подобные гриппу, в Сингапуре и других странах мира. Его команда построила модель и проанализировала, как патоген мутирует в разное время и в разных географических точках. Они обнаружили, что вирус накопил различные мутации в определенной области структурного белка. Тонг надеется, что его работа по моделированию вируса приведет к разработке новых типов вакцин, содержащих точные фрагменты вируса, вызывающие иммунный ответ. При использовании текущих технологий вакцины содержат случайно выбранные фрагменты вируса или весь ослабленный мертвый вирус.

Визуализация данных

Хотя компьютеры могут производить горы интересных данных, эти данные остаются бесполезными, пока биологи не смогут извлечь из них смысл. Здесь им нужна помощь компьютерных ученых.

«Биологи хотят выяснить, какие формы принимают клетки в ответ на лечение. Наша работа — визуализировать результаты анализа данных так, чтобы это было понятно биологам», — говорит Уильям Тджи, научный сотрудник Института высокопроизводительных вычислений (IHPC) A*STAR.

В сотрудничестве с биологом Фредериком Бардом из Института молекулярной и клеточной биологии A*STAR Тджи разрабатывает методологию преобразования миллионов оцифрованных изображений клеток в числовые значения или матрицы. Затем он проводит анализ, чтобы найти области, в которых один связный паттерн можно отделить от другого.

«На основе этого кластерного анализа биологи делают свою собственную интерпретацию», — говорит он.

Возможность получить первоначальное визуальное представление о данных помогает биологам планировать детальные эксперименты. Но в прошлом надежность визуальных подходов была непостоянной, потому что биологам приходилось вручную классифицировать клетки либо под микроскопом, либо с помощью инструмента, называемого классификатором. Такие методы сильно зависят от человеческого вмешательства при определении начальных определений интересных паттернов. Тджи пытается снизить уровень человеческого вмешательства в процесс создания данных, чтобы исследователи могли минимизировать субъективность.

Чтобы расширить подход кластерного анализа для полномасштабной работы, Тджи сотрудничает с Бардом и Риком Го, старшим научным сотрудником IHPC, над проектом по решению «проблемы миллионов клеток». На данный момент программное обеспечение Тджи способно анализировать 50 000 клеток, но команда пытается увеличить эту возможность до нескольких миллионов. Го в настоящее время оценивает виды методов и инструментов высокопроизводительных вычислений, необходимых для такой платформы, которая может включать гибридные архитектуры, такие как многоядерные системы, ускорители и графические процессоры.

Компьютерная ловушка

Новые инженерные решения, революционизировавшие биологические исследования, раскрыли ранее невообразимые аспекты биологии и опровергли множество биологических мифов. Однако такое технологическое развитие ушло так далеко вперед от информационной инфраструктуры, которая его поддерживает, что данные теперь накапливаются гораздо быстрее, чем их можно осмыслить или синтезировать. Как отмечает Митчелл, информационный аспект системы вычислительной поддержки становится узким местом.

Одна из проблем, с которой сталкиваются многие исследователи в этой области, — нехватка емкости хранилищ данных и памяти. Машины для высокопроизводительного анализа выдают терабайты данных каждый день, и многие биологи сочли бы немыслимым удалить какие-либо данные для экономии места.

«Наши терабайты памяти могут закончиться так легко», — говорит Го.

Большие объемы данных также влияют на мобильность данных.

«На наших серверах мы можем перемещать терабайты данных менее чем за несколько часов. Но перемещение данных из одной системы хранения в другую может занять дни или даже недели — и это время требуется еще до начала анализа», — добавляет Го.

Одной из потенциальных методик вместо перемещения данных является перемещение вычислительного кода и обработка данных на исходной системе, что устраняет время на передачу данных.

Быстрая смена поколений экспериментальных технологий также является постоянной головной болью.

«Мы тратим много времени на размышления о том, с какими приложениями и новыми технологиями работать и как мы можем анализировать данные, полученные с их помощью», — говорит Кларк.

Более того, поскольку исследователи все больше делятся данными внутри сообщества, стандартизация становится еще одной насущной проблемой, требующей серьезного обсуждения.

«Данные могут быть несогласованными и не интерпретируемыми с использованием других баз данных. Для биоинформатики нет контроля качества», — указывает Тонг.

Построение моста

Помимо аппаратных проблем, возможно, самой большой проблемой для вычислительной биологии является диалог между компьютерными учеными и биологами, говорят многие исследователи. При построении модели для анализа или прогнозов, или визуализации матричных данных, компьютерные ученые не всегда могут понять, что именно хотят узнать биологи.

«Если я просто возьму данные, предоставленные биологами, и помещу их в свой кластерный анализ, результаты будут плохими, — говорит Тджи. — Мне нужно понять, как данные генерируются их экспериментами. Мне нужно учитывать этот факт при включении данных в анализ, и тогда результаты, как правило, становятся лучше».

Тджи признает, что понимание таких разных дисциплин — далеко не простая задача, но короткого пути нет.

«Мы должны больше общаться с биологами. В такой проект нужно вкладывать больше времени, чтобы люди понимали друг друга».

Многие исследователи, занимающиеся вычислительной биологией, надеются найти человека, который понимает язык обеих сторон этого исследования. Митчелл, чья роль заключается в общении как с биологами, так и с компьютерными учеными, согласен, что самая большая проблема — это коммуникация. Но он более оптимистично смотрит в будущее.

«Молодые ученые и студенты чувствуют себя более комфортно с компьютерными методами, потому что компьютеры уже являются естественным продолжением их повседневной жизни. Для следующего поколения диалог между вычислительными и экспериментальными методами естественным образом станет рутиной. Мне придется искать другую работу».