Как большие данные меняют науку
Биология переживает революцию, вызванную лавиной данных от новых методов, особенно секвенирования нового поколения. Если проект «Геном человека» (завершен в 2003 г.) занял 13 лет и стоил >£2 млрд, то сегодня полный геном можно секвенировать за 24 часа примерно за £1000.
Это изменило не только методы, но и сам научный процесс.
От гипотез к данным
Раньше наука была гипотез-ориентированной: идея → эксперимент → проверка. Теперь часто собирают огромные массивы данных (например, 10 000 геномов больных и здоровых), а алгоритмы находят в них закономерности и формируют гипотезы. Такой подход называется полногеномный поиск ассоциаций (GWAS).
Алгоритмы как новый инструмент
Современному биологу необходимо быть статистиком или программистом. Алгоритмы сравнивают сотни параметров одновременно, подобно тому как поисковый алгоритм Google ранжирует миллиарды веб-страниц.
Пример из онкологии: Команда Морица Герстунга секвенировала геномы рака 1500 пациентов с лейкемией, выявила 5000 мутаций и около 1000 их комбинаций. Это позволило разделить болезнь на 11 категорий риска и точнее назначать тяжелое лечение (трансплантацию костного мозга).
Секвенирование опухолей изменило взгляд на рак:
- Опухоль — не просто масса одинаковых клеток, а сообщество десятков клонов с разными мутациями.
- Рак теперь классифицируют не только по органу (рак легкого), но и по генетическому профилю. Опухоли в разных органах могут быть генетически ближе друг к другу, чем к опухолям в том же органе. Например, ген BRCA1 (связанный с раком груди) находят и при раке простаты.
- FDA уже одобрило препарат пембролизумаб для лечения любой опухоли с конкретным генетическим дефектом (нестабильностью микросателлитов), а не по локализации.
Кризис и перестройка навыков
Объемы данных растут быстрее, чем по закону Мура. Ученые столкнулись с «бутылочным горлышком»: данных много, но их некому анализировать.
- Старшие ученые, выросшие в «мокрых лабораториях», вынуждены полагаться на младших коллег в вопросах биоинформатики. Их навыки устарели за 10–15 лет.
- Молодые ученые осваивают программирование и статистику как новый язык.
- Университеты медленно адаптируют программы, добавляя биоинформатические модули, но студенты не всегда готовы к этому.
Даже самые ориентированные на эксперимент ученые теперь тратят на «мокрую» работу менее 50% времени, а некоторые — всего 10% или даже 0%.
Новые открытия, невозможные ранее
1. 3D-геномика (Стефан Шенфельдер)
Хромосомы в ядре образуют сложные трехмерные структуры. Удаленные участки ДНК могут физически сближаться и регулировать работу генов. Эта конформация уникальна для каждого типа клеток (T-лимфоцита, печеночной, мозговой). Алгоритмы, анализируя миллиарды точек данных, помогают построить 3D-модели хромосом и понять, как возникают 200 типов клеток человека.
2. Рассеянный склероз (Гил МакВиэн)
GWAS выявили >250 участков генома, связанных с риском рассеянного склероза (РС). Обнаружено генетическое перекрытие с ревматоидным артритом: некоторые гены, повышающие риск РС, снижают риск артрита. Это подтвердило аутоиммунную природу РС (хотя он проявляется как нейродегенеративное заболевание) и привело к новым терапевтическим программам.
3. Эпигенетические часы старения (Вольф Райк)
В клетках существует «часы старения» на основе метилирования ДНК (присоединения метильных групп к цитозину C). Алгоритм, подсчитывая эти изменения, может предсказать возраст человека с точностью до 3 лет. Это самый точный биомаркер старения, и в будущем могут появиться препараты, способные замедлить эти часы.
Заключение
Переход к науке, управляемой данными, может казаться дезориентирующим. Однако он вернул оптимизм в геномику. Теперь ученые могут задавать вопросы, которые 10 лет назад были недоступны.
«Когда я ставлю эксперимент, я получаю обратно 100–200 миллионов точек данных, — говорит Шенфельдер. — 10 лет назад такие вопросы были полностью за пределами возможного. Это необыкновенная революция».
