Продвинутые ИИ-модели не всегда лучше простых в предсказании реакции на генетические возмущения
Исследователи из EPFL разработали инструмент Systema для оценки того, насколько хорошо ИИ-модели предсказывают эффекты генетических возмущений (намеренного изменения генов).
Понимание этих эффектов важно для изучения функций генов, клеточной инженерии и разработки новых методов лечения. Хотя в лаборатории можно протестировать множество возмущений, проверить все возможные комбинации невозможно.
ИИ даёт возможность использовать большие биологические наборы данных для предсказания эффектов от неизученных изменений генов. Но насколько эти модели эффективны?
Оценка моделей предсказания
Учёные из лаборатории Machine Learning for Biomedicine Laboratory (MLBio) EPFL вместе с международными коллегами протестировали лучшие ИИ-модели на данных десяти различных экспериментов, сравнив их с простыми статистическими подходами.
В исследовании, опубликованном в Nature Biotechnology, обнаружено неожиданное: простые подходы работали не хуже, а иногда и лучше продвинутых ИИ-моделей на многих наборах данных.
«Это заставило нас задуматься: действительно ли продвинутые модели понимают, что делают генетические изменения? Подходят ли стандартные метрики для их оценки?» — говорит руководитель лаборатории MLBio Мария Брбич.
Почему простые методы показали хороший результат?
Продвинутые модели могут казаться лучше, чем есть на самом деле, из-за систематических различий между обработанными и необработанными клетками. В таких случаях модели могут учиться не истинным эффектам генетических изменений, а лишь закономерностям, вызванным дизайном эксперимента или общими для почти всех изменений эффектами.
Также выяснилось, что распространённые способы проверки производительности моделей могут вводить в заблуждение, так как часто не учитывают эти систематические различия.
«Чтобы решить эту проблему, мы создали инструмент Systema. Он снижает влияние систематических смещений и фокусируется на уникальных эффектах каждого генетического возмущения. Systema также упрощает понимание того, что на самом деле делают эти возмущения», — пояснил первый автор статьи Рамон Виньяс Торне.
Предсказание сложнее, чем кажется
С помощью Systema исследователи обнаружили, что ИИ-моделям по-прежнему очень сложно предсказывать эффекты новых генетических изменений. Некоторые модели могли делать верные предположения, когда гены были частью одного биологического процесса, но в целом задача остаётся сложной.
Systema помогает отличить модели, которые лишь улавливают смещения, от тех, что действительно понимают, как генетические модификации влияют на клетки.
Учёные предлагают оценивать ИИ-модели на основе их биологической ценности — того, насколько хорошо их предсказания объясняют клеточные признаки.
«В перспективе более масштабные и разнообразные эксперименты помогут улучшить эти предсказания. Также новые технологии, изучающие клетки более детально (например, их форму или расположение), могут углубить наше понимание влияния генетических изменений на клетки и ткани», — заключила Брбич.
