Понимание внутренне неупорядоченных областей белков и их роли в раке

Исследователи из Школы инженерии Маккелви при Вашингтонском университете в Сент-Луисе разработали алгоритм для понимания того, как внутренне неупорядоченные области (IDR) белков могут быть организованы в отдельные функциональные классы. Этот инструмент может значительно улучшить понимание того, как распространяются некоторые виды рака.

Кирстен Рафф и Мэттью Кинг из лаборатории Рохита В. Паппу использовали ранее разработанный в их лаборатории алгоритм NARDINI+ для анализа аминокислотных последовательностей IDR белков. Цель — выявить и систематизировать так называемые молекулярные грамматики.

С помощью методов неконтролируемого машинного обучения, которые обнаруживают неслучайные паттерны использования аминокислот и их расположения вдоль линейных последовательностей, Рафф обнаружила, что грамматики естественных последовательностей попадают в конечное число кластеров, каждый со своим набором функций. Это привело к созданию ресурса, названного GIN (Grammars Inferred using NARDINI+). Результаты исследования опубликованы в журнале Cell.

Функции IDR и их изучение

IDR бросают вызов традиционным подходам, поскольку не имеют определённой трёхмерной структуры. Лаборатория Паппу изучает, как информация, закодированная в аминокислотных последовательностях IDR, определяет их функции. Работа показала, что IDR могут принимать определённые типы структур и выполнять функции, которыми управляют аминокислотный состав (алфавит) и линейное расположение пар аминокислот (синтаксис).

В 2022 году был представлен алгоритм NARDINI, который оценивает, являются ли различные синтаксисы в последовательности IDR неслучайными. Было показано, что ключевые бинарные паттерны неслучайны, а IDR, связанные со схожими функциями, имеют схожие неслучайные бинарные паттерны.

Расширение алгоритма и его применение

Рафф разработала NARDINI+ в рамках сотрудничества с лабораторией Сигалль Кадоч из Института рака Дана-Фарбер и Гарвардской медицинской школы. Алгоритм был применён для анализа всех IDR в человеческом протеоме.

Анализ выявил конечное число грамматик — кластеров GIN. Было показано, что определённые кластеры GIN связаны с предпочтениями в локализации белков внутри клетки. Они также помогают объяснить функциональную организацию на молекулярном уровне и временной порядок ключевых процессов, таких как производство рибосом.

Сотрудничество с лабораторией Кадоч позволило получить доступ к масштабным данным Broad Institute. Анализ показал, что ранее выявленные корреляции между парами генов в раковых клетках можно объяснить как корреляции между грамматиками IDR.

Тестирование и значение для онкологии

Кинг проверил точность выводов GIN относительно предпочтений локализации, определяемых грамматиками IDR. «Наличие IDR с определённой грамматикой, по-видимому, является ключевым, хотя и не единственным, фактором предпочтительной субклеточной локализации белка», — отметил он.

«Важное открытие, сделанное благодаря созданию GIN, — это понимание, что генные транслокации, вызывающие определённые виды рака у человека, являются результатом нарушения грамматик IDR мутациями», — сказала Рафф. «Прогноз заключается в том, что эти изменённые грамматики приводят к перестройке конкретных сетей взаимодействия, которые мы теперь можем идентифицировать, что активирует программы клеточной пролиферации».

По словам Паппу, GIN станет полезным ресурсом для новых исследований IDR и потенциально позволит конструировать синтетические IDR для выполнения специфических функций. В настоящее время лаборатории Паппу и Кадоч совместно работают над исследованиями, чтобы понять, как изменённые грамматики IDR запускают программы пролиферации при раковых заболеваниях человека.