Источник фото: ru.123rf.com

Исследование ученых из России, Канады, Швейцарии, США и Германии существенно дополняет карту управления генами человека и поможет точнее оценивать, как генетические мутации приводят к заболеваниям. Результаты опубликованы в журнале Nature.

Ученые международного проекта Codebook/GRECO-BIT в области вычислительной и статистической геномики установили, какие последовательности ДНК узнают малоизученные регуляторные белки человека. Специфичность 332 таких белков определяли пятью независимыми методами, работающими и в пробирке, и в живых клетках, а каждую построенную модель связывания проверяли на данных, полученных другими методами для того же белка. Надежные мотивы удалось описать для 177 белков, причем для большинства из них мотива до сих пор не было известно вовсе; общее число транскрипционных факторов человека с охарактеризованной специфичностью превысило 1400. Полученный каталог позволяет предсказывать, с какими участками генома связывается тот или иной регуляторный белок и как на это связывание влияют отдельные мутации. 

Codebook/GRECO-BIT — это масштабная международная коллаборация в области биоинформатики и молекулярной биологии, направленная на изучение специфичности связывания транскрипционных факторов (TF) с ДНК. Проект собирает экспериментальные данные и разрабатывает компьютерные методы, чтобы понять, какие именно участки ДНК распознает каждый такой белок. Это помогает лучше понимать работу генов, исследовать причины наследственных заболеваний, разрабатывать новые методы диагностики и лечения.

 

Четверть регуляторных белков ранее не имела описанного мотива связывания

В ДНК человека записана огромная «инструкция» по работе организма, но далеко не все гены работают одновременно. За их включение и выключение отвечают специальные белки – транскрипционные факторы. Они находят в ДНК определенные участки, как будто распознают кодовые слова в длинном тексте, и после этого запускают или останавливают работу соседних генов. Эти «кодовые слова» называют мотивами связывания.

Согласно каталогу транскрипционных факторов человека, составленному в 2018 году, порядка четверти из примерно 1600 предполагаемых регуляторных белков человека не имели ни надежно установленного мотива связывания, ни сколько-нибудь масштабных данных о связывании с ДНК. Большинство таких недоизученных факторов не родственны хорошо изученным белкам, поэтому восстановить их специфичность по гомологии было невозможно. Неизвестным оставалось и то, обладают ли эти белки мотивами связывания в принципе. 

Консорциум Codebook поставил себе целью восполнить этот пробел. Специфичность определяли для 393 белков: 332 из них — не полностью изученные предполагаемые транскрипционные факторы человека, еще 61 вошел в контрольную выборку. Каждый белок исследовали пятью экспериментальными методами — как полностью «пробирочными», так и позволяющими увидеть работу белка в живой клетке. Всего работа заняла почти восемь лет и потребовала более 4000 экспериментов.

Полученные данные позволят точнее понимать, как работают гены, а в будущем — лучше объяснять, почему некоторые изменения в ДНК могут влиять на здоровье человека. Например, если в геноме возникает мутация, можно будет оценить, не мешает ли она важному белку правильно найти свой участок ДНК и выполнить свою функцию.

«Ценность проведенных опытов не только в покрытии множества малоисследованных факторов транскрипции, но и в их систематичности. Геномные паттерны связывания регуляторного белка могут очень сильно отличаться от связывания с искусственными последовательностями. Эти данные — один из немногих наборов, которые позволяют создавать универсальные модели связывания, в том числе модели искусственного интеллекта, способные к качественному и оцениваемому переносу знаний между разными модальностями», – рассказывает Арсений Зинкевич, куратор магистерской программы «Применение машинного обучения в биологии», старший преподаватель факультета биоинженерии и биоинформатики МГУ, член группы GRECO-BIT.

 

Как из сотен моделей выбирали одну

Прежде чем применять модель связывания, нужно решить, какую именно из множества возможных считать правильной. Для каждого эксперимента разные алгоритмы поиска мотивов строят разные модели, а для белка, специфичность которого никогда не описывали, сверить результат не с чем. Главным критерием становится переносимость: модель, выведенная из одного эксперимента, должна предсказывать данные другого эксперимента, поставленного иным методом. 

Модели, построенные десятью разными программами, тестировали на всех остальных экспериментах для того же белка, а результаты сопоставления собрали в открытый каталог Codebook Motif Explorer. Каждый эксперимент дополнительно оценивали не менее трех независимых экспертов из числа членов консорциума. Побочным результатом сравнения стало наблюдение, расходящееся с распространенными ожиданиями: «четкость» мотива, которую формально измеряют его информационным содержанием по Шеннону, не связана с точностью предсказания участков связывания. Многие «нечеткие» модели, в которых ни одна позиция не требует строго определенного нуклеотида, описывали связывание не хуже прочих и воспроизводились сразу на нескольких экспериментальных платформах. 

«Codebook Motif Explorer – это наглядный пример важности и ценности данной работы, – уточняет Иван Козин, соавтор работы, студент второго курса магистратуры по применению машинного обучения в биологии факультета биоинженерии и биоинформатики МГУ. – Эта работа ценна не только тем, что закрывает множество пробелов в наших знаниях о специфичности связывания транскрипционных факторов. Полученные данные и результаты уже становятся основой для новых исследований и инструментов».

 

От мотивов к интерпретации генетических вариантов

Проверенные модели связывания позволяют перейти к практической задаче: понять, как однобуквенные замены влияют на работу генов.

Оценить это удалось напрямую по экспериментальным данным проекта. Клетки, на которых ставили опыты, несут по две копии каждой хромосомы, и в части положений генома эти копии различаются: в одной стоит исходный вариант, в другой — вариант с заменой. Эксперимент показывает, какие именно фрагменты ДНК связал белок, поэтому достаточно посмотреть, фрагменты с каким вариантом попадаются в прочтениях чаще. Если замена на связывание не влияет, оба варианта встретятся примерно поровну; заметный перекос означает, что она связыванию мешает или, наоборот, помогает. Такое неравенство называют аллель-специфичным связыванием.

Перекос обнаружили в 10 тыс. участков генома, а всего набралось 12 тыс. случаев, поскольку одно и то же положение может влиять на связывание сразу нескольких проверенных белков. В трех случаях из четырех тот же эффект успешно предсказывался: модель связывания указывала на тот вариант, который белок действительно предпочитал.

«Про многие замены в некодирующей части генома до сих пор известно только то, что они статистически связаны с каким-то признаком или заболеванием, но непонятны причины этой связи, — говорит Владимир Ноздрин, соавтор работы, аспирант и преподаватель факультета биоинженерии и биоинформатики МГУ. — Теперь же мы можем объяснить и их механизм для тех белков, по которым ранее не было таких данных».

 

Российская команда в проекте

Анализ мотивов осуществляла большая команда под руководством Ивана Кулаковского (Институт белка РАН) и Всеволода Макеева (Институт общей генетики имени Н.И. Вавилова РАН), а платформу для анализа геномных данных предоставила группа Федора Колпакова (Университет «Сириус»). В работе с российской стороны также участвовали сотрудники Института биохимии и генетики УФИЦ РАН и компании «Биософт».

На российской стороне был выполнен поиск мотивов по первичным данным, их кросс-платформенное сопоставление, создание сервиса для экспертной оценки экспериментов и каталога Codebook Motif Explorer, анализ аллель-специфичного связывания и активности мотивов в тканях и клеточных линиях, а также организация соревнования IBIS Challenge, которое успешно завершилось в 2025 году. Статья по его результатам готовится к публикации.

«Все модели связывания, исходные данные и результаты сопоставлений выложены в открытый доступ, поэтому их уже сейчас можно применять для аннотации регуляторных участков и оценки эффекта генетических вариантов. Консорциум провел предварительный анализ белков, которые не дали мотива: часть из них, вероятно, требует партнеров по связыванию или модифицированной ДНК, а часть, скорее всего, вовсе не связывает ДНК специфично», – рассказывает Иван Кулаковский, доктор биологических наук, профессор учебного центра молекулярной биологии ИБ РАН (Пущино).

 

Полученные данные и ресурсы

Библиотека полученных и проверенных мотивов доступна в каталоге Codebook Motif Explorer, репозитории Zenodo, в сборке 3.1 базы данных CisBP, и в составе 14-й версии коллекции HOCOMOCO, разработанной российским коллективом. Подготовленные наборы данных и протоколы проверки моделей выложены на площадке соревнования IBIS. Сведения по каждому изученному белку собраны на портале проекта Codebook, первичные данные секвенирования депонированы в базах SRA, ArrayExpress и GEO, а программы для анализа аллель-специфичного связывания и активности мотивов доступны на GitHub.

 

Информация предоставлена пресс-службой МГУ

Источник фото: ru.123rf.com