Методы глубинного обучения для предсказания Z-ДНК на основе омиксных данных тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Бекназаров Назар Сохибжонович

  • Бекназаров Назар Сохибжонович
  • кандидат науккандидат наук
  • 2026, «Национальный исследовательский университет «Высшая школа экономики»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 97
Бекназаров Назар Сохибжонович. Методы глубинного обучения для предсказания Z-ДНК на основе омиксных данных: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет «Высшая школа экономики». 2026. 97 с.

Оглавление диссертации кандидат наук Бекназаров Назар Сохибжонович

ВВЕДЕНИЕ

Глава 1. Литературный обзор

1.1 Структурная организация и биологическая роль Z-ДНК в геноме

1.2 Термодинамические подходы к предсказанию Z-ДНК

1.3 Ограничения подходов предсказания Z-ДНК на основе последовательности

1.4 Развитие архитектур глубокого обучения в геномике

1.4.1 DeepBind

1.4.2 DeepSEA

1.4.3 DanQ

1.4.4 DeepHistone

1.4.5 SpliceRover

1.5 Интеграция омиксных данных в геномном моделировании

1.6 Геномные языковые модели

1.6.1 Теоретические основы геномных языковых моделей

1.6.2 DNABERT

1.6.3 DNABERT-2

Глава 2. Разработка подхода по предсказанию Z-ДНК на

основе омиксных данных

2.1 Переход от задачи классификации к задаче сегментации

2.2 Решение проблемы целевой утечки

2.3 Интеграция мультиомиксных данных в расширенное пространство признаков

2.4 Подход DeepZ

2.4.1 Предобработка геномных и омиксных данных

2.4.2 Разработка эффективной структуры хранения данных

2.4.3 Обоснование выбора архитектуры нейронных сетей

2.4.4 Экспериментальный отбор высокопроизводительной архитектуры

2.4.5 Параметры обучения

2.5 Применение DeepZ для предсказания регионов Z-ДНК de-novo

2.6 Применение метода регуляризации для интерпретации модели DeepZ

2.7 Сравнение DeepZ и Z-Hunt

2.8 Валидация полногеномных предсказаний DeepZ

2.9 Обсуждение результатов

Глава 3. Применение подхода DeepZ к геному мыши

3.1 Кураксин и запуск Z-ДНК-опосредованного некроптоза

3.2 Экспериментальные данные по Z-ДНК в геноме мыши после воздействия кураксином

3.3 Адаптация подхода DeepZ к геному мыши

3.4 Применение метода регуляризации для интерпретации модели DeepZ

3.5 Полногеномное предсказание регионов Z-ДНК моделью DeepZ

для генома мыши

3.6 Обсуждение результатов

Глава 4. Обобщение подхода DeepZ с объединением

признакового пространства для геномов человека и мыши

4.1 Подготовка общих мультиомиксных данных для генома

человека и мыши

4.2 Обучение моделей DeepZ на общих омиксных признаках для генома человека и мыши

4.3 Полногеномная аннотация Z-ДНК регионов в геномах человека и мыши моделями DeepZ на основе общего набора омикс-признаков

4.4 Оценка важности групп признаков методом абляции

4.5 Обогащение Z-флипонов в консервативных регионах геномов человека и мыши

4.6 UMAP кластеризация консервативных Z-флипонов на основе омикс-векторов

4.6.1 Распределение Z-флипонов по геномным регионам

4.6.2 Функциональные кластеры Z-флипонов на основе омиксных признаков

4.7 Ассоциация Z-флипонов с повышенной скоростью реинициации транскрипции

4.8 Обсуждение результатов

Глава 5. Сравнение подхода DeepZ с моделями на основе

трансформеров

5.1 Модель Z-DNABERT

5.2 Сравнительный анализ Z-DNABERT и DeepZ

5.2.1 Сравнение DeepZ и Z-DNABERT в пространстве

омиксных векторов

5.2.2 Комплиментарность подхода DeepZ и Z-DNABERT

5.3 Обсуждение результатов

ЗАКЛЮЧЕНИЕ

ВЫВОДЫ

БЛАГОДАРНОСТИ

Словарь терминов

Список литературы

ВВЕДЕНИЕ

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Методы глубинного обучения для предсказания Z-ДНК на основе омиксных данных»

Актуальность исследования

Открытие стандартной правозакрученной формы B-ДНК [1] стало важнейшей вехой в молекулярной биологии, заложившей основу для последующих открытий различных конформаций ДНК, включая A-ДНК [2], левозакручен-ную Z-ДНК [3], триплексы [4], квадруплексы [5] и крестообразные структуры [6]. Z-ДНК была обнаружена при рентгеноструктурном анализе кристаллического фрагмента ДНК [3], и, в отличие от канонической правосторонней B-ДНК, отличается уникальным зигзагообразным остовом и чередованием syn- и anti-syn конформаций нуклеотидов [7].

Многочисленные исследования последних десятилетий выявили фундаментальную роль Z-ДНК в регуляции различных биологических процессов [8; 9]. Сайты, способные к образованию Z-конформации, или Z-флипоны, обнаружены у широкого круга организмов — от вирусов до млекопитающих [9; 10], что свидетельствует об их древнем происхождении и эволюционной консервативности, а значит, и о фундаментальной биологической значимости этих структур [11]. Установлено, что формирование Z-ДНК в промоторных областях генов может влиять на регуляцию транскрипции, тем самым модифицируя экспрессию генов, связанных с прогрессированием раковой опухоли и иммунными реакциями [12—15]. Кроме того, было показано, что Z-ДНК способствует гомологичной рекомбинации, повышая частоту соответствующих событий [16].

Несмотря на накопление экспериментальных данных, картирование Z-ДНК в геноме по-прежнему остаётся нетривиальной задачей из-за высокой динамичности этой конформации и ограничений прямых методов детекции in vivo [17]. Классические подходы, основанные на нуклеотидной последовательности и термодинамическом моделировании перехода B в Z (например, Z-Hunt), демонстрируют значительное расхождение между предсказанным потенциалом к образованию Z-ДНК и реально наблюдаемыми участками in vivo [18; 19], поскольку не учитывают эпигенетическое состояние, топологию хроматина и белковые взаимодействия [17]. Это приводит к систематическому завышению числа потенциальных Z-участков и ограничивает применение таких моделей для функциональной интерпретации экспериментальных данных [20].

Появление и развитие ChIP-seq технологий, специально ориентированных на картирование Z-ДНК с использованием антител к Z-конформации, создало основу для построения моделей машинного обучения, предназначенных для последующего полногеномного картирования Z-флипонов. Самый первый ChIP-seq эксперимент по определению Z-ДНК в геноме человека - датасет Shin et al. [21] - содержал всего около 400 регионов Z-ДНК, что является сильно заниженным количеством функциональных регионов Z-ДНК в клетке. Заниженное число детектируемых флипонов в клетке объясняется тем, что любой эксперимент может детектировать только доступные в данный момент в клетке активные структурные элементы, которые образовались в ответ на внутренний или внешний сигналы. И актуальной является задача восстановления полной карты функциональных флипонов по ограниченной экспериментальной выборке.

Второй экспериментальный набор данных, доступный на момент исследования - датасет Kouzine et al. [17] - получен методом Sl/перманганантного футпринтинга, при котором нуклеаза S1 используется для картирования участков ДНК с локально расплетённой двуцепочечной структурой на временных шкалах от секунд до минут. В основе подхода лежит селективное модифицирование неспаренных тиминов перманганатом с последующим расщеплением нуклеазой S1 и высокопроизводительным секвенированием, что позволяет с высоким разрешением выявлять регионы трансляционной активности, склонные к переходу в неканонические состояния, включая Z-конформацию. В работе Kouzine et al. [17] было показано, что такие сигналы локализуются преимущественно в активно транскрибируемых промоторах и регуляторных областях, где отрицательная суперспирализация и транскрипционная динамика создают условия для транзинтного образования Z-ДНК [17], тем самым предоставляя независимый экспериментальный критерий для идентификации Z-флипонов в геноме. На момент начала настоящего исследования наборы данных Shin et al. [21] и Kouzine et al. [17] были единственными экспериментальными полногеномными данными по картированию Z-ДНК на уровне всего генома.

Первые полногеномные модели предсказания Z-ДНК пытались определить характерные ДНК-паттерны данной конформации, как то чередование пуринов и пиримидинов или динуклеотидный состав [22; 23]. Первые модели машинного обучения опирались преимущественно на композиционный нуклеотид-

ный состав ДНК при оценке потенциала региона к переходу в Z-конформацию [24; 25]. Все эти ранние подходы не продемонстрировали достаточной точности.

Параллельно бурное развитие высокопроизводительных омиксных технологий (ОЫЕ-ввд, DNase-seq, ATAC-seq и других) привело к накоплению экспериментальных данных по полногеномному картированию гистоновых меток, профилей доступности хроматина, сайтов связывания транскрипционных факторов и хроматиновых ремоделлеров, отражающих функциональное состояние генома в различных типах клеток [26; 27]. В связи с этим возникла методологически важная задача интеграции разнородных омиксных данных с первичной последовательностью ДНК для более точного предсказания функциональных элементов генома, включая регионы Z-ДНК. Данная задача выходит за рамки возможностей традиционных термодинамических моделей [18]. Поэтому актуальной становится разработка подхода, основанного на интеграции широкого спектра омиксных данных. Такой подход должен позволять приближённо реконструировать распределение функциональных Z-флипонов в масштабе всего генома. На момент проведения исследования данная задача оставалась нерешённой.

Кроме того, актуальна задача определения наиболее значимых омиксных признаков, связанных с образованием Z-ДНК регионов, что позволит более четко определить функциональные классы. Решение этой задачи может быть достигнуто за счёт применения методов анализа важности признаков в моделях глубокого обучения [20; 28].

Основные положения, выносимые на защиту:

1. Разработан подход DeepZ на основе методов глубокого обучения, который агрегирует мультимодальные данные о последовательности ДНК, структурных характеристиках энергии перехода динуклеотидов из Б- в Z-конформацию, и десятков тысяч полногеномных омиксных экспериментов для предсказания функциональных регионов Z-ДНК на уровне всего генома. Разработанный подход повысил точность предсказания участков Z-ДНК по сравнению с моделью Z-Hunt, основанной на термодинамическом подходе.

2. Разработанный подход DeepZ был применен для генерации полногеномных карт участков Z-ДНК на экспериментальных данных CЫP-seq

Shin et al. [21] для генома человека и экспериментальных данных ChIP-seq Zhang et al. [15] по образованию Z-ДНК после воздействия курак-сина для генома мыши.

3. Разработанный подход DeepZ с использованием одинакового набора омиксных данных был применен для определения консервативных участков Z-ДНК в геноме человека и мыши, в результате чего было определено множество консервативных функциональных Z-флипонов.

4. Был произведен UMAP анализ регионов Z-ДНК как векторов в многомерном пространстве омиксных признаков и определены общие функциональные кластера консервативных Z-флипонов в геномах человека и мыши.

5. Была продемонстрирована комплиментарность подходов DeepZ и трансформерной модели Z-DNABERT, при которой более высокая точность Z-DNABERT дополняется функциональной значимостью омиксных признаков DeepZ.

6. С помощью разработанного подхода DeepZ были сгенерированы новые полногеномные карты регионов Z-ДНК для человека и мыши.

Научная новизна исследования

1. Впервые разработан подход DeepZ на основе моделей глубокого обучения, интегрирующий данные о последовательности ДНК и омиксные признаки для предсказания функциональных регионов Z-ДНК.

2. Впервые применена новая стратегия разбиения данных, эффективно предотвращающая утечку целевых данных.

3. Впервые создан специализированный формат хранения данных для эффективной работы с разреженными омиксными сигналами, обеспечивающий компрессию до 10-4 от исходного объёма.

4. Впервые выполнена кросс-видовая валидация модели на геномах человека и мыши с использованием общего набора омиксных признаков.

5. Впервые была разработана методика анализа функциональных Z-фли-понов как векторов в многомерном пространстве омиксных данных.

6. Впервые было показана ассоциация консервативных регионов Z-ДНК с повышенной скоростью инициации транскрипции.

Научная и практическая значимость

Научная и практическая значимость результатов исследования заключается в создании новых инструментов для функциональной геномики. Предложенный метод DeepZ повышает точность предсказания Z-ДНК благодаря интеграции мультиомиксных данных, преодолевая ограничения моделей, основанных исключительно на первичной последовательности, и учитывая эпигенетический контекст клетки. Созданные полногеномные карты Z-флипонов представляют собой новый ресурс для анализа их распределения и функциональных взаимосвязей в геномах человека и мыши. Результаты кросс-видовой валидации подтверждают консервативность выявленных паттернов, углубляя понимание эволюционной роли Z-ДНК в регуляции транскрипции.

Метод DeepZ позволяет проводить систематическую аннотацию Z-ДНК в геномах различных представителей дерева жизни. Созданные полногеномные карты Z-флипонов представляют открытый ресурс для изучения онкогенеза, иммунотерапии и некроптоза, поскольку Z-ДНК считается потенциальной терапевтической мишенью при этих процессах. Благодаря эффективному формату хранения разреженных омиксных данных, предложенный подход является масштабируемым и применим в рамках крупных геномных проектов.

Степень достоверности

Достоверность и надёжность представленных в диссертации научных результатов достигается за счёт комплексного применения современных статистических и экспериментальных методов контроля качества, которые минимизируют влияние случайных артефактов и обеспечивают высокую воспроизводимость выводов. В частности, для оценки обобщающей способности модели DeepZ использована кросс-валидация на независимых подвыборках данных, разделённых по хромосомам и без учёта информации о целевых метках при формировании обучающих множеств, что полностью исключает целевую утечку и гарантирует объективность метрик производительности, таких как ИОС АиС и П-метрику. Кроме того, все ключевые предсказания полногеномных карт Z-ДНК подвергнуты строгому сопоставлению с экспериментальными дан-

ными высокого разрешения, полученными методами ChIP-seq (включая наборы данных Shin et al. [21] и наборы данных по образованию Z-ДНК после воздействия кураксином Zhang et al. [15]), что демонстрирует высокую корреляцию между вычислительными прогнозами и наблюдаемыми регионами Z-ДНК in vivo. Наконец, воспроизводимость результатов подтверждена путём повторного обучения и тестирования моделей на геномах человека и мыши с использованием унифицированного признакового пространства, а также статистическим анализом (например, QQ-плотами и корреляциями весов признаков).

Личный вклад.

Все результаты были получены лично автором настоящего исследования либо при его непосредственном участии. Весь процесс разработки кода, сбора и подготовки данных, создания и валидации модели, а также визуализация данных и написание рукописи представляет собой личный вклад автора в данное исследование. Идея исследования и концептуальная основа данной диссертации были разработаны совместно с научным руководителем. Обсуждение и интерпретация результатов, а также подготовка публикаций и тезисов конференций осуществлялись автором совместно с научным руководителем и соавторами.

Апробация работы.

Результаты исследования были представлены на международных и российских конференциях в виде устных и стендовых докладов:

— Maria Poptsova, Dmitry Umerenkov, Nazar Beknazarov, Alexander Fedorov, Fedor Pavlov, Dmitry Konovalov, Anna Danilova, Vladimir Kokh, Alan Herbert. Regulatory potential of flipons revealed by deep learning. Proceedings of 11th Moscow Conference on Computational Molecular Biology MCCMB'23, Moscow, August 3-6, 2023.

— Beknazarov, N., Jin, S., & Poptsova, M. Deep Learning Approach to Recognize Genome Functional Elements Using Diverse Genomic Data. In: Proceedings of the Conference on Modeling and Analysis of Complex Systems and Processes (MACSPro 2020), October 22-24, 2020, Venice, Italy & Moscow, Russia.

— Beknazarov, N. Optimizing Computational Infrastructure for LLMs in Bioinformatics: A Case Study. Proceedings of International Conference "Parallel Computing Technologies 2025" (PCT'2025), April 8-10, 2025, Moscow, Russia.

Патенты связанные с работой.

По теме диссертации получены свидетельства о государственной регистрации программ для ЭВМ:

1. Poptsova, M. S., Beknazarov, N. S. Pipeline for training and launching a deep learning model for predicting Z-DNA regions. Certificate of state registration of a computer program No. 2025617502. Russian Federation. Date of state registration: March 26, 2025.

2. Poptsova, M. S., Fedorov, A. N., Voyteckiy, A. A., Latyshev, P. V., Pavlov, F. I., Borovkov, P. V., Borevskiy, A. O., Danilova, A. V., Konovalov, D. L., Mal'kov, V. V., Beknazarov, N. S. Unified library of software and analytical tools (framework) designed for predicting the location of genomic functional elements using deep learning methods based on molecular biology omics data. Certificate of state registration of a computer program No. 2023668972. Russian Federation. Date of state registration: September 6, 2023.

Список публикаций по теме диссертации.

По теме диссертации опубликованно 5 статей, индексируемых в базах данных WoS, Scopus и РИНЦ, в том числе 4 в журналах 1-го квартиля, включенных в Белый список научных журналов Минобрнауки России:

1. Beknazarov, N., Jin, S. Poptsova, M. Deep learning approach for predicting functional Z-DNA regions using omics data. Sci Rep 10, 19134 (2020). https://doi.org/10.1038/s41598-020-76203-1.

2. Zhang T, Yin C, Fedorov A, Qiao L, Bao H, Beknazarov N, Wang S, Gautam A, Williams RM, Crawford JC, Peri S, Studitsky V, Beg AA, Thomas PG, Walkley C, Xu Y, Poptsova M, Herbert A, Balachandran S. ADAR1 masks the cancer immunotherapeutic promise of ZBP1-driven necroptosis. Nature. 2022 Jun;606(7914):594-602. doi:10.1038/s41586-022-04753-7.

3. Beknazarov N, Konovalov D, Herbert A, Poptsova M. Z-DNA formation in promoters conserved between human and mouse are associated with

increased transcription reinitiation rates. Sci Rep. 2024 Aug 1;14(1):17786. doi: 10.1038/s41598-024-68439-y.

4. Umerenkov D, Herbert A, Konovalov D, Danilova A, Beknazarov N, Kokh V, Fedorov A, Poptsova M. Z-flipon variants reveal the many roles of Z-DNA and Z-RNA in health and disease. Life Sci Alliance. 2023 May 10;6(7):e202301962. doi: 10.26508/lsa.202301962

5. Beknazarov N, Poptsova M. DeepZ: A Deep Learning Approach for Z-DNA Prediction. Methods Mol Biol. 2023;2651:217-226. doi:10.1007/978-1-0716-3084-6_15.

Объем и структура работы. Диссертация состоит из введения, пяти глав, заключения. Полный объём диссертации составляет 97 страниц с 21 рисунком и 5 таблицами. Список литературы содержит 85 наименований.

Глава 1. Литературный обзор

1.1 Структурная организация и биологическая роль Z-ДНК в

геноме

Открытие двойной спирали ДНК Уотсоном и Криком в 1953 году стало фундаментальной вехой в молекулярной биологии, определив центральную догму молекулярной биологии [1]. На протяжении последующих десятилетий именно правозакрученная каноническая Б-форма ДНК рассматривалась как универсальная и единственно биологически значимая конформация для хранения генетической информации. Однако по мере развития структурных методов, в первую очередь рентгеноструктурного анализа, стало очевидно, что ДНК способна существовать в альтернативных конформациях. Данные наблюдения позволили установить, что ДНК не является статичной молекулой, а представляет собой динамичный биополимер, находящийся в динамическом равновесии между несколькими структурными состояниями [2; 29].

В ходе дальнейших исследований были идентифицированы различные неканонические формы ДНК, существенно расширившие понимание полиморфизма нуклеиновых кислот. К ним относятся А-форма, стабилизирующаяся в условиях обезвоживания и характеризующаяся укороченным и более широким витком по сравнению с Б-ДНК [2]; триплексы (Н-ДНК), формирующиеся в пу-рин-пиримидиновых последовательностях при низком pH или повышенной отрицательной суперспирализации [4]; а также С-квадруплексы (С4-структуры), возникающие в гуанин-обогащённых мотивах (С-трактах) благодаря стэкинг-взаимодействию тетраэдрических планок гуанина [5; 30]. Особенно значимым стало открытие левозакрученной Z-ДНК, которое существенно расширило представления о возможных состояниях двойной спирали [3]. Это открытие ознаменовало переход от представления о единой канонической Б-форме к концепции динамического спектра ДНК-конформаций, каждая из которых может выполнять специфические функции в клетке [8].

Таким образом, в современной трактовке ДНК понимается не только как носитель генетической информации, но и как динамичная структура, способная

участвовать в регуляции собственных биологических функций. Это признание структурной пластичности ДНК создало теоретические предпосылки для изучения её альтернативных форм, среди которых Z-ДНК занимает особое место как конформация, обладающая уникальными физико-химическими свойствами и предполагаемой регуляторной активностью.

Z-ДНК, как было отмечено выше, представляет собой левозакрученную двойную ДНК спираль, противоположную по хиральности классической Б-фор-ме. Фосфатный остов этой структуры образует характерную зигзагообразную траекторию, что и послужило основанием для её обозначения буквой <^» [3]. Долгое время оставался неясным вопрос о том, насколько энергетически возможна и стабильна данная конформация, поскольку она казалась термодинамически неблагоприятной. Впоследствии было показано, что на уровне нук-леотидов Z-ДНК достаточно стабильна и стабилизируется чередованием бцп-и аиИ-конформаций гликозидных связей, соединяющих основания с дезоксири-бозой, что резко отличает её от однородной anti-конформации в канонической форме [3; 8].

Ранние биофизические эксперименты над простыми полимерами ДНК продемонстрировали, что Z-форма характерна не для любой последовательности ДНК, а преимущественно образуется в последовательностях с чередующимися пуринами и пиримидинами, например в поли^С^С) участках [8; 31]. Однако дальнейшие исследования показали, что образование Z-ДНК возможно и в более сложных последовательностях, если присутствуют подходящие структурные условия или механические стимулы, такие как отрицательная супер-спирализация [32]. Таким образом, способность к образованию Z-конформации определяется не только первичной структурой, но и физическим контекстом молекулы.

Впоследствии выяснилось, что Z-ДНК представляет собой не просто структурную аномалию, но динамический регуляторный элемент, участвующий в контроле ключевых клеточных процессов. Её образование в промоторных регионах генов изменяет локальную топологию ДНК и модулирует доступность сайтов связывания транскрипционных факторов [12; 33]. Такие конформацион-ные перестройки напрямую влияют на уровень экспрессии генов, включая те, что задействованы в клеточном цикле, сигнальных путях и ответах на стресс [8; 13; 14].

Помимо транскрипционной регуляции, Z-ДНК участвует в процессах гомологичной рекомбинации и репарации ДНК, свидетельствуя о её роли в поддержании геномной стабильности [16]. Однако избыточное или аномальное формирование Z-конформаций провоцирует повышенную частоту разрывов ДНК и мутагенез, что ассоциируется с патологическими состояниями, включая онкоге-нез [15; 34].

Понимание Z-ДНК как динамичного состояния привело к введению термина «флипоны» - участков генома, способных принимать нестандартную Z-кон-формацию, но не находящихся в ней постоянно [35—37]. Иными словами, эти участки представляют собой нестандартные элементы генома, способные обратимо переключаться между альтернативными конформациями в ответ на клеточные сигналы [37; 38]. Подобная концепция подчёркивает функциональную гибкость генома, в котором структурные переходы могут выступать в качестве дополнительного уровня регуляции.

Последующие исследования выявили высокую эволюционную консервативность сайтов Z-ДНК в геномах различных организмов, что послужило убедительным доказательством их функциональной значимости [37; 39]. Такие сайты, предрасположенные к Z-конформации, идентифицированы у широкого спектра видов — от вирусов и прокариот до эукариот, включая млекопитающих и человека [10; 40]. Наличие аналогичных структурных мотивов в филогенетически удалённых линиях указывает на то, что механизмы, опосредованные Z-ДНК, являются древними и универсальными для клеточной жизни [37; 41]. Консервативность Z-формы отражает сохранение её биологической функции, связанной с регуляцией транскрипции и поддержанием геномной стабильности.

1.2 Термодинамические подходы к предсказанию Z-ДНК

До появления методов обнаружения вторичных структур ДНК на основе данных полногеномного секвенирования прогнозирование структурных особенностей ДНК опиралось главным образом на физико-химические модели. Одним из первых методов, направленных на предсказание регионов, способных образовывать участки Z-ДНК, стал алгоритм Z-Hunt [18]. Он был основан на расчёте

свободной энергии перехода из B- в Z-форму и представлял собой попытку количественно описать структурную динамику ДНК на основе термодинамических параметров.

В рамках Z-Hunt каждая последовательность рассматривалась как совокупность динуклеотидных шагов, для которых определялись энергетические параметры (AG°), полученные из экспериментов in vitro [18]. Алгоритм использовал скользящее окно фиксированной длины и оценивал потенциальную устойчивость перехода. Итогом вычислений являлась Z-оценка (Pz), отражающая потенциал участка к образованию левозакрученной формы.

Модель Z-Hunt имела ряд ограничений. Так, в модели последовательность ДНК рассматривалась изолированно, игнорируя влияние белковых взаимодействий, топологических напряжений и эпигенетических факторов [19]. В результате модель хорошо предсказывала энергетически допустимые участки in vitro, но слабо коррелировала с реально наблюдаемыми структурами in vivo. Тем не менее, Z-Hunt заложил методологическую основу для современных алгоритмов, продемонстрировав принципиальную возможность количественного моделирования конформационного полиморфизма ДНК.

1.3 Ограничения подходов предсказания Z-ДНК на основе

последовательности

Первоначальные модели, включая Z-Hunt, опирались на данные in vitro, полученные в упрощённых экспериментальных условиях, которые не учитывали сложную среду клеточного ядра. Структура ДНК in vivo определяется множеством факторов, таких как концентрация ионов, суперспирализация, состояние хроматина и активность стабилизирующих белков [8; 17].

Двухвалентные катионы, такие как Мд2+ и Zn2+, способствуют стабилизации Z-формы, тогда как избыток одновалентных катионов (Na+, К+) препятствует её образованию [8]. Отрицательная суперспирализация, возникающая при транскрипции, также создаёт условия для локального перехода B^Z [32]. Важную роль играют белки с Za-доменами, включая ADAR1 [37; 42] и ZBP1 [43], способные специфически распознавать и стабилизировать Z-ДНК.

Эти факторы полностью отсутствуют в термодинамических моделях, что делает их непригодными для клеточных условий.

В итоге, расхождение между in vitro-экспериментами и in vivo-средой приводит к систематическому расхождению между предсказаниями модели и наблюдаемыми данными, что указывает на необходимость интеграции геномного контекста в будущие модели [21].

Помимо концептуальных ограничений, Z-Hunt характеризовался упрощённой алгоритмической архитектурой. Фиксированная длина окна (16-24 нук-леотида) не позволяла учитывать протяжённые или прерывистые участки, а также кооперативные эффекты между соседними Z-образующими регионами. Кроме того, модель не различала конкурирующие структурные мотивы, такие как G-квадруплексы и Н-ДНК, что могло приводить к переоценке предсказанных сайтов [23]. Эти ограничения приводили к значительному завышению количества потенциальных Z-участков по сравнению с экспериментально верифицированными [44].

Сопоставление результатов Z-Hunt с данными in vivo выявило крупный разрыв между теоретическим потенциалом и функциональной активностью. Алгоритм предсказывал сотни тысяч участков с высокой склонностью к Z-кон-формации, тогда как реальные данные указывают на их ограниченное число, специфичное для типа клетки [17]. Этот факт подчёркивает, что последовательность является необходимым, но недостаточным условием формирования структуры. Реализация Z-конформации требует определённого хроматинового и транскрипционного контекста, который не учитывался ранними моделями.

1.4 Развитие архитектур глубокого обучения в геномике

Выявление закономерностей функциональной организации генома представляет собой одну из ключевых задач современной системной биологии. Традиционно аннотация некодирующих регионов ДНК базировалась на методах, требующих экспертного конструирования признаков, например из k-меров или позиционно-весовых матриц [28]. Однако данные подходы продемонстрировали ограниченную эффективность при моделировании сложных нелинейных вза-

имодействий. Развитие технологий высокопроизводительного секвенирования (СЫР-эед, ОКазе-зед, МШэе-эед) обеспечило необходимую эмпирическую базу для применения методов глубокого обучения. Использование искусственных нейронных сетей позволило перейти к парадигме автоматического извлечения признаков непосредственно из первичных нуклеотидных последовательностей [7ои2015рге^с^п^.

Прогресс методов глубокого обучения в области геномики характеризуется переходом от базовых сверточных сетей к комплексным гибридным и муль-тимодальным архитектурам. Ниже рассмотрены ключевые модели, демонстрирующие эволюцию инженерных подходов к декодированию регуляторных механизмов генома.

1.4.1 DeepBind

Модель DeepBind [45], предложенная Alipanahi и соавторами в 2015 году, стала фундаментальной работой, заложившей основу для применения свёрточ-ных нейронных сетей (CNN) в задаче de novo идентификации сайтов связывания белков с ДНК и РНК. DeepBind продемонстрировала, что CNN способны не только превосходить традиционные методы позиционно-весовых матриц (PWM) [46—48], но и автоматически извлекать биологически интерпретируемые мотивы из сырых последовательностей, обеспечивая высокую точность прогнозирования (AUROC 0.93-0.99) для более чем 690 транскрипционных факторов и РНК-связывающих белков на датасетах HT-SELEX и CLIP-seq.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Бекназаров Назар Сохибжонович, 2026 год

Список литературы

1. Watson J. D., Crick F. H. Molecular structure of nucleic acids: a structure for deoxyribose nucleic acid // Nature. — 1953. — т. 171, № 4356. — с. 737—738.

2. Franklin R. E., Gosling R. G. The structure of sodium thymonucleate fibres. I. The influence of water content // Acta Crystallographica. — 1953. — т. 6, № 8/9. — с. 673—677.

3. Molecular structure of a left-handed double helical DNA fragment at atomic resolution / A. H.-J. Wang [и др.] // Nature. — 1979. — т. 282, № 5740. — с. 680—686.

4. DNA H form requires a homopurine-homopyrimidine mirror repeat / S. M. Mirkin [и др.] // Nature. — 1987. — т. 330, № 6147. — с. 495—497.

5. Sen D., Gilbert W. Formation of parallel four-stranded complexes by guanine-rich motifs in DNA and its implications for meiosis // nature. — 1988. — т. 334, № 6180. — с. 364—366.

6. Lilley D. M. The inverted repeat as a recognizable structural feature in supercoiled DNA molecules // Proceedings of the National Academy of Sciences. — 1980. — т. 77, № 11. — с. 6468—6472.

7. Rich A., Nordheim A., Wang A. The chemistry and biology of left-handed Z-DNA. — 1984.

8. Rich A., Zhang S. Z-DNA: the long road to biological function // Nature Reviews Genetics. — 2003. — т. 4, № 7. — с. 566—572.

9. Herbert A. Z-DNA and Z-RNA in human disease // Communications biology. — 2019. — т. 2, № 1. — с. 7.

10. Z-flipon variants reveal the many roles of Z-DNA and Z-RNA in health and disease / D. Umerenkov [и др.] // Life Science Alliance. — 2023. — т. 6, № 7.

11. Herbert A. ALU non-B-DNA conformations, flipons, binary codes and evolution // Royal Society Open Science. — 2020. — т. 7, № 6. — с. 200222.

12. Transcription of human c-myc in permeabilized nuclei is associated with formation of Z-DNA in three discrete regions of the gene. / B. Wittig [и др.] // The EMBO journal. — 1992. — т. 11, № 12. — с. 4653—4663.

13. Z-DNA-forming silencer in the first exon regulates human ADAM-12 gene expression / B. K. Ray [h gp.] // Proceedings of the National Academy of Sciences. — 2011. — t. 108, № 1. — c. 103—108.

14. Nrf2 activation is associated with Z-DNA formation in the human HO-1 promoter / A. Maruyama [h gp.] // Nucleic acids research. — 2013. — t. 41, № 10. — c. 5223—5234.

15. ADAR1 masks the cancer immunotherapeutic promise of ZBP1-driven necroptosis / T. Zhang [h gp.] // Nature. — 2022. — t. 606, № 7914. — c. 594— 602.

16. Wahls W. P., Wallace L. J, Moore P. D. The Z-DNA motif d (TG) 30 promotes reception of information during gene conversion events while stimulating homologous recombination in human cells in culture // Molecular and cellular biology. — 1990.

17. Permanganate/S1 nuclease footprinting reveals non-B DNA structures with regulatory potential across a mammalian genome / F. Kouzine [h gp.] // Cell systems. — 2017. — t. 4, № 3. — c. 344—356.

18. A computer aided thermodynamic approach for predicting the formation of Z-DNA in naturally occurring sequences. / P. S. Ho [h gp.] // The EMBO journal. — 1986. — t. 5, № 10. — c. 2737—2744.

19. Schroth G. P., Chou P.-J, Ho P. S. Mapping Z-DNA in the human genome. Computer-aided mapping reveals a nonrandom distribution of potential Z-DNA-forming sequences in human genes. // Journal of Biological Chemistry. — 1992. — t. 267, № 17. — c. 11846—11855.

20. Beknazarov N., Jin S., Poptsova M. Deep learning approach for predicting functional Z-DNA regions using omics data // Scientific reports. — 2020. — t. 10, № 1. — c. 19134.

21. Z-DNA-forming sites identified by ChlP-Seq are associated with actively transcribed regions in the human genome / S.-I. Shin [h gp.] // DNA Research. — 2016. — t. 23, № 5. — c. 477—486.

22. Hoheisel J. D., Pohl F. M. Searching for potential Z-DNA in genomic Escherichia coli DNA // Journal of molecular biology. — 1987. — t. 193, № 3. — c. 447—464.

23. Concordance of experimentally mapped or predicted Z-DNA sites with positions of selected alternating purine-pyrimidine tracts / A. K. Konopka [h gp.] // Nucleic acids research. — 1985. — t. 13, № 5. — c. 1683—1701.

24. Tevanyan E., Poptsova M. Recognizing patterns of nucleosome and DNA structures positioning // 2018 IEEE International Conference on Bioinformatics and Biomedicine (BIBM). — IEEE. 2018. — c. 2808—2809.

25. Beknazarov N., Jina S., Poptsova M. Deep Learning Approach to Recognize Genome Functional Elements Using Diverse Genomic Data // Proceedings http://ceur-ws. org ISSN. — 2020. — t. 1613. — c. 0073.

26. ChIP-Atlas 2021 update: a data- mining suite for exploring epigenomic landscapes by fully integrating ChIP-seq, ATAC-seq and Bisulfite-seq data / Z. Zou [h gp.] // Nucleic acids research. — 2022. — t. 50, W1. — W175—W182.

27. Ch IP-Atlas: a data-mining suite powered by full integration of public Ch IP-seq data / S. Oki [h gp.] // EMBO reports. — 2018. — t. 19, № 12. — e46255.

28. Shastry K. A., Sanjay H. Machine learning for bioinformatics // Statistical modelling and machine learning principles for bioinformatics techniques, tools, and applications. — 2020. — c. 25—39.

29. Franklin R. E., Gosling R. G. Molecular configuration in sodium thymonucleate // Nature. — 1953. — t. 171, № 4356. — c. 740—741.

30. Sundquist W. I., Klug A. Telomeric DNA dimerizes by formation of guanine tetrads between hairpin loops // nature. — 1989. — t. 342, № 6251. — c. 825— 829.

31. Pohl F. M, Jovin T. M. Salt-induced co-operative conformational transition of a synthetic DNA: equilibrium and kinetic studies // Journal of molecular biology. — 1972. — t. 67, № 3. — c. 375—396.

32. Liu L. F., Wang J. C. Supercoiling of the DNA template during transcription. // Proceedings of the National Academy of Sciences. — 1987. — t. 84, № 20. — c. 7024 7027.

33. Transcription of the human corticotropin-releasing hormone gene in NPLC cells is correlated with Z-DNA formation. / S. Wolfl [h gp.] // Proceedings of the National Academy of Sciences. — 1996. — t. 93, № 8. — c. 3664—3668.

34. DNA structure-induced genomic instability in vivo / G. Wang [h gp.] // JNCI: Journal of the National Cancer Institute. — 2008. — t. 100, № 24. — c. 1815— 1817.

35. Herbert A. A genetic instruction code based on DNA conformation // Trends in Genetics. — 2019. — t. 35, № 12. — c. 887—890.

36. Herbert A. Flipons and small RNAs accentuate the asymmetries of pervasive transcription by the reset and sequence-specific microcoding of promoter conformation // Journal of Biological Chemistry. — 2023. — t. 299, № 9.

37. Herbert A. FLIPONS: The Discovery of Z-dna and Soft-wired Genomes. — CRC Press, 2024.

38. Herbert A. The simple biology of flipons and condensates enhances the evolution of complexity // Molecules. — 2021. — Vol. 26. — P. 4881. — DOI: 10.3390/molecules26164881CrossRefGoogle. — Scholar.

39. Conserved micrornas and flipons shape gene expression during development by altering promoter conformations / A. Herbert [h gp.] // International Journal of Molecular Sciences. — 2023. — t. 24, № 5. — c. 4884.

40. Z-DNA formation in promoters conserved between human and mouse are associated with increased transcription reinitiation rates / N. Beknazarov [h gp.] // Scientific Reports. — 2024. — t. 14, № 1. — c. 17786.

41. Herbert A. The ancient Z-DNA and Z-RNA specific Za fold has evolved modern roles in immunity and transcription through the natural selection of Flipons // Royal Society Open Science. — 2024. — t. 11, № 6. — c. 240080.

42. The Zalpha domain from human ADAR1 binds to the Z-DNA conformer of many different sequences / A. Herbert [h gp.] // Proceedings of the National Academy of Sciences. — 1997. — t. 94, № 16. — c. 8421—8426.

43. Structure of the DLM-1-Z-DNA complex reveals a conserved family of Z-DNA-binding proteins / T. Schwartz [h gp.] // Nature structural biology. — 2001. — t. 8, № 9. — c. 761—765.

44. Human genomic Z-DNA segments probed by the Za domain of ADAR1 / H. Li [h gp.] // Nucleic acids research. — 2009. — t. 37, № 8. — c. 2737—2746.

45. Predicting the sequence specificities of DNA-and RNA-binding proteins by deep learning / B. Alipanahi [h gp.] // Nature biotechnology. — 2015. — t. 33, № 8. — c. 831—838.

46. Sequence features and chromatin structure around the genomic regions bound by 119 human transcription factors / J. Wang [h gp.] // Genome research. — 2012. — t. 22, № 9. — c. 1798—1812.

47. Machanick P., Bailey T. L. MEME-ChIP: motif analysis of large DNA datasets // Bioinformatics. — 2011. — t. 27, № 12. — c. 1696—1697.

48. A compendium of RNA-binding motifs for decoding gene regulation / D. Ray [h gp.] // Nature. — 2013. — t. 499, № 7457. — c. 172—177.

49. JASPAR 2014: an extensively expanded and updated open-access database of transcription factor binding profiles / A. Mathelier [h gp.] // Nucleic acids research. — 2014. — t. 42, № D1. — c. D142—D147.

50. Beknazarov N., Poptsova M. DeepZ: A Deep Learning Approach for Z-DNA Prediction // Z-DNA: Methods and Protocols. — Springer, 2023. — c. 217— 226.

51. Zhou J., Troyanskaya O. G. Predicting the effects of noncoding variants with deep learning-based sequence model // Nature methods. — 2015. — t. 12, № 10. — c. 931—934.

52. Formation of chromosomal domains by loop extrusion / G. Fudenberg [et al.] // Cell Rep. — 2016. — Vol. 15. — P. 2038-2049. — DOI: 10.1016/j. celrep.2016.04.085CrossRefPubMedGoogle. — Scholar.

53. Kingma D. P., Ba J. Adam: A method for stochastic optimization // arXiv preprint arXiv:1412.6980. — 2014.

54. A general framework for estimating the relative pathogenicity of human genetic variants / M. Kircher [h gp.] // Nature genetics. — 2014. — t. 46, № 3. — c. 310—315.

55. Functional annotation of noncoding sequence variants / G. R. Ritchie [h gp.] // Nature methods. — 2014. — t. 11, № 3. — c. 294—296.

56. FunSeq2: a framework for prioritizing noncoding regulatory variants in cancer / Y. Fu [h gp.] // Genome biology. — 2014. — t. 15, № 10. — c. 480.

57. The Human Gene Mutation Database: building a comprehensive mutation repository for clinical and molecular genetics, diagnostic testing and personalized genomic medicine / P. D. Stenson [h gp.] // Human genetics. — 2014. — t. 133. — c. 1—9.

58. The nhgri-ebi gwas catalog of published genome-wide association studies, targeted arrays and summary statistics 2019 / A. Buniello [et al.] // Nucleic Acids Res. — 2019. — Vol. 47. — P. 1005-1012. — DOI: 10.1093/nar/ gky1120CrossRefPubMedGoogle. — Scholar.

59. Enhanced regulatory sequence prediction using gapped k-mer features / M. Ghandi [h gp.] // PLoS computational biology. — 2014. — t. 10, № 7. — e1003711.

60. Quang D., Xie X. DanQ: a hybrid convolutional and recurrent deep neural network for quantifying the function of DNA sequences // Nucleic acids research. — 2016. — t. 44, № 11. — e107—e107.

61. DeepHistone: a deep learning approach to predicting histone modifications / Q. Yin [h gp.] // BMC genomics. — 2019. — t. 20, Suppl 2. — c. 193.

62. Integrative analysis of 111 reference human epigenomes / A. Kundaje [h gp.] // Nature. — 2015. — t. 518, № 7539. — c. 317—330.

63. Loshchilov I., Hutter F. Decoupled weight decay regularization // arXiv preprint arXiv:1711.05101. — 2017.

64. Effective gene expression prediction from sequence by integrating long-range interactions / Z. Avsec [h gp.] // Nature methods. — 2021. — t. 18, № 10. — c. 1196—1203.

65. SpliceRover: interpretable convolutional neural networks for improved splice site prediction / J. Zuallaert [h gp.] // Bioinformatics. — 2018. — t. 34, № 24. — c. 4180—4188.

66. Yeo G., Burge C. B. Maximum entropy modeling of short sequence motifs with applications to RNA splicing signals // Journal of computational biology. — 2004. — t. 11, № 2/3. — c. 377—394.

67. ClinVar: improving access to variant interpretations and supporting evidence / M. J. Landrum [h gp.] // Nucleic acids research. — 2018. — t. 46, № D1. — c. D1062—D1067.

68. GENCODE: the reference human genome annotation for The ENCODE Project / J. Harrow [h gp.] // Genome research. — 2012. — t. 22, № 9. — c. 1760—1774.

69. Consortium G. GTEx Portal. — 2024. — URL: https://www.gtexportal.org/ ; Accessed: 2024-11-16.

70. DNABERT: pre-trained Bidirectional Encoder Representations from Transformers model for DNA-language in genome / Y. Ji [h gp.] // Bioinformatics. — 2021. — t. 37, № 15. — c. 2112—2120.

71. Attention is all you need / A. Vaswani [h gp.] // Advances in neural information processing systems. — 2017. — t. 30.

72. Bert: Pre-training of deep bidirectional transformers for language understanding / J. Devlin [h gp.] // arXiv preprint arXiv:1810.04805. — 2018.

73. DNABERT-2: Efficient Foundation Model and Benchmark for Multi-Species Genome / Z. Zhou [h gp.] // arXiv preprint arXiv:2306.15006. — 2023.

74. Flashattention: Fast and memory-efficient exact attention with io-awareness / T. Dao [h gp.] // Advances in Neural Information Processing Systems. — 2022. — t. 35. — c. 16344—16359.

75. Press O, Smith N. A., Lewis M. Train short, test long: Attention with linear biases enables input length extrapolation // arXiv preprint arXiv:2108.12409. — 2021.

76. Quantifying similarity between motifs / S. Gupta [h gp.] // Genome Biology. — 2014. — t. 15, № 2. — R30. — DOI: 10.1186/gb-2014-15-2-r30.

77. The MEME Suite / T. L. Bailey [h gp.] // Nucleic Acids Research. — 2015. — t. 43, W1. — W39—W49. — DOI: 10.1093/nar/gkv416.

78. Ge S. X., Jung D., Yao R. ShinyGO: a graphical gene-set enrichment tool for animals and plants // Bioinformatics. — 2020. — anp. — t. 36, № 8. — c. 2628—2629. — DOI: 10.1093/bioinformatics/btz931. — URL: https://doi. org/10.1093/bioinformatics/btz931.

79. Haer F., Steinbacher S., Rich A. Crystal structure of Z-DNA without an alternating purine-pyrimidine sequence // Proceedings of the National Academy of Sciences. — 2018. — t. 115, № 23. — E5307—E5315. — DOI: 10.1073/pnas. 1806210115. — URL: https://www.pnas.org/doi/10.1073/ pnas.82.11.3611.

80. Sullivan B. A., Karpen G. H. Centromeric chromatin exhibits a histone modification pattern that is distinct from both euchromatin and heterochromatin // Nature Structural & Molecular Biology. — 2004. — t. 11, № 11. — c. 1076—1083. — DOI: 10.1038/nsmb839. — URL: https://www. nature.com/articles/nsmb839.

81. H3K27me3 and H2A.Z mediate chromatin compaction and silencing of zygotic genes upon oocyte-to-embryo transition / S. A. Machado [h gp.] // Nature Structural & Molecular Biology. — 2016. — t. 23, № 12. — c. 1038—1046. — DOI: 10.1038/nsmb.3296.

82. A polymorphic dinucleotide repeat in the rat nucleolin gene forms Z-DNA and inhibits promoter activity / S. Rothenburg [h gp.] // Proceedings of the National Academy of Sciences. — 2002. — t. 99, № 4. — c. 1682—1687. — DOI: 10.1073/pnas.99.4.1682. — URL: https://www.pnas.org/doi/10.1073/pnas.99. 4.1682.

83. Herbert A., Balachandran S. Z-DNA enhances immunotherapy by triggering death of inflammatory cancer-associated fibroblasts // Journal for ImmunoTherapy of Cancer. — 2022. — t. 10, № 11. — e005704. — DOI: 10. 1136/jitc-2022-005704.

84. Influenza virus Z-RNAs induce ZBP1-mediated necroptosis / T. Zhang [h gp.] // Cell. — 2020. — t. 180, № 6. — c. 1115 1129.

85. CDK9-dependent RNA polymerase II pausing controls transcription initiation / S. Gressel [h gp.] // eLife. — 2017. — t. 6. — e29736. — DOI: 10.7554/eLife.29736.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.