Оценка аллельного дисбаланса по данным высокопроизводительного секвенирования для поиска регуляторных однонуклеотидных вариантов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Мещеряков Георгий Андреевич
- Специальность ВАК РФ00.00.00
- Количество страниц 149
Оглавление диссертации кандидат наук Мещеряков Георгий Андреевич
Введение
Глава 1. Обзор литературы
1.1. Методы классических eQTL исследований
1.2. Подходы, основанные на биномиальном распределении
1.2.1. QUASAR
1.2.2. BaalChIP
1.3. Подходы, основанные на отрицательной биномиальной модели
1.4. Определение Фонового отношения аллельных частот (BAD)
1.5. Заключение по обзору литературы
Глава 2. Материалы и методы
2.1. Обоснование модели, двухмерное распределение чисел прочтений
2.1.1. Построение модели эксперимента на уровне одного ОНП
2.1.2. Альтернативный взгляд
2.2. Основные положения
2.3. Учёт BAD для поли- и анеуплоидных образцов и CNV
2.4. Оценка параметров модели
2.4.1. Метод локального максимального правдоподобия
2.4.2. Стандартные ошибки оценок
2.5. Отрицательная биномиальная модель
2.5.1. Подсчёт градиента неполной бета-функции
2.6. Бета отрицательное биномиальное распределение
2.6.1. Регуляризация #£^.^"$-модели: штрафование дисперсии
2.6.2. Подсчёт градиента функции распределения ЪеАиЖЪ
2.7. Маргинализованное составное отрицательное биномиальное распределение
2.7.1. Постановка, определение
2.7.2. Функция вероятности МеКЪ
2.7.3. Моменты МбКЪ
2.7.4. Обобщение МбКЪ
2.8. Репараметризация в ЪешКЪ и МеКЪ
2.9. Статистические тесты
2.9.1. Обнаружение статичных АСВ
2.9.2. Обнаружение дифференциальных АСВ
2.9.3. Постериорная поправка к w для BAD >
2.10. Программная реализация MIXALIME
2.11. Метод генерации синтетических данных
2.12. Предобработка реальных экспериментальных данных
2.12.1. Предобработка данных CAGE-Seq человеческих сердец
2.12.2. Предобработка данных CAGE для сравнения с внешними БД
2.12.3. Предобработка анеуплоидных данных
2.13. Обсуждение методов
2.13.1. Аппроксимация двухмерного распределения условными
2.13.2. Контроль ошибки картирования через оценку р
Глава 3. Результаты
3.1. Тестирование MIXALIME на синтетических данных
3.2. Верификация MIXALIME на данных CAGE-Seq сердец человека
3.2.1. Аллель-зависимое связывание CTCF с вариантами генома, ассоциированными с сердечными патологиями
3.2.2. TBX5 как транс-регулятор SPATS2L
3.2.3. Аллель-специфичный анализ приоритизирует роль HIF1 в защите сердца от фиброза через регуляцию десмоплакина
3.3. Сравнение MIXALIME с другим ПО на внешних БД
3.4. Проверка работы MIXALIME на анеуплоидных геномах
3.4.1. Постановка сравнительного эксперимента
3.4.2. Техническая валидация: сравнение точности методов
3.4.3. Биологическая валидация: связь найденных вариантов с функцией клетки
3.5. Применение MIXALIME для верификации моделей глубокого обучения
Заключение
Выводы
Список сокращений и условных обозначений
Словарь терминов
Список литературы
Приложение A. Исходные материалы
Приложение B. Вычисление функции распределения из QuASAR
Приложение C. Пример подсчёта функции вероятности представителей семейства МСЖЪ в
рамках библиотеки jacobin
Приложение D. Замкнутость составных биномиальных моделей по распределению параметра
длины серии
Приложение E. Процедура генерации синтетических наборов данных
Приложение F. О совместной модели распределения чисел прочтений
F.1 Распределение Дирихле
F.2 Отступление: оценки ММП недооценивают дисперсию у обусловленных моделей
F.3 Характеризация распределения бета-Лиувилля
F.4 Совместная $£ЖМ-модель распределения
F.5 Подсчёт многомерной функции вероятности
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Разработка методов контроля качества и построения карты геномных районов связывания транскрипционных факторов на основе сравнительного анализа ChIP-seq экспериментов2024 год, кандидат наук Колмыков Семён Константинович
Вычислительное предсказание эффектов мутаций в регуляторных районах генов2025 год, кандидат наук Пензар Дмитрий Дмитриевич
Анализ аллель-специфичного связывания факторов транскрипции в геноме человека для интерпретации влияния однонуклеотидных замен на активность транскрипции2024 год, кандидат наук Абрамов Сергей Александрович
Статистические вопросы, связанные с техническими и биологическими вариациями, возникающие при аллель-специфическом анализе данных секвенирования2023 год, кандидат наук Менделевич Ася Владимировна
Полногеномное выявление регуляторных SNPs человека на основе получения и анализа комплекса данных ChIP-seq и RNA-seq2025 год, кандидат наук Дамаров Игорь Сергеевич
Введение диссертации (часть автореферата) на тему «Оценка аллельного дисбаланса по данным высокопроизводительного секвенирования для поиска регуляторных однонуклеотидных вариантов»
Введение
Индивидуальные геномы конкретных особей одного вида, например, конкретных людей, значительно различаются по своим нуклеотидным последовательностям. Самыми частыми отличиями являются однонуклеотидные варианты (ОНВ), соматические мутации и представленные в популяции однонуклеотидные полиморфизмы (ОНП). Относительно эталонной (также называемой референсной) последовательности генома человека, традиционно используемой в молекулярно-биологических и биоинформатических исследованиях, индивидуальный геном насчитывает десятки миллионов таких однонуклеотидных замен [1,2]. Часть ОНВ находится в участках, кодирующих белки, но Большинство располагается в некодирующих областях генома, в том числе, в районах управляющих транскрипцией генов, промоторах и энхансерах [3]. Присутствие ОНВ в таких регуляторных районах может оказывать прямое влияние на активность транскрипции, например, через изменение эффективности инициации транскрипции, которая контролируется ДНК-белковыми взаимодействиями, и, как следствие, зависит от нуклеотидной последовательности [4]. Аннотация и предсказание функциональной роли ОНВ важны для решения задач медицинской генетики и персонализированной медицины в целом [5]. В то время как референсный геном человека был прочитан в начале XXI века, исследования, связанные с функциональным анализом человеческого пангенома с учетом разнообразия в популяции, активно продолжаются с привлечением высокопроизводительных экспериментальных методов и вычислительных методов анализа данных [6]. Развитие новых эффективных подходов к изучению функциональности ОНВ не только расширяет фундаментальные знания о структуре и функциях регуляторных последовательностей, но и создаёт новые возможности для совершенствования методов подбора индивидуального лечения и прогнозирования предрасположенности к заболеваниям в зависимости от генотипа [7], что и обуславливает актуальность работы. Учитывая быстрое снижение стоимости технологий высокопроизводительного секвенирования [8], можно ожидать, что в обозримое время станет практически достижимым массовое составление «генетических паспортов» пациентов и повсеместное внедрение достижений генетики,
молекулярной Биологии и биоинформатики в клиническую практику. Для областей генома,
кодирующих белки, собрано достаточно много информации об эффектах различных вариантов,
разработаны продвинутые прогностические модели. Что касается регуляции работы генов,
задача достоверной оценки влияния ОНВ на активность регуляторных областей в своей
полноте остается неразрешенной. В настоящее время наиболее распространенным методом
выявления полиморфизмов, связанных с заболеваниями, является проведение крупномасштабных
полногеномных и полнотранскриптомных исследований ассоциаций - genome-wide association
studies (GWAS) и transcriptome-wide association studies (TWAS) [9], которые выявляют
связи «генотип-фенотип» путём статистического анализа Больших когорт. Однако, такие
исследования ограничены размером используемой популяционной выборки и не предоставляют
функциональной информации о молекулярном механизме, объясняющим вовлечение вариантов
в формирование фенотипа, (например, предрасположенности к патологии. Тот факт, что геном
человека в большинстве клеток является диплоидным, позволяет использовать альтернативный
подход: аллель-специфический анализ гетерозиготных ОНВ, отличающий материнскую и
отцовскую хромосомы одного организма.
Аллель-специфичный анализ основан на функциональном сравнении аллелей,
расположенных на гомологичных хромосомах, с точки зрения экспрессии гена или его
альтернативной регуляции. Массовое распространение и удешевление высокопроизводительного
секвенирования позволяет масштабировать аллель-специфичный анализ до полного генома или
транскриптома, в зависимости от типа проведенного «омиксного» высокопроизводительного
эксперимента. Совершенствование вычислительных подходов к анализу аллель-специфичности
ОНВ и их применение к существующим и вновь получаемым омиксным данным является важным
шагом на пути к персонализированной медицине.
По данным высокопроизводительного секвенирования удается эффективно выявлять
гетерозиготные участки в гомологичных хромосомах генома человека, в том числе биаллельные
ОНВ, воздействующие на те или иные молекулярные механизмы. В зависимости от конкретного
экспериментального метода на основе высокопроизводительного секвенирования, аллель-
специфичный анализ может дать информацию о влиянии ОНВ на множество клеточных
процессов. В частности, аллель-специфичное ДНК-белковое взаимодействие может изучаться по данным ChIP-Seq (Chromatin immunoprecipitation by deep sequencing) [10], аллель-специфичная доступность хроматина для фрагментации по данным DNase-Seq (DNase I hypersensitive sites sequencing) [11], транспозиций по данным ATAC-Seq (Assay for transposase-accessible chromatin using sequencing) [12], аллель-специфичная экспрессия генов на уровне представленности транскриптов по данным RNA-Seq (Ribonucleotidic acid sequencing) [13] или аллель-специфичная инициация транскрипции по данным CAGE-Seq (Cap analysis of gene expression by deep sequencing) [14]. С точки зрения вычислительного анализа данных, результаты эксперимента на основе высокопроизводительного секвенирования - это числа прочтений, включающих («поддерживающих») один или другой аллель ОНВ. По отношению чисел прочтений между двумя аллелями - т.н. аллельному дисбалансу (АД) - можно установить избирательность рассматриваемого в конкретном эксперименте молекулярного механизма по отношению к аллелю
однонуклеотидного варианта.
На практике, аллель-специфичный анализ сталкивается с малым числом
экспериментальных повторностей, что делает применение конвенциальных статистических моделей, требующих больших выборок, нерациональным. Ограниченное число повторностей может быть обусловлено трудоемкостью получения материала, а часто и стоимостью проведения функциональных омиксных экспериментов, за пределами традиционного RNA-Seq. Таким образом, требуются вычислительные и статистические модели, учитывающие природу экспериментальных данных и менее требовательные к размеру выборки. Строго говоря, может быть достаточно получить не точную количественную оценку соотношения двух сигналов с альтернативных аллелей, а качественный ответ на вопрос «является ли разница между аллельными сигналами значимой» (например, достигается ли некоторое достаточно низкое Р-значение). ОНВ, для которых даётся утвердительный ответ, мы будем называть аллель-специфичными вариантами. Статистическая оценка АД является промежуточным этапом на пути к обнаружению аллель-специфичных вариантов (АСВ) (см. Рисунок 1). При этом требуется учитывать ошибки или шумы, связанные с несовершенствами экспериментов, техническую вариабельность и прочие отклонения в распределениях числа прочтений между
Рисунок 1 - Схематическое изображение объекта исследования. В зависимости от разницы между числами прочтений, поддерживаюющих основной (ref) или альтернативный (alt) аллели, меняется
и уверенность в принадлежности ОНВ к классу АСВ.
вариантами и аллелями, например, вызванные ошибками картирования коротких прочтений на геномную последовательностей. К сожалению, существующие на сегодняшний момент подходы ошибочно переоценивают либо недооценивают дисперсию и не способны учитывать информацию о вариациях копийности участков генома, вплоть до хромосомных дупликаций, а Большинство методов плохо подходят для дифференциальной оценки аллель-специфичности между содержательно отличными группами образцов (например, совместно изучаемыми типами клеток).
Цель работы: создание нового вычислительного метода для выявления аллель-специфичных вариантов по результатам различных видов омиксных экспериментов на основе
высокопроизводительного секвенирования.
Для достижения цели были поставлены следующие задачи:
1. Разработать семейство статистических моделей, описывающих распределение прочтений между альтернативными аллелями гетерозиготных однонуклеотидных вариантов. Разработать методы оценки статистической значимости аллельного дисбаланса;
2. Реализовать разработанные модели и методы оценки статистической значимости в виде программного пакета. Провести тестирование пакета на синтетических данных. С
использованием экспериментальных омиксных данных по инициации транскрипции и доступности хроматина провести тестирование пакета и сравнение с существующими
методами оценки аллельного дисбаланса;
3. На основе экспериментальных данных по инициации транскрипции в клетках
сердца человека, охарактеризовать однонуклеотидные варианты, соответствующие аллель-специфичной активности промоторов. Выявить варианты, демонстрирующие дифференциальную аллель-специфичность между сердцами здоровых и больных индивидов.
Научная новизна исследования: предложена и обоснована новая статистическая модель и семейство вероятностных распределений для моделирования чисел аллельных прочтений. Модель применима в случае избыточной дисперсии числа аллельных прочтений и геномных вариаций копийности. Впервые проведен аллель-специфичный анализ инициации транскрипции по данным кэп-анализа экспрессии генов (CAGE-Seq) для сердца человека. Выявлено более двух тысяч регуляторных вариантов, соответствующих аллель-специфичной активности промоторов.
Теоретическая и практическая значимость. Теоретическая значимость работы состоит в создании обобщенного формального подхода к вычислительному анализу аллель-специфичности. Разработанный математический аппарат является методической базой для дальнейшего совершенствования методов аллель-специфичного анализа в приложении к множеству существующих и новых разрабатываемых омиксных методов, включая анализ экспрессии генов и инициации транскрипции на уровне единичных клеток. Работа имеет большую практическую значимость для дальнейших биоинформатических и молекулярно-биологических исследований, сфокусированных на геномных вариантах регуляторных последовательностей. В частности, с использованием созданного в работе инструментария была создана крупнейшая на сегодняшний момент база данных аллель-специфичной доступности хроматина UDACHA (https://udacha.autosome.org). Проведенное в работе сравнительное тестирование альтернативных моделей с различным уровнем избыточной дисперсии в рамках единого подхода позволяет контролируемо выбирать наилучшую модель в зависимости от имеющегося объема и специфики экспериментальных данных. Важным результатом работы является каталог аллель-специфичных
регуляторных вариантов, связанных с инициацией транскрипции в сердце человека, что поможет
при выявлении опосредованных ОНВ изменений регуляции транскрипции в норме и при
сердечных патологиях. Предлагаемый метод и подход к аллель-специфическому анализу обладает
высокой статистической мощностью, следовательно, способен определять большее количество
аллель-специфичных достоверных регуляторных вариантов, по сравнению с существующими
подходами. Кроме того, чувствительность метода позволит сократить финансовые расходы
на этапе лабораторного эксперимента, позволяя эффективно использовать информацию из
небольшого числа экспериментальных повторностей. В сочетании с простотой применения
разработанного программного обеспечения, работа представляет интерес для академического
сообщества, исследователей в области регуляции генома и открывает путь к созданию атласов
регуляторных вариантов генома на основе аллель-специфичного анализа для различных типов
тканей и клеток человека и других высших эукариот. Основные положения, выносимые на защиту.
1. Новая статистическая модель распределения аллельных прочтений соответствует процессу генерации данных в омиксных экспериментах и хорошо описывает
наблюдаемые в реальности распределения аллельных прочтений;
2. Созданный программный пакет превосходит существующие методы по соотношению
чувствительности и достоверности определения аллель-специфичных вариантов, и
устойчив к мисспецификации модели, вызванной геномными вариациями копийности;
3. Предложенные семейства распределений (Ж!В, ЪеЛиЖЪ, регуляризованное ЪеЛиЖЪ
и МСЖЪ) позволяют гибко контролировать консервативность определения аллель-специфичных вариантов и проводить идентификацию таких вариантов для геномов с
полнохромосомными дупликациями и локальными вариациями копийности;
4. Предложенный подход позволил идентифицировать более двух тысяч регуляторных
вариантов, вовлеченных в изменение активности промоторов в клетках сердца человека, и определить отличия в аллельных предпочтениях для некоторых вариантов между здоровыми и Больными сердцами. В частности, удалось определить аллель-специфичную активность промоторов генов BBS12 и FGF2, опосредованную связыванием транскрипционного фактора CTCF, а также
ингибирование экспрессии десмоплакина DSP , опосредованное аллель-специфичным связыванием транскрипционного фактора HIF1A.
Достоверность полученных результатов обеспечивается доказанным математическим
аппаратом, детальным тестированием разработанного программного обеспечения на
синтетических и реальных данных, сравнением с альтернативными инструментами, и успешным
сопоставлением результатов с существующими аннотациями регуляторных вариантов.
Апробация работы. Результаты работы были представлены на следующих конференциях:
1. (Устный доклад) Toward improved calling of allele-specific events in high-throughput
sequencing data with a mixture of compound Dirichlet negative multinomial distributions // BGRS/ SB-2024: 14th International Multiconference "Bioinformatics of Genome Regulation and Structure/
Systems Biology", 2024, г. Новосибирск. DOI: 10.18699/bgrs2024-12.3-20
2. (Постерный доклад) Inferring posterior weight distribution in hierarchical mixture models //
BGRS/SB-2024: 14th International Multiconference "Bioinformatics of Genome Regulation and
Structure/Systems Biology", 2024, г. Новосибирск. DOI: 10.18699/bgrs2024-12.3-19
3. (Постерный доклад) StaREC: Stabilizing Reccurence Equatiions with Constraints // SMILES
2023, 2023, г. Белокуриха.
4. (Устный доклад) Improved identification of allele-specific gene regulation in high-throughput
sequencing data with the marginalized compound negative binomial distribution // SBB-2023: 14th International young scientists school «System Biology and Bioinformatics», 2023, г. Новосибирск. DOI: 10.18699/SBB-2023-44
5. (Постерный доклад) Generalization of negative binomial distribution for identification of
allele-specific gene regulation in high-throughput sequencing experiments // MCCMB 2023: 11th Moscow Conference on Computational Molecular Biology, 2023, г. Москва. ISBN: 978-5-901158-33-3.
URL: https://mccmb.belozersky.msu.ru/2023/thesis/abstracts/51.pdf
6. (Устный доклад) Beta negative binomial mixture model facilitates identification of allele-
specific gene regulation in high-throughput sequencing data // BGRS/SB-2022: 13th International Multiconference "Bioinformatics of Genome Regulation and Structure/Systems Biology", 2022, г Новосибирск. DOI: 10.18699/SBB-2022-664
Личный вклад. Описанные в работе модели, математические выкладки и выводы были
получены автором лично. Программный пакет реализован на языке программирования Python
непосредственно автором диссертации.
Публикации. Основные результаты по теме исследования изложены в печатных изданиях,
индексируемых в Web of Science, Scopus и РИНЦ:
1. Buyan A., Meshcheryakov G.1, Safronov V., Abramov S., Boytsov A., Nozdrin V., Baulin E.
F., Kolmykov S., Vierstra J., Kolpakov F., Makeev V. J., Kulakovskiy I. V. Statistical framework for calling allelic imbalance in high-throughput sequencing data // Nature Communications. 2025. Т. 16. No 1. DOI: 10.1038/s41467-024-55513-2
2. Deviatiiarov R. M., Gams A., Kulakovskiy I. V., Buyan A., Meshcheryakov G., Syunyaev
R., Singh R., Shah P., Tatarinova T. V., Gusev O., Efimov I. R. An atlas of transcribed human cardiac promoters and enhancers reveals an important role of regulatory elements in heart failure // Nature
Cardiovascular Research. 2023. Т. 2. No 1. С. 58-75. 10.1038/s44161-022-00182-x
3. Penzar D., Nogina D., Noskova E., Zinkevich A., Meshcheryakov G., Lando A., Rafi A. M.,
Boer C. de, Kulakovskiy I. V. LegNet: a best-in-class deep learning model for short DNA regulatory
regions // Bioinformatics. 2023. Т. 39. No 8. 10.1093/bioinformatics/btad457
4. Rafi A. M., Nogina D., Penzar D., Lee D., Lee D., Kim N., Kim S., Kim D., Shin Y., Kwak
I.-Y., Meshcheryakov G., Lando A., Zinkevich A., Kim B.-C., Lee J.,16, Kang T., Vaishnav E. D.,
Yadollahpour P., Bornelov S., Svensson F., и др. A community effort to optimize sequence-based deep
learning models of gene regulation // Nature Biotechnology. 2024. 10.1038/s41587-024-02414-w
Объем и структура работы. Диссертация состоит из Введения, Обзора литературы,
Материалов и методов, Результатов, Выводов, Заключения и 6 приложений. Полный объем
диссертации составляет 149 страниц, включая 37 рисунков, 5 таблиц. Список литературы
содержит 171 наименование.
1Ко-первое авторство
Глава 1. Обзор литературы
В настоящее время полногеномные и полнотранскриптомные ассоциативные исследования [1518] являются основным источником информации о наследственных компонентах фенотипических признаков человека, включая предрасположенность к заболеваниям. Однако приоритизация причинных геномных вариантов среди множества кандидатов остается проблемой, поскольку Большинство вариантов, ассоциированных с заболеваниями, являются некодирующими [19,20], а разнообразие механизмов регуляции экспрессии генов усложняет исследование эффектов
некодирующих вариантов.
Омиксные технологии, основанные на высокопроизводительном секвенировании,
облегчают анализ некодирующих вариантов. В частности, становится возможным идентифицировать гетерозиготные ОНВ и раздельно оценивать количество прочтений, происходящих от парных хромосом. В зависимости от конкретного омиксного протокола (см. таблицу 1.1), наблюдение несбалансированного числа отсеквенированных прочтений, несущих тот или иной аллель, позволяет связывать варианты последовательности с изменениями в работе различных молекулярных механизмов. Аллельный дисбаланс может выявить ассоциацию или прямое влияние ОНВ на связывание транскрипционных факторов (ТФ) с использованием данных ChIP-Seq [21-24], аллель-специфичную доступность хроматина с использованием DNase-Seq или ATAC-Seq [25-27], аллель-специфичное метилирование ДНК [28,29] и аллель-специфичную
экспрессию (АСЭ) генов как таковую [30-33].
Что касается экспрессии генов, RNA-Seq широко использовались для обнаружения АСЭ в первичных клетках [31,34], клеточных линиях и опухолях [32,33,35,36], в различных тканях и в популяциях [23,37-40]. Аллель-специфичная экспрессия предоставляет важную информацию для медицинских и сельскохозяйственных целей, включая когортные исследования заболеваний [41-43], которые проводились для различных видов [44,45], включая домашний скот [46-50] и растения [51,52]. Помимо стандартного «bulk» RNA-Seq, более современные подходы позволили идентифицировать АСВ на основе данных RNA-Seq отдельных клеток (single-cell RNA-
Seq) [53-56], последовательностей длинных прочтений [57] и активности транскрибируемых
регуляторных элементов (ТРЭ) с использованием CAGE-Seq [58].
«Золотым стандартом» для картирования сайтов связывания ТФ является ChIP-Seq,
который позволяет обнаружить сайты аллель-специфичного связывания (САС) [21,22,24,30]
и модификации гистонов [10,59]. ATAC-Seq и DNase-Seq широко использовались для
оценки аллель-специфичной доступности хроматина [22,25]. Несколько методов, использующих
сортировку клеток по количественному содержанию ДНК, включая такие подходы как Repli-
Seq, оказались подходящими для анализа аллельного смещения во времени репликации [60-62].
Идентификация аллель-специфичных топологически-ассоциированных доменов хроматина из
экспериментов И-С и СЫА-РЕТ [63,64] позволяет раскрыть вклад генетической вариации и
пространственно-временную организацию хроматина [65,66].
Таким образом, проблема достоверной идентификации подобных вариантов - АСВ -
крайне актуальна. На сегодняшний день существует множество подходов и программ для
решения данной задачи, со своими сильными и слабыми сторонами. Все они (в том числе и
наш подход, обсуждаемый в разделе 2 и в приложении F) следуют общей идее: полагается,
что число аллельных прочтений для ОНВ в отсутствии аллель-специфичсности следует некой
Фоновой модели, а наблюдения, существенно от неё отклоняющиеся, являются АСВ. Вообще
говоря, строгое определение АСВ остается нечетким, так как оно зависит от контекста, методов
измерения и статистических порогов. Это приводит к неоднозначности в интерпретации данных
и формированию двух основных парадигм: первая предполагает, что все варианты в той или иной
степени аллель-специфичны, вторая — что Большинство эффектов не отличаются от Фонового
уровня, и лишь некоторые выделяются как значимые.
Первая парадигма, утверждающая универсальность аллель-специфичности, основывается
на наблюдении, что многие гены демонстрируют АСЭ в определенных условиях. Например,
исследование GTEx [39,67] показало, что 53% белок-кодирующих генов имеют двукратное
отличие в уровне АСЭ. Такая повсеместность АСЭ поддерживает идею континуума, где все гены
обладают потенциалом к аллель-специфичности, хотя степень выраженности варьирует.
Таблица 1.1 - Примеры омиксных методов на основе высокопроизводительного секвенирования.
Технология Общее назначение метода Назначение в контексте аллель-специфичного анализа ОНВ
ChIP-Seq Идентификация регионов ДНК, Аллель-специфичное связывание:
связываемых конкретным белком преференциальное связывание белка с
(например, фактором транскрипции) в одним из аллелей
изучаемом типе клеток
DNase-Seq и Картирование участков открытого Аллель-специфичная доступность
ATAC-Seq хроматина хроматина: преференциальная
с использованием эндонуклеазы или доступность одного из аллелей
гиперчувствительной транспозазы
CAGE-Seq Количественная оценка активности Аллель-специфическая активность
промоторов/TSS (Transcription Start пpoмoтopoв/TSS: преференциальное
Site) путем секвенирования 5'-концов использование TSS или
копированных РНК уровень активности промотора, ассоциированного с одним из аллелей
RNA-Seq Секвенирование РНК для АСЭ: один из аллелей гена
количественной оценки уровней экспрессируется на более (или менее)
экспрессии генов высоком уровне, чем другой
Вторая парадигма подчеркивает редкость АСВ, утверждая, что Большинство генов
демонстрируют сбалансированную экспрессию, а значимые отклонения — исключение.
Например, анализ данных консорциумом Geuvadis выявил АСЭ лишь у 6.5% генов при строгом
пороге (Р-значение < 0.005) [68]. Аналогично, исследование GeneiASE показало, что только 0.2%
генов имеют условие-зависимую АСЭ (т.е. степень выраженности АСЭ меняется в зависимости
от рассматриваемой группы/клеточной линии), а «статичная» АСЭ (т.е. относительная разница
в уровне экспрессии между двумя аллелям примерно одинаковая по всем группам/клеточным
линиям) наблюдается у 13.6% генов с гетерозиготными вариантами [69].
Нечеткость определения аллель-специфичности связана с несколькими факторами. Во-
первых, АСВ зависит от контекста: ткань, окружающая среда или физиологическое состояние
могут существенно влиять на АД [70]. Во-вторых, статистические методы и пороги значимости
отличаются в различных исследованиях, что влияет на долю генов, классифицируемых
как аллель-специфичные. Например, использование строгих порогов снижает долю АСВ,
поддерживая вторую парадигму, тогда как более либеральные подходы выявляют АСВ у
большинства генов, что ближе к первой парадигме.
Как бы то ни было, идейно, с точки зрения построения математической модели, все (и
мы, в том числе) следуем второй парадигме. Таким образом, задачу обнаружения АСВ можно
рассматривать как задачу обнаружения аномалий. Каждый конкретный подход отличает своя
модель и свой критерий, по которому «аномалии» отделяются от «обычных» наблюдений.
Обычно, процесс идентификации АСВ состоит из определения однонуклеотидных
вариантов (SNP calling), подсчета чисел прочтений, поддерживающих основной или
альтернативный аллели (allelic read counting) и анализа наблюдаемого АД для каждого из ОНВ для
подсчёта статистической значимости - P-значения. В то время как идентификация кандидатных
ОНВ («SNV/SNP calling») считается в целом решённой [71,72], оценка статистической
значимости по АД остается сложной.
Трудность заключаются в неизвестном ожидаемом распределении количества прочтений
между референсным (основным) и альтернативным аллелем в случае АД, что необходимо для
статистического контроля. В некоторых эисследованиях независимые контрольные данные были
доступны согласно дизайну эксперимента, например, при изучении асинхронной репликации,
где клетки G1 до репликации использовались для определения несмещенного ожидаемого
соотношения аллельных сигналов [62,65]. Однако в большинстве случаев это не так, и для
экспериментов, картирующих активность транскрипции, доступность ДНК или ДНК-белковые
взаимодействия, прямые измерения аллельной дозы ДНК достаточно часто недоступны.
В целом, есть несколько факторов, способствующих избыточной вариабельности аллельных
подсчетов по геному. Во-первых, вариация числа копий - CNV (Copy Number Variation) [73],
которая приводит к спорадическим регионам с повышенным АД в нормальных клетках и,
в большей степени, в образцах опухолей и иммортализованных клеточных линиях, которые
достаточно часто анеуплоидных и демонстрируют выраженную геномную нестабильность.
Во-вторых, АД искажается техническими факторами, начиная с биологической гетерогенности на уровне отдельных клеток или образцов, что увеличивает вариацию в числе аллельных прочтений. Ложный АД также может возникнуть из-за ошибок генотипирования, например, если соматические мутации, присутствующие в части клеток, ошибочно принимаются за АД на общих вариантах. В зависимости от дизайна исследования, такие ошибки можно предотвратить более глубоким покрытием секвенирования, увеличением размера выборки, множественными повторами или даже специальными анализами для точного предварительного генотипирования. Еще одним основным техническим фактором является смещение картирования прочтений (оно же ошибка картирования, англ. reference mapping bias), при котором прочтения, несущие нереференсные аллели, либо не картируются вовсе, либо картируются на неправильные, иногда множественные локации [74]. Следовательно, прочтения, несущие альтернативный аллель конкретного ОНВ, в среднем менее представлены, нежели прочтения с основного аллеля,
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Половой локус тополя Populus x sibirica и его функциональные элементы2024 год, кандидат наук Пушкова Елена Николаевна
Методы глубинного обучения для предсказания Z-ДНК на основе омиксных данных2026 год, кандидат наук Бекназаров Назар Сохибжонович
Локализация и взаимодействие генов B-генома мягкой пшеницы, индуцирующих колошение2018 год, кандидат наук Киселева, Антонина Андреевна
Регуляторные мотивы в геномах высших эукариоти их роль в экспрессии генов2017 год, доктор наук Кулаковский Иван Владимирович
Функциональный анализ некодирующих однонуклеотидных полиморфизмов, ассоциированных с аутоиммунными заболеваниями человека2026 год, кандидат наук Устюгова Алина Сергеевна
Список литературы диссертационного исследования кандидат наук Мещеряков Георгий Андреевич, 2026 год
Список литературы
1. Auton A. и др. A global reference for human genetic variation // Nature. Springer Science, Business Media LLC, 2015. т. 526, № 7571. сс. 68-74.
2. Sachidanandam R. и др. A map of human genome sequence variation containing 1.42 million
single nucleotide polymorphisms // Nature. Springer Science, Business Media LLC, 2001. т. 409, № 6822. сс. 928-933.
3. Zou H. и др. Significance of Single-Nucleotide Variants in Long Intergenic Non-protein Coding
RNAs // Frontiers in Cell and Developmental Biology. Frontiers Media SA, 2020. т. 8.
4. Carrasco Pro S. и др. Prediction of genome-wide effects of single nucleotide variants on
transcription factor binding // Scientific Reports. Springer Science, Business Media LLC, 2020. т. 10, № 1.
5. Zhang C. и др. PGG.SNV: understanding the evolutionary and medical implications of human single nucleotide variations in diverse populations // Genome Biology. Springer Science, Business
Media LLC, 2019. т. 20, № 1.
6. Wang T. и др. The Human Pangenome Project: a global resource to map genomic diversity //
Nature. Springer Science, Business Media LLC, 2022. т. 604, № 7906. сс. 437-446.
7. Molla G., Bitew M. Revolutionizing Personalized Medicine: Synergy with Multi-Omics Data
Generation, Main Hurdles, and Future Perspectives // Biomedicines. MDPI AG, 2024. т. 12, № 12. с. 2750.
8. Muir P. и др. The real cost of sequencing: scaling computation to keep pace with data generation //
Genome Biology. Springer Science, Business Media LLC, 2016. т. 17, № 1.
9. Mai J. и др. Transcriptome-wide association studies: recent advances in methods, applications and
available databases // Communications Biology. Springer Science, Business Media LLC, 2023. т. 6, № 1.
10. Cavalli M. и др. Allele specific chromatin signals, 3D interactions, and motif predictions for immune and B cell related diseases // Scientific Reports. Springer Science, Business Media LLC, 2019. т. 9, № 1.
11. Song L., Crawford G.E. DNase-seq. A High-Resolution Technique for Mapping Active Gene Regulatory Elements across the Genome from Mammalian Cells // Cold Spring Harbor Protocols.
Cold Spring Harbor Laboratory, 2010. т. 2010, № 2. с. pdb.prot5384.
12. Yan F. и др. From reads to insight. a hitchhiker's guide to ATAC-seq data analysis // Genome
Biology. Springer Science, Business Media LLC, 2020. т. 21, № 1.
13. Castel S.E. и др. Tools and best practices for data processing in allelic expression analysis //
Genome Biology. Springer Science, Business Media LLC, 2015. т. 16, № 1.
14. Policastro R.A., Zentner G.E. Global approaches for profiling transcription initiation // Cell
Reports Methods. Elsevier BV, 2021. т. 1, № 5. с. 100081.
15. Wainberg M. и др. Opportunities and challenges for transcriptome-wide association studies //
Nature Genetics. Springer Science, Business Media LLC, 2019. т. 51, № 4. сс. 592-599.
16. Uffelmann E. и др. Genome-wide association studies // Nature Reviews Methods Primers. Springer
Science, Business Media LLC, 2021. т. 1, № 1.
17. Rafi A.M. и др. A community effort to optimize sequence-based deep learning models of gene
regulation // Nature Biotechnology. Springer Science, Business Media LLC, 2024.
18. Penzar D. и др. LegNet. a best-in-class deep learning model for short DNA regulatory regions //
Bioinformatics / под ред. Birol I. Oxford University Press (OUP), 2023. т. 39, № 8.
19. Li B., Ritchie M.D. From GWAS to Gene. Transcriptome-Wide Association Studies and Other
Methods to Functionally Understand GWAS Discoveries // Frontiers in Genetics. Frontiers Media SA, 2021. т. 12.
20. Maurano M.T. и др. Systematic Localization of Common Disease-Associated Variation in Regulatory DNA // Science. American Association for the Advancement of Science (AAAS), 2012.
т. 337, № 6099. сс. 1190-1195.
21. Reddy T.E. и др. Effects of sequence variation on differential allelic transcription factor occupancy
and gene expression // Genome Research. Cold Spring Harbor Laboratory, 2012. т. 22, № 5. сс. 860-869.
22. McDaniell R. и др. Heritable Individual-Specific and Allele-Specific Chromatin Signatures in Humans // Science. American Association for the Advancement of Science (AAAS), 2010. т. 328, № 5975. сс. 235-239.
23. Chen J. h ap. A uniform survey of allele-specific binding and expression over 1000-Genomes-Project individuals // Nature Communications. Springer Science, Business Media LLC, 2016. t. 7, № 1.
24. Shi W. h ap. Evaluating the impact of single nucleotide variants on transcription factor binding //
Nucleic Acids Research. Oxford University Press (OUP), 2016. c. gkw691.
25. Vierstra J. h ap. Global reference mapping of human transcription factor footprints // Nature.
Springer Science, Business Media LLC, 2020. t. 583, № 7818. cc. 729-736.
26. Grishin D., Gusev A. Allelic imbalance of chromatin accessibility in cancer identifies candidate
causal risk variants and their mechanisms // Nature Genetics. Springer Science, Business Media
LLC, 2022. t. 54, № 6. cc. 837-849.
27. Gaulton K.J. h ap. A map of open chromatin in human pancreatic islets // Nature Genetics. Springer Science, Business Media LLC, 2010. t. 42, № 3. cc. 255-259.
28. Flack N. h ap. Chromosome-level, nanopore-only genome and allele-specific DNA methylation
of Pallas's cat, Otocolobus manul // NAR Genomics and Bioinformatics. Oxford University Press (OUP), 2023. t. 5, № 2.
29. Shoemaker R. h ap. Allele-specific methylation is prevalent and is contributed by CpG-SNPs in the human genome // Genome Research. Cold Spring Harbor Laboratory, 2010. t. 20, № 7. cc. 883-889.
30. Abramov S. h ap. Landscape of allele-specific transcription factor binding in the human genome //
Nature Communications. Springer Science, Business Media LLC, 2021. t. 12, № 1.
31. Heap G.A. h ap. Genome-wide analysis of allelic expression imbalance in human primary cells
by high-throughput transcriptome resequencing // Human Molecular Genetics. Oxford University
Press (OUP), 2009. t. 19, № 1. cc. 122-134.
32. Moyerbrailean G.A. h ap. High-throughput allele-specific expression across 250 environmental
conditions // Genome Research. Cold Spring Harbor Laboratory, 2016. t. 26, № 12. cc. 1627-1638.
33. Liu Z., Dong X., Li Y. A Genome-Wide Study of Allele-Specific Expression in Colorectal Cancer //
Frontiers in Genetics. Frontiers Media SA, 2018. t. 9.
34. Gutierrez-Arcelus M. и др. Allele-specific expression changes dynamically during T cell activation in HLA and other autoimmune loci // Nature Genetics. Springer Science, Business Media LLC, 2020. т. 52, № 3. сс. 247-253.
35. Calabrese C. и др. Genomic basis for RNA alterations in cancer // Nature. Springer Science,
Business Media LLC, 2020. т. 578, № 7793. сс. 129-136.
36. Robles-Espinoza C.D. и др. Allele-specific expression. applications in cancer and technical
considerations // Current Opinion in Genetics & Development. Elsevier BV, 2021. т. 66. сс. 10-19.
37. Knowles D.A. и др. Allele-specific expression reveals interactions between genetic variation and environment // Nature Methods. Springer Science, Business Media LLC, 2017. т. 14, № 7. сс. 699-702.
38. Kukurba K.R. и др. Allelic Expression of Deleterious Protein-Coding Variants across Human Tissues // PLoS Genetics / под ред. Gibson G. Public Library of Science (PLoS), 2014. т. 10, № 5. с. el004304.
39. Castel S.E. и др. A vast resource of allelic expression data spanning human tissues // Genome
Biology. Springer Science, Business Media LLC, 2020. т. 2l, № l.
40. Mohammadi P. и др. Genetic regulatory variation in populations informs transcriptome analysis
in rare disease // Science. American Association for the Advancement of Science (AAAS), 2019.
т. 366, № 6463. сс. 351-356.
41. Beek D. van и др. Allele-specific expression analysis for complex genetic phenotypes applied to
a unique dilated cardiomyopathy cohort // Scientific Reports. Springer Science, Business Media LLC, 2023. т. 13, № l.
42. Rao X. и др. Allele-specific expression and high-throughput reporter assay reveal functional genetic variants associated with alcohol use disorders // Molecular Psychiatry. Springer Science,
Business Media LLC, 2019. т. 26, № 4. сс. ll42-ll5l.
43. Sigurdsson M.I. и др. Allele-specific expression in the human heart and its application to
postoperative atrial fibrillation and myocardial ischemia // Genome Medicine. Springer Science, Business Media LLC, 2016. т. 8, № l.
44. Hasin-Brumshtein Y. h Ap. Allele-specific expression and eQTL analysis in mouse adipose tissue //
BMC Genomics. Springer Science, Business Media LLC, 2014. t. 15, № 1. c. 471.
45. Balasooriya G.I., Spector D.L. Allele-specific differential regulation of monoallelically expressed
autosomal genes in the cardiac lineage // Nature Communications. Springer Science, Business
Media LLC, 2022. t. 13, № 1.
46. Salavati M. h Ap. Elimination of Reference Mapping Bias Reveals Robust Immune Related Allele-
Specific Expression in Crossbred Sheep // Frontiers in Genetics. Frontiers Media SA, 2019. t. 10.
47. Ghazanfar H., Ghazanfar A. Role of spinal cord stimulation in failed back surgery syndrome //
Archives of Medicine and Health Sciences. Medknow, 2017. t. 5, № 1. c. 136.
48. Guillocheau G.M. h Ap. Survey of allele specific expression in bovine muscle // Scientific Reports.
Springer Science, Business Media LLC, 2019. t. 9, № 1.
49. Zhuo Z., Lamont S.J., Abasht B. RNA-Seq Analyses Identify Frequent Allele Specific Expression
and No Evidence of Genomic Imprinting in Specific Embryonic Tissues of Chicken // Scientific
Reports. Springer Science, Business Media LLC, 2017. t. 7, № 1.
50. Souza M.M. de h Ap. Allele-specific expression is widespread in Bos indicus muscle and affects
meat quality candidate genes // Scientific Reports. Springer Science, Business Media LLC, 2020. t. 10, № 1.
51. Shao L. h Ap. Patterns of genome-wide allele-specific expression in hybrid rice and the implications on the genetic basis of heterosis // Proceedings of the National Academy of Sciences. Proceedings
of the National Academy of Sciences, 2019. t. 116, № 12. c. 5653.
52. Hu H. h Ap. Allele-specific Expression Reveals Multiple Paths to Highland Adaptation in Maize //
Molecular Biology and Evolution / noA peA. Wittkopp P. Oxford University Press (OUP), 2022. t. 39, № 11.
53. Borel C. h Ap. Biased Allelic Expression in Human Primary Fibroblast Single Cells // The American
Journal of Human Genetics. Elsevier BV, 2015. t. 96, № 1. cc. 70-80.
54. Jiang Y., Zhang N.R., Li M. SCALE: modeling allele-specific gene expression by single-cell RNA
sequencing // Genome Biology. Springer Science, Business Media LLC, 2017. t. 18, № 1.
55. Choi K., Raghupathy N., Churchill G.A. A Bayesian mixture model for the analysis of allelic expression in single cells // Nature Communications. Springer Science, Business Media LLC, 2019. т. 10, № 1.
56. Qi G. и др. Single-cell allele-specific expression analysis reveals dynamic and cell-type-specific regulatory effects // Nature Communications. Springer Science, Business Media LLC, 2023. т. 14, № 1.
57. Glinos G., Wei G., Shinohara M. 33827 Hospitalization outcomes in patients with CTCL: A multicenter study // Journal of the American Academy of Dermatology. Elsevier BV, 2022. т. 87, № 3. с. AB1.
58. Deviatiiarov R.M. и др. An atlas of transcribed human cardiac promoters and enhancers reveals an important role of regulatory elements in heart failure // Nature Cardiovascular Research. Springer
Science, Business Media LLC, 2023. т. 2, № 1. сс. 58-75.
59. McVicker G. и др. Identification of Genetic Variants That Affect Histone Modifications in Human
Cells // Science. American Association for the Advancement of Science (AAAS), 2013. т. 342, № 6159. сс. 747-749.
60. Mukhopadhyay R. и др. Allele-Specific Genome-wide Profiling in Human Primary Erythroblasts Reveal Replication Program Organization // PLoS Genetics / под ред. Schubeler D. Public Library
of Science (PLoS), 2014. т. 10, № 5. с. e1004319.
61. Bartholdy B. и др. Allele-specific analysis of DNA replication origins in mammalian cells // Nature
Communications. Springer Science, Business Media LLC, 2015. т. 6, № 1.
62. Dileep V., Gilbert D.M. Single-cell replication profiling to measure stochastic variation in
mammalian replication timing // Nature Communications. Springer Science, Business Media LLC, 2018. т. 9, № 1.
63. Ye T., Ma W. ASHIC: Hierarchical Bayesian modeling of diploid chromatin contacts and structures.
Cold Spring Harbor Laboratory, 2020.
64. Richer S. и др. Widespread allele-specific topological domains in the human genome are not
confined to imprinted gene clusters // Genome Biology. Springer Science, Business Media LLC, 2023. т. 24, № 1.
65. Rivera-Mulia J.C. h Ap. Allele-specific control of replication timing and genome organization
during development // Genome Research. Cold Spring Harbor Laboratory, 2018. t. 28, № 6. c. 800.
66. Zhao P. A., Sasaki T., Gilbert D.M. High-resolution Repli-Seq defines the temporal choreography
of initiation, elongation and termination of replication in mammalian cells // Genome Biology.
Springer Science, Business Media LLC, 2020. t. 21, № 1.
67. Genetic effects on gene expression across human tissues // Nature. Springer Science, Business
Media LLC, 2017. t. 550, № 7675. cc. 204-213.
68. Cleary S., Seoighe C. Perspectives on Allele-Specific Expression // Annual Review of Biomedical
Data Science. Annual Reviews, 2021. t. 4, № 1. cc. 101-122.
69. Edsgard D. h Ap. GeneiASE: Detection of condition-dependent and static allele-specific expression
from RNA-seq data without haplotype information // Scientific Reports. Springer Science, Business Media LLC, 2016. t. 6, № 1.
70. St. Pierre C.L. h Ap. Genetic, epigenetic, and environmental mechanisms govern allele-specific
gene expression // Genome Research. Cold Spring Harbor Laboratory, 2022. t. 32, № 6. cc. 10421057.
71. Li H. A statistical framework for SNP calling, mutation discovery, association mapping and population genetical parameter estimation from sequencing data // Bioinformatics. Oxford University Press (OUP), 2011. t. 27, № 21. c. 2987.
72. Lefouili M., Nam K. The evaluation of Bcftools mpileup and GATK HaplotypeCaller for variant
calling in non-human species // Scientific Reports. Springer Science, Business Media LLC, 2022. t. 12, № 1.
73. Santiago I. de h Ap. BaalChIP: Bayesian analysis of allele-specific transcription factor binding in
cancer genomes // Genome Biology. Springer Science, Business Media LLC, 2017. t. 18, № 1.
74. Geijn B. van de h Ap. WASP: allele-specific software for robust molecular quantitative trait locus
discovery // Nature Methods. Springer Science, Business Media LLC, 2015. t. 12, № 11. c. 1061.
75. Rozowsky J. h Ap. AlleleSeq: analysis of allele-specific expression and binding in a network
framework // Molecular Systems Biology. Springer Science, Business Media LLC, 2011. t. 7, № 1.
76. Pandey R.V. и др. Allelic imbalance metre (<scp>A</scp>llim), a new tool for measuring allele-specific gene expression with <scp>RNA</scp>-seq data // Molecular Ecology Resources. Wiley, 2013. т. 13, № 4. сс. 740-745.
77. Soderlund J.R. Lenape Country. Delaware Valley Society Before William Penn. University of
Pennsylvania Press, 2014.
78. Mayba O. и др. MBASED. allele-specific expression detection in cancer tissues and cell lines //
Genome Biology. Springer Science, Business Media LLC, 2014. т. 15, № 8.
79. Harvey C.T. и др. QuASAR. quantitative allele-specific analysis of reads // Bioinformatics. Oxford
University Press (OUP), 2014. т. 3l, № 8. сс. 1235-1242.
80. Romanel A. и др. ASEQ. fast allele-specific studies from next-generation sequencing data // BMC
Medical Genomics. Springer Science, Business Media LLC, 2015. т. 8, № l.
81. Shetty A. и др. Allele-specific epigenetic activity in prostate cancer and normal prostate tissue
implicates prostate cancer risk mechanisms // The American Journal of Human Genetics. Elsevier
BV, 2021. т. 108, № ll. сс. 2071-2085.
82. Fan J. и др. ASEP. Gene-based detection of allele-specific expression across individuals in a
population by RNA sequencing // PLOS Genetics / под ред. Zhu X. Public Library of Science
(PLoS), 2020. т. 16, № 5. c. el008786.
83. Nica A.C., Dermitzakis E.T. Expression quantitative trait loci. present and future // Philosophical
Transactions of the Royal Society B. Biological Sciences. The Royal Society, 2013. т. 368, № 1620. c. 20120362.
84. Visscher P.M. и др. 10 Years of GWAS Discovery. Biology, Function, and Translation // The
American Journal of Human Genetics. Elsevier BV, 2017. т. 101, № l. cc. 5-22.
85. Shabalin A.A. Matrix eQTL. ultra fast eQTL analysis via large matrix operations // Bioinformatics.
Oxford University Press (OUP), 2012. т. 28, № 10. cc. 1353-1358.
86. Sul J.H. и др. Effectively Identifying eQTLs from Multiple Tissues by Combining Mixed Model
and Meta-analytic Approaches // PLoS Genetics / под ред. Schork N.J. Public Library of Science (PLoS), 2013. т. 9, № 6. c. el00349l.
87. Gádin J.R. и др. AllelicImbalance: an R/ bioconductor package for detecting, managing, and visualizing allele expression imbalance data from RNA sequencing // BMC Bioinformatics. Springer Science, Business Media LLC, 2015. т. 16, № 1.
88. R Core Team. R: A Language and Environment for Statistical Computing. Vienna, Austria, 2013.
89. McKenna A. и др. The Genome Analysis Toolkit: A MapReduce framework for analyzing next-
generation DNA sequencing data // Genome Research. Cold Spring Harbor Laboratory, 2010. т. 20, № 9. сс. 1297-1303.
90. DePristo M.A. и др. A framework for variation discovery and genotyping using next-generation DNA sequencing data // Nature Genetics. Springer Science, Business Media LLC, 2011. т. 43, № 5. сс. 491-498.
91. Wilks S.S. The Large-Sample Distribution of the Likelihood Ratio for Testing Composite Hypotheses // The Annals of Mathematical Statistics. Institute of Mathematical Statistics, 1938. т. 9, № 1. сс. 60-62.
92. Wald A. Tests of statistical hypotheses concerning several parameters when the number of observations is large // Transactions of the American Mathematical Society. American
Mathematical Society (AMS), 1943. т. 54, № 3. сс. 426-482.
93. León-Novelo L.G. и др. A flexible Bayesian method for detecting allelic imbalance in RNA-seq
data // BMC Genomics. Springer Science, Business Media LLC, 2014. т. 15, № 1.
94. Graze R.M. и др. Allelic Imbalance in Drosophila Hybrid Heads: Exons, Isoforms, and Evolution //
Molecular Biology and Evolution. Oxford University Press (OUP), 2012. т. 29, № 6. сс. 15211532.
95. Ramensky V.E. и др. DNA Segmentation Through the Bayesian Approach // Journal of
Computational Biology. Mary Ann Liebert Inc, 2000. т. 7, № 1-2. сс. 215-231.
96. Meshcheryakov G. и др. MIXALIME: MIXture models for ALlelic IMbalance Estimation in high-
throughput sequencing data [электронный ресурс]. arXiv, 2023. URL: https://arxiv.org/abs/2306. 08287.
97. Balakrishnan N. Discrete Multivariate Distributions [электронный ресурс]. Wiley, 2005. URL: http://dx.doi.org/10.1002/0471667196.ess5099.pub2.
98. Besag J. Statistical Analysis of Non-Lattice Data // The Statistician. JSTOR, 1975. т. 24, № 3. с. 179.
99. BESAG J. Efficiency of pseudolikelihood estimation for simple Gaussian fields // Biometrika.
Oxford University Press (OUP), 1977. т. 64, № 3. сс. 616-618.
100. Tibshirani R., Hastie T. Local Likelihood Estimation // Journal of the American Statistical Association. Taylor & Francis, 1987. т. 82, № 398. сс. 559-567.
101. Loader C.R. Local likelihood density estimation // The Annals of Statistics. Institute of
Mathematical Statistics, 1996. т. 24, № 4.
102. Zhu C. и др. Algorithm 778: L-BFGS-B: Fortran subroutines for large-scale bound-constrained
optimization // ACM Transactions on Mathematical Software. Association for Computing
Machinery (ACM), 1997. т. 23, № 4. сс. 550-560.
103. Virtanen P. и др. SciPy 1.0: Fundamental Algorithms for Scientific Computing in Python // Nature
Methods. 2020. т. 17. сс. 261-272.
104. Bradbury J. и др. JAX: composable transformations of Python+NumPy programs [электронный
ресурс]. 2018. URL: http://github.com/jax-ml/jax.
105. Brown B.W., Levy L.B. Certification of Algorithm 708 // ACM Transactions on Mathematical
Software. Association for Computing Machinery (ACM), 1994. т. 20, № 3. сс. 393-397.
106. Tretter M.J., Walster G.W. Continued Fractions for the Incomplete Beta Function: Additions and
Corrections // The Annals of Statistics. Institute of Mathematical Statistics, 1979. т. 7, № 2.
107. Tretter M.J., Walster G.W. Analytic Subtraction Applied to the Incomplete Gamma and Beta
Functions // SIAM Journal on Scientific and Statistical Computing. Society for Industrial &
Applied Mathematics (SIAM), 1980. т. 1, № 3. сс. 321-326.
108. Lentz W.J. A Method of Computing Spherical Bessel Functions of Complex Argument with Tables. Defense Technical Information Center, 1973.
109. Handbook of Mathematical Functions: with Formulas, Graphs, and Mathematical Tables (Dover
Books on Mathematics). Paperback / под ред. Abramowitz M., Stegun I.A. Dover Publications, 1965. с. 1046.
110. Boik R.J., Robison-Cox J.F. Derivatives of the Incomplete Beta Function // Journal of Statistical Software. Foundation for Open Access Statistic, 1998. т. 3, № 1.
111. Poorten A.J. van der, Loxton J.H. Notes on continued fractions and recurrence sequences // Number
Theory and Cryptography. Cambridge University Press, 1990. сс. 86-97.
112. Ebisu A., Iwasaki K. Contiguous relations, Laplace's methods, and continued fractions for 3F2(1) //
The Ramanujan Journal. 2017. т. 49. сс. 159-213.
113. Tonien J. 102.06 A new elementary proof of Euler's continued fractions // The Mathematical
Gazette. Cambridge University Press (CUP), 2018. т. 102, № 553. сс. 105-111.
114. Barnett A. An algorithm for regular and irregular Coulomb and Bessel functions of real order to
machine accuracy // Computer Physics Communications. Elsevier BV, 1981. т. 21, № 3. сс. 297314.
115. Johansson F. Computing Hypergeometric Functions Rigorously // ACM Trans. Math. Softw. New
York, NY, USA: Association for Computing Machinery, 2019. т. 45, № 3.
116. Ibrahim A.K. Contiguous relations for 2F1 hypergeometric series // Journal of the Egyptian
Mathematical Society. Egyptian Knowledge Bank, 2012. т. 20, № 2. сс. 72-78.
117. Johnson N.L., Kemp A.W., Kotz S. Univariate Discrete Distributions. Wiley, 2005.
118. Graham R.L., Knuth D.E., Patashnik O. Concrete mathematics. 2-е изд. Boston, MA: Addison
Wesley, 1994.
119. Inc. W.R. Mathematica, Version 14.2 [электронный ресурс]. URL: https://www.wolfram.com/ mathematica.
120. Arbel J. Faa di Bruno's note on eponymous formula, trilingual version [электронный ресурс].
arXiv, 2016. URL: https://arxiv.org/abs/1612.05393.
121. Bell E T. Partition Polynomials // The Annals of Mathematics. JSTOR, 1927. т. 29, № 1/4. с. 38.
122. Petkovsek M., Pisanski T. Combinatorial interpretation of unsigned Stirling numbers and lah
numbers // Pi Mu Epsilon Journal. Temporary Publisher, 2007. т. 12, № 7. сс. 417-424.
123. Kummer E. // Journal für die reine und angewandte Mathematik (Crelles Journal). Walter de
Gruyter GmbH, 1837. т. 1837, № 17. сс. 228-242.
124. Panjer H.H. Recursive Evaluation of a Family of Compound Distributions // ASTIN Bulletin.
Cambridge University Press (CUP), 1981. т. 12, № 1. сс. 22-26.
125. George E.O., Mudholkar G.S. P-Values for Two-Sided Tests // Biometrical Journal. Wiley, 1990.
т. 32, № 6. сс. 747-751.
126. Benjamini Y., Hochberg Y. Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing // Journal of the Royal Statistical Society Series B: Statistical
Methodology. Oxford University Press (OUP), 1995. т. 57, № 1. сс. 289-300.
127. Seabold S., Perktold J. statsmodels: Econometric and statistical modeling with python // 9th Python
in Science Conference. 2010.
128. Marteli A. gmpy2: GMP/MPIR, MPFR, and MPC interface for Python [электронный ресурс].
2025. URL: https://pypi.org/project/gmpy2/.
129. Granlund T., the GMP development team. GNU MP: The GNU Multiple Precision Arithmetic
Library. 5.0.5 изд. 2012.
130. Fousse L. и др. MPFR: A multiple-precision binary floating-point library with correct rounding // ACM Transactions on Mathematical Software. Association for Computing Machinery (ACM), 2007. т. 33, № 2. с. 13.
131. Python Package Index - PyPI [электронный ресурс]. Python Software Foundation. URL: https://
pypi.org/ (дата обращения: 01.05.2025).
132. Bolger A.M., Lohse M., Usadel B. Trimmomatic: a flexible trimmer for Illumina sequence data //
Bioinformatics. Oxford University Press (OUP), 2014. т. 30, № 15. сс. 2114-2120.
133. Li H., Durbin R. Fast and accurate long-read alignment with Burrows-Wheeler transform //
Bioinformatics. Oxford University Press (OUP), 2010. т. 26, № 5. сс. 589-595.
134. Kim D. и др. Graph-based genome alignment and genotyping with HISAT2 and HISAT-genotype //
Nature Biotechnology. Springer Science, Business Media LLC, 2019. т. 37, № 8. сс. 907-915.
135. Kolmykov S. и др. GTRD: an integrated view of transcription regulation // Nucleic Acids Research.
Oxford University Press (OUP), 2020. т. 49, № D1. сс. D104-D111.
136. Buyan A. и др. Statistical framework for calling allelic imbalance in high-throughput sequencing
data // Nature Communications. Springer Science, Business Media LLC, 2025. т. 16, № 1.
137. Liu Y. и др. RNA-Seq identifies novel myocardial gene expression signatures of heart failure //
Genomics. Elsevier BV, 2015. т. 105, № 2. сс. 83-89.
138. Anene-Nzelu C.G. и др. Genomic enhancers in cardiac development and disease // Nature Reviews
Cardiology. Springer Science, Business Media LLC, 2021. т. 19, № 1. сс. 7-25.
139. Gasperini M., Tome J.M., Shendure J. Towards a comprehensive catalogue of validated and target-linked human enhancers // Nature Reviews Genetics. Springer Science, Business Media LLC, 2020. т. 21, № 5. сс. 292-310.
140. rs309357 RefSNP Report - dbSNP - NCBI [электронный ресурс]. National Institute of Health,
USA. URL: https://www.ncbi.nlm.nih.gov/snp/rs309357 (дата обращения: 01.07.2025).
141. Yu Z.L. и др. Serum fibroblast growth factor-2 levels complement vital biomarkers for diagnosing
heart failure // BMC Cardiovascular Disorders. Springer Science, Business Media LLC, 2024. т. 24, № 1.
142. House S.L. и др. Fibroblast growth factor 2 mediates isoproterenol-induced cardiac hypertrophy through activation of the extracellular regulated kinase // Mol. Cell. Pharmacol. 2010. т. 2, № 4. сс. 143-154.
143. Zhao Y., Rahmouni K. BBSome: a New Player in Hypertension and Other Cardiovascular Risks //
Hypertension. Ovid Technologies (Wolters Kluwer Health), 2022. т. 79, № 2. сс. 303-313.
144. Elbedour K. и др. Cardiac abnormalities in the Bardet-Biedl syndrome: Echocardiographic studies
of 22 patients // American Journal of Medical Genetics. Wiley, 1994. т. 52, № 2. сс. 164-169.
145. Himes B.E. и др. Genome-Wide Association Analysis in Asthma Subjects Identifies SPATS2L as
a Novel Bronchodilator Response Gene // PLoS Genetics / под ред. Ober C. Public Library of Science (PLoS), 2012. т. 8, № 7. с. el002824.
146. Workman A.J. Cardiac adrenergic control and atrial fibrillation // Naunyn-Schmiedeberg's
Archives of Pharmacology. Springer Science, Business Media LLC, 2009. т. 38l, № 3. сс. 235249.
147. Arking D.E. и др. Genetic association study of QT interval highlights role for calcium signaling pathways in myocardial repolarization // Nature Genetics. Springer Science, Business Media LLC, 2014. т. 46, № 8. сс. 826-836.
148. Vorontsov I.E. и др. HOCOMOCO in 2024: a rebuild of the curated collection of binding models
for human and mouse transcription factors // Nucleic Acids Research. Oxford University Press
(OUP), 2023. т. 52, № Dl. сс. D154-D163.
149. Deplancke B., Alpern D., Gardeux V. The Genetics of Transcription Factor DNA Binding
Variation // Cell. Elsevier BV, 2016. т. 166, № 3. сс. 538-554.
150. Luna-Zurita L. и др. Complex Interdependence Regulates Heterotypic Transcription Factor
Distribution and Coordinates Cardiogenesis // Cell. Elsevier BV, 2016. т. 164, № 5. сс. 999-1014.
151. Li S. и др. Context-dependent T-BOX transcription factor family: from biology to targeted
therapy // Cell Communication and Signaling. Springer Science, Business Media LLC, 2024. т. 22, № 1.
152. König T. и др. The m -AAA Protease Associated with Neurodegeneration Limits MCU Activity
in Mitochondria // Molecular Cell. Elsevier BV, 2016. т. 64, № 1. сс. 148-162.
153. De Bortoli M. и др. An antisense lncRNA mediated mechanism controls desmoplakin gene
expression // Cardiovascular Research. Oxford University Press (OUP), 2024. т. 120, № Supplement_l.
154. Yuan Z.-Y. и др. Desmoplakin and clinical manifestations of desmoplakin cardiomyopathy // Chinese Medical Journal. Ovid Technologies (Wolters Kluwer Health), 2021. т. l34, № 15. сс. l77l-l779.
155. rs2076298 RefSNP Report - dbSNP - NCBI [электронный ресурс]. National Institute of Health,
USA. URL: https://www.ncbi.nlm.nih.gov/snp/rs2076298 (дата обращения: 0l.07.2025).
156. Schödel J. и др. High-resolution genome-wide mapping of HIF-binding sites by ChIP-seq // Blood.
American Society of Hematology, 20ll. т. ll7, № 23. сс. e207-e2l7.
157. rs2076298 - ADASTRA Database [электронный ресурс]. Autosome team. URL: https://adastra.
autosome.org/mabel/snps/rs2076298/C?fdr=0.05&es=0 (дата обращения: 0l.07.2025).
158. Knutson A.K. и др. HIF in the heart: development, metabolism, ischemia, and atherosclerosis //
Journal of Clinical Investigation. American Society for Clinical Investigation, 2021. т. l3l, № 17.
159. Janbandhu V. и др. Hif-la suppresses ROS-induced proliferation of cardiac fibroblasts following
myocardial infarction // Cell Stem Cell. Elsevier BV, 2022. т. 29, № 2. сс. 281-297.
160. Yang C. и др. The Diminution of R-Loops Generated by LncRNA DSP-ASl Inhibits DSP Gene
Transcription to Impede the Re-Epithelialization During Diabetic Wound Healing // Advanced
Science. Wiley, 2025. т. l2, № 12.
161. Fisher R.A. On the Interpretation of x 2 from Contingency Tables, and the Calculation of P //
Journal of the Royal Statistical Society. JSTOR, 1922. т. 85, № l. c. 87.
162. Bulik-Sullivan B.K. h Ap. LD Score regression distinguishes confounding from polygenicity in genome-wide association studies // Nature Genetics. Springer Science, Business Media LLC, 2015. t. 47, № 3. cc. 291-295.
163. Finucane H.K. h Ap. Partitioning heritability by functional annotation using genome-wide association summary statistics // Nature Genetics. Springer Science, Business Media LLC, 2015. t. 47, № 11. cc. 1228-1235.
164. Zhou J., Troyanskaya O.G. Predicting effects of noncoding variants with deep learning-based
sequence model // Nature Methods. Springer Science, Business Media LLC, 2015. t. 12, № 10. cc. 931-934.
165. Avsec Z. h Ap. Effective gene expression prediction from sequence by integrating long-range interactions // Nature Methods. Springer Science, Business Media LLC, 2021. t. 18, № 10. cc. 1196-1203.
166. Sasse A. h Ap. Benchmarking of deep neural networks for predicting personal gene expression from DNA sequence highlights shortcomings // Nature Genetics. Springer Science, Business Media LLC, 2023. t. 55, № 12. cc. 2060-2064.
167. Kathail P. h Ap. Current genomic deep learning models display decreased performance in cell type-
specific accessible regions // Genome Biology. Springer Science, Business Media LLC, 2024. t. 25, № 1.
168. Huang C. h Ap. Personal transcriptome variation is poorly explained by current genomic deep learning models // Nature Genetics. Springer Science, Business Media LLC, 2023. t. 55, № 12. cc. 2056-2059.
169. Agarwal V. h Ap. Massively parallel characterization of transcriptional regulatory elements //
Nature. Springer Science, Business Media LLC, 2025. t. 639, № 8054. cc. 411-420.
170. Mendelevich A. h Ap. Foreign RNA spike-ins enable accurate allele-specific expression analysis at
scale // Bioinformatics. Oxford University Press (OUP), 2023. t. 39, № Supplement_l. cc. i431-i439.
171. Gupta A., Song D. Generalized liouville distribution // Computers and Mathematics with Applications. Elsevier BV, 1996. t. 32, № 2. cc. 103-109.
Приложение A. Исходные материалы
Графики
Большинство графиков, представленные в данной работе, были построены самостоятельно используя следующее ПО:
• Библиотека matplotlib;
• Библиотека cetz-plot для языка вёрстки Typst;
• ПО для отрисовки диаграмм drawio.
Все скрипты и исходные данные доступны в репозитории диссертационной работы по ссылке: https://github.com/geomesch/mixalime-thesis
Программный код
Все практические результаты, продемонстрированные в данной работе, были получены при
помощи версии ПО MIXALIME v 2.13.0. Конкретно она доступна на репозитории по ссылке
https://github.eom/autosome-ru/MixALime/releases/tag/v2.13.0.
Симуляционные исследования были проведены в рамках основной публикации [96,136] и
исходный код доступен на репозитории: https://github.com/autosome-ru/mixalime_simulation/.
Приложение B. Вычисление функции распределения из QuASAR
Пусть дана составная модель:
х I п, 6, Л ~ ЪеЛ-иЪгпуат(п, ах,@х) (В.1)
= 6Л, ¡Зх = (1- 6)Л (В.2)
6 1р,к~ ЪеА,и(ав,^в) (В.3)
ав = рк, @в = (1- И-)* (В.4) Цель - рассчитать Рх(х) = Р(Х < х).
1. Маргинальная функция вероятности Р(Х = _/): Функция вероятности для х
получается путем маргинализации 6:
Р(Х — j)
) = f
Jo
Р(Х — j | 6)f(6)d6
(B.5)
где Р(Х = } I в) - это функция вероятности "ВеЛи'Ыпу&т, а /(6) - это плотность вероятности Ъе^и--распределения.
P(.X = jl6) = C(n,j)^ + eA>n-j + (1-m
т —
В(6Л, (1 - 6)Л) Qae-l(l - ef3-1
В(ае,Ре)
Подставляя их, получаем функцию вероятности:
(B.6) (B.7)
Р(х = i) = c(nJ) г = B(ae,j3e) J
(B.8)
где Ij - это интеграл:
L
= f
Jo
B(j + 1Л,п- j + (1- ОЛ)
в(а, (l - t)X)
tae-l(i - tf
dt
(B.9)
2. Численный расчет P(X — j):
Логарифмическая шкала для стабильности: Вычисления, включающие Гамма-функции (Г) для Бета-функций (В(и, v) — Г(м)гГ+~) и биномиальные коэффициенты (C(n,j)), выполняются в логарифмической области с использованием gammaln для предотвращения потери точности (ошибки типа «underflow/overflow»).
► log C(n,j) — gammaln(n + 1) — gammaln(j + 1) — gammaln(n — j + 1)
► logB(u, v) — gammaln(u) + gammaln(u) — gammaln(u + v)
l
• Ядро подынтегрального выражения: Ядро подынтегрального выражения для Ij (исключая константы, связанные с нормализацией /(б)) имеет вид:
(B10)
• Численное интегрирование: Интеграл Ij вычисляется численно с использованием адаптивной квадратуры (например, scipy.integrate.quad).
Ij — jj e^'^dt (B.ll)
Сингулярности при t — 0 или t — l (если < l или < l) обрабатываются путем указания их как точек интегрирования для квадратурной процедуры.
• Итоговое logP(X — j):
log Р(Х — j) — log C(n,j) - log B(ae,pe) + log Ij (B.l2)
3. Функция распределения FX(k): Она представляет собой сумму значений функции вероятностей:
X
FX(x) — TjP(X — j) (B.13)
j=o
Для поддержания численной стабильности, особенно для малых вероятностей, это суммирование выполняется в логарифмической области с использованием функции «Logsumexp»:
Рх(х) — exp(logsumexp j=0(log Р(Х — j))) (B.14)
где logsumexp(al5 ...,ат) — log (Z!=i exp(aj)).
Приложение C. Пример подсчёта функции вероятности представителей семейства МСЖЪ
в рамках библиотеки jacobin
Распределения семейства ЖбЖЪ считаются через рекуррентные формулы. Для того, чтобы
функция была JIT-компилируемой, в JAX (точнее, в XLA, на котором основан JAX)
предпочтительно чтобы она возвращала и принимала массивы фиксированного размера, иначе
будет происходит перекомпиляция при каждом изменении размера входных/выходных массивов.
Поэтому, рекуррентные тождества jacobin требуют 3-х аргументов: минимальный min_x и
максимальное значение х max_x, а также длина выходного массива. Выходной массив будет иметь
длину sz, на первой позиции которого будет подсчтинная функция в min_x и далее вплоть до max_x
(оставшиеся точки, если таковые есть, будут заполнены мусором).
Рассмотрим подсчёт функций плотности обобщённых МСЖЪ на примере построения
рисунка 2.22:
1 import numpy as np ■»Python
2 import matpiotlib.pyplot as pit
3 import jacobin
4
5 P_ = 0
6 г_ = 20
7
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.