Стратификация рисков трансформации в острый лейкоз и смерти у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Буг Дмитрий Сергеевич

  • Буг Дмитрий Сергеевич
  • кандидат науккандидат наук
  • 2025, «Российский национальный исследовательский медицинский университет имени Н.И. Пирогова» Министерства здравоохранения Российской Федерации
  • Специальность ВАК РФ00.00.00
  • Количество страниц 221
Буг Дмитрий Сергеевич. Стратификация рисков трансформации в острый лейкоз и смерти у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Российский национальный исследовательский медицинский университет имени Н.И. Пирогова» Министерства здравоохранения Российской Федерации. 2025. 221 с.

Оглавление диссертации кандидат наук Буг Дмитрий Сергеевич

ОГЛАВЛЕНИЕ

ВВЕДЕНИЕ

ГЛАВА 1 ЛИТЕРАТУРНЫЙ ОБЗОР

1.1. Базы данных нуклеотидных и белковых последовательностей

1.2. Методы филогенетической реконструкции

1.2.1. Построение филогенетических деревьев

1.2.2. Графовый метод

1.3. Множественное выравнивание последовательностей

1.4. Определение клинической значимости вариантов in silico

1.4.1. Программы-предикторы на основе выравнивания аминокислотных последовательностей

1.4.2. Программы-предикторы на основе выравнивания нуклеотидных последовательностей

1.4.3. Ансамблевый подход

1.5. Применение программ-предикторов в медицине

1.6. Определение клинического значения вариантов

ГЛАВА 2 МАТЕРИАЛЫ И МЕТОДЫ

2.1. Определение требований к информационной системе

2.2. Разработка программы для поиска ортологов

2.2.1. Разработка модуля для создания базы данных последовательностей

2.2.2. Разработка модуля для реализации метода COG

2.3. Определение факторов для дифференциации патогенных и нейтральных вариантов

2.3.1. Определение эволюционной распространённости с помощью выравнивания

последовательностей аминокислот

2.3.2. Определение эволюционной распространённости с помощью выравнивания псевдоридов

2.3.3. Фактор популяционной распространённости

2.3.4. Фактор локализации в «горячей точке»

2.3.5. Фактор онкогенности

2.3.6. Фактор механизма нарушения функции гена

2.3.7. Обучение и отбор признаков

2.4. Разработка информационной системы

2.4.1. Разработка программы для анализа данных NGS

2.4.2. Разработка веб-приложения для классификации миссенс-вариантов гена TP53

2.4.3. Оценка операционных характеристик информационной системы

2.4.4. Валидация информационной системы

ГЛАВА 3. РЕЗУЛЬТАТЫ И ИХ ОБСУЖДЕНИЕ

3.1. Основные характеристики информационной системы

3.2. Программа для поиска ортологов

3.2.1. Модуль для создания базы данных последовательностей

3.2.2. Модуль для реализации метода COG

3.2.3. Поиск ортологов генов TP53, BRCA1, BRCA2, PIK3CA и DICER1

3.3. Факторы для дифференциации патогенных и нейтральных вариантов

3.3.1. Фактор эволюционной распространённости

3.3.2. Фактор популяционной распространённости

3.3.3. Фактор онкогенности

3.3.4. Отбор признаков

3.4. Информационная система для стратификации рисков

3.4.1. Алгоритм классификации генетических вариантов

3.4.2. Пайплайн для анализа данных, полученных с помощью NGS

3.4.3. Веб-приложение для классификации миссенс-замен TP53

3.4.4. Оценка операционных характеристик информационной системы

3.4.4.1. Определение нейтральных вариантов на основе выравниваний нуклеотидных последовательностей

3.4.5. Примеры оценки патогенности известных мутаций гена DICER1

3.4.6. Валидация информационной системы

3.4.6.1. Когорта пациентов Международной рабочей группы по изучению МДС

3.4.6.2. Когорта пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава

России

ЗАКЛЮЧЕНИЕ

ВЫВОДЫ

ПРАКТИЧЕСКИЕ РЕКОМЕНДАЦИИ

СПИСОК СОКРАЩЕНИЙ И УСЛОВНЫХ ОБОЗНАЧЕНИЙ

СПИСОК ЛИТЕРАТУРЫ

СПИСОК ИЛЛЮСТРАТИВНОГО МАТЕРИАЛА

Приложение А. Аминокислотные замены, соответствующие вариантам из базы данных ClinVar, их известное и полученное при помощи разработанного

алгоритма клиническое значение

Приложение Б. Варианты из базы данных ClinVar, обнаруженные среди нуклеотидных вариантов в картах выравнивания псевдоридов, и их клиническое значение

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Стратификация рисков трансформации в острый лейкоз и смерти у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа»

ВВЕДЕНИЕ

Актуальность темы исследования. В настоящее время для выбора тактики ведения пациентов с онкогематологическими, нейроонкологическими и другими заболеваниями необходимо применять молекулярно-генетические методы, которые позволяют обнаруживать нарушения дезоксирибонуклеиновой кислоты (ДНК) на геномном, хромосомном и генном уровнях [26, 175]. Технология секвенирования следующего поколения (next generation sequencing, NGS) отличается от классического секвенирования по Сэнгеру значительным увеличением пропускной способности метода, позволяя обнаруживать большее число нарушений ДНК и использовать дополнительные сведения при выборе тактики ведения пациентов [105]. С внедрением метода NGS в клиническую практику объемы данных мутационного анализа ДНК пациентов с различными патологиями значительно увеличились. При этом выросло и число находок, клиническое значение (клинический эффект) которых остаётся неясным [105, 234]. В частности, большинство генетических вариантов, обнаруживаемых в некодирующих областях генома, являются неинтерпретируемыми (варианты неясного значения) [96]. В то же время, согласно базе данных ClinVar, около 75% генетических вариантов неясного значения представлено миссенс-заменами [61, 65]. В структуре генетических вариантов, обнаруженных при анализе опухолевых тканей, миссенс-замены также составляют большинство [21]. Таким образом, наиболее остро проявляется проблема определения клинической значимости генетических вариантов в некодирующих областях генома и миссенс-замен.

Миелодиспластический синдром (МДС) — это группа заболеваний с поражением стволовой клетки крови, характеризующихся цитопенией и риском

трансформации в острый миелоидный лейкоз (ОМЛ). Спектр возможных опций при определении тактики ведения пациентов варьирует от динамического наблюдения до системной противоопухолевой терапии с возможностью выполнения трансплантации гемопоэтических стволовых клеток. Для того чтобы определить, какой метод будет наиболее эффективным, используются специальные шкалы, позволяющие оценить индивидуальный риск развития осложнений: международная прогностическая балльная система (international prognostic scoring system, IPSS) [128], прогностическая балльная система Всемирной организации здравоохранения (World health organisation prognostic scoring system, WPSS) [256], пересмотренная международная прогностическая балльная система (revised international prognostic scoring system, IPSS-R) [203] и другие. Эти шкалы учитывают выраженность цитопении, уровень бластных клеток в костном мозге, а также наличие геномных и хромосомных нарушений ДНК. По мере прогрессирования заболевания у пациентов с МДС повышается частота возникновения мутаций в гене TP53, что ассоциировано с увеличенным риском развития осложнений и смерти [154, 226]. В целом, мутации в этом гене наиболее часто встречаются при злокачественных новообразованиях и связаны с неблагоприятным прогнозом [9], а у пациентов с МДС и ОМЛ они возникают в 5-10% случаев и приводят к ухудшению ответа на химиотерапию и снижению выживаемости [226]. Следует подчеркнуть, что это касается только патогенных мутаций, что обусловливает необходимость определения клинического эффекта генетических вариантов TP53, многие из которых попадают в категорию неясного значения. Таким образом, на сегодняшний день существует проблема определения патогенности генетических вариантов неясного значения в гене TP53, которая не позволяет корректно оценивать риски трансформации в ОМЛ и смерти у пациентов с МДС с учётом факторов, выявляемых на молекулярно-генетическом уровне.

Степень разработанности темы исследования. В настоящее время для оценки клинической значимости генетического варианта используются методы in vivo, in vitro или in silico. К методам in silico относится определение клинической значимости генетических вариантов при помощи программ-предикторов,

опирающихся на эволюционную консервативность гена и структурные характеристики продуцируемого им белка. Данные программы рекомендуются к использованию при обнаружении терминальных и соматических мутаций [219, 220, 221]. Согласно «Руководству по интерпретации данных последовательности ДНК человека, полученных методами массового параллельного секвенирования (MPS)» рекомендуется использовать компьютерные прогностические программы в случае, если генетический вариант не был описан ранее и не представлен ни в одной из баз данных или сведения о нём недостаточны [10]. То же касается и соматических мутаций, обнаруженных у пациентов с онкологическими заболеваниями [11]. Внедрение стандарта оценки клинического значения генетических вариантов позволяет реклассифицировать их, уточняя представление о пациенте с учётом новых данных, а также скорректировать тактику ведения больного [193].

Одним из основных принципов оценки клинической значимости in silico является поиск обнаруженных у пациента генетических вариантов среди последовательностей-гомологов изменённого гена. Он лежит в основе ConSurf [67], EVE [75], PROVEAN [58] и других программ. В AlphaMissense и других программах используется дополнительная информация о структуре и функции белкового продукта исследуемого гена [25]. «Ансамблевые» программы (например, APF2) осуществляют оценку патогенности генетических вариантов на основе результатов работы других программ-предикторов [265].

Однако, из-за недостаточной специфичности результаты работы прогностических программ могут использоваться для применения лишь дополнительных критериев для определения нейтральных (критерий BP4) и патогенных (критерий PP3) вариантов [10, 151, 220]. При этом патогенность генетического варианта может подтверждаться только при условии его соответствия другим критериям, которые предполагают проведение функциональных и клинических исследований. Следовательно, оценка патогенности генетического варианта, полученная с помощью программ-предикторов, не может использоваться в качестве основополагающего критерия

для классификации генетических вариантов согласно общепринятым руководствам для интерпретации данных секвенирования. Более того, программы-предикторы ограничиваются классификацией вариантов в целом, без учёта нозологии и персонализированного подхода. Кроме того, во многих программах не осуществляется обновление информации о характеристиках патогенных вариантов.

Таким образом, в настоящее время существует потребность в создании новой постоянно актуализируемой информационной системы для оценки клинической значимости генетических вариантов с выделением группы высоких рисков трансформации в ОМЛ и летального исхода у взрослых пациентов с МДС на основе механизма сбора из различных баз данных для получения информации об изменении функции и структуры белка, эволюционной консервативности гена, популяционной распространённости генетического варианта и его онкогенности.

Цель исследования: разработка информационной системы для стратификации рисков трансформации в острый лейкоз или летального исхода у пациентов с миелодиспластическим синдромом на основе данных мутационного анализа ТР53.

Задачи исследования

1. Определить требования к информационной системе с учётом особенностей алгоритмов, лежащих в основе современных программ-предикторов.

2. Разработать программу для поиска ортологов в целях определения эволюционной распространённости генетических вариантов среди ортологичных последовательностей.

3. Выявить информативные факторы для дифференциации патогенных и нейтральных вариантов.

4. Разработать алгоритмическое и программное обеспечение информационной системы для определения групповых и индивидуальных рисков трансформации в ОМЛ и летального исхода больных с МДС, определить её операционные характеристики.

Научная новизна исследования. В результате выполнения диссертационного исследования получены следующие результаты, характеризующиеся научной новизной:

1. Разработан метод исследования эволюционной вариабельности мультидоменных белков, основанный на множественном выравнивании субпоследовательностей ортологов.

2. Впервые в России создана программа для поиска ортологов, позволяющая изучать эволюционную историю произвольных генов с использованием как кластеров Маркова, так и наибольших максимальных клик.

3. Предложена новая концепция, основанная на методе генетического выравнивания «псеворидов» гомологичных последовательностей, предназначенная для определения нейтрального клинического эффекта генетических вариантов.

В рамках выполнения диссертационной работы было осуществлено решение актуальной научной задачи — стратификация пациентов с миелодиспластическим синдромом на основании данных мутационного анализа гена ТР53, что имеет значение для медицинской информатики.

Теоретическая и практическая значимость работы. Созданная информационная система позволяет определять группы высокого и низкого риска трансформации в лейкоз и смерти среди пациентов с МДС на основе данных мутационного анализа ТР53. По мере обновления информации из независимых баз данных может производиться реклассификация генетических вариантов.

Информационная система предназначена для использования лабораторным генетиком при интерпретации данных мутационного анализа гена ТР53 у пациентов с МДС для оценки патогенности обнаруженных мутаций. Для интерпретации миссенс-замен целесообразно применять информационную систему в виде веб-приложения, где в качестве входных параметров указываются координаты мутации и альтернативная аминокислота.

Положения, выносимые на защиту

1. Информационная система обладает наилучшей точностью определения патогенных мутаций генов ТР53, BRCA1, BRCA2, DICER1 и Р1К3СА среди программ-предикторов, а по чувствительности и специфичности не уступает им.

2. Информационная система обеспечивает стратификацию рисков трансформации в лейкоз и летального исхода у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа.

Степень достоверности результатов исследования. Достоверность исследования обеспечена корректностью применения современных методик сбора и обработки исходной информации, правильным подбором объектов наблюдения, достаточным объемом исследуемой выборочной совокупности, использованием апробированного математического аппарата и подтверждается проверкой, обсуждением результатов исследования на международных и всероссийских научных конференциях, публикациями результатов исследования в рецензируемых научных изданиях.

Внедрение результатов работы в практическое здравоохранение.

Результаты внедрены в работу Лаборатории трансплантологии и молекулярной гематологии клиники «НИИ детской онкологии, гематологии и трансплантологии им. Р.М. Горбачевой» ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России и в учебный процесс кафедры физики, математики и информатики ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России.

Методология и методы исследования. Объектом настоящего исследования являются данные молекулярной диагностики пациентов с миелоидной патологией, включая МДС, — одного из наиболее актуальных направлений развития современной онкологии. В качестве предмета исследования рассматривается оценка индивидуальных и групповых рисков трансформации в ОМЛ и смерти у пациентов с МДС. В данной работе для обозначения любого отличия последовательности ДНК пациента от референсной последовательности генома человека 2013 года версии GRCh38 используется термин «генетический вариант». Ретроспективно были проанализированы результаты мутационного анализа гена

TP53 пациентов с МДС и ОМЛ, обследованных в рамках деятельности Международной рабочей группы изучения МДС (2343 человека) [154] и проходивших лечение в ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России в период с 2018 по 2023 год (195 человек). В качестве материала для выделения ДНК использовался костный мозг или кровь. Методы настоящего исследования включают в себя обработку биологических, а также деперсонифицированных клинических и лабораторных данных с использованием языка Python 3 и библиотеки Pandas, формирование баз данных последовательностей типа Lightning Memory-Mapped Database (LMDB) при помощи программного пакета BLAST+ [43], графовый анализ, визуализацию графов в виде файлов HTML (HyperText Markup Language, язык гипертекстовой разметки) с внедрёнными функциями JavaScript, множественное выравнивание последовательностей, построение филогенетических деревьев, анализ данных, полученных с помощью NGS, методы дескриптивной и сравнительной статистики, включая отбор признаков и анализ выживаемости..

Апробация результатов. Основные положения диссертации доложены и обсуждены на:

1. XXIV Всероссийской конференции молодых учёных с международным участием «Актуальные проблемы биомедицины - 2018» (г. Санкт-Петербург, 12-13 апреля 2018 г.);

2. XVI Санкт-Петербургской международной конференции «Региональная информатика (РИ-2018)» (г. Санкт-Петербург, 24-26 октября 2018 г.);

3. Конференции «Вычислительная биология и искусственный интеллект для персонализированной медицины 2022» (г. Москва, 2-4 августа 2022 г.);

4. XXVII конгрессе Европейской Ассоциации Гематологии «EHA2022 Congress» (г. Вена, 9-12 июня 2022 г.);

5. XVIII международном Симпозиуме памяти Раисы Максимовны Горбачевой «Трансплантация гемопоэтических стволовых клеток. Генная и клеточная терапия» (г. Санкт-Петербург, 19-21 сентября 2024 г.);

6. Заседаниях кафедры медицинской кибернетики и информатики им. С. А. Гаспаряна медико-биологического факультета ФГАОУ ВО РНИМУ им. Н.И. Пирогова Минздрава России (Пироговский Университет) 26 марта 2024 г., 24 сентября 2024 г., 24 июня 2025 г.

Апробация диссертационной работы была проведена 3 июня 2025 г. (протокол заседания № 2) на Проблемной комиссии №18 «Биомедицинская статистика» ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России.

Публикации по теме диссертации. По теме диссертации опубликовано 16 научных работ, в том числе в рецензируемых научных изданиях — 2, входящих в международные реферативные базы данных и системы цитирования — 6, входящих в сборники конференций — 4, свидетельств о регистрации программы для электронно-вычислительных машин (ЭВМ) — 3, иных входящих в перечень Высшей аттестационной комиссии — 1. В опубликованных работах в полной мере изложены основные положения диссертации. В диссертации отсутствуют недостоверные сведения об опубликованных соискателем ученой степени работах, в которых изложены основные научные результаты диссертации.

Личный вклад автора. Диссертация является результатом самостоятельной научно-исследовательской работы, выполненной на кафедре физики, математики и информатики ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России. Автором лично выполнен весь объем исследования, произведен обзор отечественной и иностранной литературы по изучаемой проблеме, проведен логический и статистический анализ результатов исследования, разработаны методика, методы и компьютерные программы, сформулированы выводы и практические рекомендации, оформлены диссертация и автореферат.

Соответствие диссертации паспорту специальности. Диссертация выполнена по специальности медицинской отрасли науки 3.3.9. Медицинская информатика (медицинские науки) и соответствует пунктам 3 и 5 паспорта специальности: 3. Разработка компьютерных методов, баз данных и программных средств для получения, накопления, обработки, передачи и систематизации медицинских и экологических данных с целью использования в лечебно-

диагностическом, реабилитационном, профилактическом, образовательном процессах, 5. Разработка алгоритмов профилактики, диагностики, прогнозирования, лечения; моделей и алгоритмов для оценки индивидуального и группового риска.

Объем и структура диссертации. Диссертация изложена на 221 странице машинописного текста (191 страница без приложений) и состоит из введения, обзора литературы, материалов и методов, главы собственных исследований, заключения, выводов, практических рекомендаций, списка сокращений и условных обозначений, списка литературы и списка иллюстративного материала. Иллюстрирована 20 таблицами и 27 рисунками. Библиографический указатель включает 12 отечественных и 253 зарубежных источника.

ГЛАВА 1 ЛИТЕРАТУРНЫЙ ОБЗОР

В данной главе при использовании данных отечественной и зарубежной литературы представлен обзор современных компьютерных технологий, которые применяются для определения патогенности генетических вариантов, а также общепринятый алгоритм интерпретации значения генетических вариантов в целом, что в конечном счёте позволяет учитывать различные факторы, включая молекулярные, при выборе тактики ведения пациентов.

1.1. Базы данных нуклеотидных и белковых последовательностей

Современные программы для оценки клинической значимости (патогенности) генетических вариантов основываются на множественных выравниваниях нуклеотидных последовательностей гомологичных генов [73, 76, 126, 163] или аминокислотных последовательностей их продуктов [19, 58, 67, 75, 104, 202, 210]. В основе этих методов лежит сравнение генов, кодирующих нормально функционирующие белки, с геном, содержащим исследуемый генетический вариант.

На первом этапе, для описания всех возможных форм гена, способных продуцировать функциональный продукт, необходимо идентифицировать гомологичные (имеющие общее происхождение) гены различных биологических видов. Выравнивание и сравнение последовательностей исследуемого гена и его гомологов позволяет определить, присутствуют ли среди гомологичных генов последовательности с аналогичными миссенс-вариантами. Наличие таких вариантов может указывать на их доброкачественность и отсутствие негативного влияния на функцию гена. Таким образом, основой для оценки клинической значимости миссенс-замен является поиск гомологов исследуемого гена, что подразумевает изучение эволюции генов. Следует отметить, что исследование эволюции более информативно при сравнении аминокислотных последовательностей, и именно они используются в подавляющем большинстве программ-предикторов [55].

Таким образом, основу любого метода оценки патогенности вариантов неясного значения составляет база данных нуклеотидных или аминокислотных последовательностей, которые используются для сравнения в процессе

определения допустимости того или иного генетического варианта. Такая база данных должна отвечать следующим ключевым принципам [130, 235]:

1. База данных должна быть наиболее полной при условии минимизации избыточности (то есть наличия в базе нескольких последовательностей, соответствующих одному и тому же реальному прототипу: изоформе белка, рибонуклиновой кислоты (РНК), гену);

2. База данных должна содержать наиболее современную аннотацию каждой последовательности;

3. Атрибуты объектов базы данных должны быть совместимы с различными компьютерными программами, применяемыми для оценки клинической значимости вариантов;

4. Базы данных должны обладать высокой степенью функциональной совместимости между собой.

Существует четыре основных источника белковых последовательностей: GenPept, RefSeq, TrEMBL и SWISS-PROT. Все они связаны с соответствующими базами данных нуклеотидных последовательностей.

GenPept является частью GenBank — базы данных генетических последовательностей Национального Института Здоровья Соединённых Штатов Америки, включающей нуклеотидные последовательности и их белковые продукты [108].

Объекты в GenBank содержат атрибуты, описывающие длину последовательности, тип молекулы, координаты транслируемых участков, источник биоматериала и название организма, к которому принадлежит последовательность. Кроме того, формат GenBank включает описание объекта, которое может содержать название соответствующего гена или белка, его функцию, а также ссылки на литературные источники.

GenBank пополняется преимущественно за счёт исследователей, которые отправляют полученные последовательности и их аннотации через онлайн-систему регистрации или специализированные программы (BankIt, Sequin, tbl2asn). Каждому объекту присваивается уникальный идентификатор в течение примерно

двух дней. Процесс регистрации сопровождается контролем качества, включающим проверку на отсутствие контаминации, корректность трансляции кодирующих областей, таксономической классификации и библиографических ссылок. После проверки заявка с замечаниями отправляется автору для уточнений. Кроме того, GenBank пополняется данными из других аналогичных баз, таких как Европейская молекулярно-биологическая лаборатория (European molecular biology laboratory, EMBL) и Японская база данных ДНК [107], что обеспечивается благодаря Международной коллаборации баз данных нуклеотидных последовательностей (International Nucleotide Sequence Database Collaboration, INSDC).

Структура базы данных нуклеотидных последовательностей EMBL — европейский нуклеотидный архив (European nucleotide archive, ENA), во многом схожа с GenBank, но отличается тем, что не включает аминокислотные последовательности. Для их хранения в Европейской молекулярно-биологической лаборатории была создана отдельная база данных UniProtKB/TrEMBL [46].

Объекты в базах данных ENA и UniProtKB/TrEMBL имеют схожие атрибуты: длина последовательности, тип молекулы, источник биоматериала и таксономическая классификация организма-источника. Каждый объект снабжён описанием, включающим функцию гена или белка, его участки, а также ссылки на литературные источники. Подобно GenBank, база данных ENA пополняется исследователями с использованием специализированных программ (Webin, Sequin). Система EMBL также проводит проверку на контаминацию векторами в предоставляемых исследователями последовательностях.

UniProtKB/TrEMBL является одной из двух частей базы данных белков UniProt в системе EMBL. Вторая часть, UniProtKB/Swiss-Prot, содержит белковые последовательности, которые аннотируются и проверяются сотрудниками EMBL. Аннотация в UniProtKB/Swiss-Prot основывается на научной литературе, посвящённой экспериментально изученным белкам, а также на биоинформатическом анализе, проводимом кураторами, ответственными за аннотацию белков [92, 244]. Исследования показывают, что в автоматически

аннотируемых базах данных, таких как GenBank и UniProtKB/TrEMBL, ошибки в описании суперсемейств ферментов могут достигать 63%, тогда как в курируемой UniProtKB/Swiss-Prot ошибки в описании ферментов большинства семейств практически отсутствуют [35].

Неизбыточной (т. е. исключающей более одной записи одного и того же белка) базой данных аминокислотных последовательностей в системе UniProtKB является UniRef — набор кластеризованных последовательностей из UniProtKB и некоторых записей UniProt Archive. UniRef состоит из нескольких подразделов: UniRef100, UniRef90 и UniRef50 — они содержат кластеры, состоящие из идентичных на 100%, 90% и 50% последовательностей, соответственно.

Кроме того, существует проект RefSeq, относящийся к Национальному центру биотехнологической информации (National center for biotechnology information, NCBI) наравне с GenBank. Объекты базы данных RefSeq формируются по-разному в зависимости от исследуемого организма. Большая часть геномов архей и бактерий аннотируется при помощи специального пайплайна, предназначенного для описания прокариотических геномов. Большинство эукариотических геномов также аннотируется при помощи специально предназначенного пайплайна, который использует известные данные о транскрипте (включают в себя сведения об РНК-секвенировании и о сборке транскриптомов методом shotgun секвенирования), гомологии последовательности и известных курируемых транскриптах и белках RefSeq, а также прогнозирует некоторые свойства последовательности ab initio. Сравнительно небольшая часть бактериальных и эукариотических геномов курируется специалистами.

Существует множество баз данных, которые основаны на информации из других баз данных. Примером может служить неизбыточная база данных белковых последовательностей NCBI (NCBI non-redundant protein database), которая включает последовательности из GenPept, UniProtKB/Swiss-Prot, RefSeq и ряда других баз данных, таких как PIR, PDF и PDB.

Итак, существует множество баз данных аминокислотных последовательностей, каждая из которых обладает своими особенностями.

Автоматизированные программы для определения клинического эффекта миссенс-вариантов используют в качестве источника различные базы данных белковых последовательностей. Например, UniProtKB служит исходной базой данных для SIFT [210] и MutationTaster [160], а NCBI non-redundant protein database — для PROVEAN [58]. Следует отметить, что аминокислотные последовательности определяются на основе последовательностей соответствующих генов, которые, в свою очередь, формируются на основе геномных сборок.

Растущее число геномных сборок обуславливает необходимость оценки того, насколько хорошо та или иная сборка описывает реально существующий геном организма. Существуют стандартные показатели для оценки целостности считываемых последовательностей при сборке генома, которые учитывают размеры контигов. Контиг — это непрерывный участок ДНК, полученный при сборке генома с использованием перекрывающихся фрагментов ДНК. Общепринятые показатели включают в себя:

1. N50 — длина наиболее короткого контига из минимального количества максимально длинных контигов, сумма длин которых составляет не менее 50% от суммы длин всех контигов в сборке;

2. NG50 — модификация предыдущего показателя, отличающаяся тем, что вместо 50% от суммы длин всех контигов в сборке используется 50% предполагаемой длины генома исследуемого организма [36];

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Буг Дмитрий Сергеевич, 2025 год

СПИСОК ЛИТЕРАТУРЫ

1. Анализ информативности компьютерных т silico предсказательных программ при оценке клинической значимости миссенс-замен гена GJB2 (Сх26) / В. Г. Пшенникова, Н. А. Барашков, А. В. Соловьёв [и др.] // Якутский медицинский журнал. 2017. — Т. 59, № 3. — С. 40-46

2. Буг, Д. С. Биоинформатический анализ генетических полиморфизмов уромодулина / Д. С. Буг // Региональная информатика (РИ-2018). XVI Санкт-Петербургская международная конференция «Региональная информатика (РИ-2018)». Санкт-Петербург, 24-26 октября 2018 г.: Материалы конференции. — СПб.: СПОИСУ. — 2018. С. 420-421

3. Буг, Д. С. Обзор программ для оценки патогенности генетических вариантов / Д. С. Буг, А. Н. Наркевич, Н. В. Петухова // Учёные записки Первого Санкт-Петербургского государственного медицинского университета имени академика И. П. Павлова. — 2025. — Т. 32, № 1. — С. 11-20

4. Буг, Д. С. Поиск ортологов метил-CpG-связывающего белка в задаче определения мутации МеСР2 у больных синдромом Ретта / Д. С. Буг, И. А. Фильченко, М. В. Радионова // Материалы XXIV Всероссийской конференции молодых учёных с международным участием. — СПб.: РИЦ ПСПбГМУ. — 2018. — С. 50-51

5. Исследование патогенности мутации V281I в гене CYP21A2 при врожденной гиперплазии надпочечников / Д. А. Кузовенкова, Д. С. Буг, В. Д. Назаров [и др.] // Сборник тезисов конференции «Вычислительная биология и искусственный интеллект для персонализированной медицины». — М.: НМИЦ эндокринологии. — 2022. С. 50

6. Клинико-эпидемиологическая характеристика острых миелоидных лейкозов у взрослых по данным муниципальных отделений гематологии Москвы / С. В. Сёмочкин, Т. Н. Толстых, Н. В. Архипова [и др.] // Терапевтический архив. — 2015. — Т. 87, № 7. — С. 26-32

7. Миелодиспластический синдром: эпидемиология и эпигенетические нарушения / П. В. Липилкин, Е. Д. Кулаева, А. Н. Зельцер [и др.] // Медицинский вестник Юга России. — 2022. — Т. 13, № 2. — С. 179-190

8. Национальная Программа Российского общества клинической онкологии «Совершенствование молекулярно-генетической диагностики в Российской Федерации с целью повышения эффективности противоопухолевого лечения» // Интернет-портал Российского общества клинической онкологии : сайт. — URL: https://rosoncoweb.ru/activities/cancergenome (дата обращения 24.10.2023)

9. Прогностическое значение результатов секвенирования нового поколения у пациентов с миелодиспластическим синдромом / Н. Ю. Цветков, Е. В. Морозова, И. М. Бархатов [и др.] // Клиническая онкогематология. — 2020. — Т. 13, № 2. — C. 170-175

10. Рыжкова, О. П. Руководство по интерпретации данных последовательности ДНК человека, полученных методами массового параллельного секвенирования (MPS) (редакция 2018, версия 2) / О. П. Рыжкова, О. Л. Кардымон, Е. Б. Прохорчук [и др.] // Медицинская генетика. — 2021. — Т. 18, № 2. — С. 3-23

11. Спектор, М. А. Интерпретация соматических генетических вариантов, выявленных методом высокопроизводительного секвенирования опухолевой ДНК, на примере онкологических заболеваний детского возраста. / М. А. Спектор, Л. А. Ясько, А. Е. Друй // Медицинская генетика. — 2020. — Т. 20, № 3. — С. 3-25

12. 3DCoffee@igs: a web server for combining sequences and structures into a multiple sequence alignment / O. Poirot, K. Suhre, C. Abergel [et al.] // Nucleic Acids Research. — 2007. — Vol. 32. — P. W37-W40

13. A Comprehensive Benchmark Study of Multiple Sequence Alignment Methods: Current Challenges and Future Perspectives / J. D. Thompson, B. Linard, O. Lecompte [et al.] // PLoS ONE. — 2011. — Vol. 6, № 3. — P. e18093

14. A Comprehensive Evaluation of the Performance of Prediction Algorithms on Clinically Relevant Missense Variants / E. Qorri, B. Takacs, A. Graf [et al.] // IJMS. — 2022. — Vol. 23, № 14. — P. 7946

15. A Statistical Framework to Predict Functional Non-Coding Regions in the Human Genome Through Integrated Analysis of Annotation Data / Q. Lu, Y. Hu, J. Sun [et al.] // Sci Rep. — 2015. — Vol. 5, № 1. P. — 10576

16. A Strong Candidate for the Breast and Ovarian Cancer Susceptibility Gene BRCA1 / Y. Miki, J. Swensen, D. Shattuck-Eidens [et al.] // Science. — 2006. — Vol. 266, № 5182. — P. 66-71

17. A Structural EM Algorithm for Phylogenetic Inference / N. Friedman, M. Ninio, I. Pe'er [et al.] // Journal of Computational Biology. — 2002. — Vol. 9, № 2. — P. 331-353

18. A general framework for estimating the relative pathogenicity of human genetic variants / M. Kircher, D. M. Witten, P. Jain [et al.] // Nat Genet. — 2014. — Vol. 46, № 3. — P. 310-315

19. A method and server for predicting damaging missense mutations / I. A. Adzhubei, S. Schmidt, L. Peshkin [et al.] // Nat Methods. — 2010. — Vol. 7, № 4. — P. 248-249

20. A method for calculating probabilities of fitness consequences for point mutations across the human genome / B. Gulko, M. J. Hubisz, I. Gronau [et al.] // Nat Genet. — 2015. — Vol. 47, № 3. — P. 276-283

21. A pan-cancer analysis of synonymous mutations / Y. Sharma, M. Miladi, S. Dukare [et al.] // Nat Commun. — 2019. — Vol. 10, № 1. P. — 2569

22. A spectral approach integrating functional genomic annotations for coding and noncoding variants / I. Ionita-Laza, K. McCallum, B. Xu [et al.] // Nat Genet. — 2016. — Vol. 48, № 2. — P. 214-220

23. Abascal, F. ProtTest: selection of best-fit models of protein evolution / F. Abascal, R. Zardoya, D. Posada // Bioinformatics. — 2005. — Vol. 21, № 9. — P. 2104-2105. 10.1093/bioinformatics/bti263

24. Accelerating Discovery of Functional Mutant Alleles in Cancer / M.T. Chang, T.S. Bhattarai, A.M. Schram [et al.] // Cancer Discovery. — 2017. — Vol. 8, № 2. — P. 174183

25. Accurate proteome-wide missense variant effect prediction with AlphaMissense / J. Cheng, G. Novati, J. Pan [et al.] // Science. — 2023. — Vol. 381, № 6664. — P. eadg7492

26. Acute Myeloid Leukemia, Version 3.2019, NCCN Clinical Practice Guidelines in Oncology / M. S. Tallman, E. S. Wang, J. K. Altman [et al.] // Journal of the National Comprehensive Cancer Network. — 2019. — Vol. 17, № 6. — P. 721-749

27. Advances and Applications in the Quest for Orthologs / N. Glover, C. Dessimoz, I. Ebersberger [et al.] // Molecular Biology and Evolution. — 2019. — Vol. 36, № 10. — P. 2157-2164

28. Aligning Multiple Genomic Sequences With the Threaded Blockset Aligner / M. Blanchette, W. J. Kent, C. Riemer [et al.] // Genome Res. — 2004. — Vol. 14, № 4. — P. 708-715

29. Altenhoff, A. M. Phylogenetic and Functional Assessment of Orthologs Inference Projects and Methods / A. M. Altenhoff, C. Dessimoz // PLoS Comput Biol. — 2009. — Vol. 5, № 1. — P. e1000262

30. Altschul, S. Gapped BLAST and PSI-BLAST: a new generation of protein database search programs / S. Altschul // Nucleic Acids Research. — 2002. Vol. 25, № 17. — P. 3389-3402

31. An RNA gene expressed during cortical development evolved rapidly in humans / K. S. Pollard, S. R. Salama, N. Lambert [et al.] // Nature. — 2006. — Vol. 443, № 7108. — P. 167-172

32. An algorithm for assessing the pathogenicity of genetic mutations in tumor based on a retrospective study of pathogenic and neutral genetic variants

/ D. S. Bug, A. N. Narkevich, A. V. Tishkov [et al.] // Siberian Journal of Clinical and Experimental Medicine. — 2025. — Vol. 40, № 1. — P. 226-234

33. An integrative approach to predicting the functional effects of non-coding and coding sequence variation / H. A. Shihab, M. F. Rogers, J. Gough [et al.] // Bioinformatics. — 2015. — Vol. 31, № 10. — P. 1536-1543

34. Analysis of Sequence Conservation at Nucleotide Resolution / S. Asthana, M. Roytberg, J. Stamatoyannopoulos [et al.] // PLoS Comput Biol. — 2007. — Vol. 3, № 12. — P. e254

35. Annotation Error in Public Databases: Misannotation of Molecular Function in Enzyme Superfamilies / A. M. Schnoes, S. D. Brown, I. Dodevski [et al.] // PLoS Comput Biol. — 2009. — Vol. 5, № 12. — P. e1000605

36. Assemblathon 1: A competitive assessment of de novo short read assembly methods / D. Earl, K. Bradnam, J. St. John [et al.] // Genome Res. — 2011. — Vol. 21, № 12. — P. 2224-2241

37. Assemblathon 2: evaluating de novo methods of genome assembly in three vertebrate species / K. R. Bradnam, J. N. Fass, A. Alexandrov [et al.] // GigaSci. — 2013. — Vol. 2, № 1. — P. 10

38. Assembly: a resource for assembled genomes at NCBI / P. A. Kitts, D. M. Church, F. Thibaud-Nissen [et al.] // Nucleic Acids Res. — 2015. — Vol. 44, № D1. — P. D73-D80

39. Assessing performance of pathogenicity predictors using clinically relevant variant datasets / A.C. Gunning, V. Fryer, J. Fasham [et al.] // J Med Genet. — 2020. — Vol. 58, № 8. — P. 547-555

40. Assessment of computational methods for predicting the effects of missense mutations in human cancers / F. Gnad, A. Baucom, K. Mukhyala [et al.] // BMC Genomics. — 2019. — Vol. 14, № S3. — P. S7

41. Assessment of miRNA biogenesis genes variants in MDS development and progression / D. Bug, A. Tishkov, I. Moiseev [et al.] // HemaSphere. — 2022. — Vol. 6. — P. 640-641.

42. Automated inference of molecular mechanisms of disease from amino acid substitutions / B. Li, V. G. Krishnan, M. E. Mort [et al.] // Bioinformatics. — 2009. — Vol. 25, № 21. — P. 2744-2750

43. BLAST+: Architecture and applications / C. Camacho, G. Coulouris, V. Avagyan [et al.] // BMC Bioinformatics. — 2009. — Vol. 10, № 1. — P. 421

44. Bug, D. S. Alignment of pseudoreads obtained from homologous sequences in identifying potentially tolerated genomic variants. / D. S. Bug, A. N. Narkevich, N. V. Petukhova // Journal of Bioinformatics and Genomics. — 2023. — Vol. 21, № 3. — P. 19-25.

45. BUSCO: assessing genome assembly and annotation completeness with single-copy orthologs / F. A. Simâo, R. M. Waterhouse, P. Ioannidis [et al.] // Bioinformatics. — 2015. — Vol. 31, № 19. — P. 3210-3212

46. Baker, W. The EMBL Nucleotide Sequence Database / W. Baker // Nucleic Acids Research. — 2002. Vol. 28, № 1. — P. 19-23

47. Basic local alignment search tool / S. F. Altschul, W. Gish, W. Miller [et al.] // Journal of Molecular Biology. — 2007. — Vol. 215, № 3. — P. 403-410

48. Bayesian Inference of Phylogeny and Its Impact on Evolutionary Biology / J. P. Huelsenbeck, F. Ronquist, R. Nielsen [et al.] // Science. — 2002. — Vol. 294, № 5550. — P. 2310-2314

49. Biegert, A. Sequence context-specific profiles for homology searching / A. Biegert, J. Soding // Proc. Natl. Acad. Sci. U.S.A. — 2009. — Vol. 106, № 10. — P. 3770-3775

50. Biology and Targetability of the Extended Spectrum of PIK3CA Mutations Detected in Breast Carcinoma / H. S. Rugo, K. Raskina, A. B. Schrock [et al.] // Clinical Cancer Research. — 2022. — Vol. 29, № 6. — P. 1056-1067

51. Bruno, W. J. Weighted Neighbor Joining: A Likelihood-Based Approach to Distance-Based Phylogeny Reconstruction / W. J. Bruno, N. D. Socci, A. L. Halpern // Molecular Biology and Evolution. — 2012. — Vol. 17, № 1. — P. 189-197

52. COCO-CL: hierarchical clustering of homology relations based on evolutionary correlations / R. Jothi, E. Zotenko, A. Tasneem [et al.] // Bioinformatics. — 2006. — Vol. 22, № 7. — P. 779-788

53. CScape: a tool for predicting oncogenic single-point mutations in the cancer genome / M. F. Rogers, H. A. Shihab, T. R. Gaunt [et al.] // Sci Rep. — 2017. — Vol. 7, № 1. P. — 11597

54. Calibration of computational tools for missense variant pathogenicity classification and ClinGen recommendations for PP3 /BP4 criteria / V. Pejaver, A. B. Byrne, B. Feng [et al.] // The American Journal of Human Genetics. — 2022. — Vol. 109, № 12. — P. 2163-2177

55. Capriotti, E. Evaluating the relevance of sequence conservation in the prediction of pathogenic missense variants / E. Capriotti, P. Fariselli // Hum Genet. — 2022. — Vol. 141, № 10. — P. 1649-1658

56. Characterization of p53 Family Homologs in Evolutionary Remote Branches of Holozoa / M. Bartas, V. Brazda, J. Cerven [et al.] // IJMS. — 2019. — Vol. 21, № 1. — P. 6

57. Chen, L. DIVAN: accurate identification of non-coding disease-specific risk variants using multi-omics profiles / L. Chen, P. Jin, Z. S. Qin // Genome Biol. — 2016. — Vol. 17, № 1. — P. 252

58. Choi, Y. PROVEAN web server: a tool to predict the functional effect of amino acid substitutions and indels / Y. Choi, A. P. Chan // Bioinformatics. — 2015. — Vol. 31, № 16. — P. 2745-2747

59. Chun, S. Identification of deleterious mutations within three human genomes / S. Chun, J. C. Fay // Genome Res. — 2009. — Vol. 19, № 9. — P. 1553-1561

60. Classification and Clinical Management of Variants of Uncertain Significance in High Penetrance Cancer Predisposition Genes / S. Moghadasi, D. M. Eccles, P. Devilee [et al.] // Human Mutation. — 2016. — Vol. 37, № 4. — P. 331-336

61. ClinVar: improving access to variant interpretations and supporting evidence / M. J. Landrum, J. M. Lee, M. Benson [et al.] // Nucleic Acids Research. — 2017. — Vol. 46, № D1. — P. D1062-D1067

62. Collins, F. S. BRCA1 — Lots of Mutations, Lots of Dilemmas / F. S. Collins // N Engl J Med. — 2002. Vol. 334, № 3. — P. 186-188

63. Comparative Genomics of the Archaea (Euryarchaeota): Evolution of Conserved Protein Families, the Stable Core, and the Variable Shell / K. S. Makarova, L. Aravind, M. Y. Galperin [et al.] // Genome Res. — 2021. — Vol. 9, № 7. — P. 608-628

64. Comparison and integration of deleteriousness prediction methods for nonsynonymous SNVs in whole exome sequencing studies / C. Dong, P. Wei, X. Jian [et al.] // Human Molecular Genetics. — 2015. — Vol. 24, № 8. — P. 2125-2137

65. Comprehensive characterization of amino acid positions in protein structures reveals molecular effect of missense variants / S. Iqbal, E. Pérez-Palma, J. B. Jespersen [et al.] // Proc. Natl. Acad. Sci. U.S.A. — 2020. — Vol. 117, № 45. — P. 28201-28211

66. Computational Tools for Splicing Defect Prediction in Breast /Ovarian Cancer Genes: How Efficient Are They at Predicting RNA Alterations? / A. Moles-Fernández, L. Duran-Lozano, G. Montalban [et al.] // Front. Genet. — 2018. — Vol. 9. — P. 366

67. ConSurf 2016: an improved methodology to estimate and visualize evolutionary conservation in macromolecules / H. Ashkenazy, S. Abadi, E. Martz [et al.] // Nucleic Acids Res. — 2016. — Vol. 44, № W1. — P. W344-W350

68. ConSurf: Identification of Functional Regions in Proteinsby Surface-Mapping of Phylogenetic Information / F. Glaser, T. Pupko, I. Paz [et al.] // Bioinformatics. — 2002. — Vol. 19, № 1. — P. 163-164

69. De novo pattern discovery enables robust assessment of functional consequences of non-coding variants / H. Yang, R. Chen, Q. Wang [et al.] // Bioinformatics. — 2018. — Vol. 35, № 9. — P. 1453-1460

70. De Bruyn, A. Phylogenetic Reconstruction Methods: An Overview / A. De Bruyn, D. P. Martin, P. Lefeuvre // Molecular Plant Taxonomy / Besse P. (Ed.). — Humana Press. — Totowa, NJ, 2014 — P.257 — 277

71. De la Campa, E. Á. Development of pathogenicity predictors specific for variants that do not comply with clinical guidelines for the use of computational evidence

/ E. À. de la Campa, N. Padilla, X. de la Cruz // BMC Genomics. — 2017. — Vol. 18, № S5. — P. 569

72. DeepCLIP: Predicting the effect of mutations on protein — RNA binding with deep learning / A. G. B. Gronning, T. K. Doktor, S. J. Larsen [et al.] // Nucleic Acids Research. — 2020. — P. gkaa530

73. Detection of nonneutral substitution rates on mammalian phylogenies / K. S. Pollard, M. J. Hubisz, K. R. Rosenbloom [et al.] // Genome Res. — 2009. — Vol. 20, № 1. — P. 110-121

74. Dhar, A. Maximum likelihood phylogenetic inference / A. Dhar, V. N. Minin // Encyclopedia of Evolutionary Biology / Kliman R. M. (Ed.). — Elsevier 2016. — P. 499-506

75. Disease variant prediction with deep generative models of evolutionary data / J. Frazer, P. Notin, M. Dias [et al.] // Nature. — 2021. — Vol. 599, № 7883. — P. 9195

76. Distribution and intensity of constraint in mammalian genomic sequence / G. M. Cooper, E. A. Stone, G. Asimenos [et al.] // Genome Res. — 2005. — Vol. 15, № 7. — P. 901-913

77. ERIC recommendations for TP53 mutation analysis in chronic lymphocytic leukemia — update on methodological approaches and results interpretation / J. Malcikova, E. Tausch, D. Rossi [et al.] // Leukemia. — 2018. — Vol. 32, № 5. — P. 1070-1080

78. Edgar, R. C. MUSCLE: a multiple sequence alignment method with reduced time and space complexity / R. C. Edgar // BMC Bioinformatics. — 2004. — Vol. 5, № 1. — P. 113

79. Edgar, R. C. MUSCLE: multiple sequence alignment with high accuracy and high throughput / R. C. Edgar // Nucleic Acids Research. — 2004. Vol. 32, № 5. — P. 17921797

80. Efron, B. Bootstrap confidence levels for phylogenetic trees / B. Efron, A. Halloran, S. Holmes // Proc. Natl. Acad. Sci. U.S.A. — 1996. Vol. 93, № 23. — P. 13429

81. EggNOG 5.0: a hierarchical, functionally and phylogenetically annotated orthology resource based on 5090 organisms and 2502 viruses / J. Huerta-Cepas, D. Szklarczyk, D. Heller [et al.] // Nucleic Acids Research. — 2018. — Vol. 47, № D1. — P. D309-D314

82. Ekseth, O. K. orthAgogue: an agile tool for the rapid prediction of orthology relations / O. K. Ekseth, M. Kuiper, V. Mironov // Bioinformatics. — 2013. — Vol. 30, № 5. — P. 734-736

83. Emergence of an Auxin Sensing Domain in Plant-Associated Bacteria / J. A. Gavira, M. Rico-Jiménez, Á. Ortega [et al.] // mBio. — 2023. — Vol. 14, № 1. — P. e0336322

84. Emms, D. M. Benchmarking Orthogroup Inference Accuracy: Revisiting Orthobench / D. M. Emms, S. Kelly // Genome Biology and Evolution. — 2020. — Vol. 12, № 12. — P. 2258-2266

85. Emms, D. M. OrthoFinder: solving fundamental biases in whole genome comparisons dramatically improves orthogroup inference accuracy / D. M. Emms, S. Kelly // Genome Biol. — 2015. — Vol. 16, № 1. — P. 157

86. Enredo and Pecan: Genome-wide mammalian consistency-based multiple alignment with paralogs / B. Paten, J. Herrero, K. Beal [et al.] // Genome Res. — 2008. — Vol. 18, № 11. — P. 1814-1828

87. Enright, A. J. An efficient algorithm for large-scale detection of protein families / A. J. Enright // Nucleic Acids Research. — 2002. Vol. 30, № 7. — P. 1575-1584

88. Establishing the precise evolutionary history of a gene improves prediction of disease-causing missense mutations / O. Adebali, A. O. Reznik, D. S. Ory [et al.] // Genetics in Medicine. — 2016. — Vol. 18, № 10. — P. 1029-1036

89. Evaluating the Effect of 3'-UTR Variants in DICER1 and DROSHA on Their Tissue-Specific Expression by miRNA Target Prediction / D. S. Bug, A. V. Tishkov, I. S. Moiseev [et al.] // Curr. Issues Mol. Biol. — 2021. — Vol. 43, № 2. — P. 605-617

90. Evolutionarily conserved elements in vertebrate, insect, worm, and yeast genomes / A. Siepel, G. Bejerano, J. S. Pedersen [et al.] // Genome Res. — 2005. — Vol. 15, № 8. — P. 1034-1050

91. Evolutionary reconstruction of MT-RNR2 gene demonstrates a diverse compositional landscape of humanin in vertebrates / D. S. Bug, A. V. Tishkov, T. F. Subbotina [et al.] // Journal of Evolutionary Biochemistry and Physiology. — 2023. — Vol. 59, № 5. — P. 1566-1576

92. Expert curation in UniProtKB: a case study on dealing with conflicting and erroneous data / S. Poux, M. Magrane, C. N. Arighi [et al.] // Database. — 2014. — Vol. 2014, № 0. — P. bau016-bau016

93. FATHMM-XF: accurate prediction of pathogenic point mutations via extended features / M. F. Rogers, H. A. Shihab, M. Mort [et al.] // Bioinformatics. — 2017. — Vol. 34, № 3. — P. 511-513

94. FIRE: functional inference of genetic variants that regulate gene expression / N. M. Ioannidis, J. R. Davis, M. K. DeGorter [et al.] // Bioinformatics. — 2017. — Vol. 33, № 24. — P. 3895-3901

95. Fast, scalable generation of high-quality protein multiple sequence alignments using Clustal Omega / F. Sievers, A. Wilm, D. Dineen [et al.] // Molecular Systems Biology. — 2011. — Vol. 7, № 1. P. — 539

96. Federici, G. Variants of uncertain significance in the era of high-throughput genome sequencing: a lesson from breast and ovary cancers / G. Federici, S. Soddu // J Exp Clin Cancer Res. — 2020. — Vol. 39, № 1. — P. 46

97. Felsenstein, J. Phylogenies and quantitative characters / J. Felsenstein // Annu. Rev. Ecol. Syst. — 2003. Vol. 19, № 1. — P. 445-471

98. Feng, D. Progressive sequence alignment as a prerequisite to correct phylogenetic trees / D. Feng, R. F. Doolittle // J Mol Evol. — 2007. — Vol. 25, № 4. — P. 351-360

99. Flanagan, S. E. Using SIFT and PolyPhen to Predict Loss-of-Function and Gain-of-Function Mutations / S. E. Flanagan, A. Patch, S. Ellard // Genetic Testing and Molecular Biomarkers. — 2010. — Vol. 14, № 4. — P. 533-537

100. Fox, G. Using de novo protein structure predictions to measure the quality of very large multiple sequence alignments / G. Fox, F. Sievers, D. G. Higgins // Bioinformatics. — 2015. — Vol. 32, № 6. — P. 814-820

101. From fastq data to high-confidence variant calls: The genome analysis toolkit best practices pipeline / G. A. Van Der Auwera, M. O. Carneiro, C. Hartl [et al.] // Current Protocols in Bioinformatics. — 2013. — Vol. 43, № 1. P. — 11.10.1-11.10.33

102. FunSeq2: a framework for prioritizing noncoding regulatory variants in cancer / Y. Fu, Z. Liu, S. Lou [et al.] // Genome Biol. — 2014. — Vol. 15, № 10. — P. 480

103. Functional Assessment of Genetic Variants with Outcomes Adapted to Clinical Decision-Making / P. Thouvenot, B. Ben Yamin, L. Fourrière [et al.] // PLoS Genet. — 2016. — Vol. 12, № 6. — P. e1006096

104. Functional annotations improve the predictive score of human disease-related mutations in proteins / R. Calabrese, E. Capriotti, P. Fariselli [et al.] // Hum. Mutat. — 2009. — Vol. 30, № 8. — P. 1237-1244

105. Gagan, J. Next-generation sequencing to guide cancer therapy / J. Gagan, E. M. Van Allen // Genome Med. — 2015. — Vol. 7, № 1. — P. 80

106. Gelfand, M. S. Prediction of transcription regulatory sites in Archaea by a comparative genomic approach / M. S. Gelfand // Nucleic Acids Research. — 2002. Vol. 28, № 3. — P. 695-705

107. GenBank / D. A. Benson, I. Karsch-Mizrachi, D. J. Lipman [et al.] // Nucleic Acids Research. — 2009. — Vol. 38, № 1. — P. D46-D51

108. GenBank / D. A. Benson, M. Cavanaugh, K. Clark [et al.] // Nucleic Acids Research. — 2012. — Vol. 41, № D1. — P. D36-D42

109. Genome-wide analysis of noncoding regulatory mutations in cancer / N. Weinhold, A. Jacobsen, N. Schultz [et al.] // Nat Genet. — 2014. — Vol. 46, № 11. — P. 1160-1165

110. Genome-wide prediction of disease variant effects with a deep protein language model / N. Brandes, G. Goldman, C.H. Wang [et al.] // Nat Genet. — 2023. — Vol. 55, № 9. — P. 1512-1522

111. González-Pérez, A. Improving the Assessment of the Outcome of Nonsynonymous SNVs with a Consensus Deleteriousness Score, Condel / A. González-Pérez, N. López-Bigas // The American Journal of Human Genetics. — 2011. — Vol. 88, № 4. — P. 440-449

112. Grantham, R. Amino Acid Difference Formula to Help Explain Protein Evolution / R. Grantham // Science. — 2006. Vol. 185, № 4154. — P. 862-864

113. Gudmundsson, S. Interpreting variants in genes affected by clonal hematopoiesis in population data / S. Gudmundsson, C. M. Carlston, A. O'Donnell-Luria // Human Genetics. — 2024. — Vol. 143. — P. 545-549

114. Guha, T. Inherited TP53 Mutations and the Li — Fraumeni Syndrome / T. Guha, D. Malkin // Cold Spring Harb Perspect Med. — 2017. — Vol. 7, № 4. — P. a026187

115. HH-suite3 for fast remote homology detection and deep protein annotation / M. Steinegger, M. Meier, M. Mirdita [et al.] // BMC Bioinformatics. — 2019. — Vol.

20, № 1. — P. 473

116. Harris, R. S. Improved pairwise alignment of genomic DNA. Ph.D. thesis / Robert S. Harris. — The Pennsylvania State University, 2007. — 74 pp

117. Hernández-Salmerón, J. E. Progress in quickly finding orthologs as reciprocal best hits: comparing blast, last, diamond and MMseqs2 / J. E. Hernández-Salmerón, G. Moreno-Hagelsieb // BMC Genomics. — 2020. — Vol.

21, № 1. — P. 741

118. High mutation burden in the checkpoint and micro-RNA processing genes in myelodysplastic syndrome / I. S. Moiseev, N. Y. Tcvetkov, I. M. Barkhatov [et al.] // PLoS ONE. — 2021. — Vol. 16, № 3. — P. e0248430

119. High-throughput functional evaluation of BRCA2 variants of unknown significance / M. Ikegami, S. Kohsaka, T. Ueno [et al.] // Nat Commun. — 2020. — Vol. 11, № 1. P. — 2573

120. Huang, Y. Fast, scalable prediction of deleterious noncoding variants from functional and population genomic data / Y. Huang, B. Gulko, A. Siepel // Nat Genet. — 2017. — Vol. 49, № 4. — P. 618-624

121. Huber, C. D. Population genetic models of GERP scores suggest pervasive turnover of constrained sites across mammalian evolution / C. D. Huber, B. Y. Kim, K. E. Lohmueller // PLoS Genet. — 2020. — Vol. 16, № 5. — P. e1008827

122. IQ-TREE 2: New Models and Efficient Methods for Phylogenetic Inference in the Genomic Era / B. Q. Minh, H. A. Schmidt, O. Chernomor [et al.] // Molecular Biology and Evolution. — 2020. — Vol. 37, № 5. — P. 1530-1534

123. Identification and Characterization of a Novel CLCN7 Variant Associated with Osteopetrosis / D. S. Bug, I. M. Barkhatov, Y. V. Gudozhnikova [et al.] // Genes. — 2020. — Vol. 11, № 11. — P. 1242

124. Identification of the breast cancer susceptibility gene BRCA2 / R. Wooster, G. Bignell, J. Lancaster [et al.] // Nature. — 2003. — Vol. 378, № 6559. — P. 789-792

125. Identifying a High Fraction of the Human Genome to be under Selective Constraint Using GERP++ / E. V. Davydov, D. L. Goode, M. Sirota [et al.] // PLoS Comput Biol. — 2010. — Vol. 6, № 12. — P. e1001025

126. Identifying novel constrained elements by exploiting biased substitution patterns / M. Garber, M. Guttman, M. Clamp [et al.] // Bioinformatics. — 2009. — Vol. 25, № 12. — P. i54-i62

127. Inhibition of Poly(ADP-Ribose) Polymerase in Tumors from BRCA Mutation Carriers / P. C. Fong, D. S. Boss, T. A. Yap [et al.] // N Engl J Med. — 2009. — Vol. 361, № 2. — P. 123-134

128. International Scoring System for Evaluating Prognosis in Myelodysplastic Syndromes / P. Greenberg, C. Cox, M.M. LeBeau [et al.] // Blood. — 1997. — Vol. 89, № 6. — P. 2079-2088

129. Interpreting missense variants: comparing computational methods in human disease genes CDKN2A , MLH1 , MSH2 , MECP2 , and tyrosinase (TYR) / P. A. Chan, S. Duraisamy, P. J. Miller [et al.] // Hum. Mutat. — 2007. — Vol. 28, № 7. — P. 683-693

130. Issues in searching molecular sequence databases / S. F. Altschul, M. S. Boguski, W. Gish [et al.] // Nat Genet. — 2004. — Vol. 6, № 2. — P. 119-129

131. Jakobsson, M. The Relationship Between F ST and the Frequency of the Most Frequent Allele / M. Jakobsson, M. D. Edge, N. A. Rosenberg // Genetics. — 2012. — Vol. 193, № 2. — P. 515-528

132. Janin, J. Structural domains in proteins and their role in the dynamics of protein function / J. Janin, S. J. Wodak // Progress in Biophysics and Molecular Biology. — 2003. — Vol. 42. — P. 21-78

133. Johnson, L. S. Hidden Markov model speed heuristic and iterative HMM search procedure / L. S. Johnson, S. R. Eddy, E. Portugaly // BMC Bioinformatics. — 2010. — Vol. 11, № 1. — P. 431

134. Jordan, D. M. Human allelic variation: perspective from protein function, structure, and evolution / D. M. Jordan, V. E. Ramensky, S. R. Sunyaev // Current Opinion in Structural Biology. — 2010. — Vol. 20, № 3. — P. 342-350

135. Jukes, T. H. Evolution of Protein Molecules / T. H. Jukes, C. R. Cantor // Mammalian Protein Metabolism / H. N. Munro (Ed.). — Academic Press — New York, 1969 — P. 21 — 132

136. Kannan, L. Maximum Parsimony on Phylogenetic networks / L. Kannan, W. C. Wheeler // Algorithms Mol Biol. — 2012. — Vol. 7, № 1. — P. 9

137. Kans, J. Entrez Direct: E-utilities on the Unix Command Line. Entrez Programming Utilities Help [Электронный ресурс] // ncbi.nlm.nih.gov. — 2013. Дата обновления: 27.09.2023. URL: https://www.ncbi.nlm.nih.gov/books/NBK179288 (дата обращения: 28.09.2023)

138. Katoh, K. MAFFT: a novel method for rapid multiple sequence alignment based on fast Fourier transform / K. Katoh // Nucleic Acids Research. — 2002. Vol. 30, № 14. — P. 3059-3066

139. Kimura, M. A simple method for estimating evolutionary rates of base substitutions through comparative studies of nucleotide sequences / M. Kimura // J Mol Evol. — 2005. Vol. 16, № 2. — P. 111-120

140. Koonin, E. V. Orthologs, Paralogs, and Evolutionary Genomics / E. V. Koonin // Annu. Rev. Genet. — 2005. Vol. 39, № 1. — P. 309-338

141. Langmead, B. Fast gapped-read alignment with Bowtie 2 / B. Langmead, S. L. Salzberg // Nat Methods. — 2012. — Vol. 9, № 4. — P. 357-359

142. Lassmann, T. Kalign — an accurate and fast multiple sequence alignment algorithm / T. Lassmann, E. L. Sonnhammer // BMC Bioinformatics. — 2005. — Vol. 6, № 1. — P. 298

143. Le, Q. Protein multiple sequence alignment benchmarking through secondary structure prediction / Q. Le, F. Sievers, D. G. Higgins // Bioinformatics. — 2017. — Vol. 33, № 9. — P. 1331-1337

144. Li, H. Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM [Электронный ресурс] // arXiv.org. — 2013. Дата обновления: 26.05.2013. URL: https://arxiv.org/abs/1303.3997 (дата обращения: 28.09.2023)

145. Li, H. Fast and accurate long-read alignment with Burrows — Wheeler transform / H. Li, R. Durbin // Bioinformatics. — 2010. — Vol. 26, № 5. — P. 589-595

146. Li, H. Fast and accurate short read alignment with Burrows — Wheeler transform / H. Li, R. Durbin // Bioinformatics. — 2009. — Vol. 25, № 14. — P. 1754-1760

147. Li, L. OrthoMCL: Identification of Ortholog Groups for Eukaryotic Genomes / L. Li, C. J. Stoeckert, D. S. Roos // Genome Res. — 2003. — Vol. 13, № 9. — P. 2178-2189

148. Li, W. CD-HIT: a fast program for clustering and comparing large sets of protein or nucleotide sequences / W. Li, A. Godzik // Bioinformatics. — 2006. — Vol. 22, № 13. — P. 1658-1659

149. Lipton, Z. C. The Mythos of Model Interpretability / Z. C. Lipton // Queue. — 2020. Vol. 16, № 3. — P. 31-57

150. M-CAP eliminates a majority of variants of uncertain significance in clinical exomes at high sensitivity / K. A. Jagadeesh, A. M. Wenger, M. J. Berger [et al.] // Nat Genet. — 2016. — Vol. 48, № 12. — P. 1581-1586

151. Masica, D. L. Towards Increasing the Clinical Relevance of In Silico Methods to Predict Pathogenic Missense Variants / D. L. Masica, R. Karchin // PLoS Comput Biol. — 2016. — Vol. 12, № 5. — P. e1004725

152. Meta-analytic support vector machine for integrating multiple omics data / S. Kim, J. Jhong, J. Lee [et al.] // BioData Mining. — 2017. — Vol. 10, № 1. — P. 2

153. ModelFinder: fast model selection for accurate phylogenetic estimates / S. Kalyaanamoorthy, B. Q. Minh, T. K. F. Wong [et al.] // Nat Methods. — 2017. — Vol. 14, № 6. — P. 587-589

154. Molecular international prognostic scoring system for myelodysplastic syndromes / E. Bernard, H. Tuechler, P. L. Greenberg [et al.] // NEJM Evidence. — 2022. — Vol. 1. № 7

155. morFeus: a web-based program to detect remotely conserved orthologs using symmetrical best hits and orthology network scoring / I. Wagner, M. Volkmer, M. Sharan [et al.] // BMC Bioinformatics. — 2014. — Vol. 15, № 1. — P. 263

156. Morgenstern, B. DIALIGN 2: improvement of the segment-to-segment approach to multiple sequence alignment. / B. Morgenstern // Bioinformatics. — 2002. Vol. 15, № 3. — P. 211-218

157. Mount, D. W. Using Iterative Methods for Global Multiple Sequence Alignment / D. W. Mount // Cold Spring Harb Protoc. — 2009. Vol. 2009, № 7. — P. pdb.top44

158. Mukherjee, K. Evolution of Animal and Plant Dicers: Early Parallel Duplications and Recurrent Adaptation of Antiviral RNA Binding in Plants / K. Mukherjee, H. Campos, B. Kolaczkowski // Molecular Biology and Evolution. — 2012. — Vol. 30, № 3. — P. 627-641

159. Mushegian, A. R. A minimal gene set for cellular life derived by comparison of complete bacterial genomes. / A. R. Mushegian, E. V. Koonin // Proc. Natl. Acad. Sci. U.S.A. — 2002. — Vol. 93, № 19. — P. 10268-10273

160. MutationTaster2021 / R. Steinhaus, S. Proft, M. Schuelke [et al.] // Nucleic Acids Research. — 2021. — Vol. 49, № W1. — P. W446-W451

161. NCBI Taxonomy: a comprehensive update on curation, resources and tools / C. L. Schoch, S. Ciufo, M. Domrachev [et al.] // Database, 2020. — 2020. — P. baaa062

162. New and continuing developments at PROSITE / C. J. A. Sigrist, E. de Castro, L. Cerutti [et al.] // Nucleic Acids Research. — 2012. — Vol. 41, № D1. — P. D344-D347

163. New methods for detecting lineage-specific selection / A. Siepel, K. S. Pollard, D. Haussler // Research in Computational Molecular Biology / Apostolico A., Guerra C., Istrail S. [et al.] (Eds.). — Springer Berlin Heidelberg. — Berlin, Heidelberg, 2006. — P. 190 — 205

164. Ng, P. C. Predicting Deleterious Amino Acid Substitutions / P. C. Ng, S. Henikoff // Genome Res. — 2002. — Vol. 11, № 5. — P. 863-874

165. Ng, P. C. SIFT: predicting amino acid changes that affect protein function / P. C. Ng // Nucleic Acids Research. — 2003. Vol. 31, № 13. — P. 3812-3814

166. Nichio, B. T. L. New Tools in Orthology Analysis: A Brief Review of Promising Perspectives / B. T. L. Nichio, J. N. Marchaukoski, R. T. Raittz // Front. Genet. — 2017. — Vol. 8. — P. 165

167. Notredame, C. SAGA: sequence alignment by genetic algorithm / C. Notredame // Nucleic Acids Research. — 2002. Vol. 24, № 8. — P. 1515-1524

168. Notredame, C. T-COFFEE: a novel method for fast and accurate multiple sequence alignment 1 1Edited by J. Thornton / C. Notredame, D. G. Higgins, J. Heringa // Journal of Molecular Biology. — 2002. — Vol. 302, № 1. — P. 205-217

169. Nuin, P. A. The accuracy of several multiple sequence alignment programs for proteins / P. A. Nuin, Z. Wang, E. R. Tillier // BMC Bioinformatics. — 2006. — Vol. 7, № 1. — P. 471

170. OMA orthology in 2021: website overhaul, conserved isoforms, ancestral gene order and more / A. M. Altenhoff, C. Train, K. J. Gilbert [et al.] // Nucleic Acids Research. — 2020. — Vol. 49, № D1. — P. D373-D379

171. OXBench: A benchmark for evaluation of protein multiple sequence alignment accuracy / G. Raghava, S. M. Searle, P. C. Audley [et al.] // BMC Bioinformatics. — 2003. — Vol. 4, № 1. — P. 47

172. Olivier, M. TP53 Mutations in Human Cancers: Origins, Consequences, and Clinical Use / M. Olivier, M. Hollstein, P. Hainaut // Cold Spring Harbor Perspectives in Biology. — 2009. — Vol. 2, № 1. — P. a001008-a001008

173. OncoKB: A Precision Oncology Knowledge Base / D. Chakravarty, J, Gao, S. M. Phillips [et al.] // JCO Precis Oncol. — 2017. — Vol. 1. — P. 1-16

174. Orion: Detecting regions of the human non-coding genome that are intolerant to variation using population genetics / A. B. Gussow, B. R. Copeland, R. S. Dhindsa [et al.] // PLoS ONE. — 2017. — Vol. 12, № 8. — P. e0181604

175. Orr, B. A. Pathology, diagnostics, and classification of medulloblastoma / B. A. Orr // Brain Pathology. — 2020. Vol. 30, № 3. — P. 664-678

176. OrthoDB in 2020: evolutionary and functional annotations of orthologs / E. M. Zdobnov, D. Kuznetsov, F. Tegenfeldt [et al.] // Nucleic Acids Research. — 2020. — Vol. 49, № D1. — P. D389-D393

177. OrthoDB: a hierarchical catalog of animal, fungal and bacterial orthologs / R. M. Waterhouse, F. Tegenfeldt, J. Li [et al.] // Nucleic Acids Research. — 2012. — Vol. 41, № D1. — P. D358-D365

178. OrthoVenn: a web server for genome wide comparison and annotation of orthologous clusters across multiple species / Y. Wang, D. Coleman-Derr, G. Chen [et al.] // Nucleic Acids Res. — 2015. — Vol. 43, № W1. — P. W78-W84

179. Orthograph: a versatile tool for mapping coding nucleotide sequences to clusters of orthologous genes / M. Petersen, K. Meusemann, A. Donath [et al.] // BMC Bioinformatics. — 2017. — Vol. 18, № 1. — P. 111

180. Ortholog-Finder: A Tool for Constructing an Ortholog Data Set / T. Horiike, R. Minai, D. Miyata [et al.] // Genome Biol Evol. — 2016. — Vol. 8, № 2. — P. 446-457

181. Orthology prediction methods: A quality assessment using curated protein families / K. Trachana, T. A. Larsson, S. Powell [et al.] // Bioessays. — 2011. — Vol. 33, № 10. — P. 769-780

182. Ou, S. Assessing genome assembly quality using the LTR Assembly Index (LAI) / S. Ou, J. Chen, N. Jiang // Nucleic Acids Research. — 2018. — P. e126

183. PANTHER: A Library of Protein Families and Subfamilies Indexed by Function / P. D. Thomas, M. J. Campbell, A. Kejariwal [et al.] // Genome Res. — 2003. — Vol. 13, № 9. — P. 2129-2141

184. Pagni, M. Making sense of score statistics for sequence alignments / M. Pagni, C. V. Jongeneel // Briefings in Bioinformatics. — 2001. Vol. 2, № 1. — P. 51-67

185. PanOCT: automated clustering of orthologs using conserved gene neighborhood for pan-genomic analysis of bacterial strains and closely related species / D. E. Fouts, L. Brinkac, E. Beck [et al.] // Nucleic Acids Research. — 2012. — Vol. 40, № 22. — P. e172-e172

186. Penny, D. Progress with methods for constructing evolutionary trees / D. Penny, M. D. Hendy, M. A. Steel // Trends in Ecology & Evolution. — 2003. — Vol. 7, № 3. — P. 73-79

187. Pfeffer, C. M. The Evolution, Functions and Applications of the Breast Cancer Genes BRCA1 and BRCA2 / C. M. Pfeffer, B. N. Ho, A. T. K. Singh // CGP. — 2017. — Vol. 14, № 5. — P. 293 — 298

188. Philippon, H. Evolutionary history of phosphatidylinositol-3-kinases: ancestral origin in eukaryotes and complex duplication patterns / H. Philippon, C. Brochier-Armanet, G. Perrière // BMC Evol Biol. — 2015. — Vol. 15, № 1. — P. 226

189. PhosphOrtholog: a web-based tool for cross-species mapping of orthologous protein post-translational modifications / R. Chaudhuri, A. Sadrieh, N. J. Hoffman [et al.] // BMC Genomics. — 2015. — Vol. 16, № 1. — P. 617

190. Phylogenetic Relationships within Cation Transporter Families of Arabidopsis / P. Mäser, S. Thomine, J. I. Schroeder [et al.] // Plant Physiology. — 2002. — Vol. 126, № 4. — P. 1646-1667

191. Posada, D. jModelTest: Phylogenetic Model Averaging / D. Posada // Molecular Biology and Evolution. — 2008. Vol. 25, № 7. — P. 1253-1256

192. Predicting the Functional, Molecular, and Phenotypic Consequences of Amino Acid Substitutions using Hidden Markov Models / H. A. Shihab, J. Gough, D. N. Cooper [et al.] // Human Mutation. — 2012. — Vol. 34, № 1. — P. 57-65

193. Prevalence of Variant Reclassification Following Hereditary Cancer Genetic Testing / J. Mersch, N. Brown, S. Pirzadeh-Miller [et al.] // JAMA. — 2018. — Vol. 320, № 12. — P. 1266

194. ProbCons: Probabilistic consistency-based multiple sequence alignment / C. B. Do, M. S. Mahabhashyam, M. Brudno [et al.] // Genome Res. — 2005. — Vol. 15, № 2. — P. 330-340

195. Progressive Cactus is a multiple-genome aligner for the thousand-genome era / J. Armstrong, G. Hickey, M. Diekhans [et al.] // Nature. — 2020. — Vol. 587, № 7833. — P. 246-251

196. Quang, D. DANN: a deep learning approach for annotating the pathogenicity of genetic variants / D. Quang, Y. Chen, X. Xie // Bioinformatics. — 2014. — Vol. 31, № 5. — P. 761-763

197. Quest for Orthologs Entails Quest for Tree of Life: In Search of the Gene Stream / B. Boeckmann, M. Marcet-Houben, J. A. Rees [et al.] // Genome Biol Evol. — 2015. — Vol. 7, № 7. — P. 1988-1999

198. REVEL: An Ensemble Method for Predicting the Pathogenicity of Rare Missense Variants / N. M. Ioannidis, J. H. Rothstein, V. Pejaver [et al.] // The American Journal of Human Genetics. — 2016. — Vol. 99, № 4. — P. 877-885

199. Ranking of non-coding pathogenic variants and putative essential regions of the human genome / A. Wells, D. Heckerman, A. Torkamani [et al.] // Nat Commun. — 2019. — Vol. 10, № 1. P. — 5241

200. Rao, C. R. Score Test: Historical Review and Recent Developments / C. R. Rao // Advances in Ranking and Selection, Multiple Comparisons, and Reliability / Balakrishnan N., Nagaraja H. N., Kannan N. (Eds.). - Boston, MA.: Birkhäuser Boston, 2005 - P. 3-20

201. Remm, M. Automatic clustering of orthologs and in-paralogs from pairwise species comparisons / M. Remm, C. E. Storm, E. L. Sonnhammer // Journal of Molecular Biology. — 2002. — Vol. 314, № 5. — P. 1041-1052

202. Reva, B. Predicting the functional impact of protein mutations: application to cancer genomics / B. Reva, Y. Antipin, C. Sander // Nucleic Acids Research. — 2011. — Vol. 39, № 17. — P. e118-e118

203. Revised International Prognostic Scoring System for Myelodysplastic Syndromes / P.L. Greenberg, H. Tuechler, J. Schanz [et al.] // Blood. — 2012. — Vol. 120, № 12. — P. 2454-2465

204. Riera, C. Prediction of pathological mutations in proteins: the challenge of integrating sequence conservation and structure stability principles / C. Riera, S. Lois, X. de la Cruz // WIREs Comput Mol Sci. — 2013. — Vol. 4, № 3. — P. 249-268

205. Robertson, J. DICER1 Syndrome: DICER1 Mutations in Rare Cancers / J. Robertson, C. Jorcyk, J. Oxford // Cancers. — 2018. — Vol. 10, № 5. — P. 143

206. Rogers, M. F. CScape-somatic: distinguishing driver and passenger point mutations in the cancer genome / M. F. Rogers, T. R. Gaunt, C. Campbell // Bioinformatics. — 2020. — Vol. 36, № 12. — P. 3637—3644

207. Rosenberg, M. S. Evolutionary distance estimation and fidelity of pair wise sequence alignment / M. S. Rosenberg // BMC Bioinformatics. — 2005. — Vol. 6, № 1. — P. 102

208. Roth, A. C. Algorithm of OMA for large-scale orthology inference / A. C. Roth, G. H. Gonnet, C. Dessimoz // BMC Bioinformatics. — 2008. — Vol. 9, № 1. — P. 518

209. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead / C. Rudin // Nat Mach Intell. — 2019. Vol. 1, № 5. — P. 206-215

210. SIFT web server: predicting effects of amino acid substitutions on proteins / N. Sim, P. Kumar, J. Hu [et al.] // Nucleic Acids Research. — 2012. — Vol. 40, № W1. — P. W452-W457

211. SIMAP — the database of all-against-all protein sequence similarities and annotations with new interfaces and increased coverage / R. Arnold, F. Goldenberg, H. Mewes [et al.] // Nucl. Acids Res. — 2013. — Vol. 42, № D1. — P. D279-D284

212. SPAdes: A New Genome Assembly Algorithm and Its Applications to Single-Cell Sequencing / A. Bankevich, S. Nurk, D. Antipov [et al.] // Journal of Computational Biology. — 2012. — Vol. 19, № 5. — P. 455-477

213. Seshat: A Web service for accurate annotation, validation, and analysis of TP53 variants generated by conventional and next-generation sequencing / T. Tikkanen, B. Leroy, J. L. Fournier [et al.] // Human Mutation. — 2018. — Vol. 39, № 7. — P. 925-933

214. Shedding light on the DICER1 mutational spectrum of uncertain significance in malignant neoplasms / D. S. Bug, I. S. Moiseev, Yu. B. Porozov [et al.] // Front. Mol. Biosci. — 2024. — Vol. 11

215. Shi, G. MSOAR 2.0: Incorporating tandem duplications into ortholog assignment based on genome rearrangement / G. Shi, L. Zhang, T. Jiang // BMC Bioinformatics. — 2010. — Vol. 11, № 1. — P. 10

216. Sievers, F. QuanTest2: benchmarking multiple sequence alignments using secondary structure prediction / F. Sievers, D. G. Higgins // Bioinformatics. — 2019. — Vol. 36, № 1. — P. 90-95

217. Soltis, P. S. Applying the Bootstrap in Phylogeny Reconstruction / P. S. Soltis, D. E. Soltis // Statist. Sci. — 2003. — Vol. 18, № 2. — P. 256-267

218. Soria-Carrasco, V. Estimation of Phylogenetic Inconsistencies in the Three Domains of Life / V. Soria-Carrasco, J. Castresana // Molecular Biology and Evolution. — 2008. — Vol. 25, № 11. — P. 2319-2329

219. Standards and Guidelines for the Interpretation and Reporting of Sequence Variants in Cancer / M.M. Li, M. Datto, E.J. Duncavage [et al.] // The Journal of Molecular Diagnostics. — 2016. — Vol. 19, № 1. — P. 4-23

220. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology / S. Richards, N. Aziz, S. Bale [et al.] // Genetics in Medicine. — 2015. — Vol. 17, № 5. — P. 405-424

221. Standards for the classification of pathogenicity of somatic variants in cancer (oncogenicity): Joint recommendations of Clinical Genome Resource (ClinGen), Cancer Genomics Consortium (CGC), and Variant Interpretation for Cancer Consortium (VICC) / P. Horak, M. Griffith, A.M. Danos [et al.] // Genetics in Medicine. — 2022. — Vol. 24, № 5. — P. 986-998

222. Stone, E. A. Physicochemical constraint violation by missense substitutions mediates impairment of protein function and disease severity / E. A. Stone, A. Sidow // Genome Res. — 2005. — Vol. 15, № 7. — P. 978-986

223. Sunyaev, S. R. Inferring causality and functional significance of human coding DNA variants / S. R. Sunyaev // Human Molecular Genetics. — 2012. Vol. 21, № R1. — P. R10-R17

224. Systematic analysis of noncoding somatic mutations and gene expression alterations across 14 tumor types / N. J. Fredriksson, L. Ny, J. A. Nilsson [et al.] // Nat Genet. — 2014. — Vol. 46, № 12. — P. 1258-1263

225. TP53 mutations in human cancers: functional selection and impact on cancer prognosis and outcomes / A. Petitjean, M. I. W. Achatz, A. L. Borresen-Dale [et al.] // Oncogene. — 2007. — Vol. 26, № 15. — P. 2157-2165

226. TP53-Mutated Myelodysplastic Syndrome and Acute Myeloid Leukemia: Biology, Current Therapy, and Future Directions / N.G. Daver, A. Maiti, T.M. Kadia [et al.] // Cancer Discovery. — 2022. — Vol. 12, № 11. — P. 2516-2529

227. Tabari, E. PorthoMCL: Parallel orthology prediction using MCL for the realm of massive genome availability / E. Tabari, Z. Su // Big Data Anal. — 2017. — Vol. 2, № 1. — P. 4

228. Tang, H. PANTHER-PSEP: predicting disease-causing genetic variants using position-specific evolutionary preservation / H. Tang, P. D. Thomas // Bioinformatics. — 2016. — Vol. 32, № 14. — P. 2230-2232

229. Tatusov, R. L. A Genomic Perspective on Protein Families / R. L. Tatusov, E. V. Koonin, D. J. Lipman // Science. — 2002. — Vol. 278, № 5338. — P. 631-637

230. Tatusov, R. L. The COG database: a tool for genome-scale analysis of protein functions and evolution / R. L. Tatusov // Nucleic Acids Research. — 2002. Vol. 28, № 1. — P. 33-36

231. Tatusov, R. L. The COG database: new developments in phylogenetic classification of proteins from complete genomes / R. L. Tatusov // Nucleic Acids Research. — 2002. Vol. 29, № 1. — P. 22-28

232. Tavtigian, S. V. Comprehensive statistical study of 452 BRCA1 missense substitutions with classification of eight recurrent substitutions as neutral / S. V. Tavtigian // Journal of Medical Genetics. — 2005. Vol. 43, № 4. — P. 295-305

233. The Ensembl Variant Effect Predictor / W. McLaren, L. Gil, S. E. Hunt [et al.] // Genome Biology. — 2016. — Vol. 17, № 1. — P. 122

234. The European Bioinformatics Institute in 2016: Data growth and integration / C. E. Cook, M. T. Bergman, R. D. Finn [et al.] // Nucleic Acids Res. — 2015. — Vol. 44, № D1. — P. D20-D26

235. The European Bioinformatics Institute in 2020: building a global infrastructure of interconnected data resources for the life sciences / C. E. Cook, O. Stroe, G. Cochrane [et al.] // Nucleic Acids Research. — 2019. — Vol. 48, № D1. — P. D17-D23

236. The Origins and Evolution of the p53 Family of Genes / V. A. Belyi, P. Ak, E. Markert [et al.] // Cold Spring Harbor Perspectives in Biology. — 2009. — Vol. 2, № 6. — P. a001198-a001198

237. The Sequence Alignment /Map format and SAMtools / H. Li, B. Handsaker, A. Wysoker [et al.] // Bioinformatics. — 2009. — Vol. 25, № 16. — P. 2078-2079

238. The folding and evolution of multidomain proteins / J. Han, S. Batey, A. A. Nickson [et al.] // Nat Rev Mol Cell Biol. — 2007. — Vol. 8, № 4. — P. 319-330

239. The human noncoding genome defined by genetic diversity / J. di Iulio, I. Bartha, E. H. M. Wong [et al.] // Nat Genet. — 2018. — Vol. 50,

№ 3. — P. 333-337

240. The mutational constraint spectrum quantified from variation in 141,456 humans / K. J. Karczewski, L. C. Francioli, G. Tiao [et al.] // Nature. — 2020. — Vol. 581, № 7809. — P. 434-443

241. The p53 gene family in vertebrates: Evolutionary considerations / M. A. Biscotti, M. Barucca, F. Carducci [et al.] // J Exp Zool Pt B. — 2019. — Vol. 332, № 6. — P. 171-178

242. The real cost of sequencing: scaling computation to keep pace with data generation / P. Muir, S. Li, S. Lou [et al.] // Genome Biol. — 2016. — Vol. 17, № 1. — P. 53

243. The use of gene clusters to infer functional coupling / R. Overbeek, M. Fonstein, M. D'Souza [et al.] // Proc. Natl. Acad. Sci. U.S.A. — 2002. — Vol. 96, № 6. — P. 2896-2901

244. The UniProt Consortium. UniProt: a hub for protein information / The UniProt Consortium // Nucleic Acids Research. — 2015. — Vol. 43, № D1. — P. D204-12

245. Thompson, J. D. A comprehensive comparison of multiple sequence alignment programs / J. D. Thompson, F. Plewniak, O. Poch // Nucleic Acids Research. — 2002. — Vol. 27, № 13. — P. 2682-2690

246. Thompson, J. D. BAliBASE: a benchmark alignment database for the evaluation of multiple alignment programs. / J. D. Thompson, F. Plewniak, O. Poch // Bioinformatics. — 2002. — Vol. 15, № 1. — P. 87-88

247. Thompson, J. D. CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and

weight matrix choice / J. D. Thompson, D. G. Higgins, T. J. Gibson // Nucl Acids Res. — 2007. — Vol. 22, № 22. — P. 4673-4680

248. Thusberg, J. Performance of mutation pathogenicity prediction methods on missense variants / J. Thusberg, A. Olatubosun, M. Vihinen // Hum. Mutat. — 2011. — Vol. 32, № 4. — P. 358-368

249. Towards Understanding the Pathogenicity of DROSHA Mutations in Oncohematology / D. S. Bug, A. V. Tishkov, I. S. Moiseev [et al.] // Cells. — 2021. — Vol. 10, № 9. — P. 2357

250. Uzzell, T. Fitting Discrete Probability Distributions to Evolutionary Events / T. Uzzell, K. W. Corbin // Science. — 2006. — Vol. 172, № 3988. — P. 1089-1096

251. Valencia, A. Computational methods for the prediction of protein interactions / A. Valencia, F. Pazos // Current Opinion in Structural Biology. — 2002. — Vol. 12, № 3. — P. 368-373

252. VarScan: variant detection in massively parallel sequencing of individual and pooled samples / D. C. Koboldt, K. Chen, T. Wylie [et al.] // Bioinformatics. — 2009. — Vol. 25, № 17. — P. 2283-2285

253. Variant effect prediction tools assessed using independent, functional assay-based datasets: implications for discovery and diagnostics / K. Mahmood, C. Jung, G. Philip [et al.] // Hum Genomics. — 2017. — Vol. 11, № 1. — P. 10

254. Variant interpretation using population databases: Lessons from gnomAD / S. Gudmundsson, M. Singer-Berk, N.A. Watts [et al.] // Human Mutation. — 2021. — Vol. 43, № 8. — P. 1012-1030

255. Vihinen, M. Majority Vote and Other Problems when using Computational Tools / M. Vihinen // Human Mutation. — 2014. Vol. 35, № 8. — P. 912-914

256. WHO classification and WPSS predict posttransplantation outcome in patients with myelodysplastic syndrome: a study from the Gruppo Italiano Trapianto di Midollo Osseo (GITMO) / E.P. Alessandrino, M.G. Della Porta, A. Bacigalupo [et al.] // Blood. — 2008. — Vol. 112, № 3. — P. 895-902

257. Wang, K. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data / K. Wang, M. Li, H. Hakonarson // Nucleic Acids Res. — 2010. — Vol. 38, № 16. — P. e164

258. Watanabe, H. A comprehensive representation of extensive similarity linkage between large numbers of proteins / H. Watanabe, J. Otsuka // Bioinformatics. — 2007. — Vol. 11, № 2. — P. 159-166

259. Welcsh, P. L. BRCA1 and BRCA2 and the genetics of breast and ovarian cancer / P. L. Welcsh // Human Molecular Genetics. — 2002. Vol. 10, № 7. — P. 705-713

260. Wetlaufer, D. B. Nucleation, Rapid Folding, and Globular Intrachain Regions in Proteins / D. B. Wetlaufer // Proc. Natl. Acad. Sci. U.S.A. — 2006. Vol. 70, № 3. — P. 697-701

261. Yandell, M. A beginner's guide to eukaryotic genome annotation / M. Yandell, D. Ence // Nat Rev Genet. — 2012. — Vol. 13, № 5. — P. 329-342

262. Yang, Z. Molecular phylogenetics: principles and practice / Z. Yang, B. Rannala // Nat Rev Genet. — 2012. — Vol. 13, № 5. — P. 303-314

263. Zhang, F. Non-coding genetic variants in human disease / F. Zhang, J. R. Lupski // Hum. Mol. Genet. — 2015. — Vol. 24, № R1. — P. R102-R110

264. Zhou, L. Prioritization and functional assessment of noncoding variants associated with complex diseases / L. Zhou, F. Zhao // Genome Med. — 2018. — Vol. 10, № 1. — P. 53

265. Zhou, Y. APF2: an improved ensemble method for pharmacogenomic variant effect prediction / Y. Zhou, S. Pirmann, V. M. Laushke // Pharmacogenomics J. — 2024. — Vol. 24, № 3. — P. 17

СПИСОК ИЛЛЮСТРАТИВНОГО МАТЕРИАЛА

Номер Наименование Страница

1. Рисунок 1 — Половозрастная диаграмма обследованных Международной рабочей группы изучения миелодиспластического синдрома 79

2. Рисунок 2 — Диаграмма распределения обследованных по диагнозам 79

3. Рисунок 3 — Фрагмент выравнивания белковых последовательностей гомологов гена CDKN2A, полученное в результате работы программы SIFT 91

4. Рисунок 4 — Фрагменты множественных выравниваний последовательностей, используемых программами MAPP (А, Б, В), SIFT (Г, Д) и PolyPhen2 (Е) для определения клинического эффекта замен, затрагивающих позиции 1705 (А), 1809 (Б, Г), 1813 (Б, Е) и 1822 (В, Д) белка DICER1 92

5. Рисунок 5 — Схема формирования базы данных последовательностей 100

6. Рисунок 6 — Схема реализации метода COG для поиска ортологов 102

7. Рисунок 7 — Интерфейс программы для поиска ортологов 105

8. Рисунок 8 — Графы ортологов исследуемых генов и их паралогов. Исследуемые гены человека отмечены красным. А, В, Д, Ж, И: цвет узла отражает принадлежность к кластеру 107

Маркова; Б, Г, Е, З, К: цвет отражает принадлежность к наибольшим максимальным кликам различных генов человека. А, Б: BRCA1 и BARD1, В, Г: BRCA2 и BRCA2-like, Д, Е: ТР53, ТР63 и ТР73, Ж, З: DICER1 и DICER2, И, К: Р1К3СА, Р1К3СВ и PIK3CD. Паралоги различимы по цветам кластеров Маркова, к которым они относятся; в некоторых случаях вершины, относящиеся к паралогам, обведены

9. Рисунок 9 — Филогенетические деревья белков исследуемых генов. Клады ортологов отмечены красным цветом 108

10. Рисунок 10 — Фрагмент множественного выравнивания ортологов DICER1, демонстрирующий законсервированную (красный) и вариабельную (зелёный) позиции 111

11. Рисунок 11 — Классификация биохимических групп аминокислот 112

12. Рисунок 12 — Схема мутационного анализа с применением информационной системы для оценки патогенности генетических вариантов. Шаги, осуществляемые в рамках работы информационной системы, выделены пунктирной рамкой 117

13. Рисунок 13 — ROC-кривая классификатора, основанного на популяционной частоте вариантов 119

14. Рисунок 14 — Веб-приложение для классификации миссенс-вариантов ТР53 124

15. Рисунок 15 — Чувствительность и специфичность определения патогенных вариантов информационной системы и программ-предикторов 125

16. Рисунок 16 — Диаграмма Венна, демонстрирующая пересечение между двумя множествами генетических вариантов: обнаруженных в выравниваниях нуклеотидных 131

последовательностей и присутствующих в базе данных GnomAD v3.1.1

17. Рисунок 17 — Распределение доброкачественных и патогенных вариантов среди вариантов в СНпУаг, GnomAD v3.1.1 и обнаруженных обнаруженных в выравниваниях нуклеотидных последовательностей. В скобках указано общее количество доброкачественных и патогенных вариантов 132

18. Рисунок 18 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 162-й аминокислоты 135

19. Рисунок 19 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 1637-й аминокислоты 135

20. Рисунок 20 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 1708-й аминокислоты 135

21. Рисунок 21 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 1813-й аминокислоты 135

22. Рисунок 22 — Распределение пациентов Международной рабочей группы изучения МДС, классифицированных согласно разработанному алгоритму, по возрасту 137

23. Рисунок 23 — Кривые пятилетней общей выживаемости трёх подгрупп пациентов Международной рабочей группы, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 140

24. Рисунок 24 — Кривые пятилетней безлейкозной выживаемости трёх подгрупп пациентов Международной рабочей группы, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 143

25. Рисунок 25 — Распределение пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России, классифицированных согласно разработанному алгоритму, по возрасту 147

26. Рисунок 26 — Кривые пятилетней общей выживаемости групп пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 147

27. Рисунок 27 — Кривые пятилетней беспрогрессивной выживаемости групп пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 149

28. Таблица 1 — Система категориальных переменных для описания эволюционной распространённости 58

29. Таблица 2 — Структура набора данных для обучения и тестирования 68

30. Таблица 3 — Базы данных и методы, используемые программами-предикторами для оценки клинического эффекта миссенс-вариантов на основе выравниваний белковых последовательностей 86

31. Таблица 4 — Метод оценки патогенности и дополнительные сведения, используемые программами-предикторами 87

32. Таблица 5 — Границы доменов DICER1, позиции соответствуют последовательности КР 001258211 93

33. Таблица 6 — Границы доменов BRCA2, позиции соответствуют последовательности КР 000050 93

34. Таблица 7 — Аминокислоты в позиции мутаций гена DICER1 до и после выравнивания субпоследовательностей 94

35. Таблица 8 — Распределение отобранных признаков для классификации в наборе данных для исследования 116

36. Таблица 9 — Чувствительность, специфичность, точность и логарифм отношения шансов, полученные на каждом из этапов перекрёстной проверки 119

37. Таблица 10 — Чувствительность, специфичность и точность определения патогенных вариантов с помощью информационной системы и других предикторов 126

38. Таблица 11 — Положительная и отрицательная прогностическая ценность определения патогенных вариантов с помощью информационной системы и других предикторов 127

39. Таблица 12 — Чувствительность, специфичность и точность определения патогенных вариантов с помощью информационной системы и других предикторов на тестовой выборке с исключением онкогенных вариантов 128

40. Таблица 13 — Положительная и отрицательная прогностическая ценность определения патогенных вариантов с помощью информационной системы и других предикторов 129

41. Таблица 14 — Характеристики обследованных с нейтральными или патогенными генетическими вариантами в гене ТР53 и без них 138

42. Таблица 15 — Диагнозы пациентов трёх подгрупп, определённых по результатам мутационного анализа ТР53 138

43. Таблица 16 — Риск по шкале IPSS-R пациентов Международной рабочей группы в трёх подгруппах, определённых по результатам мутационного анализа ТР53 141

44. Таблица 17 — Результаты регрессионного анализа Кокса при анализе общей выживаемости 142

45. Таблица 18 — Результаты регрессионного анализа Кокса при анализе безлейкозной выживаемости 144

46. Таблица 19 — Риск по шкале IPSS-M пациентов Международной рабочей группы в трёх подгруппах, определённых по результатам мутационного анализа ТР53 145

47. Таблица 20 — Распределение пациентов с мутациями различной классификации по диагнозам 148

48. Формула 1 — Индекс Юдена 61

49. Формула 2 — Чувствительность определения патогенных вариантов 69

50. Формула 3 — Специфичность определения патогенных вариантов 69

51. Формула 4 — Точность определения патогенных вариантов 69

52. Формула 5 — Положительная прогностическая ценность определения патогенных вариантов 69

53. Формула 6 — Отрицательная прогностическая ценность определения патогенных вариантов 69

54. Формула 7 — Положительная прогностическая ценность с поправкой на встречаемость 69

55. Формула 8 — Отрицательная прогностическая ценность с поправкой на встречаемость 69

56. Формула 9 — Формула Клоппера-Пирсона для нижней границы 95%-го доверительного интервала 70

57. Формула 10 — Формула Клоппера-Пирсона для верхней границы 95%-го доверительного интервала 70

58. Формула 11 — Границы 95%-го доверительного интервала для положительной прогностической ценности с поправкой на встречаемость 70

59. Формула 12 — Границы 95%-го доверительного интервала для отрицательной прогностической ценности с поправкой на встречаемость 70

60. Формула 13 — Натуральный логарифм отношения шансов 71

61. Формула 14 — Границы 95%-го доверительного интервала для натурального логарифма отношения шансов 71

62. Формула 15 — Критерий Хи-квадрат Пирсона 81

63. Формула 16 — Вероятность отклонения наблюдаемых данных от ожидаемых по точному тесту Фишера 81

64. Формула 17 — Критерий Краскела-Уоллиса 82

65. Формула 18 — Критерий Манна-Уитни 82

66. Формула 19 — ^критерий Стьюдента 82

67. Формула 20 — Поправка Бенджамини-Хохберга для множественных сравнений 83

68. Формула 21 — Функция выживаемости по методу Каплана-Мейера 83

69. Формула 22 — Формула Гринвуда для вычисления 95%-го доверительного интервала для функции выживаемости 83

70. Формула 23 — Функция риска согласно регрессионной модели Кокса 84

Приложение А

(справочное)

Аминокислотные замены, соответствующие вариантам из базы данных СНпУаг, их известное и полученное при помощи разработанного алгоритма клиническое

значение

Замена (указаны хромосома, позиция, референсный и альтернативный аллели) Известное клиническое значение Полученное клиническое значение

^13-32316461^^ Патогенный вариант Патогенное

^13-32316462-^ Патогенный вариант Патогенное

^13-32316462-^ Патогенный вариант Патогенное

^13-32316463^^ Патогенный вариант Патогенное

chr13-32316463-G-T Патогенный вариант Патогенное

^13-32316513^^ Доброкачественный вариант Нейтральное

chr13-32316527-G-T Патогенный вариант Патогенное

chr13-32319134-A-G Доброкачественный вариант Нейтральное

chr13-32319137-A-G Доброкачественный вариант Нейтральное

chr13-32319176-A-C Доброкачественный вариант Нейтральное

^13-32319232^^ Доброкачественный вариант Нейтральное

chr13-32325081-A-C Доброкачественный вариант Нейтральное

chr13-32326115-A-G Доброкачественный вариант Нейтральное

chr13-32326150-G-A Доброкачественный вариант Патогенное

chr13-32326268-C-A Доброкачественный вариант Нейтральное

^13-32326613^^ Патогенный вариант Патогенное

chr13-32326613-G-C Патогенный вариант Патогенное

chr13-32330928-AG-GA Патогенный вариант Патогенное

chr13-32332343-A-C Доброкачественный вариант Нейтральное

chr13-32332456-C-A Доброкачественный вариант Нейтральное

^13-32332518^^ Доброкачественный вариант Нейтральное

СЫ-13-32332592-Л-С Доброкачественный вариант Нейтральное

СЫ-13-32332601-С-Т Доброкачественный вариант Нейтральное

chr13-32332619-G-Л Доброкачественный вариант Нейтральное

chr13-32332629-C-T Доброкачественный вариант Нейтральное

СЫ-13-32332644-С-Л Доброкачественный вариант Нейтральное

chr13-32332659-Л-C Доброкачественный вариант Нейтральное

chr13-32332832-C-Л Доброкачественный вариант Нейтральное

chr13-32332863-Л-G Доброкачественный вариант Нейтральное

chr13-32332992-T-C Доброкачественный вариант Нейтральное

сИг13-32333016-Л^ Доброкачественный вариант Нейтральное

chr13-32333140-T-G Доброкачественный вариант Нейтральное

chr13-32333222-Л-C Доброкачественный вариант Нейтральное

chr13-32333264-G-C Доброкачественный вариант Нейтральное

chr13-32333270-Л-G Доброкачественный вариант Нейтральное

СЫ-13-32333274-С-Т Доброкачественный вариант Нейтральное

chr13-32333276-T-C Доброкачественный вариант Нейтральное

chr13-32333282-G-Л Доброкачественный вариант Нейтральное

chr13-32333288-Л-G Доброкачественный вариант Нейтральное

chr13-32333343-C-T Доброкачественный вариант Нейтральное

^13-32333367-^ Доброкачественный вариант Нейтральное

chr13-32336293-C-Л Доброкачественный вариант Нейтральное

chr13-32336319-C-G Доброкачественный вариант Нейтральное

chr13-32336493-Л-T Доброкачественный вариант Нейтральное

chr13-32336705-Л-G Доброкачественный вариант Нейтральное

сЫ-13-3233677№С Доброкачественный вариант Нейтральное

chr13-32337035-G-Л Доброкачественный вариант Нейтральное

chr13-32337053-Л-G Доброкачественный вариант Нейтральное

chr13-32337071-Л-G Доброкачественный вариант Нейтральное

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.