Стратификация рисков трансформации в острый лейкоз и смерти у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Буг Дмитрий Сергеевич
- Специальность ВАК РФ00.00.00
- Количество страниц 221
Оглавление диссертации кандидат наук Буг Дмитрий Сергеевич
ОГЛАВЛЕНИЕ
ВВЕДЕНИЕ
ГЛАВА 1 ЛИТЕРАТУРНЫЙ ОБЗОР
1.1. Базы данных нуклеотидных и белковых последовательностей
1.2. Методы филогенетической реконструкции
1.2.1. Построение филогенетических деревьев
1.2.2. Графовый метод
1.3. Множественное выравнивание последовательностей
1.4. Определение клинической значимости вариантов in silico
1.4.1. Программы-предикторы на основе выравнивания аминокислотных последовательностей
1.4.2. Программы-предикторы на основе выравнивания нуклеотидных последовательностей
1.4.3. Ансамблевый подход
1.5. Применение программ-предикторов в медицине
1.6. Определение клинического значения вариантов
ГЛАВА 2 МАТЕРИАЛЫ И МЕТОДЫ
2.1. Определение требований к информационной системе
2.2. Разработка программы для поиска ортологов
2.2.1. Разработка модуля для создания базы данных последовательностей
2.2.2. Разработка модуля для реализации метода COG
2.3. Определение факторов для дифференциации патогенных и нейтральных вариантов
2.3.1. Определение эволюционной распространённости с помощью выравнивания
последовательностей аминокислот
2.3.2. Определение эволюционной распространённости с помощью выравнивания псевдоридов
2.3.3. Фактор популяционной распространённости
2.3.4. Фактор локализации в «горячей точке»
2.3.5. Фактор онкогенности
2.3.6. Фактор механизма нарушения функции гена
2.3.7. Обучение и отбор признаков
2.4. Разработка информационной системы
2.4.1. Разработка программы для анализа данных NGS
2.4.2. Разработка веб-приложения для классификации миссенс-вариантов гена TP53
2.4.3. Оценка операционных характеристик информационной системы
2.4.4. Валидация информационной системы
ГЛАВА 3. РЕЗУЛЬТАТЫ И ИХ ОБСУЖДЕНИЕ
3.1. Основные характеристики информационной системы
3.2. Программа для поиска ортологов
3.2.1. Модуль для создания базы данных последовательностей
3.2.2. Модуль для реализации метода COG
3.2.3. Поиск ортологов генов TP53, BRCA1, BRCA2, PIK3CA и DICER1
3.3. Факторы для дифференциации патогенных и нейтральных вариантов
3.3.1. Фактор эволюционной распространённости
3.3.2. Фактор популяционной распространённости
3.3.3. Фактор онкогенности
3.3.4. Отбор признаков
3.4. Информационная система для стратификации рисков
3.4.1. Алгоритм классификации генетических вариантов
3.4.2. Пайплайн для анализа данных, полученных с помощью NGS
3.4.3. Веб-приложение для классификации миссенс-замен TP53
3.4.4. Оценка операционных характеристик информационной системы
3.4.4.1. Определение нейтральных вариантов на основе выравниваний нуклеотидных последовательностей
3.4.5. Примеры оценки патогенности известных мутаций гена DICER1
3.4.6. Валидация информационной системы
3.4.6.1. Когорта пациентов Международной рабочей группы по изучению МДС
3.4.6.2. Когорта пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава
России
ЗАКЛЮЧЕНИЕ
ВЫВОДЫ
ПРАКТИЧЕСКИЕ РЕКОМЕНДАЦИИ
СПИСОК СОКРАЩЕНИЙ И УСЛОВНЫХ ОБОЗНАЧЕНИЙ
СПИСОК ЛИТЕРАТУРЫ
СПИСОК ИЛЛЮСТРАТИВНОГО МАТЕРИАЛА
Приложение А. Аминокислотные замены, соответствующие вариантам из базы данных ClinVar, их известное и полученное при помощи разработанного
алгоритма клиническое значение
Приложение Б. Варианты из базы данных ClinVar, обнаруженные среди нуклеотидных вариантов в картах выравнивания псевдоридов, и их клиническое значение
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Антибиотикорезистентность бактерий родов Ureaplasma и Mycoplasma, ассоциированных с воспалительными заболеваниями урогенитального тракта2018 год, кандидат наук Колесникова, Елена Александровна
Исследование патогенности вариантов нуклеотидной последовательности в гене SCN1A, влияющих на сплайсинг2024 год, кандидат наук Спарбер Пётр Андреевич
Закономерности рекомбинации и эволюции у ряда социально значимых (+)РНК-вирусов млекопитающих2023 год, кандидат наук Вакуленко Юлия Александровна
Разработка подходов для исследования патогенности вариантов нуклеотидной последовательности с использованием функционального анализа2025 год, доктор наук Скоблов Михаил Юрьевич
Методы циклического выравнивания и разложения шума для поиска скрытой периодичности в белковых семействах2005 год, кандидат физико-математических наук Ласкин, Андрей Александрович
Введение диссертации (часть автореферата) на тему «Стратификация рисков трансформации в острый лейкоз и смерти у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа»
ВВЕДЕНИЕ
Актуальность темы исследования. В настоящее время для выбора тактики ведения пациентов с онкогематологическими, нейроонкологическими и другими заболеваниями необходимо применять молекулярно-генетические методы, которые позволяют обнаруживать нарушения дезоксирибонуклеиновой кислоты (ДНК) на геномном, хромосомном и генном уровнях [26, 175]. Технология секвенирования следующего поколения (next generation sequencing, NGS) отличается от классического секвенирования по Сэнгеру значительным увеличением пропускной способности метода, позволяя обнаруживать большее число нарушений ДНК и использовать дополнительные сведения при выборе тактики ведения пациентов [105]. С внедрением метода NGS в клиническую практику объемы данных мутационного анализа ДНК пациентов с различными патологиями значительно увеличились. При этом выросло и число находок, клиническое значение (клинический эффект) которых остаётся неясным [105, 234]. В частности, большинство генетических вариантов, обнаруживаемых в некодирующих областях генома, являются неинтерпретируемыми (варианты неясного значения) [96]. В то же время, согласно базе данных ClinVar, около 75% генетических вариантов неясного значения представлено миссенс-заменами [61, 65]. В структуре генетических вариантов, обнаруженных при анализе опухолевых тканей, миссенс-замены также составляют большинство [21]. Таким образом, наиболее остро проявляется проблема определения клинической значимости генетических вариантов в некодирующих областях генома и миссенс-замен.
Миелодиспластический синдром (МДС) — это группа заболеваний с поражением стволовой клетки крови, характеризующихся цитопенией и риском
трансформации в острый миелоидный лейкоз (ОМЛ). Спектр возможных опций при определении тактики ведения пациентов варьирует от динамического наблюдения до системной противоопухолевой терапии с возможностью выполнения трансплантации гемопоэтических стволовых клеток. Для того чтобы определить, какой метод будет наиболее эффективным, используются специальные шкалы, позволяющие оценить индивидуальный риск развития осложнений: международная прогностическая балльная система (international prognostic scoring system, IPSS) [128], прогностическая балльная система Всемирной организации здравоохранения (World health organisation prognostic scoring system, WPSS) [256], пересмотренная международная прогностическая балльная система (revised international prognostic scoring system, IPSS-R) [203] и другие. Эти шкалы учитывают выраженность цитопении, уровень бластных клеток в костном мозге, а также наличие геномных и хромосомных нарушений ДНК. По мере прогрессирования заболевания у пациентов с МДС повышается частота возникновения мутаций в гене TP53, что ассоциировано с увеличенным риском развития осложнений и смерти [154, 226]. В целом, мутации в этом гене наиболее часто встречаются при злокачественных новообразованиях и связаны с неблагоприятным прогнозом [9], а у пациентов с МДС и ОМЛ они возникают в 5-10% случаев и приводят к ухудшению ответа на химиотерапию и снижению выживаемости [226]. Следует подчеркнуть, что это касается только патогенных мутаций, что обусловливает необходимость определения клинического эффекта генетических вариантов TP53, многие из которых попадают в категорию неясного значения. Таким образом, на сегодняшний день существует проблема определения патогенности генетических вариантов неясного значения в гене TP53, которая не позволяет корректно оценивать риски трансформации в ОМЛ и смерти у пациентов с МДС с учётом факторов, выявляемых на молекулярно-генетическом уровне.
Степень разработанности темы исследования. В настоящее время для оценки клинической значимости генетического варианта используются методы in vivo, in vitro или in silico. К методам in silico относится определение клинической значимости генетических вариантов при помощи программ-предикторов,
опирающихся на эволюционную консервативность гена и структурные характеристики продуцируемого им белка. Данные программы рекомендуются к использованию при обнаружении терминальных и соматических мутаций [219, 220, 221]. Согласно «Руководству по интерпретации данных последовательности ДНК человека, полученных методами массового параллельного секвенирования (MPS)» рекомендуется использовать компьютерные прогностические программы в случае, если генетический вариант не был описан ранее и не представлен ни в одной из баз данных или сведения о нём недостаточны [10]. То же касается и соматических мутаций, обнаруженных у пациентов с онкологическими заболеваниями [11]. Внедрение стандарта оценки клинического значения генетических вариантов позволяет реклассифицировать их, уточняя представление о пациенте с учётом новых данных, а также скорректировать тактику ведения больного [193].
Одним из основных принципов оценки клинической значимости in silico является поиск обнаруженных у пациента генетических вариантов среди последовательностей-гомологов изменённого гена. Он лежит в основе ConSurf [67], EVE [75], PROVEAN [58] и других программ. В AlphaMissense и других программах используется дополнительная информация о структуре и функции белкового продукта исследуемого гена [25]. «Ансамблевые» программы (например, APF2) осуществляют оценку патогенности генетических вариантов на основе результатов работы других программ-предикторов [265].
Однако, из-за недостаточной специфичности результаты работы прогностических программ могут использоваться для применения лишь дополнительных критериев для определения нейтральных (критерий BP4) и патогенных (критерий PP3) вариантов [10, 151, 220]. При этом патогенность генетического варианта может подтверждаться только при условии его соответствия другим критериям, которые предполагают проведение функциональных и клинических исследований. Следовательно, оценка патогенности генетического варианта, полученная с помощью программ-предикторов, не может использоваться в качестве основополагающего критерия
для классификации генетических вариантов согласно общепринятым руководствам для интерпретации данных секвенирования. Более того, программы-предикторы ограничиваются классификацией вариантов в целом, без учёта нозологии и персонализированного подхода. Кроме того, во многих программах не осуществляется обновление информации о характеристиках патогенных вариантов.
Таким образом, в настоящее время существует потребность в создании новой постоянно актуализируемой информационной системы для оценки клинической значимости генетических вариантов с выделением группы высоких рисков трансформации в ОМЛ и летального исхода у взрослых пациентов с МДС на основе механизма сбора из различных баз данных для получения информации об изменении функции и структуры белка, эволюционной консервативности гена, популяционной распространённости генетического варианта и его онкогенности.
Цель исследования: разработка информационной системы для стратификации рисков трансформации в острый лейкоз или летального исхода у пациентов с миелодиспластическим синдромом на основе данных мутационного анализа ТР53.
Задачи исследования
1. Определить требования к информационной системе с учётом особенностей алгоритмов, лежащих в основе современных программ-предикторов.
2. Разработать программу для поиска ортологов в целях определения эволюционной распространённости генетических вариантов среди ортологичных последовательностей.
3. Выявить информативные факторы для дифференциации патогенных и нейтральных вариантов.
4. Разработать алгоритмическое и программное обеспечение информационной системы для определения групповых и индивидуальных рисков трансформации в ОМЛ и летального исхода больных с МДС, определить её операционные характеристики.
Научная новизна исследования. В результате выполнения диссертационного исследования получены следующие результаты, характеризующиеся научной новизной:
1. Разработан метод исследования эволюционной вариабельности мультидоменных белков, основанный на множественном выравнивании субпоследовательностей ортологов.
2. Впервые в России создана программа для поиска ортологов, позволяющая изучать эволюционную историю произвольных генов с использованием как кластеров Маркова, так и наибольших максимальных клик.
3. Предложена новая концепция, основанная на методе генетического выравнивания «псеворидов» гомологичных последовательностей, предназначенная для определения нейтрального клинического эффекта генетических вариантов.
В рамках выполнения диссертационной работы было осуществлено решение актуальной научной задачи — стратификация пациентов с миелодиспластическим синдромом на основании данных мутационного анализа гена ТР53, что имеет значение для медицинской информатики.
Теоретическая и практическая значимость работы. Созданная информационная система позволяет определять группы высокого и низкого риска трансформации в лейкоз и смерти среди пациентов с МДС на основе данных мутационного анализа ТР53. По мере обновления информации из независимых баз данных может производиться реклассификация генетических вариантов.
Информационная система предназначена для использования лабораторным генетиком при интерпретации данных мутационного анализа гена ТР53 у пациентов с МДС для оценки патогенности обнаруженных мутаций. Для интерпретации миссенс-замен целесообразно применять информационную систему в виде веб-приложения, где в качестве входных параметров указываются координаты мутации и альтернативная аминокислота.
Положения, выносимые на защиту
1. Информационная система обладает наилучшей точностью определения патогенных мутаций генов ТР53, BRCA1, BRCA2, DICER1 и Р1К3СА среди программ-предикторов, а по чувствительности и специфичности не уступает им.
2. Информационная система обеспечивает стратификацию рисков трансформации в лейкоз и летального исхода у пациентов с миелодиспластическим синдромом на основании данных мутационного анализа.
Степень достоверности результатов исследования. Достоверность исследования обеспечена корректностью применения современных методик сбора и обработки исходной информации, правильным подбором объектов наблюдения, достаточным объемом исследуемой выборочной совокупности, использованием апробированного математического аппарата и подтверждается проверкой, обсуждением результатов исследования на международных и всероссийских научных конференциях, публикациями результатов исследования в рецензируемых научных изданиях.
Внедрение результатов работы в практическое здравоохранение.
Результаты внедрены в работу Лаборатории трансплантологии и молекулярной гематологии клиники «НИИ детской онкологии, гематологии и трансплантологии им. Р.М. Горбачевой» ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России и в учебный процесс кафедры физики, математики и информатики ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России.
Методология и методы исследования. Объектом настоящего исследования являются данные молекулярной диагностики пациентов с миелоидной патологией, включая МДС, — одного из наиболее актуальных направлений развития современной онкологии. В качестве предмета исследования рассматривается оценка индивидуальных и групповых рисков трансформации в ОМЛ и смерти у пациентов с МДС. В данной работе для обозначения любого отличия последовательности ДНК пациента от референсной последовательности генома человека 2013 года версии GRCh38 используется термин «генетический вариант». Ретроспективно были проанализированы результаты мутационного анализа гена
TP53 пациентов с МДС и ОМЛ, обследованных в рамках деятельности Международной рабочей группы изучения МДС (2343 человека) [154] и проходивших лечение в ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России в период с 2018 по 2023 год (195 человек). В качестве материала для выделения ДНК использовался костный мозг или кровь. Методы настоящего исследования включают в себя обработку биологических, а также деперсонифицированных клинических и лабораторных данных с использованием языка Python 3 и библиотеки Pandas, формирование баз данных последовательностей типа Lightning Memory-Mapped Database (LMDB) при помощи программного пакета BLAST+ [43], графовый анализ, визуализацию графов в виде файлов HTML (HyperText Markup Language, язык гипертекстовой разметки) с внедрёнными функциями JavaScript, множественное выравнивание последовательностей, построение филогенетических деревьев, анализ данных, полученных с помощью NGS, методы дескриптивной и сравнительной статистики, включая отбор признаков и анализ выживаемости..
Апробация результатов. Основные положения диссертации доложены и обсуждены на:
1. XXIV Всероссийской конференции молодых учёных с международным участием «Актуальные проблемы биомедицины - 2018» (г. Санкт-Петербург, 12-13 апреля 2018 г.);
2. XVI Санкт-Петербургской международной конференции «Региональная информатика (РИ-2018)» (г. Санкт-Петербург, 24-26 октября 2018 г.);
3. Конференции «Вычислительная биология и искусственный интеллект для персонализированной медицины 2022» (г. Москва, 2-4 августа 2022 г.);
4. XXVII конгрессе Европейской Ассоциации Гематологии «EHA2022 Congress» (г. Вена, 9-12 июня 2022 г.);
5. XVIII международном Симпозиуме памяти Раисы Максимовны Горбачевой «Трансплантация гемопоэтических стволовых клеток. Генная и клеточная терапия» (г. Санкт-Петербург, 19-21 сентября 2024 г.);
6. Заседаниях кафедры медицинской кибернетики и информатики им. С. А. Гаспаряна медико-биологического факультета ФГАОУ ВО РНИМУ им. Н.И. Пирогова Минздрава России (Пироговский Университет) 26 марта 2024 г., 24 сентября 2024 г., 24 июня 2025 г.
Апробация диссертационной работы была проведена 3 июня 2025 г. (протокол заседания № 2) на Проблемной комиссии №18 «Биомедицинская статистика» ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России.
Публикации по теме диссертации. По теме диссертации опубликовано 16 научных работ, в том числе в рецензируемых научных изданиях — 2, входящих в международные реферативные базы данных и системы цитирования — 6, входящих в сборники конференций — 4, свидетельств о регистрации программы для электронно-вычислительных машин (ЭВМ) — 3, иных входящих в перечень Высшей аттестационной комиссии — 1. В опубликованных работах в полной мере изложены основные положения диссертации. В диссертации отсутствуют недостоверные сведения об опубликованных соискателем ученой степени работах, в которых изложены основные научные результаты диссертации.
Личный вклад автора. Диссертация является результатом самостоятельной научно-исследовательской работы, выполненной на кафедре физики, математики и информатики ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России. Автором лично выполнен весь объем исследования, произведен обзор отечественной и иностранной литературы по изучаемой проблеме, проведен логический и статистический анализ результатов исследования, разработаны методика, методы и компьютерные программы, сформулированы выводы и практические рекомендации, оформлены диссертация и автореферат.
Соответствие диссертации паспорту специальности. Диссертация выполнена по специальности медицинской отрасли науки 3.3.9. Медицинская информатика (медицинские науки) и соответствует пунктам 3 и 5 паспорта специальности: 3. Разработка компьютерных методов, баз данных и программных средств для получения, накопления, обработки, передачи и систематизации медицинских и экологических данных с целью использования в лечебно-
диагностическом, реабилитационном, профилактическом, образовательном процессах, 5. Разработка алгоритмов профилактики, диагностики, прогнозирования, лечения; моделей и алгоритмов для оценки индивидуального и группового риска.
Объем и структура диссертации. Диссертация изложена на 221 странице машинописного текста (191 страница без приложений) и состоит из введения, обзора литературы, материалов и методов, главы собственных исследований, заключения, выводов, практических рекомендаций, списка сокращений и условных обозначений, списка литературы и списка иллюстративного материала. Иллюстрирована 20 таблицами и 27 рисунками. Библиографический указатель включает 12 отечественных и 253 зарубежных источника.
ГЛАВА 1 ЛИТЕРАТУРНЫЙ ОБЗОР
В данной главе при использовании данных отечественной и зарубежной литературы представлен обзор современных компьютерных технологий, которые применяются для определения патогенности генетических вариантов, а также общепринятый алгоритм интерпретации значения генетических вариантов в целом, что в конечном счёте позволяет учитывать различные факторы, включая молекулярные, при выборе тактики ведения пациентов.
1.1. Базы данных нуклеотидных и белковых последовательностей
Современные программы для оценки клинической значимости (патогенности) генетических вариантов основываются на множественных выравниваниях нуклеотидных последовательностей гомологичных генов [73, 76, 126, 163] или аминокислотных последовательностей их продуктов [19, 58, 67, 75, 104, 202, 210]. В основе этих методов лежит сравнение генов, кодирующих нормально функционирующие белки, с геном, содержащим исследуемый генетический вариант.
На первом этапе, для описания всех возможных форм гена, способных продуцировать функциональный продукт, необходимо идентифицировать гомологичные (имеющие общее происхождение) гены различных биологических видов. Выравнивание и сравнение последовательностей исследуемого гена и его гомологов позволяет определить, присутствуют ли среди гомологичных генов последовательности с аналогичными миссенс-вариантами. Наличие таких вариантов может указывать на их доброкачественность и отсутствие негативного влияния на функцию гена. Таким образом, основой для оценки клинической значимости миссенс-замен является поиск гомологов исследуемого гена, что подразумевает изучение эволюции генов. Следует отметить, что исследование эволюции более информативно при сравнении аминокислотных последовательностей, и именно они используются в подавляющем большинстве программ-предикторов [55].
Таким образом, основу любого метода оценки патогенности вариантов неясного значения составляет база данных нуклеотидных или аминокислотных последовательностей, которые используются для сравнения в процессе
определения допустимости того или иного генетического варианта. Такая база данных должна отвечать следующим ключевым принципам [130, 235]:
1. База данных должна быть наиболее полной при условии минимизации избыточности (то есть наличия в базе нескольких последовательностей, соответствующих одному и тому же реальному прототипу: изоформе белка, рибонуклиновой кислоты (РНК), гену);
2. База данных должна содержать наиболее современную аннотацию каждой последовательности;
3. Атрибуты объектов базы данных должны быть совместимы с различными компьютерными программами, применяемыми для оценки клинической значимости вариантов;
4. Базы данных должны обладать высокой степенью функциональной совместимости между собой.
Существует четыре основных источника белковых последовательностей: GenPept, RefSeq, TrEMBL и SWISS-PROT. Все они связаны с соответствующими базами данных нуклеотидных последовательностей.
GenPept является частью GenBank — базы данных генетических последовательностей Национального Института Здоровья Соединённых Штатов Америки, включающей нуклеотидные последовательности и их белковые продукты [108].
Объекты в GenBank содержат атрибуты, описывающие длину последовательности, тип молекулы, координаты транслируемых участков, источник биоматериала и название организма, к которому принадлежит последовательность. Кроме того, формат GenBank включает описание объекта, которое может содержать название соответствующего гена или белка, его функцию, а также ссылки на литературные источники.
GenBank пополняется преимущественно за счёт исследователей, которые отправляют полученные последовательности и их аннотации через онлайн-систему регистрации или специализированные программы (BankIt, Sequin, tbl2asn). Каждому объекту присваивается уникальный идентификатор в течение примерно
двух дней. Процесс регистрации сопровождается контролем качества, включающим проверку на отсутствие контаминации, корректность трансляции кодирующих областей, таксономической классификации и библиографических ссылок. После проверки заявка с замечаниями отправляется автору для уточнений. Кроме того, GenBank пополняется данными из других аналогичных баз, таких как Европейская молекулярно-биологическая лаборатория (European molecular biology laboratory, EMBL) и Японская база данных ДНК [107], что обеспечивается благодаря Международной коллаборации баз данных нуклеотидных последовательностей (International Nucleotide Sequence Database Collaboration, INSDC).
Структура базы данных нуклеотидных последовательностей EMBL — европейский нуклеотидный архив (European nucleotide archive, ENA), во многом схожа с GenBank, но отличается тем, что не включает аминокислотные последовательности. Для их хранения в Европейской молекулярно-биологической лаборатории была создана отдельная база данных UniProtKB/TrEMBL [46].
Объекты в базах данных ENA и UniProtKB/TrEMBL имеют схожие атрибуты: длина последовательности, тип молекулы, источник биоматериала и таксономическая классификация организма-источника. Каждый объект снабжён описанием, включающим функцию гена или белка, его участки, а также ссылки на литературные источники. Подобно GenBank, база данных ENA пополняется исследователями с использованием специализированных программ (Webin, Sequin). Система EMBL также проводит проверку на контаминацию векторами в предоставляемых исследователями последовательностях.
UniProtKB/TrEMBL является одной из двух частей базы данных белков UniProt в системе EMBL. Вторая часть, UniProtKB/Swiss-Prot, содержит белковые последовательности, которые аннотируются и проверяются сотрудниками EMBL. Аннотация в UniProtKB/Swiss-Prot основывается на научной литературе, посвящённой экспериментально изученным белкам, а также на биоинформатическом анализе, проводимом кураторами, ответственными за аннотацию белков [92, 244]. Исследования показывают, что в автоматически
аннотируемых базах данных, таких как GenBank и UniProtKB/TrEMBL, ошибки в описании суперсемейств ферментов могут достигать 63%, тогда как в курируемой UniProtKB/Swiss-Prot ошибки в описании ферментов большинства семейств практически отсутствуют [35].
Неизбыточной (т. е. исключающей более одной записи одного и того же белка) базой данных аминокислотных последовательностей в системе UniProtKB является UniRef — набор кластеризованных последовательностей из UniProtKB и некоторых записей UniProt Archive. UniRef состоит из нескольких подразделов: UniRef100, UniRef90 и UniRef50 — они содержат кластеры, состоящие из идентичных на 100%, 90% и 50% последовательностей, соответственно.
Кроме того, существует проект RefSeq, относящийся к Национальному центру биотехнологической информации (National center for biotechnology information, NCBI) наравне с GenBank. Объекты базы данных RefSeq формируются по-разному в зависимости от исследуемого организма. Большая часть геномов архей и бактерий аннотируется при помощи специального пайплайна, предназначенного для описания прокариотических геномов. Большинство эукариотических геномов также аннотируется при помощи специально предназначенного пайплайна, который использует известные данные о транскрипте (включают в себя сведения об РНК-секвенировании и о сборке транскриптомов методом shotgun секвенирования), гомологии последовательности и известных курируемых транскриптах и белках RefSeq, а также прогнозирует некоторые свойства последовательности ab initio. Сравнительно небольшая часть бактериальных и эукариотических геномов курируется специалистами.
Существует множество баз данных, которые основаны на информации из других баз данных. Примером может служить неизбыточная база данных белковых последовательностей NCBI (NCBI non-redundant protein database), которая включает последовательности из GenPept, UniProtKB/Swiss-Prot, RefSeq и ряда других баз данных, таких как PIR, PDF и PDB.
Итак, существует множество баз данных аминокислотных последовательностей, каждая из которых обладает своими особенностями.
Автоматизированные программы для определения клинического эффекта миссенс-вариантов используют в качестве источника различные базы данных белковых последовательностей. Например, UniProtKB служит исходной базой данных для SIFT [210] и MutationTaster [160], а NCBI non-redundant protein database — для PROVEAN [58]. Следует отметить, что аминокислотные последовательности определяются на основе последовательностей соответствующих генов, которые, в свою очередь, формируются на основе геномных сборок.
Растущее число геномных сборок обуславливает необходимость оценки того, насколько хорошо та или иная сборка описывает реально существующий геном организма. Существуют стандартные показатели для оценки целостности считываемых последовательностей при сборке генома, которые учитывают размеры контигов. Контиг — это непрерывный участок ДНК, полученный при сборке генома с использованием перекрывающихся фрагментов ДНК. Общепринятые показатели включают в себя:
1. N50 — длина наиболее короткого контига из минимального количества максимально длинных контигов, сумма длин которых составляет не менее 50% от суммы длин всех контигов в сборке;
2. NG50 — модификация предыдущего показателя, отличающаяся тем, что вместо 50% от суммы длин всех контигов в сборке используется 50% предполагаемой длины генома исследуемого организма [36];
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Филогенетический анализ видов саранчовых семейств Acrididae и Pamphagidae на основе митохондриальных и ядерных маркеров2020 год, кандидат наук Сухих Игорь Сергеевич
Расположение аминокислотных замен на эволюционном дереве как показатель изменчивости однопозиционного адаптивного ландшафта2020 год, кандидат наук Клинк Галина Викторовна
Молекулярно-генетическая характеристика пандемического вируса гриппа А подтипа H1N1, циркулировавшего на территории Российской Федерации на протяжении сезонов 2009-2011гг.2011 год, кандидат медицинских наук Журавлева, Марина Михайловна
Идентификация и биохимическая характеристика геновариантов парэховирусов человека2012 год, кандидат биологических наук Зверев, Владимир Владимирович
Изучение фено-генотипических характеристик спорадического и наследственного рака желудка у пациентов российской популяции2025 год, кандидат наук Данишевич Анастасия Михайловна
Список литературы диссертационного исследования кандидат наук Буг Дмитрий Сергеевич, 2025 год
СПИСОК ЛИТЕРАТУРЫ
1. Анализ информативности компьютерных т silico предсказательных программ при оценке клинической значимости миссенс-замен гена GJB2 (Сх26) / В. Г. Пшенникова, Н. А. Барашков, А. В. Соловьёв [и др.] // Якутский медицинский журнал. 2017. — Т. 59, № 3. — С. 40-46
2. Буг, Д. С. Биоинформатический анализ генетических полиморфизмов уромодулина / Д. С. Буг // Региональная информатика (РИ-2018). XVI Санкт-Петербургская международная конференция «Региональная информатика (РИ-2018)». Санкт-Петербург, 24-26 октября 2018 г.: Материалы конференции. — СПб.: СПОИСУ. — 2018. С. 420-421
3. Буг, Д. С. Обзор программ для оценки патогенности генетических вариантов / Д. С. Буг, А. Н. Наркевич, Н. В. Петухова // Учёные записки Первого Санкт-Петербургского государственного медицинского университета имени академика И. П. Павлова. — 2025. — Т. 32, № 1. — С. 11-20
4. Буг, Д. С. Поиск ортологов метил-CpG-связывающего белка в задаче определения мутации МеСР2 у больных синдромом Ретта / Д. С. Буг, И. А. Фильченко, М. В. Радионова // Материалы XXIV Всероссийской конференции молодых учёных с международным участием. — СПб.: РИЦ ПСПбГМУ. — 2018. — С. 50-51
5. Исследование патогенности мутации V281I в гене CYP21A2 при врожденной гиперплазии надпочечников / Д. А. Кузовенкова, Д. С. Буг, В. Д. Назаров [и др.] // Сборник тезисов конференции «Вычислительная биология и искусственный интеллект для персонализированной медицины». — М.: НМИЦ эндокринологии. — 2022. С. 50
6. Клинико-эпидемиологическая характеристика острых миелоидных лейкозов у взрослых по данным муниципальных отделений гематологии Москвы / С. В. Сёмочкин, Т. Н. Толстых, Н. В. Архипова [и др.] // Терапевтический архив. — 2015. — Т. 87, № 7. — С. 26-32
7. Миелодиспластический синдром: эпидемиология и эпигенетические нарушения / П. В. Липилкин, Е. Д. Кулаева, А. Н. Зельцер [и др.] // Медицинский вестник Юга России. — 2022. — Т. 13, № 2. — С. 179-190
8. Национальная Программа Российского общества клинической онкологии «Совершенствование молекулярно-генетической диагностики в Российской Федерации с целью повышения эффективности противоопухолевого лечения» // Интернет-портал Российского общества клинической онкологии : сайт. — URL: https://rosoncoweb.ru/activities/cancergenome (дата обращения 24.10.2023)
9. Прогностическое значение результатов секвенирования нового поколения у пациентов с миелодиспластическим синдромом / Н. Ю. Цветков, Е. В. Морозова, И. М. Бархатов [и др.] // Клиническая онкогематология. — 2020. — Т. 13, № 2. — C. 170-175
10. Рыжкова, О. П. Руководство по интерпретации данных последовательности ДНК человека, полученных методами массового параллельного секвенирования (MPS) (редакция 2018, версия 2) / О. П. Рыжкова, О. Л. Кардымон, Е. Б. Прохорчук [и др.] // Медицинская генетика. — 2021. — Т. 18, № 2. — С. 3-23
11. Спектор, М. А. Интерпретация соматических генетических вариантов, выявленных методом высокопроизводительного секвенирования опухолевой ДНК, на примере онкологических заболеваний детского возраста. / М. А. Спектор, Л. А. Ясько, А. Е. Друй // Медицинская генетика. — 2020. — Т. 20, № 3. — С. 3-25
12. 3DCoffee@igs: a web server for combining sequences and structures into a multiple sequence alignment / O. Poirot, K. Suhre, C. Abergel [et al.] // Nucleic Acids Research. — 2007. — Vol. 32. — P. W37-W40
13. A Comprehensive Benchmark Study of Multiple Sequence Alignment Methods: Current Challenges and Future Perspectives / J. D. Thompson, B. Linard, O. Lecompte [et al.] // PLoS ONE. — 2011. — Vol. 6, № 3. — P. e18093
14. A Comprehensive Evaluation of the Performance of Prediction Algorithms on Clinically Relevant Missense Variants / E. Qorri, B. Takacs, A. Graf [et al.] // IJMS. — 2022. — Vol. 23, № 14. — P. 7946
15. A Statistical Framework to Predict Functional Non-Coding Regions in the Human Genome Through Integrated Analysis of Annotation Data / Q. Lu, Y. Hu, J. Sun [et al.] // Sci Rep. — 2015. — Vol. 5, № 1. P. — 10576
16. A Strong Candidate for the Breast and Ovarian Cancer Susceptibility Gene BRCA1 / Y. Miki, J. Swensen, D. Shattuck-Eidens [et al.] // Science. — 2006. — Vol. 266, № 5182. — P. 66-71
17. A Structural EM Algorithm for Phylogenetic Inference / N. Friedman, M. Ninio, I. Pe'er [et al.] // Journal of Computational Biology. — 2002. — Vol. 9, № 2. — P. 331-353
18. A general framework for estimating the relative pathogenicity of human genetic variants / M. Kircher, D. M. Witten, P. Jain [et al.] // Nat Genet. — 2014. — Vol. 46, № 3. — P. 310-315
19. A method and server for predicting damaging missense mutations / I. A. Adzhubei, S. Schmidt, L. Peshkin [et al.] // Nat Methods. — 2010. — Vol. 7, № 4. — P. 248-249
20. A method for calculating probabilities of fitness consequences for point mutations across the human genome / B. Gulko, M. J. Hubisz, I. Gronau [et al.] // Nat Genet. — 2015. — Vol. 47, № 3. — P. 276-283
21. A pan-cancer analysis of synonymous mutations / Y. Sharma, M. Miladi, S. Dukare [et al.] // Nat Commun. — 2019. — Vol. 10, № 1. P. — 2569
22. A spectral approach integrating functional genomic annotations for coding and noncoding variants / I. Ionita-Laza, K. McCallum, B. Xu [et al.] // Nat Genet. — 2016. — Vol. 48, № 2. — P. 214-220
23. Abascal, F. ProtTest: selection of best-fit models of protein evolution / F. Abascal, R. Zardoya, D. Posada // Bioinformatics. — 2005. — Vol. 21, № 9. — P. 2104-2105. 10.1093/bioinformatics/bti263
24. Accelerating Discovery of Functional Mutant Alleles in Cancer / M.T. Chang, T.S. Bhattarai, A.M. Schram [et al.] // Cancer Discovery. — 2017. — Vol. 8, № 2. — P. 174183
25. Accurate proteome-wide missense variant effect prediction with AlphaMissense / J. Cheng, G. Novati, J. Pan [et al.] // Science. — 2023. — Vol. 381, № 6664. — P. eadg7492
26. Acute Myeloid Leukemia, Version 3.2019, NCCN Clinical Practice Guidelines in Oncology / M. S. Tallman, E. S. Wang, J. K. Altman [et al.] // Journal of the National Comprehensive Cancer Network. — 2019. — Vol. 17, № 6. — P. 721-749
27. Advances and Applications in the Quest for Orthologs / N. Glover, C. Dessimoz, I. Ebersberger [et al.] // Molecular Biology and Evolution. — 2019. — Vol. 36, № 10. — P. 2157-2164
28. Aligning Multiple Genomic Sequences With the Threaded Blockset Aligner / M. Blanchette, W. J. Kent, C. Riemer [et al.] // Genome Res. — 2004. — Vol. 14, № 4. — P. 708-715
29. Altenhoff, A. M. Phylogenetic and Functional Assessment of Orthologs Inference Projects and Methods / A. M. Altenhoff, C. Dessimoz // PLoS Comput Biol. — 2009. — Vol. 5, № 1. — P. e1000262
30. Altschul, S. Gapped BLAST and PSI-BLAST: a new generation of protein database search programs / S. Altschul // Nucleic Acids Research. — 2002. Vol. 25, № 17. — P. 3389-3402
31. An RNA gene expressed during cortical development evolved rapidly in humans / K. S. Pollard, S. R. Salama, N. Lambert [et al.] // Nature. — 2006. — Vol. 443, № 7108. — P. 167-172
32. An algorithm for assessing the pathogenicity of genetic mutations in tumor based on a retrospective study of pathogenic and neutral genetic variants
/ D. S. Bug, A. N. Narkevich, A. V. Tishkov [et al.] // Siberian Journal of Clinical and Experimental Medicine. — 2025. — Vol. 40, № 1. — P. 226-234
33. An integrative approach to predicting the functional effects of non-coding and coding sequence variation / H. A. Shihab, M. F. Rogers, J. Gough [et al.] // Bioinformatics. — 2015. — Vol. 31, № 10. — P. 1536-1543
34. Analysis of Sequence Conservation at Nucleotide Resolution / S. Asthana, M. Roytberg, J. Stamatoyannopoulos [et al.] // PLoS Comput Biol. — 2007. — Vol. 3, № 12. — P. e254
35. Annotation Error in Public Databases: Misannotation of Molecular Function in Enzyme Superfamilies / A. M. Schnoes, S. D. Brown, I. Dodevski [et al.] // PLoS Comput Biol. — 2009. — Vol. 5, № 12. — P. e1000605
36. Assemblathon 1: A competitive assessment of de novo short read assembly methods / D. Earl, K. Bradnam, J. St. John [et al.] // Genome Res. — 2011. — Vol. 21, № 12. — P. 2224-2241
37. Assemblathon 2: evaluating de novo methods of genome assembly in three vertebrate species / K. R. Bradnam, J. N. Fass, A. Alexandrov [et al.] // GigaSci. — 2013. — Vol. 2, № 1. — P. 10
38. Assembly: a resource for assembled genomes at NCBI / P. A. Kitts, D. M. Church, F. Thibaud-Nissen [et al.] // Nucleic Acids Res. — 2015. — Vol. 44, № D1. — P. D73-D80
39. Assessing performance of pathogenicity predictors using clinically relevant variant datasets / A.C. Gunning, V. Fryer, J. Fasham [et al.] // J Med Genet. — 2020. — Vol. 58, № 8. — P. 547-555
40. Assessment of computational methods for predicting the effects of missense mutations in human cancers / F. Gnad, A. Baucom, K. Mukhyala [et al.] // BMC Genomics. — 2019. — Vol. 14, № S3. — P. S7
41. Assessment of miRNA biogenesis genes variants in MDS development and progression / D. Bug, A. Tishkov, I. Moiseev [et al.] // HemaSphere. — 2022. — Vol. 6. — P. 640-641.
42. Automated inference of molecular mechanisms of disease from amino acid substitutions / B. Li, V. G. Krishnan, M. E. Mort [et al.] // Bioinformatics. — 2009. — Vol. 25, № 21. — P. 2744-2750
43. BLAST+: Architecture and applications / C. Camacho, G. Coulouris, V. Avagyan [et al.] // BMC Bioinformatics. — 2009. — Vol. 10, № 1. — P. 421
44. Bug, D. S. Alignment of pseudoreads obtained from homologous sequences in identifying potentially tolerated genomic variants. / D. S. Bug, A. N. Narkevich, N. V. Petukhova // Journal of Bioinformatics and Genomics. — 2023. — Vol. 21, № 3. — P. 19-25.
45. BUSCO: assessing genome assembly and annotation completeness with single-copy orthologs / F. A. Simâo, R. M. Waterhouse, P. Ioannidis [et al.] // Bioinformatics. — 2015. — Vol. 31, № 19. — P. 3210-3212
46. Baker, W. The EMBL Nucleotide Sequence Database / W. Baker // Nucleic Acids Research. — 2002. Vol. 28, № 1. — P. 19-23
47. Basic local alignment search tool / S. F. Altschul, W. Gish, W. Miller [et al.] // Journal of Molecular Biology. — 2007. — Vol. 215, № 3. — P. 403-410
48. Bayesian Inference of Phylogeny and Its Impact on Evolutionary Biology / J. P. Huelsenbeck, F. Ronquist, R. Nielsen [et al.] // Science. — 2002. — Vol. 294, № 5550. — P. 2310-2314
49. Biegert, A. Sequence context-specific profiles for homology searching / A. Biegert, J. Soding // Proc. Natl. Acad. Sci. U.S.A. — 2009. — Vol. 106, № 10. — P. 3770-3775
50. Biology and Targetability of the Extended Spectrum of PIK3CA Mutations Detected in Breast Carcinoma / H. S. Rugo, K. Raskina, A. B. Schrock [et al.] // Clinical Cancer Research. — 2022. — Vol. 29, № 6. — P. 1056-1067
51. Bruno, W. J. Weighted Neighbor Joining: A Likelihood-Based Approach to Distance-Based Phylogeny Reconstruction / W. J. Bruno, N. D. Socci, A. L. Halpern // Molecular Biology and Evolution. — 2012. — Vol. 17, № 1. — P. 189-197
52. COCO-CL: hierarchical clustering of homology relations based on evolutionary correlations / R. Jothi, E. Zotenko, A. Tasneem [et al.] // Bioinformatics. — 2006. — Vol. 22, № 7. — P. 779-788
53. CScape: a tool for predicting oncogenic single-point mutations in the cancer genome / M. F. Rogers, H. A. Shihab, T. R. Gaunt [et al.] // Sci Rep. — 2017. — Vol. 7, № 1. P. — 11597
54. Calibration of computational tools for missense variant pathogenicity classification and ClinGen recommendations for PP3 /BP4 criteria / V. Pejaver, A. B. Byrne, B. Feng [et al.] // The American Journal of Human Genetics. — 2022. — Vol. 109, № 12. — P. 2163-2177
55. Capriotti, E. Evaluating the relevance of sequence conservation in the prediction of pathogenic missense variants / E. Capriotti, P. Fariselli // Hum Genet. — 2022. — Vol. 141, № 10. — P. 1649-1658
56. Characterization of p53 Family Homologs in Evolutionary Remote Branches of Holozoa / M. Bartas, V. Brazda, J. Cerven [et al.] // IJMS. — 2019. — Vol. 21, № 1. — P. 6
57. Chen, L. DIVAN: accurate identification of non-coding disease-specific risk variants using multi-omics profiles / L. Chen, P. Jin, Z. S. Qin // Genome Biol. — 2016. — Vol. 17, № 1. — P. 252
58. Choi, Y. PROVEAN web server: a tool to predict the functional effect of amino acid substitutions and indels / Y. Choi, A. P. Chan // Bioinformatics. — 2015. — Vol. 31, № 16. — P. 2745-2747
59. Chun, S. Identification of deleterious mutations within three human genomes / S. Chun, J. C. Fay // Genome Res. — 2009. — Vol. 19, № 9. — P. 1553-1561
60. Classification and Clinical Management of Variants of Uncertain Significance in High Penetrance Cancer Predisposition Genes / S. Moghadasi, D. M. Eccles, P. Devilee [et al.] // Human Mutation. — 2016. — Vol. 37, № 4. — P. 331-336
61. ClinVar: improving access to variant interpretations and supporting evidence / M. J. Landrum, J. M. Lee, M. Benson [et al.] // Nucleic Acids Research. — 2017. — Vol. 46, № D1. — P. D1062-D1067
62. Collins, F. S. BRCA1 — Lots of Mutations, Lots of Dilemmas / F. S. Collins // N Engl J Med. — 2002. Vol. 334, № 3. — P. 186-188
63. Comparative Genomics of the Archaea (Euryarchaeota): Evolution of Conserved Protein Families, the Stable Core, and the Variable Shell / K. S. Makarova, L. Aravind, M. Y. Galperin [et al.] // Genome Res. — 2021. — Vol. 9, № 7. — P. 608-628
64. Comparison and integration of deleteriousness prediction methods for nonsynonymous SNVs in whole exome sequencing studies / C. Dong, P. Wei, X. Jian [et al.] // Human Molecular Genetics. — 2015. — Vol. 24, № 8. — P. 2125-2137
65. Comprehensive characterization of amino acid positions in protein structures reveals molecular effect of missense variants / S. Iqbal, E. Pérez-Palma, J. B. Jespersen [et al.] // Proc. Natl. Acad. Sci. U.S.A. — 2020. — Vol. 117, № 45. — P. 28201-28211
66. Computational Tools for Splicing Defect Prediction in Breast /Ovarian Cancer Genes: How Efficient Are They at Predicting RNA Alterations? / A. Moles-Fernández, L. Duran-Lozano, G. Montalban [et al.] // Front. Genet. — 2018. — Vol. 9. — P. 366
67. ConSurf 2016: an improved methodology to estimate and visualize evolutionary conservation in macromolecules / H. Ashkenazy, S. Abadi, E. Martz [et al.] // Nucleic Acids Res. — 2016. — Vol. 44, № W1. — P. W344-W350
68. ConSurf: Identification of Functional Regions in Proteinsby Surface-Mapping of Phylogenetic Information / F. Glaser, T. Pupko, I. Paz [et al.] // Bioinformatics. — 2002. — Vol. 19, № 1. — P. 163-164
69. De novo pattern discovery enables robust assessment of functional consequences of non-coding variants / H. Yang, R. Chen, Q. Wang [et al.] // Bioinformatics. — 2018. — Vol. 35, № 9. — P. 1453-1460
70. De Bruyn, A. Phylogenetic Reconstruction Methods: An Overview / A. De Bruyn, D. P. Martin, P. Lefeuvre // Molecular Plant Taxonomy / Besse P. (Ed.). — Humana Press. — Totowa, NJ, 2014 — P.257 — 277
71. De la Campa, E. Á. Development of pathogenicity predictors specific for variants that do not comply with clinical guidelines for the use of computational evidence
/ E. À. de la Campa, N. Padilla, X. de la Cruz // BMC Genomics. — 2017. — Vol. 18, № S5. — P. 569
72. DeepCLIP: Predicting the effect of mutations on protein — RNA binding with deep learning / A. G. B. Gronning, T. K. Doktor, S. J. Larsen [et al.] // Nucleic Acids Research. — 2020. — P. gkaa530
73. Detection of nonneutral substitution rates on mammalian phylogenies / K. S. Pollard, M. J. Hubisz, K. R. Rosenbloom [et al.] // Genome Res. — 2009. — Vol. 20, № 1. — P. 110-121
74. Dhar, A. Maximum likelihood phylogenetic inference / A. Dhar, V. N. Minin // Encyclopedia of Evolutionary Biology / Kliman R. M. (Ed.). — Elsevier 2016. — P. 499-506
75. Disease variant prediction with deep generative models of evolutionary data / J. Frazer, P. Notin, M. Dias [et al.] // Nature. — 2021. — Vol. 599, № 7883. — P. 9195
76. Distribution and intensity of constraint in mammalian genomic sequence / G. M. Cooper, E. A. Stone, G. Asimenos [et al.] // Genome Res. — 2005. — Vol. 15, № 7. — P. 901-913
77. ERIC recommendations for TP53 mutation analysis in chronic lymphocytic leukemia — update on methodological approaches and results interpretation / J. Malcikova, E. Tausch, D. Rossi [et al.] // Leukemia. — 2018. — Vol. 32, № 5. — P. 1070-1080
78. Edgar, R. C. MUSCLE: a multiple sequence alignment method with reduced time and space complexity / R. C. Edgar // BMC Bioinformatics. — 2004. — Vol. 5, № 1. — P. 113
79. Edgar, R. C. MUSCLE: multiple sequence alignment with high accuracy and high throughput / R. C. Edgar // Nucleic Acids Research. — 2004. Vol. 32, № 5. — P. 17921797
80. Efron, B. Bootstrap confidence levels for phylogenetic trees / B. Efron, A. Halloran, S. Holmes // Proc. Natl. Acad. Sci. U.S.A. — 1996. Vol. 93, № 23. — P. 13429
81. EggNOG 5.0: a hierarchical, functionally and phylogenetically annotated orthology resource based on 5090 organisms and 2502 viruses / J. Huerta-Cepas, D. Szklarczyk, D. Heller [et al.] // Nucleic Acids Research. — 2018. — Vol. 47, № D1. — P. D309-D314
82. Ekseth, O. K. orthAgogue: an agile tool for the rapid prediction of orthology relations / O. K. Ekseth, M. Kuiper, V. Mironov // Bioinformatics. — 2013. — Vol. 30, № 5. — P. 734-736
83. Emergence of an Auxin Sensing Domain in Plant-Associated Bacteria / J. A. Gavira, M. Rico-Jiménez, Á. Ortega [et al.] // mBio. — 2023. — Vol. 14, № 1. — P. e0336322
84. Emms, D. M. Benchmarking Orthogroup Inference Accuracy: Revisiting Orthobench / D. M. Emms, S. Kelly // Genome Biology and Evolution. — 2020. — Vol. 12, № 12. — P. 2258-2266
85. Emms, D. M. OrthoFinder: solving fundamental biases in whole genome comparisons dramatically improves orthogroup inference accuracy / D. M. Emms, S. Kelly // Genome Biol. — 2015. — Vol. 16, № 1. — P. 157
86. Enredo and Pecan: Genome-wide mammalian consistency-based multiple alignment with paralogs / B. Paten, J. Herrero, K. Beal [et al.] // Genome Res. — 2008. — Vol. 18, № 11. — P. 1814-1828
87. Enright, A. J. An efficient algorithm for large-scale detection of protein families / A. J. Enright // Nucleic Acids Research. — 2002. Vol. 30, № 7. — P. 1575-1584
88. Establishing the precise evolutionary history of a gene improves prediction of disease-causing missense mutations / O. Adebali, A. O. Reznik, D. S. Ory [et al.] // Genetics in Medicine. — 2016. — Vol. 18, № 10. — P. 1029-1036
89. Evaluating the Effect of 3'-UTR Variants in DICER1 and DROSHA on Their Tissue-Specific Expression by miRNA Target Prediction / D. S. Bug, A. V. Tishkov, I. S. Moiseev [et al.] // Curr. Issues Mol. Biol. — 2021. — Vol. 43, № 2. — P. 605-617
90. Evolutionarily conserved elements in vertebrate, insect, worm, and yeast genomes / A. Siepel, G. Bejerano, J. S. Pedersen [et al.] // Genome Res. — 2005. — Vol. 15, № 8. — P. 1034-1050
91. Evolutionary reconstruction of MT-RNR2 gene demonstrates a diverse compositional landscape of humanin in vertebrates / D. S. Bug, A. V. Tishkov, T. F. Subbotina [et al.] // Journal of Evolutionary Biochemistry and Physiology. — 2023. — Vol. 59, № 5. — P. 1566-1576
92. Expert curation in UniProtKB: a case study on dealing with conflicting and erroneous data / S. Poux, M. Magrane, C. N. Arighi [et al.] // Database. — 2014. — Vol. 2014, № 0. — P. bau016-bau016
93. FATHMM-XF: accurate prediction of pathogenic point mutations via extended features / M. F. Rogers, H. A. Shihab, M. Mort [et al.] // Bioinformatics. — 2017. — Vol. 34, № 3. — P. 511-513
94. FIRE: functional inference of genetic variants that regulate gene expression / N. M. Ioannidis, J. R. Davis, M. K. DeGorter [et al.] // Bioinformatics. — 2017. — Vol. 33, № 24. — P. 3895-3901
95. Fast, scalable generation of high-quality protein multiple sequence alignments using Clustal Omega / F. Sievers, A. Wilm, D. Dineen [et al.] // Molecular Systems Biology. — 2011. — Vol. 7, № 1. P. — 539
96. Federici, G. Variants of uncertain significance in the era of high-throughput genome sequencing: a lesson from breast and ovary cancers / G. Federici, S. Soddu // J Exp Clin Cancer Res. — 2020. — Vol. 39, № 1. — P. 46
97. Felsenstein, J. Phylogenies and quantitative characters / J. Felsenstein // Annu. Rev. Ecol. Syst. — 2003. Vol. 19, № 1. — P. 445-471
98. Feng, D. Progressive sequence alignment as a prerequisite to correct phylogenetic trees / D. Feng, R. F. Doolittle // J Mol Evol. — 2007. — Vol. 25, № 4. — P. 351-360
99. Flanagan, S. E. Using SIFT and PolyPhen to Predict Loss-of-Function and Gain-of-Function Mutations / S. E. Flanagan, A. Patch, S. Ellard // Genetic Testing and Molecular Biomarkers. — 2010. — Vol. 14, № 4. — P. 533-537
100. Fox, G. Using de novo protein structure predictions to measure the quality of very large multiple sequence alignments / G. Fox, F. Sievers, D. G. Higgins // Bioinformatics. — 2015. — Vol. 32, № 6. — P. 814-820
101. From fastq data to high-confidence variant calls: The genome analysis toolkit best practices pipeline / G. A. Van Der Auwera, M. O. Carneiro, C. Hartl [et al.] // Current Protocols in Bioinformatics. — 2013. — Vol. 43, № 1. P. — 11.10.1-11.10.33
102. FunSeq2: a framework for prioritizing noncoding regulatory variants in cancer / Y. Fu, Z. Liu, S. Lou [et al.] // Genome Biol. — 2014. — Vol. 15, № 10. — P. 480
103. Functional Assessment of Genetic Variants with Outcomes Adapted to Clinical Decision-Making / P. Thouvenot, B. Ben Yamin, L. Fourrière [et al.] // PLoS Genet. — 2016. — Vol. 12, № 6. — P. e1006096
104. Functional annotations improve the predictive score of human disease-related mutations in proteins / R. Calabrese, E. Capriotti, P. Fariselli [et al.] // Hum. Mutat. — 2009. — Vol. 30, № 8. — P. 1237-1244
105. Gagan, J. Next-generation sequencing to guide cancer therapy / J. Gagan, E. M. Van Allen // Genome Med. — 2015. — Vol. 7, № 1. — P. 80
106. Gelfand, M. S. Prediction of transcription regulatory sites in Archaea by a comparative genomic approach / M. S. Gelfand // Nucleic Acids Research. — 2002. Vol. 28, № 3. — P. 695-705
107. GenBank / D. A. Benson, I. Karsch-Mizrachi, D. J. Lipman [et al.] // Nucleic Acids Research. — 2009. — Vol. 38, № 1. — P. D46-D51
108. GenBank / D. A. Benson, M. Cavanaugh, K. Clark [et al.] // Nucleic Acids Research. — 2012. — Vol. 41, № D1. — P. D36-D42
109. Genome-wide analysis of noncoding regulatory mutations in cancer / N. Weinhold, A. Jacobsen, N. Schultz [et al.] // Nat Genet. — 2014. — Vol. 46, № 11. — P. 1160-1165
110. Genome-wide prediction of disease variant effects with a deep protein language model / N. Brandes, G. Goldman, C.H. Wang [et al.] // Nat Genet. — 2023. — Vol. 55, № 9. — P. 1512-1522
111. González-Pérez, A. Improving the Assessment of the Outcome of Nonsynonymous SNVs with a Consensus Deleteriousness Score, Condel / A. González-Pérez, N. López-Bigas // The American Journal of Human Genetics. — 2011. — Vol. 88, № 4. — P. 440-449
112. Grantham, R. Amino Acid Difference Formula to Help Explain Protein Evolution / R. Grantham // Science. — 2006. Vol. 185, № 4154. — P. 862-864
113. Gudmundsson, S. Interpreting variants in genes affected by clonal hematopoiesis in population data / S. Gudmundsson, C. M. Carlston, A. O'Donnell-Luria // Human Genetics. — 2024. — Vol. 143. — P. 545-549
114. Guha, T. Inherited TP53 Mutations and the Li — Fraumeni Syndrome / T. Guha, D. Malkin // Cold Spring Harb Perspect Med. — 2017. — Vol. 7, № 4. — P. a026187
115. HH-suite3 for fast remote homology detection and deep protein annotation / M. Steinegger, M. Meier, M. Mirdita [et al.] // BMC Bioinformatics. — 2019. — Vol.
20, № 1. — P. 473
116. Harris, R. S. Improved pairwise alignment of genomic DNA. Ph.D. thesis / Robert S. Harris. — The Pennsylvania State University, 2007. — 74 pp
117. Hernández-Salmerón, J. E. Progress in quickly finding orthologs as reciprocal best hits: comparing blast, last, diamond and MMseqs2 / J. E. Hernández-Salmerón, G. Moreno-Hagelsieb // BMC Genomics. — 2020. — Vol.
21, № 1. — P. 741
118. High mutation burden in the checkpoint and micro-RNA processing genes in myelodysplastic syndrome / I. S. Moiseev, N. Y. Tcvetkov, I. M. Barkhatov [et al.] // PLoS ONE. — 2021. — Vol. 16, № 3. — P. e0248430
119. High-throughput functional evaluation of BRCA2 variants of unknown significance / M. Ikegami, S. Kohsaka, T. Ueno [et al.] // Nat Commun. — 2020. — Vol. 11, № 1. P. — 2573
120. Huang, Y. Fast, scalable prediction of deleterious noncoding variants from functional and population genomic data / Y. Huang, B. Gulko, A. Siepel // Nat Genet. — 2017. — Vol. 49, № 4. — P. 618-624
121. Huber, C. D. Population genetic models of GERP scores suggest pervasive turnover of constrained sites across mammalian evolution / C. D. Huber, B. Y. Kim, K. E. Lohmueller // PLoS Genet. — 2020. — Vol. 16, № 5. — P. e1008827
122. IQ-TREE 2: New Models and Efficient Methods for Phylogenetic Inference in the Genomic Era / B. Q. Minh, H. A. Schmidt, O. Chernomor [et al.] // Molecular Biology and Evolution. — 2020. — Vol. 37, № 5. — P. 1530-1534
123. Identification and Characterization of a Novel CLCN7 Variant Associated with Osteopetrosis / D. S. Bug, I. M. Barkhatov, Y. V. Gudozhnikova [et al.] // Genes. — 2020. — Vol. 11, № 11. — P. 1242
124. Identification of the breast cancer susceptibility gene BRCA2 / R. Wooster, G. Bignell, J. Lancaster [et al.] // Nature. — 2003. — Vol. 378, № 6559. — P. 789-792
125. Identifying a High Fraction of the Human Genome to be under Selective Constraint Using GERP++ / E. V. Davydov, D. L. Goode, M. Sirota [et al.] // PLoS Comput Biol. — 2010. — Vol. 6, № 12. — P. e1001025
126. Identifying novel constrained elements by exploiting biased substitution patterns / M. Garber, M. Guttman, M. Clamp [et al.] // Bioinformatics. — 2009. — Vol. 25, № 12. — P. i54-i62
127. Inhibition of Poly(ADP-Ribose) Polymerase in Tumors from BRCA Mutation Carriers / P. C. Fong, D. S. Boss, T. A. Yap [et al.] // N Engl J Med. — 2009. — Vol. 361, № 2. — P. 123-134
128. International Scoring System for Evaluating Prognosis in Myelodysplastic Syndromes / P. Greenberg, C. Cox, M.M. LeBeau [et al.] // Blood. — 1997. — Vol. 89, № 6. — P. 2079-2088
129. Interpreting missense variants: comparing computational methods in human disease genes CDKN2A , MLH1 , MSH2 , MECP2 , and tyrosinase (TYR) / P. A. Chan, S. Duraisamy, P. J. Miller [et al.] // Hum. Mutat. — 2007. — Vol. 28, № 7. — P. 683-693
130. Issues in searching molecular sequence databases / S. F. Altschul, M. S. Boguski, W. Gish [et al.] // Nat Genet. — 2004. — Vol. 6, № 2. — P. 119-129
131. Jakobsson, M. The Relationship Between F ST and the Frequency of the Most Frequent Allele / M. Jakobsson, M. D. Edge, N. A. Rosenberg // Genetics. — 2012. — Vol. 193, № 2. — P. 515-528
132. Janin, J. Structural domains in proteins and their role in the dynamics of protein function / J. Janin, S. J. Wodak // Progress in Biophysics and Molecular Biology. — 2003. — Vol. 42. — P. 21-78
133. Johnson, L. S. Hidden Markov model speed heuristic and iterative HMM search procedure / L. S. Johnson, S. R. Eddy, E. Portugaly // BMC Bioinformatics. — 2010. — Vol. 11, № 1. — P. 431
134. Jordan, D. M. Human allelic variation: perspective from protein function, structure, and evolution / D. M. Jordan, V. E. Ramensky, S. R. Sunyaev // Current Opinion in Structural Biology. — 2010. — Vol. 20, № 3. — P. 342-350
135. Jukes, T. H. Evolution of Protein Molecules / T. H. Jukes, C. R. Cantor // Mammalian Protein Metabolism / H. N. Munro (Ed.). — Academic Press — New York, 1969 — P. 21 — 132
136. Kannan, L. Maximum Parsimony on Phylogenetic networks / L. Kannan, W. C. Wheeler // Algorithms Mol Biol. — 2012. — Vol. 7, № 1. — P. 9
137. Kans, J. Entrez Direct: E-utilities on the Unix Command Line. Entrez Programming Utilities Help [Электронный ресурс] // ncbi.nlm.nih.gov. — 2013. Дата обновления: 27.09.2023. URL: https://www.ncbi.nlm.nih.gov/books/NBK179288 (дата обращения: 28.09.2023)
138. Katoh, K. MAFFT: a novel method for rapid multiple sequence alignment based on fast Fourier transform / K. Katoh // Nucleic Acids Research. — 2002. Vol. 30, № 14. — P. 3059-3066
139. Kimura, M. A simple method for estimating evolutionary rates of base substitutions through comparative studies of nucleotide sequences / M. Kimura // J Mol Evol. — 2005. Vol. 16, № 2. — P. 111-120
140. Koonin, E. V. Orthologs, Paralogs, and Evolutionary Genomics / E. V. Koonin // Annu. Rev. Genet. — 2005. Vol. 39, № 1. — P. 309-338
141. Langmead, B. Fast gapped-read alignment with Bowtie 2 / B. Langmead, S. L. Salzberg // Nat Methods. — 2012. — Vol. 9, № 4. — P. 357-359
142. Lassmann, T. Kalign — an accurate and fast multiple sequence alignment algorithm / T. Lassmann, E. L. Sonnhammer // BMC Bioinformatics. — 2005. — Vol. 6, № 1. — P. 298
143. Le, Q. Protein multiple sequence alignment benchmarking through secondary structure prediction / Q. Le, F. Sievers, D. G. Higgins // Bioinformatics. — 2017. — Vol. 33, № 9. — P. 1331-1337
144. Li, H. Aligning sequence reads, clone sequences and assembly contigs with BWA-MEM [Электронный ресурс] // arXiv.org. — 2013. Дата обновления: 26.05.2013. URL: https://arxiv.org/abs/1303.3997 (дата обращения: 28.09.2023)
145. Li, H. Fast and accurate long-read alignment with Burrows — Wheeler transform / H. Li, R. Durbin // Bioinformatics. — 2010. — Vol. 26, № 5. — P. 589-595
146. Li, H. Fast and accurate short read alignment with Burrows — Wheeler transform / H. Li, R. Durbin // Bioinformatics. — 2009. — Vol. 25, № 14. — P. 1754-1760
147. Li, L. OrthoMCL: Identification of Ortholog Groups for Eukaryotic Genomes / L. Li, C. J. Stoeckert, D. S. Roos // Genome Res. — 2003. — Vol. 13, № 9. — P. 2178-2189
148. Li, W. CD-HIT: a fast program for clustering and comparing large sets of protein or nucleotide sequences / W. Li, A. Godzik // Bioinformatics. — 2006. — Vol. 22, № 13. — P. 1658-1659
149. Lipton, Z. C. The Mythos of Model Interpretability / Z. C. Lipton // Queue. — 2020. Vol. 16, № 3. — P. 31-57
150. M-CAP eliminates a majority of variants of uncertain significance in clinical exomes at high sensitivity / K. A. Jagadeesh, A. M. Wenger, M. J. Berger [et al.] // Nat Genet. — 2016. — Vol. 48, № 12. — P. 1581-1586
151. Masica, D. L. Towards Increasing the Clinical Relevance of In Silico Methods to Predict Pathogenic Missense Variants / D. L. Masica, R. Karchin // PLoS Comput Biol. — 2016. — Vol. 12, № 5. — P. e1004725
152. Meta-analytic support vector machine for integrating multiple omics data / S. Kim, J. Jhong, J. Lee [et al.] // BioData Mining. — 2017. — Vol. 10, № 1. — P. 2
153. ModelFinder: fast model selection for accurate phylogenetic estimates / S. Kalyaanamoorthy, B. Q. Minh, T. K. F. Wong [et al.] // Nat Methods. — 2017. — Vol. 14, № 6. — P. 587-589
154. Molecular international prognostic scoring system for myelodysplastic syndromes / E. Bernard, H. Tuechler, P. L. Greenberg [et al.] // NEJM Evidence. — 2022. — Vol. 1. № 7
155. morFeus: a web-based program to detect remotely conserved orthologs using symmetrical best hits and orthology network scoring / I. Wagner, M. Volkmer, M. Sharan [et al.] // BMC Bioinformatics. — 2014. — Vol. 15, № 1. — P. 263
156. Morgenstern, B. DIALIGN 2: improvement of the segment-to-segment approach to multiple sequence alignment. / B. Morgenstern // Bioinformatics. — 2002. Vol. 15, № 3. — P. 211-218
157. Mount, D. W. Using Iterative Methods for Global Multiple Sequence Alignment / D. W. Mount // Cold Spring Harb Protoc. — 2009. Vol. 2009, № 7. — P. pdb.top44
158. Mukherjee, K. Evolution of Animal and Plant Dicers: Early Parallel Duplications and Recurrent Adaptation of Antiviral RNA Binding in Plants / K. Mukherjee, H. Campos, B. Kolaczkowski // Molecular Biology and Evolution. — 2012. — Vol. 30, № 3. — P. 627-641
159. Mushegian, A. R. A minimal gene set for cellular life derived by comparison of complete bacterial genomes. / A. R. Mushegian, E. V. Koonin // Proc. Natl. Acad. Sci. U.S.A. — 2002. — Vol. 93, № 19. — P. 10268-10273
160. MutationTaster2021 / R. Steinhaus, S. Proft, M. Schuelke [et al.] // Nucleic Acids Research. — 2021. — Vol. 49, № W1. — P. W446-W451
161. NCBI Taxonomy: a comprehensive update on curation, resources and tools / C. L. Schoch, S. Ciufo, M. Domrachev [et al.] // Database, 2020. — 2020. — P. baaa062
162. New and continuing developments at PROSITE / C. J. A. Sigrist, E. de Castro, L. Cerutti [et al.] // Nucleic Acids Research. — 2012. — Vol. 41, № D1. — P. D344-D347
163. New methods for detecting lineage-specific selection / A. Siepel, K. S. Pollard, D. Haussler // Research in Computational Molecular Biology / Apostolico A., Guerra C., Istrail S. [et al.] (Eds.). — Springer Berlin Heidelberg. — Berlin, Heidelberg, 2006. — P. 190 — 205
164. Ng, P. C. Predicting Deleterious Amino Acid Substitutions / P. C. Ng, S. Henikoff // Genome Res. — 2002. — Vol. 11, № 5. — P. 863-874
165. Ng, P. C. SIFT: predicting amino acid changes that affect protein function / P. C. Ng // Nucleic Acids Research. — 2003. Vol. 31, № 13. — P. 3812-3814
166. Nichio, B. T. L. New Tools in Orthology Analysis: A Brief Review of Promising Perspectives / B. T. L. Nichio, J. N. Marchaukoski, R. T. Raittz // Front. Genet. — 2017. — Vol. 8. — P. 165
167. Notredame, C. SAGA: sequence alignment by genetic algorithm / C. Notredame // Nucleic Acids Research. — 2002. Vol. 24, № 8. — P. 1515-1524
168. Notredame, C. T-COFFEE: a novel method for fast and accurate multiple sequence alignment 1 1Edited by J. Thornton / C. Notredame, D. G. Higgins, J. Heringa // Journal of Molecular Biology. — 2002. — Vol. 302, № 1. — P. 205-217
169. Nuin, P. A. The accuracy of several multiple sequence alignment programs for proteins / P. A. Nuin, Z. Wang, E. R. Tillier // BMC Bioinformatics. — 2006. — Vol. 7, № 1. — P. 471
170. OMA orthology in 2021: website overhaul, conserved isoforms, ancestral gene order and more / A. M. Altenhoff, C. Train, K. J. Gilbert [et al.] // Nucleic Acids Research. — 2020. — Vol. 49, № D1. — P. D373-D379
171. OXBench: A benchmark for evaluation of protein multiple sequence alignment accuracy / G. Raghava, S. M. Searle, P. C. Audley [et al.] // BMC Bioinformatics. — 2003. — Vol. 4, № 1. — P. 47
172. Olivier, M. TP53 Mutations in Human Cancers: Origins, Consequences, and Clinical Use / M. Olivier, M. Hollstein, P. Hainaut // Cold Spring Harbor Perspectives in Biology. — 2009. — Vol. 2, № 1. — P. a001008-a001008
173. OncoKB: A Precision Oncology Knowledge Base / D. Chakravarty, J, Gao, S. M. Phillips [et al.] // JCO Precis Oncol. — 2017. — Vol. 1. — P. 1-16
174. Orion: Detecting regions of the human non-coding genome that are intolerant to variation using population genetics / A. B. Gussow, B. R. Copeland, R. S. Dhindsa [et al.] // PLoS ONE. — 2017. — Vol. 12, № 8. — P. e0181604
175. Orr, B. A. Pathology, diagnostics, and classification of medulloblastoma / B. A. Orr // Brain Pathology. — 2020. Vol. 30, № 3. — P. 664-678
176. OrthoDB in 2020: evolutionary and functional annotations of orthologs / E. M. Zdobnov, D. Kuznetsov, F. Tegenfeldt [et al.] // Nucleic Acids Research. — 2020. — Vol. 49, № D1. — P. D389-D393
177. OrthoDB: a hierarchical catalog of animal, fungal and bacterial orthologs / R. M. Waterhouse, F. Tegenfeldt, J. Li [et al.] // Nucleic Acids Research. — 2012. — Vol. 41, № D1. — P. D358-D365
178. OrthoVenn: a web server for genome wide comparison and annotation of orthologous clusters across multiple species / Y. Wang, D. Coleman-Derr, G. Chen [et al.] // Nucleic Acids Res. — 2015. — Vol. 43, № W1. — P. W78-W84
179. Orthograph: a versatile tool for mapping coding nucleotide sequences to clusters of orthologous genes / M. Petersen, K. Meusemann, A. Donath [et al.] // BMC Bioinformatics. — 2017. — Vol. 18, № 1. — P. 111
180. Ortholog-Finder: A Tool for Constructing an Ortholog Data Set / T. Horiike, R. Minai, D. Miyata [et al.] // Genome Biol Evol. — 2016. — Vol. 8, № 2. — P. 446-457
181. Orthology prediction methods: A quality assessment using curated protein families / K. Trachana, T. A. Larsson, S. Powell [et al.] // Bioessays. — 2011. — Vol. 33, № 10. — P. 769-780
182. Ou, S. Assessing genome assembly quality using the LTR Assembly Index (LAI) / S. Ou, J. Chen, N. Jiang // Nucleic Acids Research. — 2018. — P. e126
183. PANTHER: A Library of Protein Families and Subfamilies Indexed by Function / P. D. Thomas, M. J. Campbell, A. Kejariwal [et al.] // Genome Res. — 2003. — Vol. 13, № 9. — P. 2129-2141
184. Pagni, M. Making sense of score statistics for sequence alignments / M. Pagni, C. V. Jongeneel // Briefings in Bioinformatics. — 2001. Vol. 2, № 1. — P. 51-67
185. PanOCT: automated clustering of orthologs using conserved gene neighborhood for pan-genomic analysis of bacterial strains and closely related species / D. E. Fouts, L. Brinkac, E. Beck [et al.] // Nucleic Acids Research. — 2012. — Vol. 40, № 22. — P. e172-e172
186. Penny, D. Progress with methods for constructing evolutionary trees / D. Penny, M. D. Hendy, M. A. Steel // Trends in Ecology & Evolution. — 2003. — Vol. 7, № 3. — P. 73-79
187. Pfeffer, C. M. The Evolution, Functions and Applications of the Breast Cancer Genes BRCA1 and BRCA2 / C. M. Pfeffer, B. N. Ho, A. T. K. Singh // CGP. — 2017. — Vol. 14, № 5. — P. 293 — 298
188. Philippon, H. Evolutionary history of phosphatidylinositol-3-kinases: ancestral origin in eukaryotes and complex duplication patterns / H. Philippon, C. Brochier-Armanet, G. Perrière // BMC Evol Biol. — 2015. — Vol. 15, № 1. — P. 226
189. PhosphOrtholog: a web-based tool for cross-species mapping of orthologous protein post-translational modifications / R. Chaudhuri, A. Sadrieh, N. J. Hoffman [et al.] // BMC Genomics. — 2015. — Vol. 16, № 1. — P. 617
190. Phylogenetic Relationships within Cation Transporter Families of Arabidopsis / P. Mäser, S. Thomine, J. I. Schroeder [et al.] // Plant Physiology. — 2002. — Vol. 126, № 4. — P. 1646-1667
191. Posada, D. jModelTest: Phylogenetic Model Averaging / D. Posada // Molecular Biology and Evolution. — 2008. Vol. 25, № 7. — P. 1253-1256
192. Predicting the Functional, Molecular, and Phenotypic Consequences of Amino Acid Substitutions using Hidden Markov Models / H. A. Shihab, J. Gough, D. N. Cooper [et al.] // Human Mutation. — 2012. — Vol. 34, № 1. — P. 57-65
193. Prevalence of Variant Reclassification Following Hereditary Cancer Genetic Testing / J. Mersch, N. Brown, S. Pirzadeh-Miller [et al.] // JAMA. — 2018. — Vol. 320, № 12. — P. 1266
194. ProbCons: Probabilistic consistency-based multiple sequence alignment / C. B. Do, M. S. Mahabhashyam, M. Brudno [et al.] // Genome Res. — 2005. — Vol. 15, № 2. — P. 330-340
195. Progressive Cactus is a multiple-genome aligner for the thousand-genome era / J. Armstrong, G. Hickey, M. Diekhans [et al.] // Nature. — 2020. — Vol. 587, № 7833. — P. 246-251
196. Quang, D. DANN: a deep learning approach for annotating the pathogenicity of genetic variants / D. Quang, Y. Chen, X. Xie // Bioinformatics. — 2014. — Vol. 31, № 5. — P. 761-763
197. Quest for Orthologs Entails Quest for Tree of Life: In Search of the Gene Stream / B. Boeckmann, M. Marcet-Houben, J. A. Rees [et al.] // Genome Biol Evol. — 2015. — Vol. 7, № 7. — P. 1988-1999
198. REVEL: An Ensemble Method for Predicting the Pathogenicity of Rare Missense Variants / N. M. Ioannidis, J. H. Rothstein, V. Pejaver [et al.] // The American Journal of Human Genetics. — 2016. — Vol. 99, № 4. — P. 877-885
199. Ranking of non-coding pathogenic variants and putative essential regions of the human genome / A. Wells, D. Heckerman, A. Torkamani [et al.] // Nat Commun. — 2019. — Vol. 10, № 1. P. — 5241
200. Rao, C. R. Score Test: Historical Review and Recent Developments / C. R. Rao // Advances in Ranking and Selection, Multiple Comparisons, and Reliability / Balakrishnan N., Nagaraja H. N., Kannan N. (Eds.). - Boston, MA.: Birkhäuser Boston, 2005 - P. 3-20
201. Remm, M. Automatic clustering of orthologs and in-paralogs from pairwise species comparisons / M. Remm, C. E. Storm, E. L. Sonnhammer // Journal of Molecular Biology. — 2002. — Vol. 314, № 5. — P. 1041-1052
202. Reva, B. Predicting the functional impact of protein mutations: application to cancer genomics / B. Reva, Y. Antipin, C. Sander // Nucleic Acids Research. — 2011. — Vol. 39, № 17. — P. e118-e118
203. Revised International Prognostic Scoring System for Myelodysplastic Syndromes / P.L. Greenberg, H. Tuechler, J. Schanz [et al.] // Blood. — 2012. — Vol. 120, № 12. — P. 2454-2465
204. Riera, C. Prediction of pathological mutations in proteins: the challenge of integrating sequence conservation and structure stability principles / C. Riera, S. Lois, X. de la Cruz // WIREs Comput Mol Sci. — 2013. — Vol. 4, № 3. — P. 249-268
205. Robertson, J. DICER1 Syndrome: DICER1 Mutations in Rare Cancers / J. Robertson, C. Jorcyk, J. Oxford // Cancers. — 2018. — Vol. 10, № 5. — P. 143
206. Rogers, M. F. CScape-somatic: distinguishing driver and passenger point mutations in the cancer genome / M. F. Rogers, T. R. Gaunt, C. Campbell // Bioinformatics. — 2020. — Vol. 36, № 12. — P. 3637—3644
207. Rosenberg, M. S. Evolutionary distance estimation and fidelity of pair wise sequence alignment / M. S. Rosenberg // BMC Bioinformatics. — 2005. — Vol. 6, № 1. — P. 102
208. Roth, A. C. Algorithm of OMA for large-scale orthology inference / A. C. Roth, G. H. Gonnet, C. Dessimoz // BMC Bioinformatics. — 2008. — Vol. 9, № 1. — P. 518
209. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead / C. Rudin // Nat Mach Intell. — 2019. Vol. 1, № 5. — P. 206-215
210. SIFT web server: predicting effects of amino acid substitutions on proteins / N. Sim, P. Kumar, J. Hu [et al.] // Nucleic Acids Research. — 2012. — Vol. 40, № W1. — P. W452-W457
211. SIMAP — the database of all-against-all protein sequence similarities and annotations with new interfaces and increased coverage / R. Arnold, F. Goldenberg, H. Mewes [et al.] // Nucl. Acids Res. — 2013. — Vol. 42, № D1. — P. D279-D284
212. SPAdes: A New Genome Assembly Algorithm and Its Applications to Single-Cell Sequencing / A. Bankevich, S. Nurk, D. Antipov [et al.] // Journal of Computational Biology. — 2012. — Vol. 19, № 5. — P. 455-477
213. Seshat: A Web service for accurate annotation, validation, and analysis of TP53 variants generated by conventional and next-generation sequencing / T. Tikkanen, B. Leroy, J. L. Fournier [et al.] // Human Mutation. — 2018. — Vol. 39, № 7. — P. 925-933
214. Shedding light on the DICER1 mutational spectrum of uncertain significance in malignant neoplasms / D. S. Bug, I. S. Moiseev, Yu. B. Porozov [et al.] // Front. Mol. Biosci. — 2024. — Vol. 11
215. Shi, G. MSOAR 2.0: Incorporating tandem duplications into ortholog assignment based on genome rearrangement / G. Shi, L. Zhang, T. Jiang // BMC Bioinformatics. — 2010. — Vol. 11, № 1. — P. 10
216. Sievers, F. QuanTest2: benchmarking multiple sequence alignments using secondary structure prediction / F. Sievers, D. G. Higgins // Bioinformatics. — 2019. — Vol. 36, № 1. — P. 90-95
217. Soltis, P. S. Applying the Bootstrap in Phylogeny Reconstruction / P. S. Soltis, D. E. Soltis // Statist. Sci. — 2003. — Vol. 18, № 2. — P. 256-267
218. Soria-Carrasco, V. Estimation of Phylogenetic Inconsistencies in the Three Domains of Life / V. Soria-Carrasco, J. Castresana // Molecular Biology and Evolution. — 2008. — Vol. 25, № 11. — P. 2319-2329
219. Standards and Guidelines for the Interpretation and Reporting of Sequence Variants in Cancer / M.M. Li, M. Datto, E.J. Duncavage [et al.] // The Journal of Molecular Diagnostics. — 2016. — Vol. 19, № 1. — P. 4-23
220. Standards and guidelines for the interpretation of sequence variants: a joint consensus recommendation of the American College of Medical Genetics and Genomics and the Association for Molecular Pathology / S. Richards, N. Aziz, S. Bale [et al.] // Genetics in Medicine. — 2015. — Vol. 17, № 5. — P. 405-424
221. Standards for the classification of pathogenicity of somatic variants in cancer (oncogenicity): Joint recommendations of Clinical Genome Resource (ClinGen), Cancer Genomics Consortium (CGC), and Variant Interpretation for Cancer Consortium (VICC) / P. Horak, M. Griffith, A.M. Danos [et al.] // Genetics in Medicine. — 2022. — Vol. 24, № 5. — P. 986-998
222. Stone, E. A. Physicochemical constraint violation by missense substitutions mediates impairment of protein function and disease severity / E. A. Stone, A. Sidow // Genome Res. — 2005. — Vol. 15, № 7. — P. 978-986
223. Sunyaev, S. R. Inferring causality and functional significance of human coding DNA variants / S. R. Sunyaev // Human Molecular Genetics. — 2012. Vol. 21, № R1. — P. R10-R17
224. Systematic analysis of noncoding somatic mutations and gene expression alterations across 14 tumor types / N. J. Fredriksson, L. Ny, J. A. Nilsson [et al.] // Nat Genet. — 2014. — Vol. 46, № 12. — P. 1258-1263
225. TP53 mutations in human cancers: functional selection and impact on cancer prognosis and outcomes / A. Petitjean, M. I. W. Achatz, A. L. Borresen-Dale [et al.] // Oncogene. — 2007. — Vol. 26, № 15. — P. 2157-2165
226. TP53-Mutated Myelodysplastic Syndrome and Acute Myeloid Leukemia: Biology, Current Therapy, and Future Directions / N.G. Daver, A. Maiti, T.M. Kadia [et al.] // Cancer Discovery. — 2022. — Vol. 12, № 11. — P. 2516-2529
227. Tabari, E. PorthoMCL: Parallel orthology prediction using MCL for the realm of massive genome availability / E. Tabari, Z. Su // Big Data Anal. — 2017. — Vol. 2, № 1. — P. 4
228. Tang, H. PANTHER-PSEP: predicting disease-causing genetic variants using position-specific evolutionary preservation / H. Tang, P. D. Thomas // Bioinformatics. — 2016. — Vol. 32, № 14. — P. 2230-2232
229. Tatusov, R. L. A Genomic Perspective on Protein Families / R. L. Tatusov, E. V. Koonin, D. J. Lipman // Science. — 2002. — Vol. 278, № 5338. — P. 631-637
230. Tatusov, R. L. The COG database: a tool for genome-scale analysis of protein functions and evolution / R. L. Tatusov // Nucleic Acids Research. — 2002. Vol. 28, № 1. — P. 33-36
231. Tatusov, R. L. The COG database: new developments in phylogenetic classification of proteins from complete genomes / R. L. Tatusov // Nucleic Acids Research. — 2002. Vol. 29, № 1. — P. 22-28
232. Tavtigian, S. V. Comprehensive statistical study of 452 BRCA1 missense substitutions with classification of eight recurrent substitutions as neutral / S. V. Tavtigian // Journal of Medical Genetics. — 2005. Vol. 43, № 4. — P. 295-305
233. The Ensembl Variant Effect Predictor / W. McLaren, L. Gil, S. E. Hunt [et al.] // Genome Biology. — 2016. — Vol. 17, № 1. — P. 122
234. The European Bioinformatics Institute in 2016: Data growth and integration / C. E. Cook, M. T. Bergman, R. D. Finn [et al.] // Nucleic Acids Res. — 2015. — Vol. 44, № D1. — P. D20-D26
235. The European Bioinformatics Institute in 2020: building a global infrastructure of interconnected data resources for the life sciences / C. E. Cook, O. Stroe, G. Cochrane [et al.] // Nucleic Acids Research. — 2019. — Vol. 48, № D1. — P. D17-D23
236. The Origins and Evolution of the p53 Family of Genes / V. A. Belyi, P. Ak, E. Markert [et al.] // Cold Spring Harbor Perspectives in Biology. — 2009. — Vol. 2, № 6. — P. a001198-a001198
237. The Sequence Alignment /Map format and SAMtools / H. Li, B. Handsaker, A. Wysoker [et al.] // Bioinformatics. — 2009. — Vol. 25, № 16. — P. 2078-2079
238. The folding and evolution of multidomain proteins / J. Han, S. Batey, A. A. Nickson [et al.] // Nat Rev Mol Cell Biol. — 2007. — Vol. 8, № 4. — P. 319-330
239. The human noncoding genome defined by genetic diversity / J. di Iulio, I. Bartha, E. H. M. Wong [et al.] // Nat Genet. — 2018. — Vol. 50,
№ 3. — P. 333-337
240. The mutational constraint spectrum quantified from variation in 141,456 humans / K. J. Karczewski, L. C. Francioli, G. Tiao [et al.] // Nature. — 2020. — Vol. 581, № 7809. — P. 434-443
241. The p53 gene family in vertebrates: Evolutionary considerations / M. A. Biscotti, M. Barucca, F. Carducci [et al.] // J Exp Zool Pt B. — 2019. — Vol. 332, № 6. — P. 171-178
242. The real cost of sequencing: scaling computation to keep pace with data generation / P. Muir, S. Li, S. Lou [et al.] // Genome Biol. — 2016. — Vol. 17, № 1. — P. 53
243. The use of gene clusters to infer functional coupling / R. Overbeek, M. Fonstein, M. D'Souza [et al.] // Proc. Natl. Acad. Sci. U.S.A. — 2002. — Vol. 96, № 6. — P. 2896-2901
244. The UniProt Consortium. UniProt: a hub for protein information / The UniProt Consortium // Nucleic Acids Research. — 2015. — Vol. 43, № D1. — P. D204-12
245. Thompson, J. D. A comprehensive comparison of multiple sequence alignment programs / J. D. Thompson, F. Plewniak, O. Poch // Nucleic Acids Research. — 2002. — Vol. 27, № 13. — P. 2682-2690
246. Thompson, J. D. BAliBASE: a benchmark alignment database for the evaluation of multiple alignment programs. / J. D. Thompson, F. Plewniak, O. Poch // Bioinformatics. — 2002. — Vol. 15, № 1. — P. 87-88
247. Thompson, J. D. CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and
weight matrix choice / J. D. Thompson, D. G. Higgins, T. J. Gibson // Nucl Acids Res. — 2007. — Vol. 22, № 22. — P. 4673-4680
248. Thusberg, J. Performance of mutation pathogenicity prediction methods on missense variants / J. Thusberg, A. Olatubosun, M. Vihinen // Hum. Mutat. — 2011. — Vol. 32, № 4. — P. 358-368
249. Towards Understanding the Pathogenicity of DROSHA Mutations in Oncohematology / D. S. Bug, A. V. Tishkov, I. S. Moiseev [et al.] // Cells. — 2021. — Vol. 10, № 9. — P. 2357
250. Uzzell, T. Fitting Discrete Probability Distributions to Evolutionary Events / T. Uzzell, K. W. Corbin // Science. — 2006. — Vol. 172, № 3988. — P. 1089-1096
251. Valencia, A. Computational methods for the prediction of protein interactions / A. Valencia, F. Pazos // Current Opinion in Structural Biology. — 2002. — Vol. 12, № 3. — P. 368-373
252. VarScan: variant detection in massively parallel sequencing of individual and pooled samples / D. C. Koboldt, K. Chen, T. Wylie [et al.] // Bioinformatics. — 2009. — Vol. 25, № 17. — P. 2283-2285
253. Variant effect prediction tools assessed using independent, functional assay-based datasets: implications for discovery and diagnostics / K. Mahmood, C. Jung, G. Philip [et al.] // Hum Genomics. — 2017. — Vol. 11, № 1. — P. 10
254. Variant interpretation using population databases: Lessons from gnomAD / S. Gudmundsson, M. Singer-Berk, N.A. Watts [et al.] // Human Mutation. — 2021. — Vol. 43, № 8. — P. 1012-1030
255. Vihinen, M. Majority Vote and Other Problems when using Computational Tools / M. Vihinen // Human Mutation. — 2014. Vol. 35, № 8. — P. 912-914
256. WHO classification and WPSS predict posttransplantation outcome in patients with myelodysplastic syndrome: a study from the Gruppo Italiano Trapianto di Midollo Osseo (GITMO) / E.P. Alessandrino, M.G. Della Porta, A. Bacigalupo [et al.] // Blood. — 2008. — Vol. 112, № 3. — P. 895-902
257. Wang, K. ANNOVAR: functional annotation of genetic variants from high-throughput sequencing data / K. Wang, M. Li, H. Hakonarson // Nucleic Acids Res. — 2010. — Vol. 38, № 16. — P. e164
258. Watanabe, H. A comprehensive representation of extensive similarity linkage between large numbers of proteins / H. Watanabe, J. Otsuka // Bioinformatics. — 2007. — Vol. 11, № 2. — P. 159-166
259. Welcsh, P. L. BRCA1 and BRCA2 and the genetics of breast and ovarian cancer / P. L. Welcsh // Human Molecular Genetics. — 2002. Vol. 10, № 7. — P. 705-713
260. Wetlaufer, D. B. Nucleation, Rapid Folding, and Globular Intrachain Regions in Proteins / D. B. Wetlaufer // Proc. Natl. Acad. Sci. U.S.A. — 2006. Vol. 70, № 3. — P. 697-701
261. Yandell, M. A beginner's guide to eukaryotic genome annotation / M. Yandell, D. Ence // Nat Rev Genet. — 2012. — Vol. 13, № 5. — P. 329-342
262. Yang, Z. Molecular phylogenetics: principles and practice / Z. Yang, B. Rannala // Nat Rev Genet. — 2012. — Vol. 13, № 5. — P. 303-314
263. Zhang, F. Non-coding genetic variants in human disease / F. Zhang, J. R. Lupski // Hum. Mol. Genet. — 2015. — Vol. 24, № R1. — P. R102-R110
264. Zhou, L. Prioritization and functional assessment of noncoding variants associated with complex diseases / L. Zhou, F. Zhao // Genome Med. — 2018. — Vol. 10, № 1. — P. 53
265. Zhou, Y. APF2: an improved ensemble method for pharmacogenomic variant effect prediction / Y. Zhou, S. Pirmann, V. M. Laushke // Pharmacogenomics J. — 2024. — Vol. 24, № 3. — P. 17
СПИСОК ИЛЛЮСТРАТИВНОГО МАТЕРИАЛА
Номер Наименование Страница
1. Рисунок 1 — Половозрастная диаграмма обследованных Международной рабочей группы изучения миелодиспластического синдрома 79
2. Рисунок 2 — Диаграмма распределения обследованных по диагнозам 79
3. Рисунок 3 — Фрагмент выравнивания белковых последовательностей гомологов гена CDKN2A, полученное в результате работы программы SIFT 91
4. Рисунок 4 — Фрагменты множественных выравниваний последовательностей, используемых программами MAPP (А, Б, В), SIFT (Г, Д) и PolyPhen2 (Е) для определения клинического эффекта замен, затрагивающих позиции 1705 (А), 1809 (Б, Г), 1813 (Б, Е) и 1822 (В, Д) белка DICER1 92
5. Рисунок 5 — Схема формирования базы данных последовательностей 100
6. Рисунок 6 — Схема реализации метода COG для поиска ортологов 102
7. Рисунок 7 — Интерфейс программы для поиска ортологов 105
8. Рисунок 8 — Графы ортологов исследуемых генов и их паралогов. Исследуемые гены человека отмечены красным. А, В, Д, Ж, И: цвет узла отражает принадлежность к кластеру 107
Маркова; Б, Г, Е, З, К: цвет отражает принадлежность к наибольшим максимальным кликам различных генов человека. А, Б: BRCA1 и BARD1, В, Г: BRCA2 и BRCA2-like, Д, Е: ТР53, ТР63 и ТР73, Ж, З: DICER1 и DICER2, И, К: Р1К3СА, Р1К3СВ и PIK3CD. Паралоги различимы по цветам кластеров Маркова, к которым они относятся; в некоторых случаях вершины, относящиеся к паралогам, обведены
9. Рисунок 9 — Филогенетические деревья белков исследуемых генов. Клады ортологов отмечены красным цветом 108
10. Рисунок 10 — Фрагмент множественного выравнивания ортологов DICER1, демонстрирующий законсервированную (красный) и вариабельную (зелёный) позиции 111
11. Рисунок 11 — Классификация биохимических групп аминокислот 112
12. Рисунок 12 — Схема мутационного анализа с применением информационной системы для оценки патогенности генетических вариантов. Шаги, осуществляемые в рамках работы информационной системы, выделены пунктирной рамкой 117
13. Рисунок 13 — ROC-кривая классификатора, основанного на популяционной частоте вариантов 119
14. Рисунок 14 — Веб-приложение для классификации миссенс-вариантов ТР53 124
15. Рисунок 15 — Чувствительность и специфичность определения патогенных вариантов информационной системы и программ-предикторов 125
16. Рисунок 16 — Диаграмма Венна, демонстрирующая пересечение между двумя множествами генетических вариантов: обнаруженных в выравниваниях нуклеотидных 131
последовательностей и присутствующих в базе данных GnomAD v3.1.1
17. Рисунок 17 — Распределение доброкачественных и патогенных вариантов среди вариантов в СНпУаг, GnomAD v3.1.1 и обнаруженных обнаруженных в выравниваниях нуклеотидных последовательностей. В скобках указано общее количество доброкачественных и патогенных вариантов 132
18. Рисунок 18 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 162-й аминокислоты 135
19. Рисунок 19 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 1637-й аминокислоты 135
20. Рисунок 20 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 1708-й аминокислоты 135
21. Рисунок 21 — Фрагмент выравнивания ортологов DICER1 в окрестностях позиции 1813-й аминокислоты 135
22. Рисунок 22 — Распределение пациентов Международной рабочей группы изучения МДС, классифицированных согласно разработанному алгоритму, по возрасту 137
23. Рисунок 23 — Кривые пятилетней общей выживаемости трёх подгрупп пациентов Международной рабочей группы, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 140
24. Рисунок 24 — Кривые пятилетней безлейкозной выживаемости трёх подгрупп пациентов Международной рабочей группы, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 143
25. Рисунок 25 — Распределение пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России, классифицированных согласно разработанному алгоритму, по возрасту 147
26. Рисунок 26 — Кривые пятилетней общей выживаемости групп пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 147
27. Рисунок 27 — Кривые пятилетней беспрогрессивной выживаемости групп пациентов ФГБОУ ВО ПСПбГМУ им. И.П. Павлова Минздрава России, определённых по результатам мутационного анализа ТР53, отображены 95%-е доверительные интервалы кривых 149
28. Таблица 1 — Система категориальных переменных для описания эволюционной распространённости 58
29. Таблица 2 — Структура набора данных для обучения и тестирования 68
30. Таблица 3 — Базы данных и методы, используемые программами-предикторами для оценки клинического эффекта миссенс-вариантов на основе выравниваний белковых последовательностей 86
31. Таблица 4 — Метод оценки патогенности и дополнительные сведения, используемые программами-предикторами 87
32. Таблица 5 — Границы доменов DICER1, позиции соответствуют последовательности КР 001258211 93
33. Таблица 6 — Границы доменов BRCA2, позиции соответствуют последовательности КР 000050 93
34. Таблица 7 — Аминокислоты в позиции мутаций гена DICER1 до и после выравнивания субпоследовательностей 94
35. Таблица 8 — Распределение отобранных признаков для классификации в наборе данных для исследования 116
36. Таблица 9 — Чувствительность, специфичность, точность и логарифм отношения шансов, полученные на каждом из этапов перекрёстной проверки 119
37. Таблица 10 — Чувствительность, специфичность и точность определения патогенных вариантов с помощью информационной системы и других предикторов 126
38. Таблица 11 — Положительная и отрицательная прогностическая ценность определения патогенных вариантов с помощью информационной системы и других предикторов 127
39. Таблица 12 — Чувствительность, специфичность и точность определения патогенных вариантов с помощью информационной системы и других предикторов на тестовой выборке с исключением онкогенных вариантов 128
40. Таблица 13 — Положительная и отрицательная прогностическая ценность определения патогенных вариантов с помощью информационной системы и других предикторов 129
41. Таблица 14 — Характеристики обследованных с нейтральными или патогенными генетическими вариантами в гене ТР53 и без них 138
42. Таблица 15 — Диагнозы пациентов трёх подгрупп, определённых по результатам мутационного анализа ТР53 138
43. Таблица 16 — Риск по шкале IPSS-R пациентов Международной рабочей группы в трёх подгруппах, определённых по результатам мутационного анализа ТР53 141
44. Таблица 17 — Результаты регрессионного анализа Кокса при анализе общей выживаемости 142
45. Таблица 18 — Результаты регрессионного анализа Кокса при анализе безлейкозной выживаемости 144
46. Таблица 19 — Риск по шкале IPSS-M пациентов Международной рабочей группы в трёх подгруппах, определённых по результатам мутационного анализа ТР53 145
47. Таблица 20 — Распределение пациентов с мутациями различной классификации по диагнозам 148
48. Формула 1 — Индекс Юдена 61
49. Формула 2 — Чувствительность определения патогенных вариантов 69
50. Формула 3 — Специфичность определения патогенных вариантов 69
51. Формула 4 — Точность определения патогенных вариантов 69
52. Формула 5 — Положительная прогностическая ценность определения патогенных вариантов 69
53. Формула 6 — Отрицательная прогностическая ценность определения патогенных вариантов 69
54. Формула 7 — Положительная прогностическая ценность с поправкой на встречаемость 69
55. Формула 8 — Отрицательная прогностическая ценность с поправкой на встречаемость 69
56. Формула 9 — Формула Клоппера-Пирсона для нижней границы 95%-го доверительного интервала 70
57. Формула 10 — Формула Клоппера-Пирсона для верхней границы 95%-го доверительного интервала 70
58. Формула 11 — Границы 95%-го доверительного интервала для положительной прогностической ценности с поправкой на встречаемость 70
59. Формула 12 — Границы 95%-го доверительного интервала для отрицательной прогностической ценности с поправкой на встречаемость 70
60. Формула 13 — Натуральный логарифм отношения шансов 71
61. Формула 14 — Границы 95%-го доверительного интервала для натурального логарифма отношения шансов 71
62. Формула 15 — Критерий Хи-квадрат Пирсона 81
63. Формула 16 — Вероятность отклонения наблюдаемых данных от ожидаемых по точному тесту Фишера 81
64. Формула 17 — Критерий Краскела-Уоллиса 82
65. Формула 18 — Критерий Манна-Уитни 82
66. Формула 19 — ^критерий Стьюдента 82
67. Формула 20 — Поправка Бенджамини-Хохберга для множественных сравнений 83
68. Формула 21 — Функция выживаемости по методу Каплана-Мейера 83
69. Формула 22 — Формула Гринвуда для вычисления 95%-го доверительного интервала для функции выживаемости 83
70. Формула 23 — Функция риска согласно регрессионной модели Кокса 84
Приложение А
(справочное)
Аминокислотные замены, соответствующие вариантам из базы данных СНпУаг, их известное и полученное при помощи разработанного алгоритма клиническое
значение
Замена (указаны хромосома, позиция, референсный и альтернативный аллели) Известное клиническое значение Полученное клиническое значение
^13-32316461^^ Патогенный вариант Патогенное
^13-32316462-^ Патогенный вариант Патогенное
^13-32316462-^ Патогенный вариант Патогенное
^13-32316463^^ Патогенный вариант Патогенное
chr13-32316463-G-T Патогенный вариант Патогенное
^13-32316513^^ Доброкачественный вариант Нейтральное
chr13-32316527-G-T Патогенный вариант Патогенное
chr13-32319134-A-G Доброкачественный вариант Нейтральное
chr13-32319137-A-G Доброкачественный вариант Нейтральное
chr13-32319176-A-C Доброкачественный вариант Нейтральное
^13-32319232^^ Доброкачественный вариант Нейтральное
chr13-32325081-A-C Доброкачественный вариант Нейтральное
chr13-32326115-A-G Доброкачественный вариант Нейтральное
chr13-32326150-G-A Доброкачественный вариант Патогенное
chr13-32326268-C-A Доброкачественный вариант Нейтральное
^13-32326613^^ Патогенный вариант Патогенное
chr13-32326613-G-C Патогенный вариант Патогенное
chr13-32330928-AG-GA Патогенный вариант Патогенное
chr13-32332343-A-C Доброкачественный вариант Нейтральное
chr13-32332456-C-A Доброкачественный вариант Нейтральное
^13-32332518^^ Доброкачественный вариант Нейтральное
СЫ-13-32332592-Л-С Доброкачественный вариант Нейтральное
СЫ-13-32332601-С-Т Доброкачественный вариант Нейтральное
chr13-32332619-G-Л Доброкачественный вариант Нейтральное
chr13-32332629-C-T Доброкачественный вариант Нейтральное
СЫ-13-32332644-С-Л Доброкачественный вариант Нейтральное
chr13-32332659-Л-C Доброкачественный вариант Нейтральное
chr13-32332832-C-Л Доброкачественный вариант Нейтральное
chr13-32332863-Л-G Доброкачественный вариант Нейтральное
chr13-32332992-T-C Доброкачественный вариант Нейтральное
сИг13-32333016-Л^ Доброкачественный вариант Нейтральное
chr13-32333140-T-G Доброкачественный вариант Нейтральное
chr13-32333222-Л-C Доброкачественный вариант Нейтральное
chr13-32333264-G-C Доброкачественный вариант Нейтральное
chr13-32333270-Л-G Доброкачественный вариант Нейтральное
СЫ-13-32333274-С-Т Доброкачественный вариант Нейтральное
chr13-32333276-T-C Доброкачественный вариант Нейтральное
chr13-32333282-G-Л Доброкачественный вариант Нейтральное
chr13-32333288-Л-G Доброкачественный вариант Нейтральное
chr13-32333343-C-T Доброкачественный вариант Нейтральное
^13-32333367-^ Доброкачественный вариант Нейтральное
chr13-32336293-C-Л Доброкачественный вариант Нейтральное
chr13-32336319-C-G Доброкачественный вариант Нейтральное
chr13-32336493-Л-T Доброкачественный вариант Нейтральное
chr13-32336705-Л-G Доброкачественный вариант Нейтральное
сЫ-13-3233677№С Доброкачественный вариант Нейтральное
chr13-32337035-G-Л Доброкачественный вариант Нейтральное
chr13-32337053-Л-G Доброкачественный вариант Нейтральное
chr13-32337071-Л-G Доброкачественный вариант Нейтральное
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.