Разработка вычислительных алгоритмов для анализа данных метагеномного секвенирования микробных сообществ тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Кривонос Данил Вадимович

  • Кривонос Данил Вадимович
  • кандидат науккандидат наук
  • 2026, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 126
Кривонос Данил Вадимович. Разработка вычислительных алгоритмов для анализа данных метагеномного секвенирования микробных сообществ: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2026. 126 с.

Оглавление диссертации кандидат наук Кривонос Данил Вадимович

Введение

Степень разработанности темы

Цель работы

Задачи работы

Научная новизна

Научная значимость

Практическая значимость

Методология и методы исследования

Достоверность

Положения, выносимые на защиту

Апробация работы

Личный вклад

Публикации по теме диссертации

Структура и объем работы:

1. Литературный обзор

1.1. Методы изучения микробных сообществ и история развития метагеномики

1.2. Биоинформатические инструменты для анализа данных метагеномного секвенирования ампликонов

1.2.1. Подходы к анализу. Шумоподавление и кластеризация ASV/OTU

1.2.1.1. Подходы для генерации OTU

1.2.2. Подходы для генерации ASV

1.2.3. Метагеномика длинных ампликонов

1.5. Вывод 2. Методы

2.1. Анализ данных секвенирования ампликонов ITS микобиома кишечника у пациентов с

COVID-19

2.1.1. Материалы исследования

2.1.2. Биоинформатический анализ

2.2. Алгоритма анализа данных метагеномного секвенирования ампликонов, полученных на платформе Oxford Nanopore

2.2.1. Дизайн эксперимента

2.2.2. Амплификация 16S рРНК и ITS

2.2.3. Структура алгоритма анализа

2.2.4. Препроцессинг данных

2.2.5. Сбор признаков

2.2.6. Кластеризация прочтений

2.2.7. Сборка консенсуса

2.2.8. Режимы работы инструмента

2.2.9. Определение таксономии

2.3. Предсказание генного состава грибных сообществ по данным секвенирования ампликонов ITS

2.3.1. Формирование базы полных геномов и определение последовательностей ITS

2.3.2. Генерация векторов генного содержания

2.3.3. Проверка валидности аннотации Augustus

2.3.4. Формирование база частот k-меров последовательностей ITS

2.3.5. Структура алгоритма предсказания вектора генного состава

2.3.6. Валидация алгоритма

2.3.7. Тестирование на реальных данных

3. Результаты

3.1. Результаты анализа данных секвенирования микобиома кишечника у пациентов с COVID-19

3.1.1. Результаты сборки ASV и деконтаминация

3.1.2. Описание таксономического состава

3.1.3. Динамика микобиома кишечника у пациентов с COVID-19 в разных временных точках

3.1.4. Ассоциация микобиома с коморбидностью пациента и процедурой лечения

3.1.4.1. Анализ изменений между временными точками в составе микобиома

3.1.4.2. Взаимосвязь тяжести течения COVID-19 и альфа-разнообразия микобиома

3.1.5. Ассоциация микобиома с возрастом пациента

3.2. Анализ данных нанопорового секвенирования ампликонов

3.2.1. Анализ данных секвенирования искусственных сообществ

3.2.2. Анализ внешних стандартов искусственных сообществ

3.2.3. Анализ внешних данных секвенирования мазков из носоглотки

3.2.4. Артефакты базы UNITE

3.2.5. Коллизии при триммировании без шаблона

3.2.6. Валидация инструмента и бенчмаркинг

3.2.7. Кривые прореживания

3.2.8. Влияние количества прочтений на стабильность композиции микробного сообщества

3.2.9. Влияние размера длины k-мера на стабильность получаемых результатов

3.2.10. Влияние амплификации на композицию микробного сообщества

3.2.11. Сравнение с другими инструментами

3.3. Инструмент для предсказания генного состава грибных сообществ

3.3.1. Описание программного обеспечения

3.3.2. Результаты валидации инструмента предсказания генного состава грибных сообществ

3.3.2.1. Грибная таксономия как отражение генного состава

3.3.2.2. Подбор оптимального значения 8-окрестности

3.3.3. Моделирование метагенома

3.3.4. Применение на реальном массиве данных

4. Обсуждение

5. Заключение

6. Выводы

Список сокращений

Благодарности

Список литературы

Приложение

Введение

Метагеномика представляет собой область молекулярной биологии, занимающуюся изучением генетического материала, выделенного из сложного образца окружающей среды, биологического или клинического материала. Ключевой задачей метагеномики является изучение состава и структуры микробных сообществ в разных биотопах. Сегодня метагеномные исследования представляются чем-то привычным и обыденным, однако не всегда так. Метагеномика сравнительно молодая область в масштабах истории науки, и мы находимся лишь на этапе ее окончательного становления.

Существенный прорыв в исследовании микробных сообществ стал возможен благодаря развитию технологий высокопроизводительного параллельного секвенирования коротких фрагментов ДНК. К таким технологическим решениям относят: пиросеквенирование (454 Life Sciences), полупроводниковое секвенирование (Ion Torrent), мостиковое секвенирование (Illumina), технология секвенирования ДНК нано шаров (MGI). Анализ данных метагеномного секвенирования позволил увидеть полный репертуар различных микроорганизмов, находящихся в образце, в том числе тех, которые ранее было невозможно обнаружить с помощью классических микробиологических методов. Сама процедура анализа данных метагеномного секвенирования уже стала рутинной, однако даже на сегодняшний день метагеномика продолжает наращивать арсенал различных биоинформатических инструментов. Именно такое постоянное совершенствование и развитие вычислительных алгоритмов позволяет максимизировать полезную информацию, извлекаемую из результатов метагеномного секвенирования.

Прогресс технологий высокопроизводительного секвенирования открывает новые возможности в различных аспектах метагеномики. Так, с появлением нанопорового секвенирования (технология Oxford Nanopore) и мономолекулярного секвенирования в реальном времени (технология PacBio) появилась возможность получать длинные прочтения. Для метагеномики это ознаменовало появление возможности изучения вариабельности протяженных фрагментов генома (1000 - 2000 п.о.). Сегодня нанопоровое секвенирование стремительно набирает популярность в метагеномных исследованиях. Однако, инструменты, используемые для анализа данных нанопорового секвенирования ампликонов, часто предоставляют только аннотацию таксономии всего массива прочтений без сборки консенсусов оперативных таксономических единиц (OTU). Существующие биоинформатические инструменты, позволяющие собирать последовательности OTU из данных нанопорового секвенирования, имеют ограничения по длине исследуемого фрагмента, рассматривая только фрагменты более 1000 пар оснований (п.о.) В то же время, для оценки многообразия бактериальной микробиоты применяют секвенирование ампликонов вариабельных фрагментов

гена 16S рРНК, а для грибной биоты - последовательность внутреннего транскрибируемого спейсера, ITS (ITS1 - 5.8S рРНК - ITS2). Самый длинный фрагмент 16S рРНК, включающий все девять вариабельных регионов (V1-V9), имеет протяженность около 1500 пар оснований и такие последовательности проходят порог по минимальной длине ампликона в 1000 п.о. Однако самый длинный регион ITS может сильно варьироваться по длине, начиная от 400 п.о. и заканчивая последовательностями более 1100 п.о. Таким образом, остается актуальной задачей создание инструмента, который бы позволил автоматизированно изучать данные нанопорового секвенирования ампликонов любого размера.

Наиболее распространенным объектом изучения в метагеномных исследованиях является микробиота человека. Большая часть работ, ожидаемо, фокусируется вокруг мажорной части микробиома человека, которая представлена преимущественно бактериальной биотой (бактериома). Изучение микробиоты человека не ограничивается только бактериальной фракцией и тренды в этой области также постепенно меняются. Все больше исследований фокусируются на изучении грибной составляющей микробиоты человека, так называемого микобиома. Особый интерес к этой тематике возник на фоне пандемии новой коронавирусной инфекции (COVID-19), во время которой у больных COVID-19 нередко наблюдались осложнения, вызванные оппортунистическими инвазивными грибными патогенами. Микобиом, как правило, не является доминирующей частью микробного сообщества, что позволяет анализировать его преимущественно средствами метагеномного секвенирования ампликонов. Такое ограничение существенно затрудняет анализ генного состава грибных сообществ. Для бактериальных сообществ существуют подходы, позволяющие предсказывать генный состав индивидуальных организмов, исходя из данных секвенирования ампликонов, в то же время для грибных сообществ эта задача до недавнего времени оставалась нерешенной.

Несмотря на то, что современная метагеномика успела обзавестись обширным рядом различных вычислительных инструментов, позволяющих проводить комплексные биоинформатические анализы, отдельные проблемные области требует появления новых вычислительных алгоритмов. Создание вычислительных алгоритмов и их реализация легли в основу данной работы.

Степень разработанности темы

Метагеномика все более активно вовлекается в область изучения грибных сообществ. На сегодняшний день в ряде работ публикуют масштабные описания организации грибной компоненты микробиома человека. Однако, несмотря на то, что в научном сообществе уже имеется общее представление об основных участниках микобиома по-прежнему остается ряд актуальных вопросов. В частности, до сих пор не была изучена динамика изменения микобиома в ходе заболевания COVID-19, хотя аналогичные работы для бактериальной биоты ранее были представлены в литературе.

В ряде работ также было показано, что нанопоровое секвенирование лучше подходит для изучения ампликонов ITS грибов и с большей точностью позволяет определять грибные таксоны. Для анализа таких данных в литературе уже были предложены различные алгоритмы, однако для них свойственны определенные недостатки. В частности, ограничение максимальной длины изучаемого ампликона или отсутствие сборки консенсусов OTU. Таким образом, этот вопрос закрыт не полностью.

Задача получения функциональной аннотации генного состава из данных секвенирования ампликонов ранее была успешно решена для бактериальных сообществ. Однако, проблема предсказания генного состава для данных секвенирования ампликонов ITS грибов в литературе напрямую не была затронута.

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Разработка вычислительных алгоритмов для анализа данных метагеномного секвенирования микробных сообществ»

Цель работы

Разработка набора вычислительных алгоритмов анализа данных метагеномного секвенирования ампликонов для характеристики микробных сообществ с акцентом на микобиом.

Задачи работы

1. Провести биоинформатический анализ данных метагеномного секвенирования ампликонов ITS для характеристики грибных сообществ микробиоты кишечника у пациентов с COVID-19.

2. Разработать универсальный, не зависящий от длины прочтения вычислительный инструмент анализа данных метагеномного секвенирования ампликонов, получаемых на платформе Oxford Nanopore.

3. Разработать вычислительный алгоритм для оценки функционального генного состава грибной микробиоты на основании данных секвенирования ампликонов ITS.

Научная новизна

В настоящей работе проведен биоинформатический анализ данных метагеномного секвенирования ампликонов ITS, полученных для образцов кала пациентов с COVID-19, отобранных в двух временных точках: в момент госпитализации и по окончанию лечения. Насколько известно соискателю степени данная работа является единственной, в которой оценивались временные изменения микобиома микробиоты кишечника на фоне терапии COVID-19. Более того, данное исследование является одним из немногих исследований микобиома кишечника в Российской Федерации.

Разработанный вычислительный инструмент анализа данных нанопорового метагеномного секвенирования ампликонов в отличие от существующих аналогов, является универсальным как в отношении длины исследуемых ампликонов (от 400 до более 1500 п.о.), так и объектов, продемонстрировав свою пригодность к изучению бактериальной и грибной биоты. Более того, на сегодняшний день это единственный инструмент, который справляется с задачей анализа грибных сообществ на уровне OTU.

В ходе работы также разработан оригинальный вычислительный алгоритм для предсказания функционального генного состава грибной биоты, исходя из данным секвенирования ампликонов последовательностей ITS фрагментов. На сегодня он является единственным инструментом, позволяющим автоматизировано получать подобную информацию. Этот инструмент особенно актуален для метагеномных исследований грибных сообществ, где секвенирование ампликонов применяется наиболее часто. Однако, его применимость также актуальна и для изучение отдельных грибных изолятов.

Научная значимость

Изучение микробных сообществ представляет собой важнейшую составляющая современной биотехнологии и медицине. На сегодняшний день, с накоплением данных о структуре различных микробных биоценозов, интерес к изучению неклассических микробных сообществ постепенно смещается. Так, сегодня активный интерес представляют грибная биота, анализ которой в некоторых случаях осложняется отсутствием специализированных биоинформатических инструментов для обработки такого рода данных. Разработка таких специализированных инструментов и подходов легла в основу данного исследования.

Практическая значимость

Изучение микробных сообществ - это важная составляющая современной биотехнологии. На сегодняшний день, с накоплением данных о структуре различных

микробных биоценозов, интерес к изучению небактериальных составляющих сообществ постепенно растет. Так, сегодня активный интерес представляют грибная биота, анализ которой в некоторых случаях осложняется отсутствием специализированных биоинформатических инстурментов для обработки такого рода данных. Разработка таких специализированных инструментов и подходов легла в основу данного исследования.

Методология и методы исследования

В настоящей работе были использованы данные, полученные современными методами высокопроизводительного секвенирования с применением различных платформ секвенирования. В ходе выполнения работы применялись уже зарекомендовавшие себя в научном сообществе биоинформатические инструменты. Весь разработанный вычислительный инструментарий был создан с применением языков программирования python3 и R. Также в работе применялись методы машинного обучения и статистики.

Достоверность

Результаты данной работы опубликованы в ведущих международных журналах и представлены на международных и российских конференциях. Также полученные результаты уже цитируются другими авторами в своих работах, опубликованных в высокорейтинговых международных журналах. Все опубликованные работы на момент написания работы процитированы в исследованиях других авторов.

Положения, выносимые на защиту

1. Биоинформатический анализ данных метагеномного секвенирования ампликонов ITS для характеристики грибных сообществ микробиоты кишечника у пациентов с COVID-19 показал, что альфа-разнообразие микобиома у пациентов на момент поступления в больницу ниже по сравнению с разнообразием на момент выписки.

2. Грибы рода Geotrichum имели повышенную представленность в образцах пациентов, отобранных на момент их поступления в больницу, и пониженную представленность в образцах, отобранных на момент выписки.

3. Разработан универсальный, не зависящий от длины прочтения вычислительный инструмент анализа данных метагеномного секвенирования ампликонов, получаемых на платформе Oxford Nanopore, с помощью которого были проанализированы данные метагеномного секвенирования как искусственных, так и реальных микробных сообществ.

4. Показано, что при метагеномном секвенировании ампликонов процедура амплификации при высокой вариабельности длины целевого фрагмента ДНК приводит к искажению состава микробного сообщества, это наиболее характерно при анализе грибных сообществ.

5. Разработан вычислительный алгоритм для оценки функционального генного состава грибной микробиоты на основании данных метагеномного секвенирования ампликонов ITS, проведена валидация и апробация алгоритма на реальных данных метагеномнгого секвенирования ампликонов ITS.

Апробация работы

Апробация работы проводилась на базе ФБУН НИИ СБМ Роспотребнадзора 03.02.2026. Также отдельные доклады по теме диссертации были представлены на 6 различных научных конференциях.

1. Кривонос Д. В., Орлов А. В., Климина К. М., Веселовский В. А., Федоров Д. Е., Ковальчук С. В., Павленко А. В., Ильина Е. Н. Изменения микобиома кишечника у пациентов с COVID-19 // ФБМФ - Секция биоинформатики и цифровой медицины. 66 Всерос. конф. МФТИ (Москва, 3 апр. 2024 г.). - Москва, 2024

2. Кривонос Д. В., Конанов Д. Н., Ильина Е. Н. Разработка биоинформатических пайплайнов для анализа грибных сообществ. // 11th Moscow Conference on ComputationalMolecular Biology МССМВ'23 Moscow, August 3 - 6, 2023 2.

3. Кривонос Д. В., Федоров Д. Е., Конанов Д. Н., Введенский А. В., Корнеенко Е. В., Сперанская А. С., Ильина Е. Н. Pike: инструмент для анализа «шумных» метагеномных прочтений // VIII Съезд Вавиловского общества генетиков и селекционеров, посвященный 300-летию российской науки и высшей школы Саратов 14 - 19 июня 2024

4. Кривонос Д. В., Орлов А. В., Климина К. М., Веселовский В. А., Федоров Д. Е., Ковальчук С. В., Павленко А. В., Ильина Е. Н. Изменения микобиома кишечника во время COVID-19 // VIII Всероссийский конгресс по медицинской микробиологии, клинической микологии и иммунологии (XXVII Кашкинские чтения) Санкт-Петербург 5 - 7 июня 2024

5. Krivonos D., Fedorov D., Orlov A., Klimina K., Veselovsky V., Kovalchuk S., Pavlenko A., Ilina E. Approaches to the analysis of fungal communities using the example of the human mycobiome patient with COVID-19 // BGRS/SB-2024: 14th International Multiconference "Bioinformatics of Genome Regulation and Structure Новосибирск 5 - 10 august 2024

6. Кривонос Д. В., Федоров Д. Е., Конанов Д. Н., Введенский А. В., Сонец И. В., Корнеенко Е. В., Сперанская А. С., Ильина Е. Н. НИИ системной биологии и медицины

Роспотребнадзора, Москва Pike: инструмент для ампликоновой метагеномики Oxford Nanopore // ПОСТГЕНОМ 2024 Гостиничный комплекс «ПСБ ПАТРИОТ» 29 октября - 2 ноября 2024

Личный вклад.

Автор диссертации лично участвовал в планировании экспериментов и дизайне исследования. Полностью самостоятельно провел весь анализ микобиома кишечника у пациентов с COVID-19, разработал инструмент для анализа данных нанопорового секвенирование ампликонов, а также разработал инструмент для предсказания генного состава грибной биоты исходя из анализа последовательностей ITS фрагментов. Валидация инструментов также проводилась с прямым участием автора диссертации.

Публикации по теме диссертации.

Основные публикации по теме диссертации опубликованы в виде 3 научных статей в журналах, индексируемых в базах Scopus, РИНЦ и WoS.

1. Krivonos D. V., Konanov D. N., Ilina E. N. FunFun: ITS-based functional annotator of fungal communities // Ecology and Evolution. - 2023. - Т. 13. - №. 3. - С. e9874.

2. Krivonos D. V. et al. Gut Mycobiome Changes During COVID-19 Disease //Journal of Fungi. - 2025. - Т. 11. - №. 3. - С. 194.

3. Krivonos D. V. et al. Pike: OTU-Level Analysis for Oxford Nanopore Amplicon Metagenomics //International Journal of Molecular Sciences. - 2025. - Т. 26. - №. 9. - С. 4168.

Структура и объем работы:

Диссертация состоит из введения и 6 разделов. Полный объем диссертации составляет 126 страниц, включая 40 рисунков и 5 таблиц. Список литературы содержит 166 наименований.

1. Литературный обзор

1.1. Методы изучения микробных сообществ и история развития метагеномики

Метагеномика - раздел молекулярной биологии, изучающий совокупность генетического материала, полученного из образцов окружающей среды [6]. Метагеномный анализ позволяет определить видовое разнообразие биоты в исследуемом образце без необходимости выделения и культивирования отдельных изолятов микроорганизмов [7-11]. Объектом метагеномного исследования является практически любой образец окружающей среды или же часть живого организма. Метагеномика опирается на данные о геномной организации всего живого, полученные, в частности, средствами микробиологического культивирования и генетики/геномики отдельных микроорганизмов.

Традиционные методы культивирования микроорганизмов основаны на выращивании отдельных представителей микробиоты образца на искусственных питательных средах с последующим выделением чистых культур микроорганизмов. Такой подход позволяет работать непосредственно с живыми культурами микроорганизмов, что позволяет дотянуться до определения морфологических, биохимических и фенотипических особенностей отдельных микроорганизмов. В частности, исключительно посредством исследования особенностей индивидуальной культуры микроорганизмы можно полноценно оценить явление микробной устойчивости к антибиотикам и биоцидным препаратам. Однако, микробиологический подход имеет существенный недостаток, связанный с трудностями выращивания многих микроорганизмов в лабораторных условиях.

В то же время с развитием молекулярно-биологических методов стало возможным изучать спектр некультивируемых организмов. Начало молекулярным исследованиям в сфере исследования сообществ микроорганизмов положил Норман Пейс с коллегами [12]. Они применяли метод ПЦР (Полимеразная Цепная Реакция) для изучения разнообразия последовательностей 16S рРНК бактерий. Исследования группы Пейса в 1991 году стимулировали развитие работ по клонированию фрагментов ДНК, выделенных непосредственно из самих образцов окружающей среды [13]. Такая методика позволяла подтверждать результаты морфологических характеристик, что впоследствии использовали для постановки методов лабораторного культивирования. В 1995 году сообщается о метагеномной изоляции функциональных генов из культуры микроорганизмов из окружающей среды [14]. А Эдвард ДеЛонг, покинувший лабораторию Пейса, заложил основы построения филогении микроорганизмов из окружающей среды на основе последовательностей фрагментов гена 16S рРНК [15].

К 1998 году в науке впервые появляется термин «метагеномика» (англ. metagenomics), который который был сформулирован Джо Хандельсманом с его коллегами в статье [16]. Такое

понятие возникло из соображений о том, что наборы генов, собранные из образцов из окружающей среды, можно изучать также как и целые геномы. Метагеномика позволила постепенно абстрагироваться от необходимости культивировать клетки микроорганизмов отдельно, то есть она позволила исследовать видовой/клеточный состав объекта без необходимой ранее культуральной селекции [17].

В 2002 году Мия Брейтбард с коллегами применили метод шотган секвенирования для анализа вирусов в морской воде. В своей работе они нашли более 5000 различных вирусов в 200 литрах морской воды [18]. Дальнейшие исследования стали показывать, что в человеческих фекалиях также находится более тысячи видов вирусов, а в одном килограмме морских отложений их находится уже более миллиона. Почти все обнаруженные вирусы оказались новыми и ранее не охарактеризованными. В 2004 году Джин Тайсон с коллегами опубликовали статью, в которой описали свою работу по секвенированию ДНК из кислых вод с рудников, где им удалось собрать полные геномы новых видов бактерий и архей [19]. Метагеномика произвела своего рода революцию в науке, поскольку позволила идентифицировать то, что ранее было возможно только с применением методов микробиологии.

В 1995 году впервые появляется метод высокопроизводительного секвенирования. Технологию предложил Пол Нирен с коллегами из Королевского технологического института в Стокгольме [20]. Метод основывался на реакции полимеризации ДНК на фрагментах исследуемого организма и детекции выделяемого в ходе синтеза пирофосфата. Такой вариант севенирования стали назвать пиросеквенированием. Уже в 2005 году этот метод коммерциализируется компанией Roche, а в 2008 году выпускается первый высокопроизводительный секвенатор GS FLX, 454. Прибор позволял определять нуклеотидные последовательности длиной 300-500 пар оснований, при этом за один запуск таких последовательностей могло быть очень много и каждую такую последовательность далее стали называть «прочтение» (eng. read). Спустя год выпускается еще один высокопроизводительный секвенатор от компании Solexa. Технологию, которая легла в основу прибора Solexa, начали разрабатывать еще в 90-х годах два химика из Кембриджа Шанкар Баласубраманиан и Дэвид Кленерман. Предложенный ими подход кардинально отличался от описанного ранее пиросеквенирования, он основывался на технологии секвенирования на молекулярных кластерах с использованием флуоресцентно меченых нуклеотидов. Такой подход использовал в своей основе реакцию амплификации, входе которой добавлялись меченного нуклеотиды, приводящие к изменению свечения кластера. Прибор фиксировал все изменения и исходя из этого восстанавливал нуклеотидную последовательность прочтения. Технология Solexa позволяла получать прочтения длиной до 300 п.о. Сейчас данная технология принадлежит компании Illumina, которая выкупила Solexa в 2007 году [21].

Первые работы в области метагеномики с применением методов высокопроизводительного секвенирования 454 стали появляться 2006 году [22]. В 2009 вышла статья, в которой была показана применимость технологии Illumina (бывшая технология Solexa) для анализа данных микробиома полости рта [23]. С развитием методов высокопроизводительного секвенирования появилась потребность в анализе полученных данных. В отличии от результатов, получаемых при секвенирование методом Сэнгера, на котором работают генетические анализаторы первого поколения, анализ данных NGS представляет собой более сложную задачу.

Успех в исследовании метагеномики дал старт развитию нового глобального проекта «Микробиом человека» [24]. Этот проект был инициативой Национального института здравоохранения США, проявленной с целью лучшего понимания микрофлоры человека. Он состоял из двух фаз. На первом этапе стояла задача получить характеристики микрофлоры и сделать его предварительное описание (2007 - 2014). Второй этап стартовал в 2014 году и перед ним уже стояла задача развития ресурсной базы, с помощью которой можно было бы прояснить роль микробов, ассоциированных со здоровьем человека. Проект считается завершенным с 2016 года, однако ответить на все вопросы, интересующие науку, в ходе данного проекта не удалось.

Метагеномное секвенирование делят на два типа: Полногеномное секвенирование методом шотган (WGS) тотальной ДНК метагеномного образца и секвенирование ампликонов коротких регионов генома - 16S рРНК, ITS, COI и т.п. Оба метода имеют свои достоинства и недостатки. При первом взгляде кажется, что WGS секвенирование позволяет сохранять гораздо больше информации о микробиоте образца, позволяя получать сборки геномов, собранных из метагеномов (MAGs). Анализируя MAG можно получить более полное представление о генном составе и биохимических особенностях отдельных организмов. Однако, WGS секвенирование требует глубокого покрытия образца прочтениями, что ощутимо отражается на стоимости всего исследования.

Лейтмотивом данного раздела была мысль о том, что классические подходы культивирования микроорганизмов не всегда позволяют выделить все организмы из микробного сообщества. Прежде всего это связанно с трудностями в подборе специализированных культуральных сред и условий роста микроорганизма. Данные WGS метагеномного секвенирования позволяют сразу заглянуть на геномный уровень устройства микроорганизма, что позволяет предположить, в каких условиях может расти организм. Для задачи обратного подбора условий роста также постепенно начинают появляться специализированные биоинформатические инструменты [25].

WGS секвенирование, действительно, может позволить проводить достаточно широкий спектр манипуляций с данными, однако недостаточная глубина WGS секвенирования может

отразится на репертуаре обнаруживаемых микроорганизмов и на качестве получаемых сборок. Это значительно затрудняет анализ биоты с относительно небольшой представленностью (вирусы и грибы). В противовес этому, секвенирование ампликонов позволяет обогатить образец определенными фрагментами, тем самым позволяя охарактеризовать репертуар организмов биоты с небольшой представленностью. Такие исследования наиболее актуальны в контексте изучения грибных сообществ.

1.2. Биоинформатические инструменты для анализа данных метагеномного секвенирования

ампликонов

С появлением методов высокопроизводительного секвенирования стал расти спрос на такую область биологии, как биоинформатика. Задачи, стоявшие перед анализом метагеномных данных, также стали довольно успешно разрешаться с помощью подходов вычислительной биологии и биоинформатики. В 2013 году появляются автоматизированные биоинформатические инструменты для анализа данных секвенирования фрагментов гена 16S рРНК [26,27]. Методы того времени основывались преимущественно на кластеризации прочтений и построения консенсусных последовательностей получаемых кластеров. Такой вариант позволял получать, так называемые, OTU (Operative Taxonomic Unit). Последовательности OTU, полученные таким методом, определялись по стратегии de novo [28]. Несмотря на прозрачность подхода, он не являлся панацеей и приводил к ощутимым потерям данных. Определение OTU также возможно и без использования кластеризации, с помощью выбора ближайшего референса. При такой стратегии прочтения выравниваются на референсную базу данных. По результатам выравнивания для прочтений определяются наиболее похожие последовательности (ближайший референс) из базы данных, таксономия которых приписывается выравненным прочтениям. Каждая таксономическая единица в таком случае является отдельной OTU [28]. OTU, определенные таким методом, не могли в должной мере описать все разнообразие последовательностей в образце, поскольку были ограничены объемом используемой базы данных.

Метагеномное секвенирование ампликонов на сегодняшний день чаще всего проводится на платформах типа Illumina (MiSeq, HiSeq, NextSeq). Выбор платформы обуславливается тут наличием оптимальных и известных протоколов пробоподготовки, высоким качеством получаемых данных, а также наличием широкого ассортимента биоинформатических инструментов. Существующие подходы как правило базируются на создании набора некоторых консенсусной последовательности ампликона, собранных из метагеномных данных.

1.2.1. Подходы к анализу. Шумоподавление и кластеризация ASV/OTU 1.2.1.1. Подходы для генерации OTU

Процедура кластеризации прочтений, предшествующая этапу построения OTU, в литературе, зачастую, называется шумоподавление (eng. denoising), где «шумом» (noise) называют прочтения с техническими небиологическими ошибками. Среди инструментов, основанных на сборке OTU посредством кластеризации наиболее применяемые это VSEARCH и USEARCH.

USEARCH - мощный инструмент, служащий для широкого ряда биоинформатических задач таких как поиск последовательностей в большом массиве данных и кластеризация последовательностей [29]. В основе алгоритма поиска последовательностей, имплементированного в USEARCH, заложен подход аналогичный классическому алгоритму BLAST [30], но со значительно более быстрым выполнением. В рамках данной работы, конечно, больший интерес вызывает USEARCH в контексте генерации OTU.

UPARSE-OTU - отдельный алгоритм внутри USEARCH, создающий набор репрезентативных последовательностей OTU из прочтений ампликонов (реализован в команде cluster_otus) [31]. Прочтения при данном анализе предварительно подвергаются предобработке (удаление баркодирующих и адаптерных последовательностей, предварительная фильтрация по качеству чтения). Далее следует этап сортировки, где уникальные последовательности сортируются по представленности (abundance). Это действие следует из предположения о том, что последовательности с самой большой частотой представленности являются более корректными, а редкие наоборот с большей вероятностью содержат ошибки. USEARCH проходит по списку от наиболее представленных к менее представленным последовательностям, где самые частые последовательности назначаются центроидами (далее он и будет являться OTU) нового кластера (Рисунок 1). Все похожие последовательности с попарной идентичностью к центроиду более 97 % добавляются в общей пул кластера. Подобная процедура определения центроида с последующей кластеризации идет поступательно по мере убывания представленности последовательности. Фильтрация шума в данном случае происходит посредством отбрасывания кластеров, размер которых меньше заданного порога. Также в ходе всей этой процедуры отбрасываются одиночные химерные (артефактные последовательности) последовательности. В результате работы всего алгоритма получается таблица с центроидами кластеров, в которой указано, сколько каждая последовательность встретилась в образце.

Кластер с последовательностями с внутренней идентичностью более 97%

\

/

\

Химерные по следователь» отбрасывают*

Неоднознач_______

кластеризации

3% радиус

разницей по идентичности

Последовательности OTU, являющиеся центроидами

последовательностей с

кластеров для

более 3%

Рисунок 1 — Схема кластеризации прочтений в UPARSE-OTU.

VSEARCH [32] - прямой аналог USEARCH с открытым кодом с большей оптимизацией вычислений алгоритма. В частности, VSEARCH использует оптимальный глобальный выравниватель (полное динамическое программирование Needleman-Wunsch), в отличие от USEARCH. Подобный подход обычно приводит к более точному выравниванию и большей чувствительности, особенно для выравниваний с пробелами.

Еще одним популярным инструментом, использующем идеологически схожий подход, является CD-HIT (Cluster Database at High Identity with Tolerance) [33]. В основе CD-HIT лежит жадный инкрементальный алгоритм. Алгоритм CD-HIT в отличии от того же USEARCH сортирует последовательности не по представленности, а по длине, выбирая самую длинную последовательность в качестве первого представителя первого кластера. Такая стратегия была выбрана по причине того, что вычислительно проще сопоставить оставшиеся короткие последовательности с данным шаблоном, чем наоборот. После выбора первого кандидата алгоритм обрабатывает оставшийся массив от длинных к коротким последовательностям и оценивает каждую последовательность как избыточную или репрезентативную на основании сходства этой последовательности с существующими представителями. Говоря простыми словам, алгоритм для каждой новой последовательности пытается оценить есть ли похожая последовательность среди ранее встречаемых, если есть, то она добавляется в пул кластера. В обратном случае, когда для последовательности не находится ни одного похожего представителя, эта последовательность определяется в новый кластер. Критерием добавления последовательностей в кластер служит некоторый выбранный порог по идентичности (90% по

умолчанию). Специфика методологии оценки идентичности между последовательностями и обуславливает скорость работы CD-HIT. Вместо использования классических подходов типа BLAST он использует собственный подход. Последовательности разбивается на слова длиной k, далее сравниваются между собой, если количество общих слов меньше порогового значения, то такие последовательности являются различными. Подход, реализованный в алгоритме CD-HIT, имеет довольно широкий спектр применений и позволяет не только кластеризовать нуклеотидные последовательности, но и аминокислотные.

Sumaclust [34] по умолчанию, аналогично USEARCH, сортирует последовательности по представленности, предполагая, что такие последовательности являются «истинными». Далее процедура кластеризации идентична USEARCH, формирование кластеров происходит с помощью оценки идентичности. Принципиальным отличием тут является дополнительное введение оценки представленности самой последовательности при отнесении ее к уже определенным кластерам. Оценка проводится следующим образом, вводится критерий R, который представляет собой отношение NA к NB, где NA - представленность последовательности центроида кластера (A), а NB - представленность последовательности-кандидата (B). Соответственно, если рассчитанное соотношение NA к NB < R, то последовательность-кандидат (B) считается самостоятельным центроидом. Алгоритм, лежащий в Sumaclust учитывает больше факторов, однако общая концепция остается схожей с USEARCH/VSEARCH.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Кривонос Данил Вадимович, 2026 год

- ••

О 0.46

О 0.44

ODO

• О

СЮ о ст> 4L ►

OD (3D О « CD 300 ) 1 1 Г) сюо

-0.10 -0.05

0.00 0.05 Difference

-0.10 -0.05

0.00 0.05 Difference

Уменьшение

□ с

Возрастание

Уменьшение

3 с

Возрастание

D

1490 -1480 -1470 -1460 1450 -1440 -1430 -1420 -

<

0 QßOS) о о »

О 00 о

«о

^ 0.58

0

я 0.56

¿0.54 CD

'1 0.52

1

|0.50 О

0.48 0.46

О SD

о mm I«

• « о о

Ж

-0.04 -0.02 0.00 0.02 Difference

-0.04 -0.02

Уменьшение

Возрастание

Уменьшение

0.00 0.02 Difference □ I

Возрастание

i>

можно сделать некоторый вывод о том, что в результате амплификации относительно более короткие последовательности склонны увеличиваться в представленности, а относительно более длинные наоборот уменьшаться в представленности. При этом, чем больше разброс по длинам целевых фрагментов, тем больше будет эффект искажения. Каких-то явных сдвигов, ассоциированных с GC-составом, обнаружено не было.

3.2.11. Сравнение с другими инструментами

В дополнение к инструменту, представленному в данной работе, на момент написания работы было доступно два альтернативных решения для анализа данных нанопорового секвенирования ампликонов: пакет программного обеспечения wf-metagenomics, включенный в epi2me-labs (использует или kraken2 или картирование minimap2) и NanoCLUST. wf-metagenomics не позволяет получать de novo последовательности OTU, а следовательно ограничивает возможности исследования микробного сообщества существующими базами данных. NanoCLUST позволяет решать задачу de novo сборки OTU, но имеет существенное техническое ограничение в виде минимальной длины исследуемого ампликона (>1000 п.о.). Это автоматически делает невозможным анализ коротких ампликонов типа V3-V4 16S рРНК.

Для анализа полученного массива данных секвенирования искусственных сообществ с помощью wf-metagenomics со стратегией анализа kraken2 использовалась база данных PlusPF-8. Для wf-metagenomics со стратегией анализа minimap2 использовалась база данных NCBI_16s_18s_28s_ITS. В случае NanoCLUST для определения таксономии бактерий использовалась база данных, встроенная в программу по умолчанию. По умолчанию NanoCLUST не способен определять таксономию грибов, поэтому для ее идентификации использовался собственный модуль get_taxonomy.py (с базой данных UNITE).

Результаты обработки массива всеми имеющимися инструментами представлены на Рисунке 31 - Рисунке 35. Чтобы минимизировать визуальный шум на изображениях, легенды были удалены. Для wf-metagenomics характерно искажение микробного состава, которое особенно ярко проявляется в результатах анализа коротких ампликонов. Кроме того, wf-metagenomics с kraken2 неправильно предсказывает таксономию Y pseudotuberculosis, определяя вместо этого S. enterica. Несмотря на недостатки, wf-metagenomics позволяет обнаружить все ожидаемые микроорганизмы с незначительными отклонениями.

Анализ региона V1-V9 16s рРНК, проведенный с помощью NanoCLUST, позволил идентифицировать все ожидаемые бактерии, сохранив при этом корректность композиции микробного сообщества. Однако техническое ограничение длины исследуемого фрагмента (более 1000 п.о.) не позволило провести аналогичный анализ для ампликонов V3-V4 16s рРНК, ITS1 и ITS2. В дополнение к этому данное ограничение сильно повлияло и на результаты,

полученные для ампликона ITS1-5.8S рРНК-ITS2. Грибы, такие как Y lipolytica, имеют длину региона ITS1-5.8S рРНК-ITS2 менее 400 п.о. По этой причине Clavispora lusitaniae, Candida auris и Yarrowia lipolytica не были обнаружены с помощью NanoCLUST. В дополнение ко всему перечисленному, качество самих последовательностей консенсусов OTU NanoCLUST немного уступает качеству OTU, собранных Pike как в одиночном, так и в пулированном режимах.

В результате такого сравнительного анализа был выявлен ряд преимуществ и недостатков, характерных для альтернативных инструментов. Все наблюдения были сформированы в сводную Таблицу 5.

Таблица 5 — Преимущества и недостатки, которые были отмечены для альтернативных инструментов, использованные для анализа данных секвенирования искусственных сообществ.

wf-metagenomics

kraken2 minimap2

Достоинства • легко запустить и легко настроить • выполняет сборку

• не зависит от длины чтения ОТУ

• хорошо

восстанавливает

микробный состав

Недостатки • ошибки в • не выполняет сборку • трудно установить

таксономической ОТУ • не работает с

идентификации • высокий уровень короткими чтениями

(Yersinia ^ ложноположительной (длина, которых

Salmonella) идентификации менее 1000 п.о.)

• не производит таксонов

сборку OTUs • восстанавливает

• высокий уровень микробный состав с

ложноположительн неточностями

ой идентификации

таксонов

• восстанавливает

микробный состав с

неточностями

Рисунок 31 — Результаты анализа данных секвенирования искусственного бактериального сообщества (У3-У4 16Б рРНК), полученные с

помощью различных инструментов. Каждый цвет соответствует уникальному таксону.

Рисунок 32 — Результаты анализа данных секвенирования искусственного бактериального сообщества (У1-У9 16Б рРНК), полученные с

помощью различных инструментов. Каждый цвет соответствует уникальному таксону.

к

X о н

43

^

о

о

а «

РЗ

£3

Е

с

а о н о о

со о н о н

со

^

0

н

^

1

я я рз Й ег X о

н

РЗ

я о о X

Т1

к

X

о я ол

Т1

0

03 ^

Е

РЗ

я

РЗ Й к

03

рз

Й рз

я

1

о-

><

о о я со о X к

43

о со рз

я

1т51_1_*й_п1«а<ггйгигг|&рй ГТ31_1_и^тма(кгвксг2>

ГГ51_1_«Г_п1в1а(кгаквпЗ>

1Т51_з_»1_гг1еа(пШ11тарг> ГГ51_3_ «Г_г I «Ы(к I и к еп 2 >

1Т5ыи^_тевшп1тарг} ГТ51_Ш._вГ_тви(кгькепМ

|»_ГГгКа<1П|Штавг>

_мг_глеса№гакёп2> ■5.1_В.а_ И 11 м) I е>

.-_гггетэ ■: Т11 п I Т| а р _иг_г1еса(кгакагг>

I Г

Относительная представленность

1Т51_1_т1_те1а(т1г1тарг>

К

о 1Т51_2_«1_тка(т1п1тар1>

о

о 1Т51.2_Р1кп(рт?1>

н

со 1Т51 _3_\,1"'_гггетэ' Т|| п 1 т а р 2

о я

X

о 1—11 1ТЫ.Э_Р,кЕ(р»»

3

ч 1Т51И1_у^Г_гле(а(кга1(епг>

43

К ГГ51_В1_Р1кв(рвй1>

о>

д

о НЫ нг .«( тта(гпт1тарг:-

т ГТ51_иг_иГ_теСа(кгякеп2>

О ITS.1_F.2_ Р1 1 Г»в 1

о П51_К2_Р1кв(риЫ>

о

о Г51 ИЗ л* гг-КО'Мпт&рН

о> ГГ51 Р_т е!а(к га кеп

в 1Т51_ИЗ_Р1к№1Г№>

сг> П51_КЗ_Р1ка1р0й1}

о

н

со

рз

нч

Н

СЛ

Я 1Т51_1_Р|к=|р1Х.1>

О

Й

^

1Т51_г_ИМ5||1в1е>

о

I 1та1_2_Р1кв(роо1>

I

Е

о

о

□ 1ТЙ1_3_Р|кв(роЫ>

о

о

в

Сг4 П51_Й1_Р1кй1р0й1>

5

43 ё

Й 1Т51 Я2 Р1ке<рго1>

Я

X

I

* 1Т51_ Ю_РМроЫ>

.........

Относительная представленность

к

X о н

43

^

о

о

а «

РЗ

£3

Е

с

а о н о о

со о н о н

со

^

0

н

^

1

я я рз Й ег X о

н

РЗ

я о о X

Т1

к

X о я

Т1

0

03

Е

РЗ

X

РЗ Й к

03

рз

Й рз X

1

о-

><

о о я со о X

х

43

о со рз X

к

о

о о н со о X X о

3

4 43

к

X о

3

о о о о>

в

сг> о н со рз

н

сл ^

я о

0

1 I

Е

в

о □

о о

в

сг

5

я

I

о-

><

Относительная представленность

I Т52_1_«Г_т«Са< т I гЛта р 2 9 -

П32_иЧкв(рсга11 -

I Т52_2_1Ч(_гп«а! т I гНта в21 -

1Т52_2_Р1ксГрт<} -

1Т52_3_»г_гг-йа(т1п1тгр2! -

!_3_ИксГрос<} -

т I п1гт>5 С 2} -

52_Н1_ИквГрйй} •

ГТ5г_(!2_Икв(рйЙ} -

Относительная представленность

2_Р1ке4ыпд1е| -! 2 Р1ке[рсхЛ| -

ГГ52 Э Икв^з-^'еЧ -1Т52_Э_Р«1в[рм1| .

1Т52_аЗ_МкжКз1Г>з 1е| -ГГБ2_Ю_1*иС|кюЦ .

о

13

го ь

00

9

С

Рисунок 35 — Результаты анализа данных секвенирования искусственного грибного сообщества (1Т81-5.8Б рРНК-1ТБ2), полученные с

помощью различных инструментов. Каждый цвет соответствует уникальному таксону.

3.3. Инструмент для предсказания генного состава грибных сообществ 3.3.1. Описание программного обеспечения

В соответствии с алгоритмом, описанном в главе 2.3, был разработан инструмент для предсказания генного состава грибов исходя из данных секвенирования одного из трех вариантов ампликона ITS. В качестве входных данных данный инструмент принимает последовательности ампликонов ITS (ITS1, ITS2 или ITS1-5.8S рРНК-ITS2) в формате FASTA. Сам FASTA файл может содержать как одну, так и несколько последовательностей ITS. В качестве выходных данных инструмент возвращает таблицу, где первый столбец соответствует группе ортологии KEGG на третьем уровни иерархии, а последующие столбцы соответствуют предсказанным компонентам вектора генного состава для каждого образца. Алгоритм был реализован в виде инструмента командной строки, который был назван FunFun (сокращенно от Fungal Functional), написанный на языке программирования python3 и лежащий в открытом доступе на GitHub:https://github.com/DanilKrivonos/FunFun. Первоначально данный инструмент был разработан для предсказания генного состава отдельных грибов, однако инструмент также может быть применен на данных метагеномного секвенирования.

Инструмент имеет два ключевых параметра K - максимальное количество выбранных ближайших соседей и е, который определяет область, в которой выполняется поиск K-соседей. В случае, если инструмент не возвращает предсказание для анализируемой последовательности, пользователь может увеличить значение е. Однако здесь следует отметить, что чем больше значение е, тем ниже ожидаемое качество предсказания (рисунок 38a). С другой стороны, количество соседей K не оказывает сильного влияния на качество предсказания в целом, но в некоторых случаях может сделать предсказание более надежным, особенно когда целевая последовательность имеет много близких соседей. По умолчанию K установлено равным 10, а е установлено равным 0,5.

3.3.2. Результаты валидации инструмента предсказания генного состава грибных сообществ 3.3.2.1. Грибная таксономия как отражение генного состава

Алгоритм, лежащий в основе разработанного инструмента, базируется на предположении, что метаболизм грибов коррелирует с их таксономией. Исходя их этого ожидалось, что профили генного состава, которые были вычислили с помощью предложенного подхода, также должны коррелировать с таксономией грибов. Для проверки этого предположения было выполнено t-SNE-разложение полученных векторов генного состава с последующей кластеризацией с помощью алгоритма HDBSCAN [139,140] (Рисунок 36). На

рисунке 36 показано двумерное отображение всей матрицы векторов, где каждый цвет на этой картинке соответствует определенному семейству грибов. Согласованность полученных кластеров с таксономией NCBI (уровень семейства) численно оценивалась с помощью индекса Ренда (Ы = 0,929). Наиболее репрезентативные скопления точек были дополнительно выделены отдельно.

Рисунок 36 — ^ЫЕ разложение профилей генного состава грибов (каждая точка соответствует профилю генного состава конкретного гриба). Уникальные цвета отражают отдельные таксоны грибов (уровень семейства). Для наиболее яркие кластеры выделялись стрелочками.

Для грибной таксономии свойственны определенная неточность [141], что может привести к артефактам кластеризации и наличию определенных выбросов для кластеров семейств на графике ^ЫЕ. Кроме того, сам алгоритм ^ЫЕ имеет тенденцию генерировать кластеры точек, которые на самом деле состоят из разных таксонов (Дополнительный рисунок 3). В дополнение к этому собранная база данных не сбалансирована по семействам, и некоторые организмы могут быть единственными членами своего семейства (например, Massarinaceae, Aulographaceae и т.д.), что также может повлиять на качество кластеризации.

При построении агломеративной кластеризации по векторам генного состава также отмечается ожидаемая ассоциация с грибной таксономией (Рисунок 37). Рассчитанные значения

индекса Ренда для соответствия кластеров и таксономии составляли 0,963, это дополнительно

указывает на сильную ассоциацию полученных векторов генного состава и таксономии.

Рисунок 37 — Дендрограммы были построены с использованием агломеративной кластеризации. (А) - для векторов частот £-меров (&=5) полноразмерного кластера ITS; (В) - для рассчитанных профилей генного состава. Каждое семейство грибов отмечено уникальным

цветом.

3.3.2.2. Подбор оптимального значения е-окрестности

Два главных параметра программы - это значение е-окрестности и значение K-ближайших соседей. K тут представляет значение максимально возможных соседей, расположенных на расстоянии не более чем е. Оба этих параметра могут меняться по мере необходимости. По умолчанию значение K равно 10, это значение само всегда будет ограничено выбранными границами е-окрестности, но при более «жестких» значениях е (небольшие значения е) уже не так важно какое максимальное значение соседей будет выбрано. То есть критерий K ближайших соседей в большей степени будет оказывать влияние на финальный результат только при больших значениях е-окрестности.

Если критерий K строго говоря не нуждается в обязательной валидации, то влияние границы е-окрестности было необходимо оценить. Задавшись значением K = 10, были рассчитаны значения R2 при разных значениях е. Для каждого гриба R2 рассчитывался между вектором генного состава, который был предсказан с помощью разработанного инструмента по последовательности ITS, и вектором генного состава, полученным по данным полногеномной аннотации (Рисунок 38A). Оценка R2 тут проводилась фактически по процедуре leave-one-out, при которой из обучающей выборки (в этом случае полученной ранее базы данных) удаляется информация об образце, для которого стоит задача предсказания профиля генного состава.

При слишком «мягких» (больших значениях е) порогах е качество предсказания может быть низким, а при более «жестких» (малых значениях е) порогах е могут не найтись ближайшие соседи (родственные грибы). Поэтому дополнительно была рассчитана доля грибов, для которых удалось предсказать профиль генного состава (Рисунок 38B).

Ожидаемо, более высокие значения R2 наблюдались для полноразмерных последовательностей ITS1-5.8S рРНК-ITS2. Медианные значения R2 были не менее 0,95 независимо от выбранного значения е, поэтому по умолчанию было установлено значение е равное 0,5 и K равное 10. Важным тут будет отметить, что разные семейства представлены в разных соотношениях, что, безусловно, влияет как на качество кластеризации, так и на качество сделанного предсказания. Для оценки различия качества предсказания отдельных семейств было построен график с оценкой значений R2 для разных грибных семейств (Дополнительный рисунок 4).

Рисунок 38 — Результаты валидации. (Л) Зависимость качества предсказания генного состава от значения е. (В) Зависимость процента предсказаний от значения е (в некоторых случаях

окрестность е может не включать ни одного соседа, что не позволяет сделать предсказание.

Таким образом, чем ниже значение 8, тем меньше число предсказанных профилей).

Также важно отметить, что высокие значения R2 могут частично быть объяснены консервативными функциями генов, которые являются общими чертами всех грибов. Примерами таких функций являются гликолиз и цикл трикарбоновых кислот. Поэтому было решено дополнительно проверить, как метод оценивает относительную представленность групп ортологии с наибольшей изменчивостью. Такие, наиболее вариабельные группы ортологии, выделялись с помощью коэффициента вариации, который определяется как стандартное отклонение, нормализованное на среднее значение относительной представленности. Группы ортологии считалась высоко изменчивой, если ее коэффициент вариации был более 10. Среди таких групп ортологии были: синтез глюкозамина, биосинтез ансамицина, деградацию толуола, биосинтез индольных алкалоидов, биосинтез кофеина и т.д. После определения вариабельных групп ортологии аналогично вышеупомянутому этапу вычислялись медианные значения R2 между реальными и предсказанными векторами генного состава. В результате чего предсказанное значение R2 составляло 0,99, а процент успешных предсказаний был равен 98,6%.

Некоторые биохимические особенности связаны с так называемыми экологическими гильдиями (ecological guilds) [133,142,143]. В отличии от таксономии экологическая ниша гриба и среда его обитания напрямую зависит от его генного состава. Поэтому, если предложенный в работе подход профилирования генного состава корректен, то также будет видна ассоциация экологических гильдий с кластерами, определенными HDBSCAN из данных t-SNE разложения матрицы векторов генного состава. Классы гильдий были выгружены из базы данных, используемой в инструменте FUNGuild. По результатам соотнесения кластеров с экологическими гильдиями была подтверждена ассоциация между гильдией и предполагаемым содержанием генов (RI = 0,84; Рисунок 39).

Декомпозиция векторов генного состава

40 -

S

о

и

-20 -

-40 -

ft'V \ 1 *

у » .. -. ■H "f

*i е.Г.'Х /■ .-V-ч V •/A

"PV'-'i : - . f'î - • -С1 .а."у i. • >,л £ " * > ! 1— ■ .¡V •ftV h" У

t : К Г ; i •• ■■:' Ç. х

■ ч • fi

Декомпозиция последовательностей ITS1 -5.8S-ITS2

20 -

S 0

-20

-40 -

Ш ► ' :

V/t . « V t 7 . ?

•.fr .V ä « . • \ . 'i'-J V: r * ■ i.r A" ' %

. • * -, . g 't ■ .*■ > >

* .г • ■ к;.- • ? ' г-» Л là;

-60 -40 -20 0 20 40

1 TSNE COMPONENT

-40 -20 0 20

1 TSNE COMPONENT

40

60

Экологическая гильдия

Animal Pathogen Endophyte-Undefined Saprotroph Unknown

Animal Pathogen-Undefined Saprotroph Undefined Saprotroph

Animal Pathogen-Endophyte-Undefined Saprotroph Plant Pathogen

Animal Pathogen-Endophyte-Endosymbiont-Epiphyte-Soil Saprotroph-Undefined Saprotroph

Dung Saprotroph-Endophyte-Epiphyte-Wood Saprotroph

Ectomycorrhizal

Animal Pathogen-Soil Saprotroph Animal Pathogen-Endophyte-Plant Pathogen Animal Pathogen-Dung Saprotroph

Animal Pathogen-Endophyte-Lichen Parasite-Plant Pathogen-Soil Saprotroph-Wood Saprotroph Animal Pathogen-Endophyte-Epiphyte-Fungal Parasite-Plant Pathogen-Wood Saprotroph Endophyte Dung Saprotroph

Endophyte-Plant Pathogen-Undefined Saprotroph Animal Pathogen-Endophyte-Epiphyte-Undefined Saprotroph Animal Endosymbiont-Undefined Saprotroph Wood Saprotroph

Animal Endosymbiont-Animal Pathogen-Endophyte-Plant Pathogen-Undefined Saprotroph

Endophyte-Litter Saprotroph-Soil Saprotroph-Undefined Saprotroph

Animal Pathogen-Endophyte-Plant Pathogen-Wood Saprotroph

Plant Pathogen-Undefined Saprotroph

Fungal Parasite

Lichenized

Animal Pathogen-Endophyte-Epiphyte-Plant Pathogen

Endophyte-Plant Pathogen

Plant Pathogen-Wood Saprotroph

Dung Saprotroph-Undefined Saprotroph-Wood Saprotroph

NULL

Arbuscular Mycorrhizal Endophyte-lnsect Pathogen Nematophagous

Clawicipitaceous Endophyte-Plant Pathogen

Animal Endosymbiont-Animal Pathogen-Undefined Saprotroph

Endophyte-Plant Pathogen-Wood Saprotroph

Animal Pathogen-Endophyte-Plant Saprotroph-Soil Saprotroph

Epiphyte-Plant Pathogen-Wood Saprotroph

Animal Pathogen-Clavicipitaceous Endophyte

Endophyte-Fungal Parasite-Plant Pathogen Epiphyte

Animal Pathogen-Endophyte-Fungal Parasite-Plant Pathogen-Wood Saprotroph Dung Saprotroph-Soil Saprotroph Plant Saprotroph

Soil Saprotroph-Undefined Saprotroph Ericoid Mycorrhizal

Animal Pathogen-Endophyte-Ericoid Mycorrhteal-Plant Pathogen-Wood Saprotroph

Epiphyte-Leaf Saprotroph-Lichen Parasite-Lichenized-Plant Pathogen-Wood Saprotroph

Bryophyte Parasite-Ectomycorrhizal-Ericoid Mycorrhizal-Undefined Saprotroph

Dung 5aprotroph-Undefined Saprotroph

Ectomycorrhizal-Fungal Parasite

Animal Endosymbiont

Ectomycorrhizal-Undefined Saprotroph

Undefined Saprotroph-Wood Saprotroph

Endophyte-Fungal Parasite-Lichen Parasite-Plant Pathogen-Wood Saprotroph Animal Endosymbiont-Animal Pathogen-Plant Pathogen-Undefined Saprotroph Animal Endosymbiont-Plant Saprotroph

Animal Pathogen-Plant Pathogen-Soil Saprotroph-Undefined Saprotroph

Animal Pathogen-Dung Saprotroph-Endophyte-Lichen Parasite-Plant Pathogen-Undefined Saprotroph Animal Pathogen-Clavicipitaceous Endophyte-Fungal Parasite Endophyte-Lichen Parasite-Plant Pathogen-Undefined Saprotroph Ectomycorrhizal-Undefined Saprotroph-Wood Saprotroph

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.