Построение улучшенных онтологий генов с помощью силовых алгоритмов визуализации графов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Бузанов Глеб Сергеевич

  • Бузанов Глеб Сергеевич
  • кандидат науккандидат наук
  • 2025, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 90
Бузанов Глеб Сергеевич. Построение улучшенных онтологий генов с помощью силовых алгоритмов визуализации графов: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2025. 90 с.

Оглавление диссертации кандидат наук Бузанов Глеб Сергеевич

Введение

Глава 1. Литературный обзор

1.1 Функциональная аннотация генов

1.2 Аннотация генов по гомологии

1.3 Функциональные онтологии и базы знаний

1.4 Функциональная аннотация немодельных организмов

1.5 Данные экспрессии как источник функциональной информации

1.6 Сетевой анализ в аннотации

1.7 Методы кластеризации и выявления функциональных групп

1.8 Анализ совместной встречаемости генов в сигнатурах

1.9 Функциональная классификация генов без перекрытий

1.10 Машинное обучение в аннотации генов

1.11 Языковые модели и текстовая интерпретация в биоинформатике

1.12 Комплексные системы аннотации

Глава 2. ISEEML: Межвидовое сравнение экспрессии генов

2.1 Данные

2.1.1 Данные по экспрессии генов

2.1.2 Использование OrthoFmder

2.1.3 Использование Proteinortho

2.2 Методы

2.2.1 Постобработка ортопар

2.2.2 Оценка идентичности последовательностей

2.2.3 Методы анализа экспрессии

2.2.4 Построение классификаторов по профилям экспрессии

2.2.5 Градиентный бустинг решающих деревьев (XGBoost)

2.2.6 Полносвязная нейронная сеть

2.3 Результаты

Стр.

Глава 3. VOL-Gene: графовый алгоритм функциональной

классификации генов

3.1 Данные

3.2 Методы

3.2.1 Графовое представление функций генов

3.2.2 Кластеризация

3.2.3 Агрегация кластеров и иерархическая кластеризация

3.3 Результаты

3.3.1 Реализация пайплайна

3.3.2 Оценка вклада от отжига

3.3.3 Итоговая кластеризация

Глава 4. ZUL-Gene: модель генерации текстовых описаний наборов

генов

4.1 Данные

4.2 Методы

4.2.1 Аугментация

4.2.2 Архитектура BioGPT и её адаптация

4.2.3 Процесс дообучения

4.2.4 Итоговый конвейер обучения

4.2.5 Цели оценки

4.2.6 Базовые модели для сравнения

4.3 Результаты

4.3.1 Примеры сгенерированных описаний

4.3.2 Сравнение моделей

Заключение

Выводы

Благодарности

Список литературы

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Построение улучшенных онтологий генов с помощью силовых алгоритмов визуализации графов»

Введение

Функциональная аннотация генов — одна из центральных задач современной биологии. Несмотря на рост объёмов данных и развитие баз знаний, значительная часть генов по-прежнему остаётся недостаточно охарактеризованной, особенно в немодельных организмах. Результатом новых высокопроизводительных экспериментов (секвенирование РНК, анализ одиночных клеток, полногеномный поиск ассоциаций и др.) обычно являются списки генов, часто в значительной степени состоящие из генов, о которых практически ничего не известно. Проблемы усугубляются ограничениями традиционных методов, основанных на гомологии последовательностей: такие методы теряют эффективность при высокой филогенетической дивергенции, повторяющихся событиях дупликации и структурных перестройках геномов, особенно у растений или других таксонов с распространенной полиплоидией.

Современные базы аннотаций, такие как Gene Ontology, KEGG или MSigDB, также имеют ряд существенных недостатков. Для одного и того же функционального процесса обычно имеется множество разных подписей, подписи разных функциональных процессов часто содержат много общих генов, отсутствует приоритизация функциональных ролей генов, затруднена интерпретация коротких списков генов, а информация о совместной встречаемости генов используется явно недостаточно. Всё это делает автоматизированную и масштабируемую функциональную аннотацию сложной задачей. Вдобавок, растёт спрос на машинные методы текстовой интерпретации результатов — от генерации кратких описаний списков генов, с точки зрения их возможных общих функций, до полной автоматизации аннотирования, что невозможно без специализированных языковых моделей.

Диссертационная работа направлена на системное решение этих проблем. В ней предложен комплекс методов, реализующих единый подход к функциональной аннотации и интерпретации генов.

Актуальность темы. Функциональная аннотация генов — одна из ключевых задач современных молекулярной биологии и биоинформатики, от решения которой зависит успех широкого круга прикладных и фундаментальных исследований. Даже в хорошо охарактеризованных организмах часть генов остаётся лишённой достоверных предположений об их функциях.

Традиционные подходы к аннотации, основанные на гомологии последовательностей, постепенно исчерпывают себя: высокая степень расхождения между видами, множественные события дупликации и последующей субфункционали-зации делают невозможным прямое сопоставление функций даже для казалось бы очевидных гомологов. Особенно выражена эта проблема у растений, чьи геномы часто претерпевают события полиплоидии и крупномасштабных перестроек, в результате чего гомология не всегда свидетельствует о сохранении функции.

С развитием технологий высокопроизводительного секвенирования и накоплением данных о транскриптомах, эпигеноме и межгенных взаимодействиях становится всё более очевидной потребность в эффективной и масштабируемой функциональной аннотации генов. Всё шире становятся доступны большие наборы данных по экспрессии (секвенирование РНК, секвенирование одиночных клеток), коэкспрессии, а также структуре метаболических и сигнальных путей, позволяющие перейти от анализа последовательностей к сравнительной функциональной биоинформатике. Результатом использования этих методов обычно являются некоторые списки генов. Такие данные требуют новых методов обработки и интеграции, способные выявлять устойчивые функциональные паттерны.

В особенности это актуально для списков, содержащих небольшое число плохо аннотированных генов, которые часто встречаются в результатах геномных исследований — будь то дифференциальный анализ экспрессии, полногеномный поиск ассоциаций или транскриптомика одиночных клеток.

Часто значительная часть генов, входящая в состав полученного в результате исследования списка, относится к малоизученным. Такие гены не входят в состав классических функциональных сигнатур и не имеют описания в общепринятых онтологиях (Gene Ontology, KEGG и др.). Эта проблема усугубляется, когда такие гены появляются в анализе изолированно или в составе небольших маркерных наборов, что делает невозможным применение стандартных методов функционального обогащения, требующих статистической мощности, обеспечиваемой только длинными списками. Как следствие, такие гены остаются вне поля интерпретации, несмотря на их потенциальную биологическую значимость.

Кроме того, современные базы функциональных сигнатур перегружены пересекающимися наборами, в которых один и тот же ген входит одновременно в десятки и даже сотни сигнатур. Это приводит к снижению специфичности аннотаций и делает невозможным однозначную классификацию отдельных генов. Такая избыточность особенно затрудняет автоматическую интерпретацию корот-

ких списков генов, поскольку для большинства генов отсутствует «основная» или «предпочтительная» функциональная роль.

Третья проблема заключается в том, что часто упускается из виду важный источник информации — частота совместного включения генов в различные сигнатуры. На практике гены, часто встречающиеся в одних и тех же функциональных наборах (например, сигнатурах пути, коэкспрессии, биологических процессов), с высокой вероятностью участвуют в связанных или общих биологических функциях. Однако большинство современных подходов не учитывает эту статистику напрямую, игнорируя возможность построения на её основе обобщённых функциональных классов.

Ещё одна важная проблема — отсутствие универсального и взаимно однозначного способа разделения всего пула генов на функциональные группы. В большинстве существующих систем аннотации гены могут принадлежать множеству перекрывающихся наборов, что удобно для описания процессов, но неудобно для задач классификации или первичной интерпретации. В прикладных сценариях — например, при построении алгоритмов классификации или аннотации маркеров — часто очень полезно функциональное разбиение, где каждый ген входит только в один класс.

Наконец, с ростом объёмов данных возникает критическая потребность в автоматизированной, текстовой интерпретации результатов. Ручная аннотация требует участия эксперта, занимает значительное время и плохо масштабируется. Несмотря на то что универсальные языковые модели, такие как GPT-4, способны формировать грамматически правильные тексты, они демонстрируют ограниченную биологическую точность и специфичность без специализированного дообучения на биомедицинских корпусах. Это делает невозможным их прямое применение для достоверной генерации описаний кластеров генов или редких функциональных групп.

Таким образом, существует целый ряд актуальных нерешённых задач:

1. Сопоставление генов между видами на основе экспрессионных профилей, а не последовательностей;

2. Интерпретация единичных или малых групп генов без априорных аннотаций;

3. Устранение неоднозначности, вызванной перекрытием сигнатур;

4. Эффективное использование информации о совместной встречаемости генов;

5. Построение функциональной классификации без перекрытий;

6. Генерация корректных биологических описаний в автоматическом режиме.

Диссертационная работа направлена на системное решение этих задач с помощью методов машинного обучения, графового анализа и специализированных языковых моделей.

Целью данной работы является создание масштабируемой системы для аннотации и интерпретации генетических данных

Для достижения поставленной цели необходимо было решить следующие задачи:

1. Разработка метода межвидового функционального сопоставления генов на основе профилей экспрессии (ISEEML)

2. Создание алгоритма разбиения полного набора генов одного биологического вида по функциям на непересекающиеся классы (VOL-Gene)

3. Разработка языковой модели для автоматической генерации описаний кластеров генов (ZUL-Gene)

Научная новизна: В диссертационной работе представлены три взаимосвязанных подхода, каждый из которых предлагает оригинальное решение фундаментальных задач функциональной аннотации генов в условиях неполной, неоднородной или отсутствующей априорной информации. Все предложенные методы построены с применением современных алгоритмов машинного обучения, анализа графов и языковых моделей, и обладают рядом новшеств по сравнению с существующими аналогами.

Предложен новый алгоритм сопоставления генов различных видов, основанный не на сходстве последовательностей, а на сходстве профилей экспрессии, что особенно важно для организмов с достаточно высокой степенью эволюционного расхождения и различной морфологией. Введена новая метрика сходства профилей экспрессии — показатель экспрессии (expression score, ES), инвариантная к различиям в устройстве органов или тканей сравниваемых видов. Впервые показано, что использование машинного обучения на трансформированных матрицах экспрессии позволяет с высокой точностью выделять функционально сходные гены между филогенетически удалёнными таксонами.

Разработан оригинальный графовый метод агрегации информации из тысяч известных сигнатур генов, полученных из базы Enrichr, с целью выявления устойчивых групп функционально связанных генов. Новизна подхода заключается в

использовании частотной матрицы совместного включения пар генов в различные биологические сигнатуры как основы для построения взвешенного графа, который далее кластеризуется методом ОрепОМ. В отличие от существующих онтологий, VOL-Gene предоставляет взаимоисключающую классификацию всех генов — каждый ген принадлежит ровно одному функциональному классу, что делает её удобной в задачах аннотации одиночных генов или генных сигнатур, составленных из малого числа генов.

Предложена и реализована новая архитектура дообученной языковой модели, основанной на BioGPT, предназначенная для генерации текстовых описаний списков генов с точки зрения их общих функций. Модель обучена на аннотированных наборах генов из ВюСаГл, UniProt и других биомедицинских источников с добавлением синтетических негативных примеров и перестановок, что позволило существенно повысить качество предсказаний. Показано, что дообученная модель 7ЦЪ^епе генерирует описания, превосходящие универсальные языковые модели (включая GPT-4) по критериям точности, полезности, связности и полноты. Это является первым подобным примером специализированной генеративной языковой модели.

Таким образом, совокупность представленных результатов образует систему для функциональной аннотации генов, охватывающую уровни межвидового соответствия, функциональной кластеризации и автоматической генерации текстовых описаний общих функций. Каждый из разработанных подходов обладает самостоятельной научной и практической ценностью, а их объединение открывает новые перспективы в автоматизации анализа геномных данных.

Теоретическая и практическая значимость: Теоретическая значимость диссертационной работы заключается в разработке новых подходов к функциональной интерпретации генов и их кластеров, не зависящих от гомологии последовательностей и предварительно заданных онтологий. В работе обосновано и реализовано:

1. применение методов автоматического анализа данных для выявления функционально сходных генов между филогенетически удалёнными видами на основе их экспрессионных профилей;

2. использование частот совместной встречаемости генов в сигнатурах как основополагающей характеристики для построения устойчивых функциональных классификаций;

3. формализация задачи автоматической текстовой интерпретации определения общих функций генов из заданного списка как задачи генерации описаний с использованием специализированных языковых моделей, до-обученных на биомедицинском корпусе.

Предложенные модели расширяют понятийный аппарат и методический инструментарий функциональной геномики и биоинформатики, предлагая альтернативу традиционным подходам, основанным на поиске гомологий и методах анализа обогащения выборок генов. Работа вносит вклад в анализ функций биологических систем, в том числе в условиях неполной или неоднозначной аннотации. Практическая значимость работы определяется широкой применимостью разработанных методов и алгоритмов:

1. КЕЕМЬ может использоваться для выявления функциональных аналогов генов при переносе знаний с модельных организмов на немодельные, в том числе в агрогеномике, медицинской генетике и эволюционных исследованиях;

2. VOL-Gene предоставляет масштабируемую и универсальную систему функциональной классификации генов, пригодную для аннотации как индивидуальных генов, так и коротких маркерных списков, где методы анализа обогащения выборок генов неэффективны;

3. 7ЦЪ^епе позволяет автоматически формировать интерпретируемые текстовые описания списков генов, что существенно ускоряет и стандартизирует этап интерпретации результатов в исследованиях с использованием массового РНК-секвенирования, транскриптомики одиночных клеток, полногеномного поиска ассоциаций и других технологий.

Все методы могут быть интегрированы в существующие биоинформатические конвейеры. Их применение повышает воспроизводимость, прозрачность и интерпретируемость аналитических результатов в геномных исследованиях.

Таким образом, работа имеет значимый потенциал как для фундаментальной науки, так и для прикладных задач биомедицины и биотехнологий.

Основные положения, выносимые на защиту:

1. Алгоритм, использующий профили экспрессии наряду с последовательностями для межвидовой классификации генов. Метод демонстрирует высокую точность по сравнению с традиционными метриками и выявляет случаи неофункционализации ортологов.

2. Совместное вхождение пар генов в состав известных сигнатур позволяет построить алгоритм, анализирующий графы совместной встречаемости генов, который разбивает все гены на непересекающиеся кластеры. Созданный алгоритм превосходит существующие алгоритмы кластеризации генов с точки зрения скорости работы и качества, в терминах меры Жаккара и ассортативности.

3. Специализированная языковая модель генерации релевантных и интерпретируемых описаний генетических кластеров, существенно превосходящая существующие генеративные модели в терминах точности, полноты и понятности полученных описаний.

4. Гены, входящие в состав непересекающихся кластеров, построенных с помощью графового алгоритма, входят в состав одних и тех же функциональных систем, что подтверждается анализом аннотаций MetaScape. Генеративная модель позволяет автоматически получить описание этих функциональных систем, экспертные оценки подтверждают высокое качество сгенерированных описаний.

Апробация работы. По результатам исследования опубликовано 3 печатных работы в журналах индексируемых в WOS. Результаты работы были представлены на конференциях: BGRS/SB 2024, Конференция 67 МФТИ 2025.

Личный вклад. Автором диссертации были реализованы вычислительные методы для функциональной аннотации генов и их наборов. Предложена итоговая версия алгоритма межвидовой классификации генов на базе полносвязных нейронных сетей. Автором реализован алгоритм группировки генов по функциональной связанности с использованием графовых моделей, а также программный конвейер для автоматизированного функционального анализа наборов генов. Автором проведена оптимизация алгоритмов кластеризации, разработаны модули для формирования описаний наборов генов. Кроме того, автор принимал участие в подготовке рукописей публикаций и интерпретации полученных результатов.

Публикации. Основные результаты по теме диссертации изложены в 5 печатных изданиях, 3 из которых изданы в журналах, рекомендованных ВАК, 2 — в тезисах докладов.

Объем и структура работы. Диссертация состоит из введения, 4 глав и заключения. Полный объём диссертации составляет 90 страниц, включая 20 рисунков. Список литературы содержит 148 наименований.

Глава 1. Литературный обзор 1.1 Функциональная аннотация генов

Функциональная аннотация — это процесс систематического присвоения описаний белок-кодирующим генам или некодирующим РНК, для характериза-ции их молекулярных функций, биологических процессов и клеточной локализации. Актуальность этой задачи обусловлена необходимостью интерпретации последовательностей, полученных в результате крупномасштабных проектов по секвенированию генома, для понимания роли каждого гена в контексте функционирования организма в целом [6].

Современная функциональная аннотация основана на интеграции различных источников данных и методов анализа. Поскольку экспериментальное изучение генов в основном проводилось на относительно небольшой выборке модельных видов, распространенным методом является аннотация по гомологии. Использование стандартизированных терминов и структурированных описаний позволяет унифицировать информацию и обеспечивает ее сопоставимость между различными исследованиями и видами, для чего широкое распространение получили функциональные онтологии и специализированные базы знаний, такие как Gene Ontology (GO) [7].

Функциональная аннотация немодельных организмов особенно сложна, поскольку отсутствие экспериментальных данных существенно ограничивает возможности прямой проверки функций - сложность обусловлена не только отсутствием экспериментальных данных, но и низкой долей хорошо аннотированных генов в таких геномах, а также эволюционной удалённостью от модельных видов, что затрудняет перенос аннотации по гомологии [8]. В таких случаях используются вычислительные методы, опирающиеся как на данные по гомологии так и на анализ экспрессии генов и сетевых взаимодействий. Последние позволяют идентифицировать функциональные кластеры генов, что способствует более точной идентификации биологических процессов и путей [9].

Кластерные методы и анализ сетевых взаимодействий играют важную роль в идентификации групп генов. Совместный анализ экспрессии генов в разных условиях и тканях позволяет выявить устойчивые коэкспрессирующие модули,

что служит дополнительным доказательством их участия в общих биологических функциях [10]. В то же время современный подход включает алгоритмы машинного обучения, которые могут выявлять скрытые закономерности в больших объемах данных и предсказывать функции генов, не имеющих прямых гомологов [11].

Одной из возможных задач является функциональная классификация генов с минимизацией перекрытий между функциональными категориями, что важно для построения точных моделей биологических процессов. Для решения этой задачи используются методы, обеспечивающие четкое разделение генов на уникальные функциональные кластеры, что способствует получению более удобных для интерпретации и практически применимых аннотаций. Этот инструментальный приём не отражает полную биологическую многозначность функций генов, однако полезен для удобства анализа [12].

Развитие языковых моделей и методов обработки естественного языка позволяет автоматизировать интерпретацию биологических данных и генерацию описаний функциональных кластеров. Это может способствовать упрощению анализа результатов высокопроизводительных экспериментов и повышению информативности функциональной аннотации. Однако это всё ещё является экспериментальным направлением - на текущий момент не существует ни одной специализированной модели автоматизированного составления текстовых описаний и качество автоматической интерпретации всё ещё нуждается в валидации [13; 14].

В совокупности современные методы функциональной аннотации генов образуют сложные системы, интегрирующие различные типы биологических данных и аналитические подходы. Такие системы обеспечивают более точную и комплексную интерпретацию геномной информации, что открывает новые перспективы для фундаментальных исследований и прикладных биотехнологических разработок [15].

1.2 Аннотация генов по гомологии

Аннотация генов по гомологии является одним из наиболее распространенных и фундаментальных методов функциональной аннотации генов в со-

временных биоинформатических исследованиях. Он основан на предположении, что гомологи — гены, унаследованные от общего предка — сохраняют сходные функции. На практике это означает, что если функция одного гена известна экспериментально, то функция его гомолога может быть с высокой вероятностью перенесена на изучаемый ген. Этот принцип основан на концепции функциональной консервативности в процессе эволюции, что позволяет эффективно расширять знания о геномах многочисленных организмов, включая немодельные виды [16; 17]. Однако степень функциональной консервативности варьируется в зависимости от конкретного белка и филогенетического расстояния [18].

Ключевым инструментом гомологического подхода являются методы поиска сходства последовательностей, такие как BLAST, PSI-BLAST и более современные алгоритмы - DIAMOND, MMseqs2, HMMER, которые позволяют быстро обнаруживать схожие аминокислотные или нуклеотидные последовательности в больших базах данных [19—24]. Такие методы выявляют потенциальных гомологов, которые затем могут быть классифицированы как ортологи или паралоги. Ортологи, возникшие в результате видообразования, считаются более надежными объектами для функционального переноса, поскольку их функции обычно консервативны. Паралоги, напротив, образуются в результате геномных дупликаций и часто претерпевают функциональную дивергенцию, что затрудняет прямую аннотацию [25; 26].

Однако аннотация по гомологии имеет свои ограничения и потенциальные источники ошибок [27; 28]. Во-первых, наличие сходства последовательностей не всегда гарантирует идентичность или даже сходство функций, особенно если сходство ограничивается небольшими участками или относится к быстро эволюционирующим белкам [29; 30]. Быстрые изменения в последовательностях могут привести к появлению новых функций или утрате исходных, что приводит к ошибочным аннотациям, если полагаться исключительно на гомологию [31]. Во-вторых, мультидоменные белки и гены с повторяющимися мотивами усложняют интерпретацию гомологического сходства, поскольку отдельные домены могут иметь различную эволюционную историю и функции [32].

Проблема точности аннотации особенно актуальна для немодельных организмов, геномы которых изучены недостаточно подробно и для которых отсутствуют экспериментальные данные. В таких случаях аннотация по гомологии становится одним из основных методов первичной функциональной аннотации, однако ограниченность базы данных и неоднородность качества аннотации уве-

личивают риск ошибок. В результате возникает необходимость в дополнительных методах и критериях отбора гомологов, таких как использование статистических значений, фильтрация по уровню сходства последовательностей, интеграция с другими биологическими данными [33].

Для обеспечения высокого качества аннотации необходим комплексный подход, включающий тщательную проверку гомологов, критическую оценку результатов, а также интеграцию с другими источниками биологической информации. Это позволяет минимизировать ошибки и повысить точность функциональных выводов, что критично для дальнейших биологических и медицинских исследований.

1.3 Функциональные онтологии и базы знаний

Функциональные онтологии и базы знаний играют центральную роль в современных биологических исследованиях, создавая основу для стандартизации, интеграции и интерпретации больших объёмов данных [34]. Функциональные онтологии представляют собой формализованные структуры, которые систематизируют биологические термины и их взаимосвязи, создавая единый словарь для описания функций генов, белков и биологических процессов [35]. Среди наиболее известных и широко используемых онтологий выделяется Gene Ontology (GO) [7], которая классифицирует гены по трём основным аспектам: молекулярная функция, биологический процесс и клеточный компонент. Такая унификация терминологии значительно облегчает вычислительный анализ экспериментальных данных, в первую очередь сопоставление результатов различных экспериментов, а также позволяет исследователям из разных областей говорить на одном языке.

Структура функциональных онтологий представляет собой совокупность терминов, связанных отношениями и организованных в иерархические деревья. Каждое отношение несёт семантическую нагрузку, отражая, например, принадлежность к более общей категории или причинно-следственные связи между процессами. Это даёт возможность более точного описания биологических явлений и улучшает возможности автоматизированного анализа. Важной задачей является поддержание онтологий в актуальном состоянии, что требует регуляр-

ного обновления и проверки терминов, а также интеграции новых знаний из экспериментальных данных.

Базы знаний, основанные на функциональных онтологиях, служат хранилищами аннотированной информации, которая включает преимущественно функциональные характеристики биомолекул [36—39]. В таких ресурсах данные аккумулируются из различных источников, включая экспериментальные результаты, вычислительные предсказания и литературные обзоры. Автоматизация процесса аннотации с использованием онтологий позволяет существенно повысить скорость и масштаб исследований, однако требует тщательной оценки качества и полноты аннотированных данных.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Бузанов Глеб Сергеевич, 2025 год

Список литературы

6. Use and misuse of the gene ontology annotations / S. Yon Rhee [h gp.] // Nature Reviews Genetics. — 2008. — T. 9, № 7. — C. 509—515.

7. Gene ontology: tool for the unification of biology / M. Ashburner [h gp.] // Nature genetics. — 2000. — T. 25, № 1. — C. 25—29.

8. Yandell, M. A beginner's guide to eukaryotic genome annotation / M. Yandell, D. Ence // Nature Reviews Genetics. — 2012. — T. 13, № 5. — C. 329—342.

9. A large-scale evaluation of computational protein function prediction / P. Radivojac [h gp.] // Nature methods. — 2013. — T. 10, № 3. — C. 221—227.

10. Langfelder, P. WGCNA: an R package for weighted correlation network analysis / P. Langfelder, S. Horvath // BMC bioinformatics. — 2008. — T. 9, № 1. —C. 559.

11. Machine learning for integrating data in biology and medicine: Principles, practice, and opportunities / M. Zitnik [h gp.] // Information Fusion. — 2019. — T. 50. — C. 71-91.

12. Ballouz, S. Using predictive specificity to determine when gene set analysis is biologically meaningful / S. Ballouz, P. Pavlidis, J. Gillis // Nucleic acids research. — 2017. — T. 45, № 4. — e20—e20.

13. PubTator central: automated concept annotation for biomedical full text articles / C.-H. Wei [h gp.] // Nucleic acids research. — 2019. — T. 47, W1. — W587—W593.

14. BioBERT: a pre-trained biomedical language representation model for biomedical text mining / J. Lee [h gp.] // Bioinformatics. — 2020. — T. 36, № 4. - C. 1234-1240.

15. Gaudet, P. Gene Ontology: Pitfalls, Biases, and Remedies. / P. Gaudet, C. Dessimoz // Methods in Molecular Biology. — 2017. — T. 1446. — C. 189-205.

16. Quantitative sequence-function relationships in proteins based on gene ontology / V. Sangar [h gp.] // BMC bioinformatics. — 2007. — T. 8, № 1. — C. 294.

17. Protein function annotation by homology-based inference / Y. Loewenstein [u gp.] // Genome biology. - 2009. - T. 10, № 2. - C. 207.

18. Altenhoff, A. M. Phylogenetic and functional assessment of orthologs inference projects and methods / A. M. Altenhoff, C. Dessimoz // PLoS computational biology. — 2009. — T. 5, № 1. — e1000262.

19. Basic local alignment search tool / S. F. Altschul [u gp.] // Journal of molecular biology. - 1990. - T. 215, № 3. - C. 403-410.

20. Altschul, S. F. Gapped BLAST and PSI-BLAST: a new generation of protein detabase search programs. / S. F. Altschul // Nucleic Acids Res. — 1997. — T. 25. — C. 3389.

21. Buchfink, B. Fast and sensitive protein alignment using DIAMOND /

B. Buchfink, C. Xie, D. H. Huson // Nature methods. — 2015. — T. 12, № 1. —

C. 59-60.

22. Steinegger, M. MMseqs2 enables sensitive protein sequence searching for the analysis of massive data sets / M. Steinegger, J. Söding // Nature biotechnology. — 2017. — T. 35, № 11. — C. 1026—1028.

23. Finn, R. D. HMMER web server: interactive sequence similarity searching / R. D. Finn, J. Clements, S. R. Eddy // Nucleic acids research. — 2011. — T. 39, suppl_2. - W29-W37.

24. Hernández-Salmerón, J. E. Progress in quickly finding orthologs as reciprocal best hits: comparing blast, last, diamond and MMseqs2 / J. E. Hernández-Salmerón, G. Moreno-Hagelsieb // BMC genomics. — 2020. — T. 21, № 1. —

C. 741.

25. Testing the ortholog conjecture with comparative functional genomic data from mammals / N. L. Nehrt [u gp.] // PLoS computational biology. — 2011. — T. 7, № 6. — e1002073.

26. Impact of the presence of paralogs on sequence divergence in a set of mouse-human orthologs / V. Nembaware [u gp.] // Genome Research. — 2002. — T. 12, № 9. — C. 1370-1376.

27. Sinha, S. Implementation of homology based and non-homology based computational methods for the identification and annotation of orphan enzymes: using Mycobacterium tuberculosis H37Rv as a case study / S. Sinha, A. M. Lynn,

D. K. Desai // BMC bioinformatics. — 2020. — T. 21, № 1. — C. 466.

28. Detecting false positive sequence homology: a machine learning approach / M. S. Fujimoto [h gp.] // BMC bioinformatics. — 2016. — T. 17, № 1. — C. 101.

29. Non-homology-based prediction of gene functions / X. Dai [h gp.]. — 2019.

30. Koonin, E. V. Sequence similarity analysis of Escherichia coli proteins: functional and evolutionary implications. / E. V. Koonin, R. L. Tatusov, K. E. Rudd // Proceedings of the National Academy of Sciences. — 1995. — T. 92, № 25. - C. 11921-11925.

31. Annotation error in public databases: misannotation of molecular function in enzyme superfamilies / A. M. Schnoes [h gp.] // PLoS computational biology. — 2009. — T. 5, № 12. — e1000605.

32. Ongoing shuffling of protein fragments diversifies core viral functions linked to interactions with bacterial hosts / B. J. Smug [h gp.] // Nature Communications. — 2023. — T. 14, № 1. — C. 7460.

33. Evaluation and integration of functional annotation pipelines for newly sequenced organisms: the potato genome as a test case / D. Amar [h gp.] // BMC plant biology. — 2014. — T. 14, № 1. — C. 329.

34. Data integration in biological research: an overview / V. Lapatas [h gp.] // Journal of Biological Research-Thessaloniki. — 2015. — T. 22, № 1. — C. 9.

35. Hoehndorf, R. The role of ontologies in biological and biomedical research: a functional perspective / R. Hoehndorf, P. N. Schofield, G. V. Gkoutos // Briefings in bioinformatics. — 2015. — T. 16, № 6. — C. 1069—1080.

36. Kanehisa, M. KEGG: kyoto encyclopedia of genes and genomes / M. Kanehisa, S. Goto // Nucleic acids research. — 2000. — T. 28, № 1. — C. 27—30.

37. Nishimura, D. BioCarta / D. Nishimura // Biotech Software & Internet Report: The Computer Software Journal for Scient. — 2001. — T. 2, № 3. — C. 117—120.

38. WikiPathways: a multifaceted pathway database bridging metabolomics to other omics research/D. N. Slenter [ugp.] //Nucleic acids research. — 2018. — T. 46, № D1. — C. D661—D667.

39. PID: the pathway interaction database / C. F. Schaefer [h gp.] // Nucleic acids research. — 2009. — T. 37, suppl_1. — C. D674—D679.

40. Zúñiga-León, E. NeVOmics: an enrichment tool for gene ontology and functional network analysis and visualization of data from OMICs technologies / E. Zúñiga-León, U. Carrasco-Navarro, F. Fierro // Genes. — 2018. — T. 9, № 12. — C. 569.

41. Fahad, M. Detection and resolution of semantic inconsistency and redundancy in an automatic ontology merging system / M. Fahad, N. Moalla, A. Bouras // Journal of Intelligent Information Systems. — 2012. — T. 39, № 2. — C. 535—557.

42. A conceptual model for ontology quality assessment: A systematic review / R. Wilson [h gp.] // Semantic Web. — 2023. — T. 14, № 6. — C. 1051—1097.

43. Predicting gene ontology biological process from temporal gene expression patterns / A. L^greid [h gp.] // Genome research. — 2003. — T. 13, № 5. — C. 965-979.

44. Assessing the practice of biomedical ontology evaluation: Gaps and opportunities / M. Amith [h gp.] // Journal of biomedical informatics. — 2018. — T. 80. — C. 1-13.

45. Machine learning with biomedical ontologies / M. Kulmanov [h gp.] // biorxiv. — 2020.

46. Wong, K. H. Exploring the unknown: how can we improve single-cell RNAseq cell type annotations in non-model organisms? / K. H. Wong, N. A. Rodriguez, N. Traylor-Knowles // Integrative and comparative biology. — 2024. — T. 64, № 5. — C. 1291-1299.

47. Vandepoele, K. Northern light reviews-Application of orthology and network biology to infer gene functions in non-model plants / K. Vandepoele, S. Thierens, M. Van Bel // Physiologia Plantarum. — 2024. — T. 176, № 4. — e14441.

48. Koonin, E. V. Orthologs, paralogs, and evolutionary genomics / E. V. Koonin // Annu. Rev. Genet. — 2005. — T. 39, № 1. — C. 309—338.

49. Tulpan, D. The Plant Orthology Browser: An Orthology and Gene-Order Visualizer for Plant Comparative Genomics / D. Tulpan, S. Leger // The Plant Genome. — 2017. — T. 10, № 1. — plantgenome2016—08.

50. Standardized benchmarking in the quest for orthologs / A. M. Altenhoff [h gp.] // Nature methods. — 2016. — T. 13, № 5. — C. 425—430.

51. Birchler, J. A. The multiple fates of gene duplications: deletion, hypofunctionalization, subfunctionalization, neofunctionalization, dosage balance constraints, and neutral variation / J. A. Birchler, H. Yang // The Plant Cell. - 2022. - T. 34, № 7. - C. 2466-2474.

52. The role of lineage-specific gene family expansion in the evolution of eukaryotes / O. Lespinet [h gp.] // Genome research. — 2002. — T. 12, № 7. — C. 1048-1059.

53. Freitas, L. Expansions and contractions in gene families of independently-evolved blood-feeding insects / L. Freitas, M. F. Nery // BMC Evolutionary Biology. — 2020. — T. 20, № 1. — C. 87.

54. Giant lungfish genome elucidates the conquest of land by vertebrates / A. Meyer [h gp.] // Nature. — 2021. — T. 590, № 7845. — C. 284—289.

55. The essentiality status of mouse duplicate gene pairs correlates with developmental co-expression patterns / M. Kabir [h gp.] // Scientific Reports. — 2019. — T. 9, № 1.-C. 3224.

56. Expression pattern similarities support the prediction of orthologs retaining common functions after gene duplication events / M. Das [h gp.] // Plant Physiology. — 2016. — T. 171, № 4. — C. 2343—2357.

57. Comparative co-expression analysis in plant biology / S. Movahedi [h gp.] // Plant, cell & environment. — 2012. — T. 35, № 10. — C. 1787—1798.

58. Gupta, C. Recent advances in gene function prediction using context-specific coexpression networks in plants / C. Gupta, A. Pereira // F1000Research. — 2019. — T. 8. — F1000—Faculty.

59. An acidic loop and cognate phosphorylation sites define a molecular switch that modulates ubiquitin charging activity in Cdc34-like enzymes / E. Papaleo [h gp.] // PLoS computational biology. — 2011. — T. 7, № 5. — e1002056.

60. PlaNet: combined sequence and expression comparisons across plant networks derived from seven species / M. Mutwil [h gp.] // The Plant Cell. — 2011. — T. 23, № 3. — C. 895-910.

61. Yu, H. Systematic analysis of RNA-seq-based gene co-expression across multiple plants / H. Yu, B. Jiao, C. Liang // bioRxiv. — 2017. — C. 139923.

62. Proost, S. CoNekT: an open-source framework for comparative genomic and transcriptomic network analyses / S. Proost, M. Mutwil // Nucleic acids research. —2018. — T. 46, W1. — W133—W140.

63. Cross-species network analysis uncovers conserved nitrogen-regulated network modules in rice / M. Obertello [h gp.] // Plant physiology. — 2015. — T. 168, № 4. — C. 1830-1843.

64. Duarte, G. T. A pipeline for non-model organisms for de novo transcriptome assembly, annotation, and gene ontology analysis using open tools: case study with scots pine / G. T. Duarte, P. Y. Volkova, S. A. Geras'kin // Bio-protocol. — 2021. — T. 11, № 3. — e3912—e3912.

65. S Gelfand, M. Bioinformatics and evolution of non-model organisms / M. S Gelfand // 4th Belgrade Bioinformatics Conference. T. 4. — Belgrade: Institute of molecular genetics, genetic engineering. 2023. — C. 16—16.

66. Comprehensive RNA-Seq analysis pipeline for Non-Model organisms and its application in Schmidtea mediterranea / Y. Wang [h gp.] // Genes. — 2023. — T. 14, № 5. — C. 989.

67. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics / G. S. Gulati [h gp.] // Nature Reviews Molecular Cell Biology. - 2025. - T. 26, № 1. - C. 11-31.

68. Ovens, K. Comparative analyses of gene co-expression networks: Implementations and applications in the study of evolution / K. Ovens,

B. F. Eames, I. McQuillan//Frontiers in genetics. — 2021. — T. 12. — C. 695399.

69. Using ExpressAnalyst for comprehensive gene expression analysis in model and non-model organisms / J. Ewald [h gp.] // Current Protocols. — 2023. — T. 3, № 11. —e922.

70. Milano, M. Challenges and limitations of biological network analysis / M. Milano, G. Agapito, M. Cannataro // BioTech. — 2022. — T. 11, № 3. —

C. 24.

71. Current and future directions in network biology / M. Zitnik [h gp.]. — 2024.

72. Biomolecule and bioentity interaction databases in systems biology: a comprehensive review / F. A. Baltoumas [h gp.] // Biomolecules. — 2021. — T. 11, № 8. — C. 1245.

73. Protein-protein interaction (PPI) network analysis reveals important hub proteins and sub-network modules for root development in rice (Oryza sativa) / S. S. Wimalagunasekara [h gp.] // Journal of Genetic Engineering and Biotechnology. — 2023. — T. 21, № 1. — C. 69.

74. Nithya, C. Dissection of hubs and bottlenecks in a protein-protein interaction network / C. Nithya, M. Kiran, H. A. Nagarajaram // Computational Biology and Chemistry. — 2023. — T. 102. — C. 107802.

75. Depuydt, T. Multi-omics network-based functional annotation of unknown Arabidopsis genes / T. Depuydt, K. Vandepoele // The Plant Journal. — 2021. — T. 108, № 4. — C. 1193-1212.

76. Kavran, A. J.Denoising large-scale biological data using network filters / A. J. Kavran, A. Clauset // BMC bioinformatics. — 2021. — T. 22, № 1. — C. 157.

77. Single-cell transcriptomics reveals gene expression dynamics of human fetal kidney development / M. Hochane [h gp.] // PLoS Biology. — 2019. — T. 17, № 2. — e3000152.

78. Ashworth, A. Genetic interactions in cancer progression and treatment / A. Ashworth, C. J. Lord, J. S. Reis-Filho // Cell. - 2011. - T. 145, № 1. -C. 30-38.

79. Cano-Gamez, E. From GWAS to function: using functional genomics to identify the mechanisms underlying complex diseases / E. Cano-Gamez, G. Trynka // Frontiers in genetics. — 2020. — T. 11. — C. 424.

80. Systematic analysis of MYB family genes in potato and their multiple roles in development and stress responses / X. Li [h gp.] // Biomolecules. — 2019. — T. 9, № 8. — C. 317.

81. Comprehensive analysis of ubiquitously expressed genes in humans from a data-driven perspective / J. Gu [h gp.] // Genomics, Proteomics & Bioinformatics. — 2023. - T. 21, № 1. - C. 164-176.

82. GeneSigDB—a curated database of gene expression signatures / A. C. Culhane [h gp.] // Nucleic acids research. — 2010. — T. 38, suppl_1. — C. D716—D725.

83. Molecular signatures database (MSigDB) 3.0 / A. Liberzon [h gp.] // Bioinformatics. — 2011. — T. 27, № 12. — C. 1739—1740.

84. msigdbr: MSigDB gene sets for multiple organisms in a tidy data format / I. Dolgalev [h gp.] // R package version. — 2022. — T. 7, № 1.

85. Kaushal, P. Network-based disease gene prioritization based on protein-protein interaction networks / P. Kaushal, S. Singh // Network Modeling Analysis in Health Informatics and Bioinformatics. — 2020. — T. 9, № 1. — C. 55.

86. Clustering biological annotations and gene expression data to identify putatively co-regulated biological processes / C. Henegar [h gp.] // Journal of bioinformatics and computational biology. — 2006. — T. 4, № 04. — C. 833-852.

87. Datta, S. Methods for evaluating clustering algorithms for gene expression data using a reference set of functional classes / S. Datta, S. Datta // BMC bioinformatics. — 2006. — T. 7, № 1. — C. 397.

88. Affinity clustering: Hierarchical clustering at scale / M. Bateni [h gp.] // Advances in Neural Information Processing Systems. — 2017. — T. 30.

89. hdbscan: Hierarchical density based clustering. / L. McInnes, J. Healy, S. Astels [h gp.] // J. Open Source Softw. - 2017. - T. 2, № 11. - C. 205.

90. Hartigan, J. A. Algorithm AS 136: A k-means clustering algorithm / J. A. Hartigan, M. A. Wong // Journal of the royal statistical society. series c (applied statistics). — 1979. — T. 28, № 1. — C. 100—108.

91. Saadeh, H. Application of K-means clustering to identify similar gene expression patterns during erythroid development / H. Saadeh, R. Al Fayez, B. Elshqeirat // Int J Mach Learn Comput. — 2020. — T. 10, № 3. — C. 452—457.

92. Rousseeuw, P. J. Silhouettes: a graphical aid to the interpretation and validation of cluster analysis / P. J. Rousseeuw // Journal of computational and applied mathematics. — 1987. — T. 20. — C. 53—65.

93. Thorndike, R. L. Who belongs in the family? / R. L. Thorndike // Psychometrika. — 1953. — T. 18, № 4. — C. 267—276.

94. Dimensionality reduction and louvain agglomerative hierarchical clustering for cluster-specified frequent biomarker discovery in single-cell sequencing data / S. Seth [h gp.] // Frontiers in genetics. — 2022. — T. 13. — C. 828479.

95. Analyzing a co-occurrence gene-interaction network to identify disease-gene association / A. Al-Aamri [h gp.] // BMC bioinformatics. — 2019. — T. 20, № 1.-C. 70.

96. Ow, G. S. Multiple signatures of a disease in potential biomarker space: Getting the signatures consensus and identification of novel biomarkers / G. S. Ow, V. A. Kuznetsov // BMC genomics. — 2015. — T. 16, Suppl 7. — S2.

97. Systematic noise degrades gene co-expression signals but can be corrected / S. Freytag [h gp.] // BMC bioinformatics. — 2015. — T. 16, № 1. — C. 309.

98. The DAVID Gene Functional Classification Tool: a novel biological module-centric algorithm to functionally analyze large gene lists / D. W. Huang [h gp.] // Genome biology. — 2007. — T. 8, № 9. — R183.

99. Banu, P. ^.Performance analysis of hard and soft clustering approaches for gene expression data / P. N. Banu, S. Andrews // International Journal of Rough Sets and Data Analysis (IJRSDA). - 2015. - T. 2, № 1. - C. 58-69.

100. Consortium, G. O. The Gene Ontology (GO) database and informatics resource / G. O. Consortium // Nucleic acids research. — 2004. — T. 32, suppl_1. — C. D258—D261.

101. Consortium, G. O. The gene ontology resource: 20 years and still GOing strong / G. O. Consortium // Nucleic acids research. — 2019. — T. 47, № D1. — C. D330—D338.

102. Creating the gene ontology resource: design and implementation / G. O. Consortium [h gp.] // Genome research. — 2001. — T. 11, № 8. — C. 1425-1433.

103. GeneAgent: Self-verification language agent for gene set knowledge discovery using domain databases / Z. Wang [h gp.] // arXiv preprint arXiv:2405.16205. — 2024.

104. Enrichr: a comprehensive gene set enrichment analysis web server 2016 update / M. V. Kuleshov [h gp.] // Nucleic acids research. — 2016. — T. 44, W1. — W90—W97.

105. Applying support vector machines for gene ontology based gene function prediction / A. Vinayagam [h gp.] // BMC bioinformatics. — 2004. — T. 5, № 1. — C. 116.

106. Neural network and random forest models in protein function prediction / K. Hakala [h gp.] // IEEE/ACM transactions on computational biology and bioinformatics. — 2020. — T. 19, № 3. — C. 1772—1781.

107. An ensemble approach to predict binding hotspots in protein-RNA interactions based on SMOTE data balancing and Random Grouping feature selection strategies / T. Zhou [h gp.] // Bioinformatics. — 2022. — T. 38, № 9. — C. 2452-2458.

108. Jung, J. Automatic annotation of protein functional class from sparse and imbalanced data sets / J. Jung, M. R. Thon // VLDB workshop on data mining and bioinformatics. — Springer. 2006. — C. 65—77.

109. Kirboga, K. K. Bladder cancer gene expression prediction with explainable algorithms / K. K. Kirboga // Neural Computing and Applications. — 2024. — T. 36, № 4. — C. 1585—1597.

110. Haji, A. Comparative analysis of autoencoder and PCA for dimensionality reduction in gene expression data / A. Haji. — 2024.

111. BioGPT: generative pre-trained transformer for biomedical text generation and mining / R. Luo [h gp.] // Briefings in bioinformatics. — 2022. — T. 23, № 6. — bbac409.

112. DeepBIO: an automated and interpretable deep-learning platform for high-throughput biological sequence prediction, functional annotation and visualization analysis / R. Wang [h gp.] // Nucleic acids research. — 2023. — T. 51, № 7. — C. 3017—3029.

113. McDonnell, E. Manual gene curation and functional annotation / E. McDonnell, K. Strasser, A. Tsang // Fungal Genomics: Methods and Protocols. — Springer, 2018. — C. 185-208.

114. A guide to best practices for Gene Ontology (GO) manual annotation / R. Balakrishnan [h gp.] // Database. — 2013. — T. 2013. — bat054.

115. Consortium, t/.UniProt: a worldwide hub of protein knowledge / U. Consortium // Nucleic acids research. — 2019. — T. 47, № D1. — C. D506—D515.

116. Harnessing large language models (LLMs) for candidate gene prioritization and selection / M. Toufiq [h gp.] // Journal of translational medicine. — 2023. — T. 21, № 1.-C. 728.

117. Enhancing gene set overrepresentation analysis with large language models / J. Zhu [h gp.] // Bioinformatics Advances. — 2025. — T. 5, № 1. — vbaf054.

118. Genegpt: Augmenting large language models with domain tools for improved access to biomedical information / Q. Jin [h gp.] // Bioinformatics. — 2024. — T. 40, № 2. — btae075.

119. Large language models in bioinformatics: applications and perspectives / J. Liu [h gp.] // arXiv preprint arXiv:2401.04155. — 2024.

120. Automated genome annotation and pathway identification using the KEGG Orthology (KO) as a controlled vocabulary / X. Mao [h gp.] // Bioinformatics. — 2005. — T. 21, № 19. — C. 3787—3793.

121. Hoff, K. J. Current methods for automated annotation of protein-coding genes / K. J. Hoff, M. Stanke // Current Opinion in insect science. — 2015. — T. 7. — C. 8-14.

122. Ruiz-Perez, C. A. MicrobeAnnotator: a user-friendly, comprehensive functional annotation pipeline for microbial genomes / C. A. Ruiz-Perez, R. E. Conrad, K. T. Konstantinidis // BMC bioinformatics. — 2021. — T. 22, № 1. — C. 11.

123. The development of PIPA: an integrated and automated pipeline for genome-wide protein function annotation / C. Yu [h gp.] // BMC bioinformatics. — 2008. — T. 9, № 1. — C. 52.

124. A high resolution map of the Arabidopsis thaliana developmental transcriptome based on RNA-seq profiling / A. V. Klepikova [h gp.] // The Plant Journal. — 2016. - T. 88, № 6. - C. 1058-1070.

125. High-resolution transcriptome atlas and improved genome assembly of common buckwheat, Fagopyrum esculentum / A. A. Penin [h gp.] // Frontiers in plant science. — 2021. — T. 12. — C. 612382.

126. An expanded maize gene expression atlas based on RNA sequencing and its use to explore root development / S. C. Stelpflug [h gp.] // The plant genome. — 2016. — T. 9, № 1. — plantgenome2015—04.

127. Emms, D. M. OrthoFinder: phylogenetic orthology inference for comparative genomics / D. M. Emms, S. Kelly // Genome biology. — 2019. — T. 20, № 1. — C. 238.

128. Proteinortho: detection of (co-) orthologs in large-scale analysis / M. Lechner [h gp.] // BMC bioinformatics. — 2011. — T. 12, № 1. — C. 124.

129. Interspecific comparison of gene expression profiles using machine learning / A. S. Kasianov [h gp.] // PLOS Computational Biology. — 2023. — T. 19, № 1. — e1010743.

130. Deep learning for biology / S. Webb [h gp.] // Nature. — 2018. — T. 554, №7693. —C. 555—557.

131. Gene expression value prediction based on XGBoost algorithm / W. Li [h gp.] // Frontiers in genetics. — 2019. — T. 10. — C. 1077.

132. Evolutionarily informed machine learning enhances the power of predictive gene-to-phenotype relationships/ C.-Y. Cheng [hgp.] //Nature communications. — 2021. — T. 12, № 1.-C. 5627.

133. Liao, B.-Y. Evolutionary conservation of expression profiles between human and mouse orthologous genes / B.-Y. Liao, J. Zhang // Molecular biology and evolution. — 2006. — T. 23, № 3. — C. 530—540.

134. OpenOrd: an open-source toolbox for large graph layout / S. Martin [h gp.] // Visualization and data analysis 2011. T. 7868. — SPIE. 2011. — C. 45—55.

135. Newman, M. E. Mixing patterns in networks / M. E. Newman // Physical review E. - 2003. - T. 67, № 2. - C. 026126.

136. Jaccard, P. Distribution de la flore alpine dans le bassin des Dranses et dans quelques régions voisines / P. Jaccard // Bull Soc Vaudoise Sci Nat. — 1901. — T. 37.— C. 241—272.

137. Higham, D. J. Spectral clustering and its use in bioinformatics / D. J. Higham, G. Kalna, M. Kibble // Journal of computational and applied mathematics. — 2007. — T. 204, № 1. — C. 25—37.

138. Kaufman, L. Partitioning around medoids (program pam) / L. Kaufman // Wiley series in probability and statistics. — 1990. — T. 344. — C. 68—125.

139. Nguyen, T.-D. Efficient agglomerative hierarchical clustering for biological sequence analysis / T.-D. Nguyen, C.-K. Kwoh // TENCON 2015-2015 IEEE Region 10 Conference. — IEEE. 2015. — C. 1—3.

140. Metascape provides a biologist-oriented resource for the analysis of systemslevel datasets / Y. Zhou [и др.] // Nature communications. — 2019. — Т. 10, № 1.-С. 1523.

141. Hanahan, D. The hallmarks of cancer / D. Hanahan, R. A. Weinberg // cell. — 2000. — Т. 100, № 1. — С. 57—70.

142. AmiGO: online access to ontology and annotation data / S. Carbon [и др.] // Bioinformatics. — 2009. — Т. 25, № 2. — С. 288—289.

143. From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline / T. Li [и др.] // arXiv preprint arXiv:2406.11939. — 2024.

144. Gusev, I. PingPong: a benchmark for role-playing language models with user emulation and multi-model evaluation / I. Gusev // arXiv preprint arXiv:2409.06820.-2024.

145. Kinikoglu, I. Evaluating ChatGPT and Google Gemini performance and implications in Turkish dental education / I. Kinikoglu // Cureus. — 2025. — Т. 17, № 1.

146. Gpt-4o system card / A. Hurst [и др.] // arXiv preprint arXiv:2410.21276. — 2024.

147. Anthropic, A. The claude 3 model family: Opus, sonnet, haiku / A. Anthropic // Claude-3 Model Card. - 2024. - Т. 1, № 1. - С. 4.

148. Deepseek-v3 technical report/A. Liu [и др.] // arXiv preprintarXiv:2412.19437. — 2024.

4. Бузанов, Г. С. Построение однозначной функциональной аннотации генов с помощью метаанализа на основе графов / Г. С. Бузанов, В. Ю. Макеев // Биоинформатика регуляции и структуры геномов / Системная биология. 14-я международная мультиконференция. Тезисы докладов. — 2024.

5. Бузанов, Г. С. ZulGene - модель генерации текстовых описаний наборов генов / Г. С. Бузанов, А. Д. Воронов, В. Ю. Макеев // Сборник тезисов 67-ой Всероссийской научной конференции МФТИ. — 2025.

1. Interspecific comparison of gene expression profiles using machine learning / A. S. Kasianov [и др.] // PLOS Computational Biology. — 2023. — Т. 19.

2. Buzanov, G. Exclusive functional signatures for gene annotation with vast OpenOrd layout / G. Buzanov, V. Makeev // Algorithms for Molecular Biology. — 2025. — Т. 20.

3. Бузанов, Г. С. ZUL-Gene: Модель генерации текстовых описаний наборов генов / Г. С. Бузанов, А. Д. Воронов, В. Ю. Макеев // Труды МФТИ. — 2025.— Т. 17.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.