Методы оценки качества линейных классификаторов для анализа последовательностей микроРНК тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Жиянов Антон Павлович

  • Жиянов Антон Павлович
  • кандидат науккандидат наук
  • 2026, «Национальный исследовательский университет «Высшая школа экономики»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 106
Жиянов Антон Павлович. Методы оценки качества линейных классификаторов для анализа последовательностей микроРНК: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет «Высшая школа экономики». 2026. 106 с.

Оглавление диссертации кандидат наук Жиянов Антон Павлович

Введение

Глава 1. Методы оценки качества классификации

1.1 Метрики качества классификации

1.2 Свойства метрик классификации

1.2.1 Максимальность и минимальность

1.2.2 Симметричность

1.2.3 Расстояние

1.2.4 Монотонность

1.2.5 Несмещенность

1.3 Устранение особенностей

1.4 Теорема о несовместности

1.4.1 Отказ от расстояния

1.4.2 Отказ от несмещенности

1.5 Согласованность метрик

1.6 Доказательства утверждений

1.6.1 Проверка свойств метрик

1.6.2 Свойства многоклассовых усреднений

1.7 Заключение

Глава 2. Методы верификации линейных классификаторов

2.1 Оценки вероятности линейной разделимости

2.1.1 Условная вероятность

2.1.2 Безусловная вероятность

2.2 Критерии однородности

2.3 Перестановочный тест

2.4 Синтетические эксперименты

2.4.1 Точность верхник оценок

2.4.2 Мощность критериев

2.5 Верификация биомедицинских классификаторов

2.6 Доказательства утверждений

2.7 Заключение

Глава 3. Классификатор для анализа изоформ микроРНК

3.1 Формирование изоформ не зависит от типа рака

3.2 Мотивы гомогенного и гетерогенного расщепления

3.3 Классификатор для предсказания гомогенности

3.3.1 Построение классификатора

3.3.2 Качество классификатора

3.3.3 Верификация классификатора

3.4 Экспериментальная валидация трансдукцией

3.5 Материалы и методы

3.6 Заключение

Заключение

Список рисунков

Список таблиц

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Методы оценки качества линейных классификаторов для анализа последовательностей микроРНК»

Введение

Классификация — классическая задача машинного обучения, заключающаяся в предсказании по некоторому фиксированному набору признаков определенного класса, принадлежащего заранее известному списку. В частности, если количество классов равно двум, то классификация называется бинарной, а если классов больше, то многоклассовой.

Для оценки результатов классификации необходимо сравнить предсказанные классы с истинной разметкой классифицируемой выборки. Для этого используются различные функционалы, называемые метриками. Среди них хорошо известны точность, чувствительность, специфичность и другие1.

Формально под метрикой качества классификации подразумевается следующий функционал. Пусть n Е N — размер классифицируемой выборки, а m ^ 2 — число классов. Обозначим за C матрицу ошибок, каждый элемент Cj которой является числом элементов выборки, соответствующих истинной метке i ^ m и предсказанной метке j ^ m. Тогда под метрикой понимается произвольное отображение из множества матриц ошибок в R. Однако из этого определения не следует, что значение метрики связано с тем, насколько предсказанная разметка совпадает с истинной.

В работах [2; 3] было показано, что различные метрики сильно отличаются друг от друга, ранжируя результаты классификации по-разному. Например, в случае сильного дисбаланса размера классов, точность слабо учитывает ошибки в классах меньших размеров. Как следствие, выбор подходящей метрики является важной задачей, так как именно от нее зависит, какой из алгоритмов классификации будет считаться наиболее качественным.

Естественный способ сравнить различные метрики между собой заключается в том, чтобы проверить наличие у них определенных свойств, называемых аксиомами. В работе [4] некоторые из таких свойств описываются неформально. Затем, в работе [5] они получают формальное определение. Так, например, свойство FIX соответствует свойству максимальности

1 Обзор существующих метрик можно найти в работе [1].

и минимальности (см. Раздел 1.2.1), SYM — симметричности (см. Раздел 1.2.2), а MON связано со свойством монотонности (см. Раздел 1.2.4). Свойства CON, SDE и WDE не исследуются в данной работе, так как они определяют поведение метрики в случаях, когда какие-то из классов пусты, а анализируемые метрики доопределяются в этих граничных случаях естественным образом (см. Раздел 1.3).

Другое важное свойство, рассматриваемое в работе [5], — IMB. Оно требует, чтобы значение метрики для классификатора, всегда предсказывающего только один из классов, не зависело от размера классифицируемой выборки. Если дополнительно потребовать, чтобы это значение также не зависело от предсказываемого класса, то это свойство будет соответствовать несмещенности (см. Раздел 1.2.5).

Пользуясь предложенными аксиомами, авторы работы [5] сравнивают различные метрики между собой. В частности, они критикуют корреляцию Мэтьюса, хотя, как будет показано далее, при правильном доопределении она является одной из оптимальных метрик (см. Раздел 1.4.1).

Данная работа существенно отличается от работы [5]. Во-первых, здесь рассматривается более обширный список метрик и свойств, а также проверяется справедливость каждого свойства для каждой метрики по отдельности (см. Разделы 1.2 и 1.6.1). Во-вторых, здесь анализируется возможность одновременного выполнения наиболее важных свойств (см. Раздел 1.4) и предлагается новое семейство метрик, удовлетворяющих большинству из них (см. Разделы 1.4.1 и 1.4.2). Наконец, в этой работе исследуются различные способы доопределения метрик на случай многоклассовой классификации (см. Разделы 1.1 и 1.6.2).

Похожий анализ был проделан в работе [6], где авторы проверяют некотрые метрики на симметричность и инвариантность относительно масштаба (см. Разделы 1.2.2 и 1.4.1). Однако такие важные и, как будет показано, наиболее сложные для проверки свойства, как расстояние, монотонность и несмещенность (см. Разделы 1.2.3, 1.2.4 и 1.2.5), в этой работе не рассматривались вовсе.

Также существует ряд работ, подробно исследующих свойства отдельных метрик, например, коэффициента Коэна [7; 8], энтропии матрицы ошибок [9] или сбалансированной точности [10]. В то же время некоторые работы посвящены исследованию метрики AUC, равной площади под ROC-

кривой. Например, в работе [11] приведен теоретический анализ того, как значение АиС соотносится с точностью. В другой работе [12], посвященной связи АиС и точности, формально вводится понятие согласованности пары метрик (см. Раздел 1.5). Стоит отметить, что хотя АиС и является широко используемой метрикой качества классификации, тем не менее ее свойства не анализируются в данной работе, так как она не является пороговой метрикой (см. Раздел 1.1).

В контексте исследования свойств отдельных метрик авторы работы [8] приходят к выводу, что корреляция Мэтьюса является более предпочтительной в сравнении с коэффициентом Коэна, так как последний не удовлетворяет свойству строгой монотонности. В работе [13] предлагается использовать корреляцию Мэтьюса вместо F-меры и точности. Это предложение обосновывается практическими соображениями, которые, в итоге, сводятся к проверке несмещенности. В данной работе доказывается, что корреляция более предпочтительна по сравнению с F-мерой, точностью или коэффициентом Коэна, но, в отличие от предыдущих работ, этот вывод является результатом формальной проверки всех упомянутых выше свойств.

Существуют исследования, посвященные эмпирическому сравнению различных метрик между собой (см., например, работы [3; 14; 15]). В частности, в работе [3] фокус сделан на поведении метрик на несбалансированных по размеру классах. В данной работе также представлены результаты ряда экспериментов, ранжирующих метрики между собой, в том числе, на основе свойства согласованности (см. Раздел 1.5).

Данное исследование отчасти мотивировано работой [16], в которой проведен систематический анализ метрик, оценивающих результаты кластеризации. В данной работе многие предложенные там свойства переносятся на задачу классификации (см. Таблицу 2), а также добавляются новые свойства, метрики и теоретические результаты. Как было отмечено ранее, некоторые из рассматриваемых свойств довольно интуитивны и просты для проверки (например, симметричность, максимальность и минимальность), в то время как другие являются довольно сложными. Среди таких свойств стоит выделить несмещенность, также рассматриваемую ранее в работе [16].

Анализ свойств в совокупности приводит к следующему выводу: не существует одновременно монотонной и несмещенной метрики, являющейся в то же время и расстоянием (см. Теорема 1). Однако, как показано в дан-

ной работе, отказавшись от свойства расстояния, можно получить новое семейство метрик, обобщающее корреляцию Мэтьюса и удовлетворяющее всем оставшимся свойствам, включая несмещенность (см. Утверждение 2). Помимо корреляции это семейство также включает в себя новую метрику, которая получила название симметричной сбалансированной точности. Эта метрика ранее не использовалась в рамках задачи классификации, зато широко применялась при оценке качества кластеризации, где была известна как мера Сокала—Сниса. Также в работе показано, что если вместо расстояния отказаться от свойства несмещенности, при этом оставив его ослабленный вариант, то арккосинус корреляции Мэтьюса будет метрикой, удовлетворяющей всем оставшимся свойствам (см. Утверждение 4).

Однако перед тем как измерить качество классификатора, его необходимо построить, то есть выбрать и обучить соответствующий метод классификации. Для биомедицинских задач особенно важны линейные методы. С одной стороны, линейные классификаторы не способны выявлять сложные закономерности, возникающие при работе с большими объемами данных. С другой стороны, алгоритмы обучения таких классификаторов менее затратны с точки зрения используемых вычислительных ресурсов. Однако важнейшим достоинством линейных классификаторов является их интерпретируемость. Действительно, линейные классификаторы каждому признаку ставят в соответствие некоторый вес, отражающий его значимость. В результате эта процедура позволяет выделять наиболее важные признаки, разделяющие классифицируемые группы.

Существует большое количество метрик, удовлетворяющих тем или иным свойствам, однако среди них точность считается наиболее простой и, как следствие, часто употребимой в прикладных задачах и, в частности, в биомедицинских приложениях. Многие тестовые системы, разработанные в этой области и основанные на линейных классификаторах, используют небольшое количество генов-признаков для обнаружения специфических патологий (см., например, работы [17—19]). В результате пары генов часто используются в качестве отправной точки для построения классификаторов, с ограниченным числом признаков2. С точки зрения биоинформатики построение таких классификаторов начинается с анализа матриц экспрессии, включающих данные о концентрации тысяч генов в рассматриваемых

2Такой подход был использован в работе [20].

образцах. Из этой матрицы выбираются пары генов, на основе экспрессии которых обучаются различные классификаторы. Наконец, на основе заданной метрики выбираются пары-маркеры, минимизирующие количество ошибок при классификации.

Однако возникает важный вопрос: действительно ли отобранные классификаторы отражают различия между классами, или наблюдаемое (возможно, небольшое) количество ошибок, измеренное той или иной метрикой, обусловлено исключительно тестированием большого числа пар (эффект множественного тестирования)? В данной работе показывается, что верхние оценки вероятности почти линейной разделимости (то есть разделимости с некоторым числом ошибок) могут быть использованы для ответа на этот вопрос в практических задачах (см. Раздел 2.1). Кроме того, эта вероятность связывается с р-значением соответствующего статистического критерия, что сводит задачу верификации «случайности» линейного классификатора к задаче тестирования гипотезы однородности (см. Раздел 2.2).

Наиболее качественные классификаторы (то есть оптимизирующие заданную метрику) часто тестируются на независимом тестовом наборе данных. В этом случае проблема множественного тестирования не возникает, однако возникает проблема другого рода. Обычно размер тестовых данных существенно ниже размера данных, на которых проводилось обучение, что снижает достоверность качества классификации. В данной работе показывается, что в реальных сценариях даже небольшой тестовой выборки может быть достаточно для подтверждения статистической значимости «неслучайности» классификатора.

Формально пусть У = (Уг, г ^ к), к е N и Z = (2г, г < I), I е N — две независимые выборки, принадлежащие К^, й е N. Предположим, что У и 2 состоят из независимых одинаково распределенных случайных векторов, взятых из распределений Ту и Тz соответственно. Обозначим за X = {Хг, г ^ п} — объединение этих наборов, где п = к + I. Предположим, что У и 2 линейно разделимы, то есть нашелся линейный классификатор, безошибочно разделяющий классы У и 2 .В этом случае естественно предположить, что Ту = Тz. Но какова вероятность события Ао, при котором два набора линейно разделимы при условии, что их распределения совпадают?

Линейная разделимость данных экспрессии генов ранее исследовалась в работе [21]. Авторы разработали алгоритм, проверяющий это свойство для любой пары генов за константное время в среднем. Кроме того, они показали, что количество пар генов, по экспрессии которых можно разделить нормальные и опухолевые образцы, было значительно выше ожидаемого.

В сравнении с работой [21], в данной работе задача линейной разделимости обобщается в нескольких направлениях. А именно, рассматриваются более общие события Ат и А^т = и^т Аг, определяющие почти линейную разделимость ровно с т и не более чем с т ошибками, где т Е М, и устанавливаются верхние оценки вероятности Р (А^т) в двумерном случае, используя два подхода.

В первом подходе анализируется Р (А^т | X = S) условная вероятность, где 8 = {хг Е К2, г ^ п} — множество фиксированных наблюдений. При условии однородности Ту = все Ск возможных разбиений 8 на классы У и 2 равновероятны. В этом случае устанавливаются верхние оценки условной вероятности Р (А^т | X = 8) и строится условный статистический критерий, предполагающий 8 фиксированным (см. Разделы 2.1.1 и 2.2).

Во втором подходе предлагаются верхние оценки безусловной вероятности Р (А^т) и строится интегральный статистический критерий, предполагающий, что множество 8 разыграно из некоторого заранее известного класса распределений (см. Разделы 2.1.2 и 2.2). Хотя полученные оценки сильно опираются на результаты работ [22—26], в данной работе предлагается новый статистический взгляд на проблему «случайности» линейных классификаторов. Кроме того, в Теореме 5 устанавливается новая верхняя оценка вероятности Р (А^т) в случае нормально распределенных выборок, которые представляют особый интерес в биомедицинских приложениях. Это объясняется тем, что большинство генов имеет нормальное или логнормаль-ное распределение уровней экспрессии .

Также в работе разрабатывается алгоритм, вычисляющий вероятности Р (А'^т | X = £) и Р (А^т I X = £) для заданного множества 8 (см. Раздел 2.3). Событие А'^т отличается от А^т тем, что, в то время как А^т контролирует максимальное число ошибочно классифицируемых точек, А'^т характеризует точность классификатора, то есть суммарное число ошибок.

3Это наблюдение согласуется с работой [27].

По сравнению с алгоритмом, представленным в работе [21], рассматриваемый алгоритм применим для многомерных данных, а также в случае почти линейной разделимости.

Используя синтетические данные, показывается, что полученные верхние оценки вероятности почти линейной разделимости являются довольно точными в случае нормального распределения. Кроме того, разработанные статистические критерии применяются к классификаторам, полученным в работе [20]. Эти классификаторы предназначены для обнаружения рецидива рака молочной железы у ^^-положительных пациентов. В результате подтверждается ключевая роль пары генов ELOVL5 и IGFBP6 в предсказании рецидива, доказывая «неслучайность» соответствующего классификатора.

В качестве практического применения разработанных методов в данной работе выбирается задача о предсказании изоформ микроРНК. Мик-роРНК — это короткие некодирующие РНК, состоящие в среднем из 22 нук-леотидов, играющие важную роль в регуляции экспрессии матричных РНК (мРНК, mRNA). А именно, молекулы микроРНК связываются с мРНК-

4

мишенями, приводя к деградации или подавлению трансляции последних . Как следствие, изменения в функциональной активности микроРНК вносят существенный вклад в патогенез множества заболеваний, включая, например, рак (см. работу [29]), а также вирусные инфекции (см. работу [30]).

В работе [31] было показано, что в клетках микроРНК присутствуют в нескольких формах, называемых изоформами (isomiRs). Изоформы одной микроРНК отличаются друг от друга на 1, 2 или 3 нуклеотида на 5' и/или 3'-концах молекулы.

Один из ключевых факторов, определяющих необходимость изучения изоформ, заключается в том, что различные изоформы одной и той же мик-роРНК могут иметь совершенно разные мРНК-мишени. Действительно, в работах [32—34] было показано, что наличие у мРНК последовательности, обратнокомплиментарной seed региону (seed region) микроРНК — нуклеоти-дам со второго по седьмой, отсчитываемым с 5'-конца молекулы — определяет микроРНК-мРНК взаимодействие. Как следствие, смещение на 1-3 нуклеотида на 5'-конце ведет к изменению последовательности seed региона, что ведет к изменению репертуара мишеней. Более того, согласно недавнему

4Описание механизма микроРНК-мРНК взаимодействия представлено в работе [28].

исследованию [35], в некоторых тканях человеческого организма канонические формы большого числа микроРНК не являются наиболее экспресси-руемыми (распространенными). Таким образом, 5'-изоформы необходимо рассматривать как отдельные молекулы с собственным набором мишеней.

Коротко опишем процесс формирования микроРНК. Зрелые микроРНК образуются из первичных микроРНК (при-микроРНК, pri-miRNA) шпилек в результате ферментативного расщепления белками Drosha и Dicer (см. Рисунок 1): Drosha вырезает фланкирующие сегменты (Рисунок 1, участки слева от A и C) в ядре, а Dicer отсекает петлю (Рисунок 1, участок справа от B и D) в цитоплазме5.

А В

Рисунок 1 — Схема шпильки микроРНК (при-микроРНК). Drosha расщепляет фланкирующие сегменты шпильки: 5'-конец 5'-плеча (A) и 3'-конец 3'-плеча (C). Dicer отсекает петлю: З'-конец 5'-плеча (B) и 5'-конец 3'-плеча (D)

Нестабильность позиций расщепления приводит к образованию различных изоформ микроРНК. Механизмы, определяющие выбор этих позиций, до сих пор окончательно не выяснены. Так, например, в работе [37] было показано, что последовательности нуклеотидов вблизи участков расщепления белками Drosha и Dicer существенным образом определяют, будет ли расщепление стабильным или приведет к возникновению изоформ. В другой работе [38] было показано, что относительное положение петли при-микроРНК также влияет на точность расщепления белком Dicer. Стоит отметить, что эти наблюдения тканеспецифичны, то есть связаны с конкретными тканями человеческого организма.

5Процесса формирования молекул микроРНК детально описан в работе [36].

В данной работе анализируются экспрессии изоформ микроРНК, используя данные РНК-секвенирования6 (RNA-seq). В частности, исследуется, как различия в экспрессии изоформ микроРНК зависят от типа рака (см. Раздел 3.1). На основе полученных результатов строится линейный классификатор, предсказывающий, будет ли расщепление при-микроРНК белком Dicer приводить к образованию одной зрелой микроРНК или нескольких изоформ (см. Раздел 3.3). Используя методы, разработанные во второй главе, полученный классификатор проверяется на «случайность». Интерпретируя значимые признаки разработанного классификатора, выявляется и экспериментально валидируется набор последовательностей нуклеотидов, которые могут влиять на точность расщепления белком Dicer (см. Разделы 3.2 и 3.3).

Целью данной работы является разработка методов оценки качества и верификации линейных классификторов и применение их к задаче предсказания изоформ микроРНК.

Для достижения поставленной цели было необходимо решить следующие задачи:

1. Формализовать свойства, которым должны удовлетворять метрики качества классфикации.

2. Проверить непротиворечивость этих свойств и проверить их наличие у популярных метрик классификации.

3. Улучшить верхние оценки вероятности почти линейной разделимости, оценить их точность.

4. Разработать статистический критерий однородности, связанный с линейной разделимостью, оценить его эффективность.

5. Проанализировать данные экспрессии изоформ микроРНК в различных опухолевых тканях человека.

6. Разработать линейный классификатор, предсказывающий наличие изоформ по нуклеотидной последовательности микроРНК, и оценить его качество.

7. Выявить нуклеотидные последовательности, определяющие наличие изоформ.

6Данные были собраны в рамках проекта The Cancer Genome Atlas (TCGA, https://portal. gdc.cancer.go).

Теоретическая и практическая значимость. В работе предложен аксиоматический подход к сравнению различных метрик классификации между собой. В процессе анализа свойств метрик были получены оценки роста центральных моментов гипергеометрического распределения. При построении критерия однородности были предложены новые методы оценки числа разбиений планарного множества прямой на группы заданных размеров с фиксированным числом ошибок, восходящие к разделу комбинаторной геометрии. Полученные теоретические резултаты позволяют ранжировать линейные классификаторы и оценивать их статистическую значимость.

Построенный при анализе данных секвенирования микроРНК линейный классификатор может быть использован при конструировании синтетических РНК-молекул: предсказывая наличие или отсутствие изоформ, можно добиться более точного воздействия на целевые гены-мишени.

Научная новизна:

1. Впервые были формализованы и проверены свойства метрик качества классификации.

2. Была доказана теорема об одновременной несовместности рассматриваемых свойств.

3. Был предложен новый класс метрик, удовлетворяющих большинству свойств.

4. Впервые было проверенно сохранение свойств метрик при продолжении их на случай многоклассовой классификации.

5. Были получены более точные верхние оценки вероятности почти линейной разделимости в двумерном случае.

6. Был разработан и имплементирован критерий однородности, связанный с почти линейной разделимостью, который может быть использован для верфикации линейных классификаторов.

7. Был построен линейный классификатор, предсказывающий наличие изоформ микроРНК по последовательности нуклеотидов в районе позиции расщепления.

8. Был обнаружен новый нуклеотидный паттерн, определящий формирование изоформ.

Методология и методы исследования. При разработке теоретических результатов работы использовались методы теории вероятностей, ма-

тематической статистики, математического анализа и комбинаторной геометрии.

При реализации алгоритмов использовались методы параллельного программирования. При анализе биомедицинских данных использовались биоинформатические методы, связанные с обработкой данных РНК-секвенирования.

Основные положения, выносимые на защиту:

1. Сформулированы и формально проверены свойства метрик качества классификации: точность, сбалансированная точность, симметричная сбалансированная точность и обобщенное среднее удовлетворяют наибольшему числу свойств.

2. Формально проверено сохранение свойств метрик при продоложе-нии их на случай многоклассовой классификации: наибольшее число свойств сохраняется при макроусреднении.

3. Доказана теорема о несовместности предложенных свойств: не существует метрики бинарной классификации, которая одновременно удовлетворяет свойствам монотонности и несмещенности и при этом является расстоянием.

4. Предложен новый класс метрик, называемый обобщенным средним, удовлетворяющий почти всем свойствам, за исключением, свойства быть расстоянием.

5. Получены верхние оценки вероятности почти линейной разделимости в двумерном случае, которые являются более точными по сравнению с ранее известными оценками: в частности, для независимых одинаково распределенных нормальных выборок размеров к и I вероятность почти линейной разделимости с не более чем т ^ (к + 1) / 2 ошибками оценивается сверху, как

С тс т

Р (Л<т) ^у/2 , П = к + I.

6. Построен линейный классификатор, предсказывающий наличие изоформ микроРНК по нуклеотидной последовательности в районе позиции расщепления: нуклеотидный мотив AGCU на 5'-конце 3'-плеча при-микроРНК ассоциирован с отсутствием изоформ, а CCAG с их образованием.

Достоверность полученных результатов. Математические утверждения, сформулированные в работе, сопровождаются строгими доказательствами. Нуклеотидные паттерны, выявленные при анализе классификатора, предсказывающего наличие изоформ микроРНК, экспериментально проверены с помощью трансдукции клеточной линии короткими шпилечными РНК.

Апробация работы. Основные результаты работы докладывались на следующих конференциях и научных семинарах.

1. The Thirty-Fifth Annual Conference on Neural Information Processing Systems, Декабрь, 2021. Тема: «Good classification measures and how to find them».

2. Armenian Bioinformatics Institute Workshop in collaboration with HSE University, Апрель, 2021. Тема: «Hairpin sequence and structure is associated with features of isomiR biogenesis».

3. St. Petersburg Youth Meeting on Probability and Mathematical Physics, Ноябрь, 2024. Тема: «Statistical verification of linear classifiers».

4. Новосибирский семинар по прикладной статистике, Октябрь, 2025. Тема: «Оценка статистической значимости одного классификатора, идентифицирующего ^^-положительный рак молочной железы».

Личный вклад. Все основные результаты диссертации получены лично соискателем. Научные руководители участвовали в разработке идей диссертационного исследования, а также занимались руководством его проведения.

Публикации. Основные результаты по теме диссертации изложены в 3 печатных изданиях, 2 из которых изданы в научных журналах списка A, индексируемых Web of Science и Scopus, 1—в материалах конференции списка ACONF.

Объем и структура работы. Диссертация состоит из введения, 3 глав, заключения. Полный объём диссертации составляет 106 страниц, включая 10 рисунков и 8 таблиц. Список литературы содержит 0 наименований.

Глава 1. Методы оценки качества классификации

Эта глава посвящена анализу и проверке наличия определенных свойств у популярных метрик классификации. Содержательный смысл и строгие определения этих свойств представлены в Разделе 1.2, а их проверка— в Разделе 1.6.1. Результаты проверки приведены в Таблице 3.

В этой главе также исследуется вопрос о том, какие из свойств Раздела 1.2 сохраняются при различных типах продолжения (микро-, макро- и взвешенное) бинарной метрики на случай многоклассовой классификации. Результаты этой проверки представлены в Таблице 4, а доказательства соответствующих утверждений собраны в Разделе 1.6.2.

Наконец, в этой главе сформулирована и доказана Теорема 1 об одновременной несовместности некоторых из рассматриваемых нами свойств. В этом контексте в Разделе 1.4.1 вводится новый класс метрик, включающий в себя корреляцию Мэтьюса и симметрично сбалансированную точность и удовлетворяющий всем свойствам из Раздела 1.2 кроме свойства быть расстоянием. В свою очередь, в Разделе 1.4.2 показывается, что если взять арккосинус от корреляции Мэтьюса, то результирующая метрика будет удовлетворять всем свойствам из Раздела 1.2 кроме свойства несмещенности.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Жиянов Антон Павлович, 2026 год

Список литературы

1. Japkowicz, N. Evaluating learning algorithms: a classification perspective [Text] / N. Japkowicz, M. Shah. — Cambridge University Press, 2011.

2. Powers, D. M. W. Evaluation: From Precision, Recall and F-Measure to ROC, Informedness, Markedness and Correlation [Text] / D. M. W. Powers. — 2020. — URL: https://arxiv.org/abs/2010.16061.

3. The impact of class imbalance in classification performance metrics based on the binary confusion matrix [Text] / A. Luque [et al.] // Pattern Recognition. - 2019. - July. - Vol. 91. - P. 216-231. - URL: http://dx.doi. org/10.1016/j.patcog.2019.02.023.

4. M, H. A Review on Evaluation Metrics for Data Classification Evaluations [Text] / H. M, S. M.N // International Journal of Data Mining and Knowledge Management Process. — 2015. — Mar. — Vol. 5, no. 2. — P. 1—11. — URL: http://dx.doi.org/10.5121/ijdkp.2015.5201.

5. Sebastiani, F. An Axiomatically Derived Measure for the Evaluation of Classification Algorithms [Text] / F. Sebastiani // Proceedings of the 2015 International Conference on The Theory of Information Retrieval. — ACM, 09/2015. - (ICTIR '15). - URL: http://dx.doi.org/10.1145/2808194. 2809449.

6. Sokolova, M. A systematic analysis of performance measures for classification tasks [Text] / M. Sokolova, G. Lapalme // Information Processing and Management. — 2009. — July. — Vol. 45, no. 4. — P. 427—437. — URL: http://dx.doi.org/10.1016/j.ipm.2009.03.002.

7. Powers, D. M. W. The problem with kappa [Text] / D. M. W. Powers // Proceedings of the 13th Conference of the European Chapter of the Association for Computational Linguistics. — 2012. — P. 345—355.

8. Delgado, R. Why Cohen's Kappa should be avoided as performance measure in classification [Text] / R. Delgado, X.-A. Tibau // PLOS ONE / ed. by Q. Gu. - 2019. - Sept. - Vol. 14, no. 9. - P. 1-26. - URL: http://dx.doi.org/10.1371/journal.pone.0222916.

9. Delgado, R. Enhancing Confusion Entropy (CEN) for binary and multiclass classification [Text] / R. Delgado, J. D. Nunez-Gonzalez // PLOS ONE / ed. by F. Ciccarello. — 2019. — Jan. — Vol. 14, no. 1. — P. 1—30. — URL: http://dx.doi.org/10.1371/journal.pone.0210264.

10. The Balanced Accuracy and Its Posterior Distribution [Text] / K. H. Brodersen [et al.] // 2010 20th International Conference on Pattern Recognition. — IEEE, 08/2010. — P. 3121—3124. — URL: http: //dx.doi.org/10.1109/ICPR.2010.764.

11. Cortes, C. AUC Optimization vs. Error Rate Minimization [Text] /

C. Cortes, M. Mohri // Advances in Neural Information Processing Systems. Vol. 16 / ed. by S. Thrun, L. Saul, B. Schölkopf. — MIT Press, 2003. — P. 313—320. — URL: https://proceedings.neurips.cc/paper_files/ paper/2003/file/6ef80bb237adf4b6f77d0700e1255907-Paper.pdf.

12. Huang, J. Using AUC and accuracy in evaluating learning algorithms [Text] / J. Huang, C. Ling // IEEE Transactions on Knowledge and Data Engineering. — 2005. — Mar. — Vol. 17, no. 3. — P. 299—310. — URL: http://dx.doi.org/10.1109/tkde.2005.50.

13. Chicco, D. The advantages of the Matthews correlation coefficient (MCC) over F1 score and accuracy in binary classification evaluation [Text] /

D. Chicco, G. Jurman // BMC Genomics. — 2020. — Jan. — Vol. 21, no. 1. - URL: http://dx.doi.org/10.1186/s12864-019-6413-7.

14. Choi, S.-S. A survey of binary similarity and distance measures [Text] / S.-S. Choi, S.-H. Cha, C. C. Tappert // Journal of systemics, cybernetics and informatics. — 2010. — Vol. 8, no. 1. — P. 43—48.

15. Ferri, C. An experimental comparison of performance measures for classification [Text] / C. Ferri, J. Hernandez-Orallo, R. Modroiu // Pattern Recognition Letters. — 2009. — Jan. — Vol. 30, no. 1. — P. 27—38. — URL: http://dx.doi.org/10.1016/j.patrec.2008.08.010.

16. Gösgens, M. M. Systematic Analysis of Cluster Similarity Indices: How to Validate Validation Measures [Text] / M. M. Gösgens, A. Tikhonov, L. Prokhorenkova // Proceedings of the 38th International Conference on Machine Learning. Vol. 139 / ed. by M. Meila, T. Zhang. — PMLR,

07/2021. — P. 3799—3808. — (Proceedings of Machine Learning Research). — URL: https://proceedings.mlr.press/v139/gosgens21a.html.

17. A Multigene Assay to Predict Recurrence of Tamoxifen-Treated, Node-Negative Breast Cancer [Text] / S. Paik [et al.] // New England Journal of Medicine. — 2004. — Dec. — Vol. 351, no. 27. — P. 2817—2826. — URL: http://dx.doi.org/10.1056/NEJMoa041588.

18. Gene expression profiling predicts clinical outcome of breast cancer [Text] / L. J. van't Veer [et al.] // Nature. — 2002. — Jan. — Vol. 415, no. 6871. — P. 530-536. - URL: http://dx.doi.org/10.1038/415530a.

19. Supervised Risk Predictor of Breast Cancer Based on Intrinsic Subtypes [Text] / J. S. Parker [et al.] // Journal of Clinical Oncology. — 2009. — Mar. — Vol. 27, no. 8. — P. 1160—1167. — URL: http://dx.doi.org/10. 1200/JC0.2008.18.1370.

20. Highly informative marker sets consisting of genes with low individual degree of differential expression [Text] / V. V. Galatenko [et al.] // Scientific Reports. — 2015. — Oct. — Vol. 5, no. 1. — P. 1—8. — URL: http: //dx.doi.org/10.1038/srep14967.

21. Unger, G. Linear Separability of Gene Expression Data Sets [Text] / G. Unger, B. Chor // Transactions on Computational Biology and Bioin-formatics. — 2010. — Apr. — Vol. 7, no. 2. — P. 375—381. — URL: http: //dx.doi.org/10.1109/TCBB.2008.90.

22. Dissection Graphs of Planar Point Sets [Text] / P. Erdös [et al.] //A Survey of Combinatorial Theory. — Elsevier, 1973. — P. 139—149. — URL: http://dx.doi.org/10.1016/b978-0-7204-2262-7.50018-1.

23. Dey, T. K. Improved Bounds for Planar k-Sets and Related Problems [Text] / T. K. Dey // Discrete and Computational Geometry. — 1998. — Mar. - Vol. 19, no. 3. - P. 373-382. - URL: http://dx.doi.org/10.1007/ PL00009354.

24. Improving the Crossing Lemma by Finding More Crossings in Sparse Graphs [Text] / J. Pach [et al.] // Discrete and Computational Geometry. - 2006. - Oct. - Vol. 36, no. 4. - P. 527-552. - URL: http: //dx.doi.org/10.1007/s00454-006-1264-9.

25. Leroux, B. Improved Bounds for the Expected Number of k-Sets [Text] / B. Leroux, L. Rademacher // Discrete and Computational Geometry. — 2023. - Feb. - Vol. 70, no. 3. - P. 790-815. - URL: http://dx.doi.org/ 10.1007/s00454-022-00469-7.

26. Barany, I. On the expected number of k-sets [Text] / I. Barany, W. Steiger // Discrete and; Computational Geometry. — 1994. — Mar. — Vol. 11, no. 3. - P. 243-263. - URL: http://dx.doi.org/10.1007/ BF02574008.

27. Density distribution of gene expression profiles and evaluation of using maximal information coefficient to identify differentially expressed genes [Text] / H.-M. Liu [et al.] // PLOS ONE. - 2019. - July. - Vol. 14, no. 7. -P. 1—28. — URL: http://dx.doi.org/10.1371/journal.pone.0219551.

28. Nilsen, T. W. Mechanisms of microRNA-mediated gene regulation in animal cells [Text] / T. W. Nilsen // Trends in Genetics. — 2007. — May. — Vol. 23, no. 5. - P. 243-249. - URL: http://dx.doi.org/10.1016/j.tig. 2007.02.011.

29. Visone, R. MiRNAs and Cancer [Text] / R. Visone, C. M. Croce // The American Journal of Pathology. — 2009. — Apr. — Vol. 174, no. 4. — P. 1131-1138. - URL: http://dx.doi.org/10.2353/ajpath.2009.080794.

30. The signature of SARS-CoV-2 evolution reflects selective pressures within human guts [Text] / A. Zhiyanov [et al.] // Journal of Medical Virology. — 2023. — June. — Vol. 95, no. 8. — URL: http://dx.doi.org/10.1002/jmv. 28996.

31. Application of massively parallel sequencing to microRNA profiling and discovery in human embryonic stem cells [Text] / R. D. Morin [et al.] // Genome Research. — 2008. — Feb. — Vol. 18, no. 4. — P. 610—621. — URL: http://dx.doi.org/10.1101/gr.7179508.

32. MicroRNA-411 and Its 5'-isomiR Have Distinct Targets and Functions and Are Differentially Regulated in the Vasculature under Ischemia [Text] / R. V. van der Kwast [et al.] // Molecular Therapy. — 2020. — Jan. — Vol. 28, no. 1. — P. 157—170. — URL: http://dx.doi.org/10.1016/j.ymthe. 2019.10.002.

33. Characterizing isomiR variants within the microRNA-34/449 family [Text] / O. Mercey [et al.] // FEBS Letters. - 2017. - Feb. - Vol. 591, no. 5. - P. 693-705. - URL: http://dx.doi.org/10.1002/1873-3468.12595.

34. The highly expressed 5'-isomiR of hsa-miR-140-3p contributes to the tumor-suppressive effects of miR-140 by reducing breast cancer proliferation and migration [Text] / O. Salem [et al.] // BMC Genomics. — 2016. — Aug. — Vol. 17, no. 1. — URL: http://dx.doi.org/10.1186/s12864-016-2869-x.

35. Loher, P. IsomiR expression profiles in human lymphoblastoid cell lines exhibit population and gender dependencies [Text] / P. Loher, E. R. Londin, I. Rigoutsos // Oncotarget. — 2014. — Aug. — Vol. 5, no. 18. — P. 8790—8802. — URL: http://dx.doi.org/10.18632/oncotarget.2405.

36. Kim, Y.-K. Re-evaluation of the roles of DROSHA, Exportin 5, and DICER in microRNA biogenesis [Text] / Y.-K. Kim, B. Kim, V. N. Kim // Proceedings of the National Academy of Sciences. — 2016. — Mar. — Vol. 113, no. 13. — URL: http://dx.doi.org/10.1073/pnas.1602532113.

37. Sequence Features of Drosha and Dicer Cleavage Sites Affect the Complexity of IsomiRs [Text] / J. Starega-Roslan [et al.] // International Journal of Molecular Sciences. — 2015. — Apr. — Vol. 16, no. 4. — P. 8110—8127. — URL: http://dx.doi.org/10.3390/ijms16048110.

38. The Loop Position of shRNAs and Pre-miRNAs Is Critical for the Accuracy of Dicer Processing In Vivo [Text] / S. Gu [et al.] // Cell. — 2012. — Nov. — Vol. 151, no. 4. - P. 900-911. - URL: http://dx.doi.org/10.1016/j.cell. 2012.09.042.

39. Cohen, J. A Coefficient of Agreement for Nominal Scales [Text] / J. Cohen // Educational and Psychological Measurement. — 1960. — Apr. — Vol. 20, no. 1. - P. 37-46. - URL: http://dx.doi.org/10.1177/ 001316446002000104.

40. Gorodkin, J. Comparing two K-category assignments by a K-category correlation coefficient [Text] / J. Gorodkin // Computational Biology and Chemistry. — 2004. — Dec. — Vol. 28, no. 5/6. — P. 367—374. — URL: http://dx.doi.org/10.1016Zj.compbiolchem.2004.09.006.

41. A novel measure for evaluating classifiers [Text] / J.-M. Wei [et al.] // Expert Systems with Applications. — 2010. — May. — Vol. 37, no. 5. — P. 3799-3809. - URL: http://dx.doi.org/10.1016/j.eswa.2009.11.040.

42. Consistent Multilabel Classification [Text] / O. O. Koyejo [et al.] // Advances in Neural Information Processing Systems. Vol. 28 / ed. by C. Cortes [et al.]. — Curran Associates, Inc., 2015. — P. 3321—3329. — URL: https : / / proceedings . neurips . cc / paper _ files / paper / 2015 / file / 85f007f8c50dd25f5a45fca73cad64bd-Paper.pdf.

43. Albatineh, A. N. On Similarity Indices and Correction for Chance Agreement [Text] / A. N. Albatineh, M. Niewiadomska-Bugaj, D. Mihalko // Journal of Classification. — 2006. — Sept. — Vol. 23, no. 2. — P. 301—313. — URL: http://dx.doi.org/10.1007/s00357-006-0017-z.

44. Pearson, K. On the Moments of the Hypergeometrical Series [Text] / K. Pearson // Biometrika. — 1924. — May. — Vol. 16, no. 1/2. — P. 157-162. - URL: http://dx.doi.org/10.2307/2331916.

45. Vapnik, V. N. The Support Vector method [Text] / V. N. Vapnik // Artificial Neural Networks. — Springer Berlin Heidelberg, 1997. — P. 261—271. — URL: http://dx.doi.org/10.1007/bfb0020166.

46. Bottou, L. Support Vector Machine Solvers [Text] / L. Bottou, C.-J. Lin // Large-Scale Kernel Machines. — The MIT Press, 08/2007. — P. 1—28. — URL: http://dx.doi.org/10.7551/mitpress/7496.003.0003.

47. Benjamini, Y. Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing [Text] / Y. Benjamini, Y. Hochberg // Journal of the Royal Statistical Society Series B: Statistical Methodology. - 1995. - Jan. - Vol. 57, no. 1. - P. 289-300. - URL: http: //dx.doi.org/10.1111/j.2517-6161.1995.tb02031.x.

48. Johnsonbaugh, R. A Discrete Intermediate Value Theorem [Text] / R. John-sonbaugh, D. W. DeTemple // The College Mathematics Journal. — 1998. — Jan. — Vol. 29, no. 1. — P. 42—42. — URL: http://dx.doi. org/10.1080/07468342.1998.11973914.

49. Santalo, L. A. Integral Geometry and Geometric Probability [Text] / L. A. Santalo, M. Kac. — Cambridge University Press, 10/2004. — URL: http://dx.doi.org/10.1017/CBO9780511617331.

50. Ahmed, F. PHDcleav: a SVM based method for predicting human Dicer cleavage sites using sequence and secondary structure of miRNA precursors [Text] / F. Ahmed, R. Kaundal, G. P. Raghava // BMC Bioinformatics. — 2013. - Oct. - Vol. 14, S14. - URL: http://dx.doi.org/10.1186/1471-2105-14-S14-S9.

51. Effect of the Expression of ELOVL5 and IGFBP6 Genes on the Metastatic Potential of Breast Cancer Cells [Text] / S. Nikulin [et al.] // Frontiers in Genetics. — 2021. — Jan. — Vol. 12. — URL: http://dx.doi.org/10.3389/ fgene.2021.662843.

52. Robinson, M. D. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data [Text] / M. D. Robinson, D. J. McCarthy, G. K. Smyth // Bioinformatics. — 2009. — Nov. — Vol. 26, no. 1. — P. 139—140. — URL: http://dx.doi.org/10.1093/bioinformatics/btp616.

53. Kozomara, A. miRBase: from microRNA sequences to function [Text] / A. Kozomara, M. Birgaoanu, S. Griffiths-Jones // Nucleic Acids Research. — 2018. — Nov. — Vol. 47, no. D1. — P. D155—D162. — URL: http://dx.doi.org/10.1093/nar/gky1141.

54. Martin, M. Cutadapt removes adapter sequences from high-throughput sequencing reads [Text] / M. Martin // EMBnet.journal. — 2011. — May. — Vol. 17, no. 1. - P. 10. - URL: http://dx.doi.org/10.14806/ej.17.L200.

55. miRDeep2 accurately identifies known and hundreds of novel microRNA genes in seven animal clades [Text] / M. R. Friedländer [et al.] // Nucleic Acids Research. — 2011. — Sept. — Vol. 40, no. 1. — P. 37—52. - URL: http://dx.doi.org/10.1093/nar/gkr688.

56. Ultrafast and memory-efficient alignment of short DNA sequences to the human genome [Text] / B. Langmead [et al.] // Genome Biology. — 2009. — Mar. — Vol. 10, no. 3. — URL: http://dx.doi.org/10.1186/gb-2009-10-3-r25.

57. GENCODE reference annotation for the human and mouse genomes [Text] / A. Frankish [et al.] // Nucleic Acids Research. — 2018. — Oct. — Vol. 47, no. D1. - P. D766 D773. - URL: http://dx.doi.org/10.1093/ nar/gky955.

Публикации автора по теме диссертации

58. Good Classification Measures and How to Find Them [Text] / M. Gösgens [et al.] // Advances in Neural Information Processing Systems. Vol. 21. — Curran Associates, Inc., 2021. — P. 17136—17147. — URL: https : / / openreview.net/forum?id=TLXpi2j6F7.

59. Statistical Verification of Linear Classifiers [Text] / A. P. Zhiyanov [et al.] // Stat. - 2025. - Oct. - Vol. 14, no. 4. - URL: http://dx. doi.org/10.1002/sta4.70111.

60. Zhiyanov, A. Hairpin sequence and structure is associated with features of isomiR biogenesis [Text] / A. Zhiyanov, S. Nersisyan, A. Tonevitsky // RNA Biology. - 2021. - June. - Vol. 18, sup1. - P. 430-438. - URL: http://dx.doi.org/10.1080/15476286.2021.1952759.

Список рисунков

1 Схема микроРНК шпильки............................................12

1.1 Алгоритм выбора пороговой метрики для оценки качества

классификации ..........................................................36

2.1 Зависимость вероятности почти линейной разделимости от размеров множеств......................................................68

2.2 Зависимость мощности перестановочного теста от расстояния между распределениями................................................69

2.3 Тестирование классификатора для предсказания рак молочной железы....................................................................72

3.1 Распределение позиций расщепления..................................84

3.2 Гомогенность позиций расщепления ..................................85

3.3 Нуклеотидные мотивы расщепления..................................87

3.4 Классификатор для предсказания гомогенности....................90

3.5 Конструкции для валидации классификатора........................92

Список таблиц

1 Определения пороговых метрик в случаях бинарной и многоклассовой классификации........................................20

2 Соответствие между бинарными метриками классификации и парными метриками кластеризации ..................................22

3 Свойства метрик классификации......................................23

4 Сохранение свойств метрик классификации при усреднениях . . 23

5 Классы согласованных бинарных метрик классификации..........37

6 Свойства метрик кластеризации ......................................53

7 Данные о рецидивах рака молочной железы ........................70

8 Качество РСА-классификаторов для предсказания гомогенности 89

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.