Модели и алгоритмы обучения стохастических нейронных сетей для извлечения высокоточных представлений в задачах распознавания образов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Карпухин Иван Александрович
- Специальность ВАК РФ00.00.00
- Количество страниц 130
Оглавление диссертации кандидат наук Карпухин Иван Александрович
Введение
Глава 1. Обзор предметной области
1.1 Машинное обучение в задачах классификации
1.1.1 Обозначения
1.1.2 Классические методы классификации
1.1.3 Нейросетевые методы классификации
1.1.4 Выводы
1.2 Обзор методов оптимизации точности моделей классификации
1.2.1 Обозначения
1.2.2 Обзор и анализ методов повышения точности моделей классификации за счёт использования сглаженной функции точности
1.2.3 Ограничения известных методов
1.2.4 Выводы
1.3 Обзор стохастических нейронных сетей
1.3.1 Нейронные сети плотности (Density Networks)
1.3.2 Байесовские нейронные сети (Bayesian Neural Networks)
1.3.3 Выводы
1.4 Обзор методов обучения метрических пространств
1.4.1 Обозначения
1.4.2 Основные приложения задачи обучения метрических пространств
1.4.3 Контрастивные подходы
1.4.4 Классификационные подходы и использование представителей (прокси-методы)
1.4.5 Метрики оценки качества представлений
1.4.6 Выводы
1.5 Обзор стохастических нейронных сетей в задаче обучения метрических пространств
Стр.
1.5.1 Мотивация использования распределений представлений
1.5.2 Обзор и анализ вероятностных моделей представлений
1.5.3 Сравнение методов
1.5.4 Выводы
Глава 2. Алгоритм обучения метрических пространств на
основе сетей плотности
2.1 Описание предлагаемого метода объединения классификационного и регрессионного подходов
2.1.1 Отличия задач поиска и верификации
2.1.2 Преимущества и ограничения классификационного обучения
2.1.3 Преимущества и ограничения регрессионного обучения
2.1.4 Гибридный подход
2.2 Эксперименты
2.2.1 Процедура обучения моделей
2.2.2 Сравнение качества поиска и верификации
2.2.3 Сравнение видов распределений
2.2.4 Сравнение функций оценки близости
2.2.5 Поиск ошибок в данных и оценка уверенности
2.3 Выводы
Глава 3. Алгоритм EXACT оптимизации точности
стохастической модели классификации
3.1 Описание метода EXACT
3.1.1 Точность стохастической модели
3.1.2 Алгоритм оценки математического ожидания точности стохастической модели и его градиента по параметрам модели
3.1.3 Вывод модели (inference)
3.1.4 Методы улучшения сходимости
3.1.5 Адаптация EXACT к задачам с большим количеством классов
3.1.6 Сравнение EXACT и Variational Dropout
Стр.
3.1.7 Распределение Дирихле для описания выхода
стохастической модели
3.2 Эксперименты
3.2.1 Процедура сравнения
3.2.2 Линейные классификаторы на табличных данных
3.2.3 Нейронные сети классификации изображений
3.2.4 Устойчивость к ошибкам в метках классов
3.2.5 Зависимость точности от размера семпла
3.2.6 Вычислительная сложность
3.2.7 Сравнение с методом REINFORCE
3.3 Выводы
Заключение
Список литературы
Список рисунков
Список таблиц
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Коррекция классификаторов изображений методом каскадной редукции2022 год, кандидат наук Голубков Александр Михайлович
Оценка неопределённости в моделях глубокого обучения компьютерного зрения2026 год, кандидат наук Дерека Станислав Артурович
Доверенный байесовский классификатор для данных малой размерности на основе многослойного персептрона2026 год, кандидат наук Перминов Андрей Игоревич
Алгоритмическое обеспечение нейро-нечеткой системы классификации состояний объектов сложной структуры2022 год, кандидат наук Чернобаев Игорь Дмитриевич
Рандомизированный подход к обучению в условиях отсутствия разметки и малого количества данных2020 год, кандидат наук Бояров Андрей Александрович
Введение диссертации (часть автореферата) на тему «Модели и алгоритмы обучения стохастических нейронных сетей для извлечения высокоточных представлений в задачах распознавания образов»
Введение
В число основных задач машинного обучения традиционно включают задачи классификации, регрессии и обучения представлений [1]. Хотя машинное обучение включает и другие области, указанные задачи имеют большую практическую значимость [2—5]. Задача классификации заключается в выявлении скрытой метки или класса объекта по его признакам. Классификация возникает при распознавании текстов [6], изображений [2; 7; 8] и звука [9], при анализе намерений пользователей [10] и при прогнозировании будущих событий [11]. Также методы классификации помогают решению других задач машинного обучения, таких как генерация данных [12] и обучение представлений [13—15]. Задача регрессии состоит в определении вещественных характеристик объектов [16]. Подобно классификации, регрессия является задачей распознавания и часто возникает в экономике [17] и робототехнике [18]. Обучение представлений же возникает преимущественно как составная часть сложных систем и заключается в поиске таких описаний входных объектов, которые упрощали бы решение других задач, включая классификацию и регрессию [19]. Такие описания входных данных и называются представлениями (англ. embeddings). В зависимости от конкретного приложения, к обучаемым представлениям выдвигаются те или иные требования, такие как ограничения на размерность [20] или наличие метрических свойств [21; 22]. Обучение представлений с метрическими свойствами называется обучением метрических пространств (англ. metric learning).
Методы решения задач машинного обучения принято разделять на классические подходы (classical, conventional) и нейросетевые (neural), называемые также глубоким обучением (deep) [23]. Классическими подходами называют алгоритмы, не попадающие в область глубокого обучения. Они решают задачу используя представления, близкие к исходным признаковым описаниям, либо вручную разработанные признаки. Примерами классических алгоритмов служат логистическая регрессия, решающие деревья, метод опорных векторов, а также их ансамбли. Глубокое обучение заключается в последовательном преобразовании признакового пространства, так что различные части модели оперируют на разных уровнях абстракции. Нейросетевые модели являются примером данного подхода. Такие модели состоят из последовательно применяемых частей, называемых слоями. Каждый следующий слой повышает качество
признакового описания, так что финальные слои нейронной сети в состоянии решать сложные задачи распознавания и генерации [24].
Особую ценность представляют модели, способные предсказывать степень уверенности в собственных ответах [25]. В этом случае появляется возможность контролировать поведение системы в случаях, когда данные содержат ошибку или точное предсказание невозможно. Например, в указанных случаях можно делегировать принятие решения человеку. На степень уверенности модели оказывают влияние как недостаток знаний (epistemic uncertainty), так и случайность, присущая данным (aleatoric uncertainty) [25]. Многие модели классификации способны оценивать собственную уверенность: они оценивают вероятности всех классов, и значение вероятности служит оценкой уверенности [26]. Иначе обстоят дела с регрессионными моделями. Обычно они строятся путём минимизации средней абсолютной или среднеквадратичной ошибки. Такие модели генерируют точечное предсказание и не оценивают собственную уверенность и диапазон возможных значений. Чтобы получить данную оценку, ранее были разработаны специальные алгоритмы. К их числу относятся байесовские нейронные сети [27] и сети плотности [28]. Оба класса моделей являются примерами стохастических нейронных сетей, т.е. сетей, предсказание которых задаётся некоторым распределением, а не единственным значением [29].
Байесовские нейронные сети [30] задаются распределением весов модели и фактически представляют из себя ансамбль континуума моделей. Каждый вариант модели может давать отличное от других предсказание для одного и того же набора признаков. Таким образом формируется распределение ответов модели. Байесовские нейронные сети преимущественно применяются для повышения обобщающей способности модели [31] или уменьшения числа параметров (sparsification) [32]. Хотя сети данного типа могут применяться для оценки уверенности, получение такой оценки требует ресурсоёмких вычислений [33].
Сети плотности используют другой подход: они явно предсказывают параметры распределения ответов [28]. Например, в задаче регрессии модель может предсказывать средние и дисперсию нормального распределения или параметры сдвига и масштаба распределения Лапласа. При этом сама архитектура модели остаётся детерминированной, как в обычных нейронных сетях [25]. Процедура обучения сетей плотности в задаче регрессии заключается в минимизации перекрёстной энтропии на основе предсказанного распределения и правильного ответа, полученного из разметки. Хотя обычное обучение
моделей с использованием квадратичной или абсолютной ошибки является частным случаем сетей плотности, последние допускают ряд обобщений, повышающих гибкость и выразительность модели. Помимо оценки дисперсии, известны также варианты моделей, предсказывающие смеси распределений для моделирования сложных распределений данных [34].
Сети плотности изначально были предложены для задачи регрессии. Тем не менее, ряд работ исследовал применимость данного подхода к задаче обучения метрических пространств [29; 34—36]. На близость задач указывает тот факт, что представления обычно задаются вектором вещественных чисел и их предсказание может рассматриваться как задача регрессии [36; 37]. Хотя предыдущие работы исследовали способы обучения метрических пространств с использованием стохастических нейронных сетей, в указанных работах отсутствует системное сравнение как с аналогами так и подходами из смежных областей, таких как поиск, биометрическая идентификация и верификация. В результате трудно оценить влияние отдельных архитектурных решений на качество модели в различных приложениях обучения метрических пространств.
В предыдущих работах также остается малоизученным вопрос о применении стохастических нейронных сетей в задаче классификации. Возможность такого применения следует из связи классификации с задачей обучения метрических пространств [38]. Действительно, представления часто используются для решения других задач, в том числе и классификации. Возникает вопрос о том, какие дополнительные свойства привносит стохастичность промежуточных представлений и как эти свойства можно использовать для решения задачи.
Основные результаты.
Настоящая работа нацелена на анализ и развитие методов, основанных на сетях плотности, в задачах обучения метрических пространств и классификации.
В области обучения метрических пространств проведены сравнение и анализ известных архитектурных решений в широком спектре задач поиска, верификации и оценки уверенности модели. В результате обнаружены основные закономерности, которые позволяют выбрать необходимые инструменты для решения каждой задачи. На основе приведенного анализа предлагается улучшенный алгоритм обучения метрических пространств, который превосходит имеющиеся аналоги в задачах поиска и верификации изображений.
В работе также впервые исследована применимость сетей плотности к задаче классификации. Показано, что точность стохастических сетей является гладкой функций параметров модели, что принципиально отличается от детерминированных нейронных сетей, в которых функция точности кусочно линейна. В результате появляется возможность использования градиентных методов оптимизации для максимизации точности модели. В настоящей работе разрабатывается новый математический аппарат и методы оптимизации, нацеленные на повышение точности линейных и глубоких моделей классификации. Экспериментальная оценка доказывает высокую эффективность предлагаемых подходов. Помимо этого проводится анализ свойств полученных моделей и показывается, что новый класс моделей обладает высокой устойчивостью к ошибкам в данных по сравнению с другими методами классификации.
Целью данной работы является повышение качества обучения метрических пространств и классификации за счёт использования сетей плотности.
Для достижения данной цели были поставлены следующие задачи:
1. провести аналитический обзор литературы, включающий работы по методам классификации, методам оптимизации точности моделей, методам обучения метрических пространств, а также по стохастическим нейронным сетям;
2. улучшить методы обучения метрических пространств на основе сетей плотности для задач поиска и верификации по изображениям;
3. разработать алгоритм оптимизации точности стохастических моделей классификации, пригодный для решения задачи многоклассовой классификации и применимый для обучения нейронных сетей;
4. предложить теоретически обоснованный метод оценки функции потерь и её градиентов по параметрам модели для предложенного алгоритма классификации.
Научная новизна:
1. предложен алгоритм обучения метрических пространств на основе сетей плотности, который, в отличие от известных подходов, комбинирует классификационную и регрессионную стадии обучения;
2. предложена модель классификации EXACT на основе сетей плотности, которая, в отличие от известных моделей, позволяет оптимизировать точность классификации методом градиентного спуска;
3. предложен эффективный алгоритм оценки математического ожидания точности стохастической модели и его градиента по параметрам модели.
Теоретическая значимость диссертационной работы заключается в развитии методов обучения стохастических моделей представлений и методов классификации, нацеленных на высокую точность модели. Для стохастических моделей представлений проведён детальный анализ основных компонент известных систем и способов их обучения. На основе проведённого анализа предлагается новый алгоритм обучения метрических пространств, улучшающий качество поиска и верификации изображений. Для решения задачи классификации предлагается новый теоретически обоснованный алгоритм обучения моделей, нацеленный на повышение точности. Сформулированы и доказаны теоремы, необходимые для обоснования предложенного алгоритма оптимизации. В диссертационном исследовании получены теоретические результаты и научно-обоснованные решения, которые вносят значительный вклад в развитие методов анализа данных с использованием стохастических нейронных сетей.
Практическая значимость диссертационной работы заключается в том, что на основе новых теоретических результатов были реализованы и оценены алгоритмы обучения метрических пространств и классификации, позволяющие добиться высокого качества поиска и верификации изображений, а также классификации изображений и табличных данных. Экспериментально показано, что предложенные методы обучения метрических пространств позволяют оценивать степень уверенности модели и качество входных данных, что повышает надёжность использования предлагаемых моделей в публичных средах, таких как сеть Интернет. Эмпирические результаты также демонстрируют высокую устойчивость предлагаемых моделей классификации к ошибкам в обучающих данных, что особенно актуально при работе с большими объёмами данных, полученными в автоматическом или полу-автоматическом режиме на основе публичных данных. Разработанные подходы могут быть эффективно использованы в таких прикладных областях, как веб-поиск, биометрические системы, сбор и анализ визуальных данных, а также в задачах обнаружения и распознавания объектов на изображениях и видео.
Положения, выносимые на защиту:
1. проведён анализ известных моделей вероятностных представлений и предложен новый алгоритм обучения метрических пространств на ос-
нове сетей плотности, демонстрирующий высокое качество поиска и верификации по изображениям;
2. проанализированы ограничения известных алгоритмов оптимизации точности моделей классификации и предложен первый алгоритм оптимизации точности многоклассовой классификации, пригодный для обучения как линейных моделей, так и нейронных сетей;
3. получены теоретические результаты, необходимые для эффективного обучения предложенной модели классификации;
Публикации и апробация работы. Основные результаты, изложенные в диссертационной работе, были опубликованы в следующих статьях:
1. Karpukhin I., Dereka S., Kolesnikov S. Probabilistic embeddings revisited // The Visual Computer. - 2024. - Т. 40. - №. 6. - С. 4373-4386.
2. Karpukhin I., Dereka S., Kolesnikov S. EXACT: How to train your accuracy //Pattern Recognition Letters. - 2024. - Т. 185. - С. 23-30.
Другие опубликованные работы автора, в том числе в соавторстве, перечислены ниже:
1. Dereka S., Karpukhin I., Zhdanov M., Kolesnikov S. Diversifying Deep Ensembles: A Saliency Map Approach for Enhanced OOD Detection, Calibration, and Accuracy //2024 IEEE International Conference on Image Processing (ICIP). - IEEE, 2024. - С. 437-443.
2. Dereka S., Karpukhin I., Kolesnikov S. Deep image retrieval is not robust to label noise //Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. - 2022. - С. 4975-4980.
3. Karpukhin I. A. Contribution from the accuracy of phoneme recognition to the quality of automatic recognition of Russian speech //Moscow University Computational Mathematics and Cybernetics. - 2016. - Т. 40. - С. 89-95.
4. Karpukhin I. A., Konushin A. S. Constructing a speech audio-video corpus by aligning long segments of speech and text //Moscow University Computational Mathematics and Cybernetics. - 2017. - Т. 41. - С. 97-103.
Ниже перечислены патенты автора:
1. Karpukhin I. A. Method and system for determining speaker-user of voice-controllable device : пат. 11011174 США. - 2021.
2. Karpukhin I. A. Methods of and electronic devices for determining an intent associated with a spoken user utterance : пат. 10818284 США. - 2020.
Объем и структура работы. Диссертация состоит из введения, 3 глав, и заключения. Полный объём диссертации составляет 130 страниц, включая 14 рисунков и 12 таблиц. Список литературы содержит 113 наименований.
Глава 1. Обзор предметной области
В настоящей работе рассматриваются применения стохастических нейронных сетей в задачах классификации и обучения метрических пространств. Ниже предлагается обзор популярных методов решения указанных задач, а также обзор типичных стохастических нейронных сетей.
1.1 Машинное обучение в задачах классификации
Классификация — фундаментальная задача машинного обучения, направленная на отнесение объектов к одному из нескольких классов на основе их признаков [1]. Существует множество методов обучения моделей классификации, каждый из которых обладает своими особенностями и областями применения. В данном разделе рассматриваются основные методы классификации, включая наивный байесовский классификатор, методы, основанные на отступе, логистическую регрессию, градиентный бустинг, а также методы глубокого обучения.
1.1.1 Обозначения
Будем считать, что имеется выборка V = {xi,yi}f=l размера N, состоящая из векторов признаков Xi Е RD и меток классов у,ь Е С, где множество всех возможных меток классов С непусто и конечно. В случае бинарной классификации С = {-1,1}, а в случае многоклассовой классификации С = {1,... ,С}. Отдельные признаки в дальнейшем будем обозначать дополнительным индексом. Например, запись Xij обозначает j-й признак ¿-го элемента выборки. В задаче классификации требуется построить отображение RD ^ С, ставящее в соответствие каждому набору признаков метку класса. Такое отображение называется классификатором. Обычно классификатор является суперпозицией функции f : RD ^ R^, которая вычисляет логиты (рейтинги, scores) классов, и
функции активации д : R^ ^ R^, которая по логитам генерирует вероятности классов. В качестве ответа выбирается класс с наибольшей вероятностью
y = argmax g(f (ж))с. (1.1)
сеС
Мы будем рассматривать семейство функций fe(x), параметризуемое вектором 0 е Re. Задача машинного обучения состоит в поиске такого вектора 0, который бы оптимизировал некоторую функцию ошибки С (loss function) на имеющейся выборке:
0 = argmin С(0, V). (1.2)
0е©
Для проведения независимой оценки, выборку V обычно разделяют на два непересекающихся множества: тренировочную выборку Vtrain и тестовую выборку Vtest. Тренировочная выборка используется для поиска вектора 0, в то время, как тестовая выборка используется для оценки качества модели.
1.1.2 Классические методы классификации
Классическими методами будем называть подходы, которые основаны на линейных моделях и решающих лесах. Классические подходы часто допускают теоретический анализ сходимости и обобщающей способности. К достоинствам классических подходов также относится интерпретируемость, т.е. возможность установления причин генерации одного или другого предсказания. К недостаткам классических подходов можно отнести трудности с выявлением сложных зависимостей, трудности работы с большими объёмами данных, а также работу преимущественно с табличными данными, что не позволяет добиться высокой точности распознавания изображений и звука.
Наивный байесовский классификатор. Наивный байесовский классификатор [1] использует теорему Байеса и предположение об условной независимости признаков при заданном классе. Это предположение упрощает вычисления и позволяет эффективно оценивать апостериорные вероятности классов. В качестве предсказания обычно выбирается класс с наибольшей апостериорной вероятностью.
Теорема Байеса, применительно к задаче классификации, выражается следующим образом:
= ' (1.3)
где Р(у1хг) - апостериорная вероятность класса у при признаках хг, Р(хг]у) -вероятность наблюдения признаков хг при условии класса у, и Р(у) — априорная вероятность класса у.
Предположение об условной независимости признаков позволяет разложить правдоподобие Р(хг1у) на произведение отдельных вероятностей:
а
1у) = П РКМ (1.4)
где - ]-й признак ¿-го примера.
Поскольку число классов конечно, априорную вероятность вектора х можно вычислить по формуле полной вероятности:
Р(жО = ^ РЫу)Р(у). (1.5)
уеС
Таким образом, для применения наивного байесовского классификатора достаточно оценить распределение каждого признака при условии каждого класса.
Несмотря на упрощения, наивный байесовский классификатор часто демонстрирует хорошие результаты, особенно в задачах текстовой классификации и фильтрации спама [39]. К недостаткам данной модели относится невозможность точного моделирования зависимостей между признаками, особенно в задачах с высокой размерностью пространства признаков. Сложность вызывает также оценка распределения признаков Р(хг^\у) для классов, имеющих лишь небольшое количество примеров в обучающей выборке.
Многомерная логистическая регрессия. Многомерная логистическая регрессия - статистический метод классификации, который моделирует вероятность принадлежности объекта к каждому из классов. Она использует многомерную логистическую функцию (эойшах) для преобразования линейной комбинации признаков в вероятности.
Модель многомерной логистической регрессии задается как:
Р(у\хг) =-т—-, (1.6)
уеС
где 'Шу - вектор весов класса у, Ъу - смещение класса у. Коэффициенты матрицы п) и вектор Ь формируют вектор параметров модели 6.
Обучение модели осуществляется путем максимизации функции правдоподобия или минимизации функции потерь на основе перекрестной энтропии:
N
C(w,b) = — ^logP(^). (1.7)
i=i
Многомерная логистическая регрессия является базовой линейной моделью, которая хорошо интерпретируема и широко применяется в различных областях, таких как медицина, экономика и социальные науки [40].
Метод опорных векторов. Метод опорных векторов (Support Vector Machine, SVM) является алгоритмом бинарной классификации, который находит гиперплоскость, разделяющую классы с максимальным отступом. Отступ (margin) — это расстояние между гиперплоскостью и ближайшими к ней точками данных.
Задача оптимизации SVM в случае линейно неразделимой выборки формулируется следующим образом:
1 N
min -I Ы|2 + R Ь,
w,b 2 ^
=i
при ограничениях:
yi(wTXi + Ь) ^ 1 - Ь, Ь ^ 0,
где w - вектор весов, b - смещение, yi - метка класса, равная 1 для первого класса и —1 для второго, Ь - переменные штрафа за ошибки классификации и R - параметр регуляризации.
SVM может быть расширен на нелинейные случаи с помощью ядровых функций, которые позволяют эффективно работать в высокоразмерных пространствах признаков [1]. Однако SVM может быть вычислительно затратным на больших наборах данных и чувствителен к выбору параметров и ядра.
Градиентный бустинг. Градиентный бустинг — метод ансамблевого обучения, который строит модель в виде последовательности слабых моделей, обычно деревьев решений. Каждый последующий алгоритм стремится компенсировать ошибки предыдущих путем минимизации заданной функции потерь.
Алгоритм построения модели состоит из следующих шагов:
1. Инициализация модели постоянным предсказанием.
2. На каждом шаге вычисление остатка г г, который соответствует градиенту функции потерь.
3. Обучение нового базового алгоритма Нт на остатках.
4. Обновление общей модели путем добавления нового алгоритма с коэффициентом обучения ц.
Новый алгоритм Гт(х) на шаге 4 задаётся следующей формулой:
^то(х) = ¥т-Х (х) + цН т(х).
Для обучения моделей используются дифференцируемые функции. В задачах классификации обычно используют функцию перекрёстной энтропии, а в задачах регрессии - среднеквадратичную ошибку [41].
Градиентный бустинг позволяет достичь высокой точности на структурированных (табличных) данных и успешно применяется в задачах ранжирования, прогнозирования и классификации [1]. Тем не менее, он может быть подвержен переобучению и требует тщательной настройки гиперпараметров. К другим недостаткам градиентного бустинга, основанного на деревьях решений, относятся сложность работы в пространствах большой размерности и чрезмерное усложнение модели, необходимое для учёта зависимостей между признаками.
1.1.3 Нейросетевые методы классификации
Глубокое обучение - это подход в машинном обучении, основанный на использовании искусственных нейронных сетей с большим числом скрытых слоев [1]. Этот метод позволяет моделям обучаться представлениям данных на различных уровнях абстракции, что особенно эффективно для сложных задач в
таких областях, как компьютерное зрение, анализ звуковых сигналов и языковое моделирование. Искусственные нейронные сети можно рассматривать как обобщение и развитие многомерной логистической регрессии, которая является примером простейшей однослойной полносвязной сети. Ниже описаны основные архитектуры и способы обучения нейронных сетей классификации. Обзор нацелен в первую очередь на методы распознавания образов в задачах компьютерного зрения.
Архитектуры нейронных сетей
Архитектуры нейронных сетей могут существенно отличаться по сложности, количеству параметров, а также по способам борьбы с такими проблемами оптимизации, как затухание или взрыв градиентов. В данной секции мы рассмотрим три широко распространённые модели: полносвязные сети, остаточные нейронные сети (residual networks, ResNet) и архитектуры на основе трансфор-меров (transformers).
Полносвязные сети (Fully-Connected Networks). Полносвязная нейронная сеть (часто называемая Multi-Layer Perceptron, MLP) является одной из самых простых архитектур искусственных нейронных сетей. Её основная идея состоит в последовательном применении нескольких слоёв, каждый из которых является линейной проекцией входных данных с последующим нелинейным преобразованием. Полносвязная сеть с L слоями последовательно преобразует вектор признаков х:
h(1) = o(W(1) х + 6(1)), (1.8)
h(2) = a(W (2)h(1) + b(2)), (1.9)
h(L) = o(W (L)h(L—1) + b(L)), (1.10)
где WО и b(l,S) - параметры 1-го слоя, а а(-) - нелинейная активация (например ReLU, логистическая функция или гиперболический тангенс), которая обычно независимо преобразует каждый элемент входного вектора.
Значения на выходе сети могут быть использованы для решения задачи классификации способом, похожим на многомерную логистическую регрессию. Действительно, можно отобразить выход модели в распределение вероятностей классов при помощи многомерной логистической функции (softmax) и оценить функцию перекрёстной энтропии. Поскольку все функции, используемые в полученной модели дифференцируемы (возможно, за исключением конечного числа точек), можно использовать градиентные методы оптимизации для подбора параметров нейронной сети.
Полносвязные сети являются концептуально простыми. Однако они не масштабируются на задачи с большим числом входных признаков, такие как распознавание изображений, звука и длинных текстов. Кроме того, глубокие полносвязные сети могут страдать от проблемы затухающих градиентов, что существенно затрудняет их обучение. До появления более современных архитектур, таких как сверточные и остаточные нейронные сети, полносвязные модели редко использовались для классификации изображений, поскольку не учитывали пространственные отношения пикселей.
Свёрточные нейронные сети. Несмотря на то, что полносвязные сети могут применяться к задаче распознавания изображений, они не учитывают пространственные отношения точек изображения и требуют чрезмерно большого числа параметров. Свёрточные нейронные сети (Convolutional Neural Networks, CNN) решают эту проблему благодаря использованию свёрточных слоёв с фильтрами (ядрами), которые извлекают локальные признаки изображений [1]. Вместо того, чтобы напрямую соединять каждый пиксель со всеми нейронами последующего слоя, свёрточный слой фокусируется на небольших участках изображения, выявляя базовые структуры (например, границы, углы, текстуры). Небольшие участки изображения, которые используются нейронами следующего слоя обычно называются полями восприятия (receptive fields).
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Адаптивные стратегии обучения градиентного бустинга2024 год, кандидат наук Ибрагимов Булат Ленарович
Априорное распределение параметров в задачах выбора моделей глубокого обучения2022 год, кандидат наук Грабовой Андрей Валериевич
Методы сжатия рекуррентных нейронных сетей для задач обработки естественного языка2019 год, кандидат наук Грачев Артем Михайлович
Нейросетевой механизм кросс-внимания в задачах извлечения информации из текстов на примере биомедицинских данных2021 год, кандидат наук Алимова Ильсеяр Салимовна
Алгоритмы классификации данных дистанционного зондирования Земли для интерпретации спутниковых и аэрофотоснимков2023 год, кандидат наук Ньян Линн Тун
Список литературы диссертационного исследования кандидат наук Карпухин Иван Александрович, 2025 год
Список литературы
1. Bishop, C. M. Pattern recognition and machine learning [Текст]. Т. 4 / C. M. Bishop, N. M. Nasrabadi. — Springer, 2006.
2. Imagenet: A large-scale hierarchical image database
[Текст] / J. Deng [и др.] // 2009 IEEE conference on computer vision and pattern recognition. — Ieee. 2009. — С. 248—255.
3. Sun, Y. Deep convolutional network cascade for facial point detection [Текст] / Y. Sun, X. Wang, X. Tang // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2013. — С. 3476—3483.
4. Schroff, F. Facenet: A unified embedding for face recognition and clustering [Текст] / F. Schroff, D. Kalenichenko, J. Philbin // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2015. — С. 815—823.
5. Deep image retrieval: Learning global representations for image search [Текст] / A. Gordo [и др.] // Computer Vision-ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11-14, 2016, Proceedings, Part VI 14. — Springer. 2016. — С. 241—257.
6. GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding
[Текст] / A. Wang [и др.] // International Conference on Learning Representations. — 2019.
7. Handwritten digit recognition with a back-propagation network
[Текст] / Y. LeCun [и др.] // Advances in neural information processing systems. — 1989. — Т. 2.
8. Learning multiple layers of features from tiny images [Текст] / A. Krizhevsky, G. Hinton [и др.]. — 2009.
9. Prabhakar, S. K. Holistic approaches to music genre classification using efficient transfer and deep learning techniques
[Текст] / S. K. Prabhakar, S.-W. Lee // Expert Systems with Applications. — 2023. — Т. 211. — С. 118636.
10. Schuurmans, J. Intent classification for dialogue utterances
[Текст] / J. Schuurmans, F. Frasincar // IEEE Intelligent Systems. — 2019. — Т. 35, № 1. — С. 82—88.
11. Event Stream GPT: a data pre-processing and modeling library for generative, pre-trained transformers over continuous-time sequences of complex events [Текст] / M. McDermott [и др.] // Advances in Neural Information Processing Systems. — 2023. — Т. 36. — С. 24322—24334.
12. Generative adversarial nets
[Текст] / I. Goodfellow [и др.] // Advances in neural information processing systems. — 2014. — Т. 27.
13. Sphereface: Deep hypersphere embedding for face recognition
[Текст] / W. Liu [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — С. 212—220.
14. Cosface: Large margin cosine loss for deep face recognition
[Текст] / H. Wang [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2018. — С. 5265—5274.
15. Arcface: Additive angular margin loss for deep face recognition
[Текст] / J. Deng [и др.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2019. — С. 4690—4699.
16. A comprehensive analysis of deep regression
[Текст] / S. Lathuiliere [и др.] // IEEE transactions on pattern analysis and machine intelligence. — 2019. — Т. 42, № 9. — С. 2065—2081.
17. Sezer, O. B. Financial time series forecasting with deep learning: A systematic literature review: 2005-2019
[Текст] / O. B. Sezer, M. U. Gudelek, A. M. Ozbayoglu // Applied soft computing. — 2020. — Т. 90. — С. 106181.
18. GMR-RRT*: Sampling-based path planning using gaussian mixture regression [Текст] / J. Wang [и др.] // IEEE Transactions on Intelligent Vehicles. — 2022. — Т. 7, № 3. — С. 690—700.
19. A simple framework for contrastive learning of visual representations [Текст] / T. Chen [и др.] // International conference on machine learning. — PMLR. 2020. — С. 1597—1607.
20. Revisiting training strategies and generalization performance in deep metric learning
[Текст] / K. Roth [и др.] // International Conference on Machine Learning. — PMLR. 2020. — С. 8242—8252.
21. Guillaumin, M. Is that you? Metric learning approaches for face identification [Текст] / M. Guillaumin, J. Verbeek, C. Schmid // 2009 IEEE 12th international conference on computer vision. — IEEE. 2009. — С. 498—505.
22. Mikolov, T. Linguistic regularities in continuous space word representations [Текст] / T. Mikolov, W.-t. Yih, G. Zweig // Proceedings of the 2013 conference of the north american chapter of the association for computational linguistics: Human language technologies. — 2013. — С. 746—751.
23. LeCun, Y. Deep learning
[Текст] / Y. LeCun, Y. Bengio, G. Hinton // nature. — 2015. — Т. 521, № 7553. — С. 436—444.
24. Zeiler, M. D. Visualizing and understanding convolutional networks [Текст] / M. D. Zeiler, R. Fergus // Computer Vision-ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part I 13. — Springer. 2014. — С. 818—833.
25. A survey of uncertainty in deep neural networks
[Текст] / J. Gawlikowski [и др.] // Artificial Intelligence Review. — 2023. — Т. 56, Suppl 1. — С. 1513—1589.
26. Hendrycks, D. A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks
[Текст] / D. Hendrycks, K. Gimpel // International Conference on Learning Representations. — 2017.
27. Bayesian neural networks with confidence estimations applied to data mining [Текст] / R. Orre [и др.] // Computational Statistics & Data Analysis. — 2000. — Т. 34, № 4. — С. 473—493.
28. Bishop, C. M. Mixture density networks [Текст] / C. M. Bishop. — 1994.
29. Modeling uncertainty with hedged instance embedding
[Текст] / S. J. Oh [и др.] // arXiv preprint arXiv:1810.00319. — 2018.
30. Neal, R. M. BAYESIAN LEARNING FOR NEURAL NETWORKS [Текст] / R. M. Neal. — 1995.
31. Weight uncertainty in neural network
[Текст] / C. Blundell [и др.] // International conference on machine learning. — PMLR. 2015. — С. 1613—1622.
32. Molchanov, D. Variational dropout sparsifies deep neural networks
[Текст] / D. Molchanov, A. Ashukha, D. Vetrov // International conference on machine learning. — PMLR. 2017. — С. 2498—2507.
33. Kendall, A. What uncertainties do we need in bayesian deep learning for computer vision?
[Текст] / A. Kendall, Y. Gal // Advances in neural information processing systems. — 2017. — Т. 30.
34. von mises-fisher mixture model-based deep learning: Application to face verification
[Текст] / M. A. Hasnat [и др.] // arXiv preprint arXiv:1706.04264. — 2017.
35. Shi, Y. Probabilistic face embeddings
[Текст] / Y. Shi, A. K. Jain // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2019. — С. 6902—6911.
36. Spherical confidence learning for face recognition
[Текст] / S. Li [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2021. — С. 15629—15637.
37. Data uncertainty learning in face recognition
[Текст] / J. Chang [и др.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2020. — С. 5710—5719.
38. Scott, T. R. von mises-fisher loss: An exploration of embedding geometries for supervised learning
[Текст] / T. R. Scott, A. C. Gallagher, M. C. Mozer // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2021. — С. 10612—10622.
39. Zhang, H. Naive Bayes text classifier
[Текст] / H. Zhang, D. Li // 2007 IEEE international conference on granular computing (GRC 2007). — IEEE. 2007. — С. 708—708.
40. Menard, S. W. Logistic regression: From introductory to advanced concepts and applications
[Текст] / S. W. Menard. — Sage, 2010.
41. CatBoost: unbiased boosting with categorical features
[Текст] / L. Prokhorenkova [и др.] // Advances in neural information processing systems. — 2018. — Т. 31.
42. Deep residual learning for image recognition
[Текст] / K. He [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — С. 770—778.
43. Vaswani, A. Attention is all you need
[Текст] / A. Vaswani // Advances in Neural Information Processing Systems. — 2017.
44. Dosovitskiy, A. An image is worth 16x16 words: Transformers for image recognition at scale
[Текст] / A. Dosovitskiy // arXiv preprint arXiv:2010.11929. — 2020.
45. The pitfalls of simplicity bias in neural networks
[Текст] / H. Shah [и др.] // Advances in Neural Information Processing Systems. — 2020. — Т. 33. — С. 9573—9585.
46. Lin, T. Focal Loss for Dense Object Detection
[Текст] / T. Lin // arXiv preprint arXiv:1708.02002. — 2017.
47. Rethinking the inception architecture for computer vision
[Текст] / C. Szegedy [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — С. 2818—2826.
48. Are loss functions all the same?
[Текст] / L. Rosasco [и др.] // Neural computation. — 2004. — Т. 16, № 5. — С. 1063—1076.
49. Nguyen, T. Algorithms for direct 0-1 loss optimization in binary classification [Текст] / T. Nguyen, S. Sanner // International conference on machine learning. — PMLR. 2013. — С. 1085—1093.
50. Hasan, M. K. A new smooth approximation to the zero one loss with a probabilistic interpretation
[Текст] / M. K. Hasan, C. Pal // ACM Transactions on Knowledge Discovery from Data (TKDD). — 2019. — Т. 14, № 1. — С. 1—28.
51. Zhao, L. A Robust Loss Function for Multiclass Classification
[Текст] / L. Zhao // International Journal of Machine Learning and Computing. — 2013. — Т. 3, № 6. — С. 462—467.
52. Ghosh, A. Making risk minimization tolerant to label noise
[Текст] / A. Ghosh, N. Manwani, P. Sastry // Neurocomputing. — 2015. — Т. 160. — С. 93—107.
53. Simple and effective stochastic neural networks
[Текст] / T. Yu [и др.] // Proceedings of the AAAI Conference on Artificial Intelligence. Т. 35. — 2021. — С. 3252—3260.
54. Hands-on Bayesian neural networks—A tutorial for deep learning users [Текст] / L. V. Jospin [и др.] // IEEE Computational Intelligence Magazine. — 2022. — Т. 17, № 2. — С. 29—48.
55. Improving neural networks by preventing co-adaptation of feature detectors [Текст] / G. E. Hinton [и др.] // arXiv preprint arXiv:1207.0580. — 2012.
56. Kingma, D. P. Variational dropout and the local reparameterization trick [Текст] / D. P. Kingma, T. Salimans, M. Welling // Advances in neural information processing systems. — 2015. — Т. 28.
57. Auto-encoding variational bayes
[Текст] / Y. Chen [и др.] // Proceedings of the 2nd International Conference on Learning Representations. — 2014.
58. Graves, A. Practical variational inference for neural networks
[Текст] / A. Graves // Advances in neural information processing systems. — 2011. — Т. 24.
59. Kaya, M. Deep metric learning: A survey
[Текст] / M. Kaya, H. §. Bilge // Symmetry. — 2019. — Т. 11, № 9. — С. 1066.
60. Papernot, N. Deep k-nearest neighbors: Towards confident, interpretable and robust deep learning
[Текст] / N. Papernot, P. McDaniel // arXiv preprint arXiv:1803.04765. — 2018.
61. Deep clustering for unsupervised learning of visual features
[Текст] / M. Caron [и др.] // Proceedings of the European conference on computer vision (ECCV). — 2018. — С. 132—149.
62. The Faiss library
[Текст] / M. Douze [и др.]. — 2024. — arXiv: 2401.08281 [cs.LG].
63. Bai, Z. Speaker recognition based on deep learning: An overview
[Текст] / Z. Bai, X.-L. Zhang // Neural Networks. — 2021. — Т. 140. — С. 65—99.
64. Hermans, A. In defense of the triplet loss for person re-identification [Текст] / A. Hermans, L. Beyer, B. Leibe // arXiv preprint arXiv:1703.07737. — 2017.
65. Hadsell, R. Dimensionality reduction by learning an invariant mapping [Текст] / R. Hadsell, S. Chopra, Y. LeCun // 2006 IEEE computer society conference on computer vision and pattern recognition (CVPR'06). Т. 2. — IEEE. 2006. — С. 1735—1742.
66. Weinberger, K. Q. Distance metric learning for large margin nearest neighbor classification.
[Текст] / K. Q. Weinberger, L. K. Saul // Journal of machine learning research. — 2009. — Т. 10, № 2.
67. Multi-similarity loss with general pair weighting for deep metric learning [Текст] / X. Wang [и др.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2019. — С. 5022—5030.
68. No fuss distance metric learning using proxies
[Текст] / Y. Movshovitz-Attias [и др.] // Proceedings of the IEEE international conference on computer vision. — 2017. — С. 360—368.
69. Neighbourhood components analysis
[Текст] / J. Goldberger [и др.] // Advances in neural information processing systems. — 2004. — Т. 17.
70. Proxy anchor loss for deep metric learning
[Текст] / S. Kim [и др.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2020. — С. 3238—3247.
71. Teh, E. W. Proxynca++: Revisiting and revitalizing proxy neighborhood component analysis
[Текст] / E. W. Teh, T. DeVries, G. W. Taylor // Computer Vision-ECCV 2020: 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XXIV 16. — Springer. 2020. — С. 448—464.
72. Davies, D. L. A cluster separation measure
[Текст] / D. L. Davies, D. W. Bouldin // IEEE transactions on pattern analysis and machine intelligence. — 1979. — № 2. — С. 224—227.
73. Rousseeuw, P. J. Silhouettes: a graphical aid to the interpretation and validation of cluster analysis
[Текст] / P. J. Rousseeuw // Journal of computational and applied mathematics. — 1987. — Т. 20. — С. 53—65.
74. Hubert, L. Comparing partitions
[Текст] / L. Hubert, P. Arabie // Journal of classification. — 1985. — Т. 2. — С. 193—218.
75. Lancichinetti, A. Detecting the overlapping and hierarchical community structure in complex networks
[Текст] / A. Lancichinetti, S. Fortunato, J. Kertesz // New journal of physics. — 2009. — Т. 11, № 3. — С. 033015.
76. Musgrave, K. A metric learning reality check
[Текст] / K. Musgrave, S. Belongie, S.-N. Lim // Computer Vision-ECCV 2020: 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XXV 16. — Springer. 2020. — С. 681—699.
77. Zheng, Y. Ring loss: Convex feature normalization for face recognition [Текст] / Y. Zheng, D. K. Pal, M. Savvides // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2018. — С. 5089—5097.
78. Labeled faces in the wild: A database forstudying face recognition in unconstrained environments
[Текст] / G. B. Huang [и др.] // Workshop on faces in'Real-Life'Images: detection, alignment, and recognition. — 2008.
79. Wolf, L. Face recognition in unconstrained videos with matched background similarity
[Текст] / L. Wolf, T. Hassner, I. Maoz // CVPR 2011. — IEEE. 2011. — С. 529—534.
80. Chen, B.-C. Face recognition and retrieval using cross-age reference coding with cross-age celebrity dataset
[Текст] / B.-C. Chen, C.-S. Chen, W. H. Hsu // IEEE Transactions on Multimedia. — 2015. — Т. 17, № 6. — С. 804—815.
81. Pushing the frontiers of unconstrained face detection and recognition: Iarpa janus benchmark a
[Текст] / B. F. Klare [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2015. — С. 1931—1939.
82. Sub-center arcface: Boosting face recognition by large-scale noisy web faces [Текст] / J. Deng [и др.] // Computer Vision-ECCV 2020: 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XI 16. — Springer. 2020. — С. 741—757.
83. Deep variational information bottleneck
[Текст] / A. A. Alemi [и др.] // arXiv preprint arXiv:1612.00410. — 2016.
84. Caltech-UCSD birds 200
[Текст] / P. Welinder [и др.]. — 2010.
85. 3d object representations for fine-grained categorization
[Текст] / J. Krause [и др.] // Proceedings of the IEEE international conference on computer vision workshops. — 2013. — С. 554—561.
86. Deepfashion: Powering robust clothes recognition and retrieval with rich annotations
[Текст] / Z. Liu [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — С. 1096—1104.
87. Deep metric learning via lifted structured feature embedding
[Текст] / H. Oh Song [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — С. 4004—4012.
88. Sampling matters in deep embedding learning
[Текст] / C.-Y. Wu [и др.] // Proceedings of the IEEE International Conference on Computer Vision. — 2017. — С. 2840—2848.
89. Ioffe, S. Batch normalization: Accelerating deep network training by reducing internal covariate shift
[Текст] / S. Ioffe, C. Szegedy // International conference on machine learning. — pmlr. 2015. — С. 448—456.
90. Das: Densely-anchored sampling for deep metric learning
[Текст] / L. Liu [и др.] // Computer Vision-ECCV 2022: 17th European Conference, Tel Aviv, Israel, October 23-27, 2022, Proceedings, Part XXVI. — Springer. 2022. — С. 399—417.
91. Simultaneous Similarity-based Self-Distillation for Deep Metric Learning
[Текст] / K. Roth [и др.] // International Conference on Machine Learning. — PMLR. 2021. — С. 9095—9106.
92. Hyperspherical variational auto-encoders
[Текст] / T. R. Davidson [и др.] // 34th Conference on Uncertainty in Artificial Intelligence 2018, UAI 2018. — Association For Uncertainty in Artificial Intelligence (AUAI). 2018. — С. 856—865.
93. Scott, T. R. Stochastic prototype embeddings
[Текст] / T. R. Scott, K. Ridgeway, M. C. Mozer // arXiv preprint arXiv:1909.11702. — 2019.
94. Standardized max logits: A simple yet effective approach for identifying unexpected road obstacles in urban-scene segmentation
[Текст] / S. Jung [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2021. — С. 15425—15434.
95. Magface: A universal representation for face recognition and quality assessment
[Текст] / Q. Meng [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2021. — С. 14225—14234.
96. On the Foundations of Noise-free Selective Classification.
[Текст] / R. El-Yaniv [и др.] // Journal of Machine Learning Research. — 2010. — Т. 11, № 5.
97. A perceptually weighted rank correlation indicator for objective image quality assessment
[Текст] / Q. Wu [и др.] // IEEE Transactions on Image Processing. — 2018. — Т. 27, № 5. — С. 2499—2513.
98. Karpukhin, I. Probabilistic embeddings revisited
[Текст] / I. Karpukhin, S. Dereka, S. Kolesnikov // The Visual Computer. — 2024. — Т. 40, № 6. — С. 4373—4386.
99. Kingma, D. P. Adam: A method for stochastic optimization
[Текст] / D. P. Kingma, J. Ba // arXiv preprint arXiv:1412.6980. — 2014.
100. Li, X. On the convergence of stochastic gradient descent with adaptive stepsizes
[Текст] / X. Li, F. Orabona // The 22nd international conference on artificial intelligence and statistics. — PMLR. 2019. — С. 983—992.
101. Asam: Adaptive sharpness-aware minimization for scale-invariant learning of deep neural networks
[Текст] / J. Kwon [и др.] // International Conference on Machine Learning. — PMLR. 2021. — С. 5905—5914.
102. Genz, A. Numerical computation of multivariate normal probabilities [Текст] / A. Genz // Journal of computational and graphical statistics. — 1992. — Т. 1, № 2. — С. 141—149.
103. Accelerated training for massive classification via dynamic class selection [Текст] / X. Zhang [и др.] // Proceedings of the AAAI Conference on Artificial Intelligence. Т. 32. — 2018.
104. Soch, J. Exceedance Probabilities for the Dirichlet Distribution
[Текст] / J. Soch, C. Allefeld // arXiv preprint arXiv:1611.01439. — 2016.
105. An ensemble of simple convolutional neural network models for mnist digit recognition
[Текст] / S. An [и др.] // arXiv preprint arXiv:2008.10400. — 2020.
106. Zagoruyko, S. Wide residual networks
[Текст] / S. Zagoruyko, N. Komodakis // arXiv preprint arXiv:1605.07146. — 2016.
107. Dua, D. UCI Machine Learning Repository
[Текст] / D. Dua, C. Graff. — 2017. — URL: http://archive.ics.uci.edu/ml.
108. Reading digits in natural images with unsupervised feature learning [Текст] / Y. Netzer [и др.]. — 2011.
109. Autoaugment: Learning augmentation strategies from data
[Текст] / E. D. Cubuk [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2019. — С. 113—123.
110. Scikit-learn: Machine Learning in Python
[Текст] / F. Pedregosa [и др.] // Journal of Machine Learning Research. — 2011. — Т. 12. — С. 2825—2830.
111. A limited memory algorithm for bound constrained optimization
[Текст] / R. H. Byrd [и др.] // SIAM Journal on scientific computing. — 1995. — Т. 16, № 5. — С. 1190—1208.
112. Polyloss: A polynomial expansion perspective of classification loss functions
[Текст] / Z. Leng [и др.] // arXiv preprint arXiv:2204.12511. — 2022.
113. Williams, R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning
[Текст] / R. J. Williams // Machine learning. — 1992. — Т. 8, № 3. — С. 229—256.
Список рисунков
1.1 Модельная задача классификации, демонстрирующая преимущества оптимизации точности по сравнению с известными функциями потерь. Верхний график показывает зависимость точности от параметра b пороговой функций. Нижний график показывает зависимость известных функций потерь и предлагаемой в третьей главе функции EXACT от параметра модели. В отличие от других функций, минимизация EXACT позволяет найти оптимальный параметр Ь, для которого точность модели достигает 100%..................................... 32
1.2 Сравнение доли ошибок (error rate) (слева) и one-vs-one обобщения сглаженной бинарной функции ошибки (справа) от параметров модели в предлагаемой модельной классификационной задаче. Приведённые графики иллюстрируют различие двух функций. ... 34
1.3 Сравнения известных алгоритмов, выполненные в прошлых работах. В литературе содержится только 2 из 15 возможных сравнений. В настоящей работе мы сравниваем все указанные методы. 67
2.1 Предложенный двухстадийный алгоритм обучения стохастической модели представлений. На первой стадии используется классификационная функция потерь для обучения центроид классов. На второй стадии выполняется регрессия к центроидам полученным на первом шаге........................ 70
2.2 Сравнение задачи поиска и верификации. Каждый круг соответствует множеству элементов данных. Цвет круга соответствует классу элементов. Задача поиска решается с максимальной точностью при использовании Евклидова расстояния, в то время, как верификации не может быть решена на основе пороговой функции: элементы первого класса могут быть дальше, чем некоторые элементы классов 2 и 3............. 71
2.3 Значение метрики MAP@R для различных степеней фильтрации зашумлённого корпуса данных на основе предсказанной оценки уверенности. Вероятностные подходы оценивают степень уверенности для каждого входного изображения. Детерминированные методы ArcFace и CosFace не дают такой
оценки. Вместо неё используется вероятность предсказанного класса. 88
2.4 Примеры изображений, упорядоченных по степени уверенности модели DUL-reg-cls от меньшей уверенности к большей........ 89
3.1 Схема метода EXACT. Модель предсказывает среднее и дисперсию вектора логитов. Функция потерь оценивает точность стохастической модели, которая является гладкой функцией. Таким образом, появляется возможность оптимизировать точность модели
градиентными методами.......................... 91
3.2 Зависимость математического ожидания точности от параметра модели в простой задаче классификации для различных значений а. 92
3.3 Зависимость функции потерь EXACT от параметра модели с использованием и без использования зазора (margin). Зазор улучшает ландшафт оптимизации на ранних этапах обучения при больших значениях а............................ 99
3.4 Тестовая точность моделей, обученных с различными функциями потерь на данных их репозитория UCI, в зависимости от доли изменённых меток классов.........................106
3.5 Тестовая точность алгоритма EXACT в зависимости от размера выборки, используемой при оценке интеграла. Результаты приведены для оптимизации методом стохастического градиентного спуска с импульсом, равным 0.9...................... 108
3.6 Потребление памяти и скорость обработки данных при обучении в перерасчёте на один элемент данных для функции потерь EXACT в зависимости от числа классов и размера выборки, используемой при интегрировании. Также приведено сравнение со скоростью расчёта градиентов модели Wide ResNet 16-8..............109
3.7 Ошибка оценки градиента метода EXACT и метода REINFORCE для различных объёмов выборки, участвующей в численной оценке интеграла..................................110
Список таблиц
1 Сравнение показателей функции ошибки и one-vs-one функции
потерь для разных параметров модели.................. 33
2 Сравнение стохастических моделей представлений........... 67
3 Сравнение детерминированных и стохастических моделей на наборах данных Cars196 и CUB200. Детерминированные методы сгруппированы в верхней части таблицы, а стохастические в середине. Результаты для предлагаемого нового подход приведены внизу таблицы. Лучший результат в каждом столбце выделен жирным шрифтом, а результаты превосходящие детерминированные модели подчёркнуты. Все значения приведены
в процентах................................. 79
4 Сравнение детерминированных и стохастических моделей на наборах данных In-shop и SOP. Детерминированные методы сгруппированы в верхней части таблицы, а стохастические в середине. Результаты для предлагаемого нового подход приведены внизу таблицы. Лучший результат в каждом столбце выделен жирным шрифтом, а результаты превосходящие детерминированные модели подчёркнуты. Все значения приведены
в процентах................................. 80
5 Сравнение нормального распределения и распределения фон Мизеса-Фишера на основе метрики MAP@R (%) для различных стохастических моделей. Подчёркнуты распределения, используемые в исходных работах..................... 82
6 Сравнения функций оценки расстояния на основе метрики MAP@R (%). Подчеркнуты функции расстояния, используемые в исходных статьях.................................... 84
7 Сравнение Recall@1 (%) и confidence-based error detection accuracy (CEDA, %) на подмножестве обучающих данных............ 85
8 Сравнение Recall@1 (%) и confidence-based error detection accuracy (CEDA, %) на тестовых данных...................... 85
9 Коэффициент ранговой корреляции Спирмена между предсказанной уверенностью модели и качеством изображений на зашумлённых наборах данных. В качестве базового подхода оценивалась наибольшая вероятность класса, предсказанная моделью ArcFace (на данных Cars196 и CUB200) или CosFace (на данных In-shop и SOP)........................... 87
10 Тестовая точность классификации (%) линейных моделей, обученных с использованием различных функций потерь на 10-и табличных наборах данных. Приведены среднее и стандартное отклонение точности, полученные для 5 итераций обучения с различными состояниями генератора случайных чисел. Обучение модели логистической регрессии Sklearn не зависит от генератора случайных чисел и стандартное отклонение для него равно нулю. Лучший результат выделен жирным шрифтом.............104
11 Тестовая точность классификации (%) глубоких моделей, обученных с использованием различных функций потерь на задачах компьютерного зрения. Приведены среднее и стандартное отклонение точности, полученные для 5 итераций обучения с различными состояниями генератора случайных чисел. Лучший результат выделен жирным шрифтом..................105
12 Оценка устойчивости к ошибкам в разметке на данных CIFAR-10 и CIFAR-100..................................107
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.