Оценка неопределённости в моделях глубокого обучения компьютерного зрения тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Дерека Станислав Артурович
- Специальность ВАК РФ00.00.00
- Количество страниц 144
Оглавление диссертации кандидат наук Дерека Станислав Артурович
Введение
Глава 1. Оценка неопределённости и OOD-детекция: обзор и
постановка задачи
1.1 Типы неопределённости и их проявления в компьютерном зрении
1.1.1 Алейаторная неопределённость
1.1.2 Эпистемическая неопределённость
1.2 Постановка задачи OOD-детекции
1.3 Риск-контролируемое распознавание и роль OOD-детекции
1.4 Метрики и критерии оценки качества в задачах оценки неопределённости и OOD-детекции
1.4.1 Калибровка вероятностей: ECE, NLL, Brier, температурная настройка
1.4.2 Метрики в OOD-детекции: AUROC, AUPR, FPR@TPR
1.5 Пост-хок методы OOD-детекции и калибровки
1.5.1 Maximum Softmax Probability (MSP)
1.5.2 ODIN: температурное масштабирование и малые возмущения
1.5.3 Энергетические оценки
1.5.4 ReAct, VIM, SHE, ASH
1.6 Ансамбли и диверсификация
1.6.1 Диверсификация и существующие методы: NCL, ADP,
DICE
1.6.2 Ограничения диверсификации на уровне выходов
1.7 Байесовские подходы и лапласовская аппроксимация
1.7.1 Лапласовская аппроксимация: основы
1.7.2 Ограничения практического применения лапласовской аппроксимации
1.7.3 Last-Layer Laplace Approximation (LLLA)
1.8 Вероятностные эмбеддинги: контекст и обзор
1.8.1 Метрическое обучение: методы, метрики и особенности оценки
1.8.2 Метрики качества в метрическом обучении
1.8.3 Вероятностные эмбеддинги
Глава 2. Saliency-Diversified Deep Ensembles (SDDE): метод,
эксперименты и результаты
2.1 Мотивация
2.2 Метод SDDE: диверсификация по saliency-картам
2.2.1 Карты внимания
2.2.2 SDDE
2.2.3 Методы агрегации для OOD-детекции
2.3 Эмпирический анализ: как связаны карты внимания и согласованность предсказаний в ансамбле?
2.4 Экспериментальный сетап
2.5 Экспериментальные результаты
2.5.1 Влияние SDDE на разнообразие предсказаний в ансамбле
2.5.2 Точность предсказания ансамбля и метрики калибровки
2.5.3 OOD-детекция
2.5.4 Результаты на ImageNet
2.5.5 Устойчивость к сдвигам распределения данных
2.5.6 Использование OOD-данных для улучшения обучения
2.5.7 Анализ агрегации логитов и распределения предсказаний
2.5.8 Влияние количества моделей в ансамбле на OOD-детекцию
2.6 Выводы
Глава 3. Упрощения лапласовской аппроксимации для
улучшения OOD-детекции и калибровки
3.1 Мотивация и ограничения стандартной аппроксимации Лапласа
3.2 Метод ICLA: тождественная кривизна и оптимизация точности априора
3.2.1 Методы анализа спектральных свойств информации Фишера и разделимости классов
3.2.2 Identity Curvature Laplace Approximation
3.3 Экспериментальные результаты
3.3.1 Синтетические примеры: наглядная демонстрация эффекта
3.3.2 Результаты в задачах OOD-детекции
3.3.3 Точность классификации и метрики калибровки
3.4 Анализ
3.4.1 Анализ независимости от стадии обучения
3.4.2 Спектральный анализ собственных значений Фишера
3.4.3 Влияние разделимости классов в пространстве признаков
3.4.4 Штраф Фишера и минимизация, учитывающая кривизну
3.5 Выводы
Глава 4. Неопределённость в задачах поиска изображений,
метрического машинного обучения и классификации. Применения для улучшения робастности к шуму в
данных и фильтрации грязных данных
4.1 Мотивация и особенности неопределённости в метрическом обучении
4.1.1 Проблема качества данных и робастности к шуму разметки
4.1.2 Ограничения детерминистических подходов и потребность в моделировании неопределённости
4.1.3 Проблема субоптимальности суррогатных функций потерь
4.1.4 Интеграционная перспектива
4.2 Робастность метрического обучения к шуму разметки
4.2.1 Характеристика шума в датасетах поиска изображений
4.2.2 Типы шума, специфичные для метрического обучения
4.2.3 Экспериментальное сравнение робастности между задачами
4.2.4 Влияние структуры шума на производительность
4.2.5 Теоретическое обоснование пониженной робастности
4.3 Вероятностные эмбеддинги: унифицированный анализ и применение для фильтрации грязных данных
4.3.1 Систематическое сравнение PE-методов
4.3.2 Оценка неопределённости и предсказание качества данных
4.3.3 Практические аспекты выбора PE-методов
4.4 Прямая оптимизация точности в стохастических моделях
4.4.1 Ограничения суррогатных функций потерь
4.4.2 Метод EXACT: стохастические модели и ортантная интеграция
4.4.3 Экспериментальные результаты и применение
4.5 Выводы главы
Заключение
Список литературы
Список рисунков
Список таблиц
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Доверенный байесовский классификатор для данных малой размерности на основе многослойного персептрона2026 год, кандидат наук Перминов Андрей Игоревич
Модели и алгоритмы обучения стохастических нейронных сетей для извлечения высокоточных представлений в задачах распознавания образов2025 год, кандидат наук Карпухин Иван Александрович
Разработка алгоритмов обработки фото- и видеоданных на базе искусственных нейронных сетей в рамках создаваемого программно-аппаратного комплекса для мониторинга окружающей среды на особо охраняемых природных территориях2025 год, кандидат наук Ефремов Владислав Александрович
Исследование и разработка методов и алгоритмов мультимодального обучения с подкреплением в сложных динамических средах2025 год, кандидат наук Воловикова Зоя Александровна
Построение пространств свойств на основе вероятностных моделей для задач предсказания структур2006 год, кандидат физико-математических наук Титов, Иван Андреевич
Введение диссертации (часть автореферата) на тему «Оценка неопределённости в моделях глубокого обучения компьютерного зрения»
Введение
Актуальность темы. Современные методы глубокого обучения обеспечили кардинальный прорыв в области компьютерного зрения, значительно превзойдя человеческий уровень производительности в классификации [1], детекции объектов [2], семантической сегментации [3] и верификации лиц [4]. На эталонных бенчмарках, включая ImageNet [1], глубокие нейронные сети демонстрируют беспрецедентные результаты, существенно превосходящие человеческие возможности. Однако по мере масштабного внедрения этих систем в критически важные практические приложения выявилась фундаментальная уязвимость к сдвигам распределения данных и появлению примеров вне обучающего домена (out-of-distгibution, ССЭ) [5—8]. В подобных условиях первостепенную роль приобретают оценка неопределённости и моделирование доверия к предсказаниям, которые формируют концептуальную основу для механизмов раннего предупреждения и безопасной деградации качества [9—18].
В практических областях применения — от медицинской диагностики до автономных транспортных систем — последствия ошибочных предсказаний детерминированных моделей могут быть критическими. В связи с этим острую актуальность приобретают методы, которые не только обеспечивают высокую точность, но и адекватно сигнализируют о неопределённости, поддерживают механизмы отказа от предсказания и сохраняют устойчивость к новым факторам вариативности [6]. В рамках концепции риск-контролируемого распознавания корректная оценка неопределённости становится центральной научной проблемой [19], а надёжное моделирование доверия и эффективная СЭВ-детекция представляют неотъемлемые компоненты современных практических систем
[5].
В основе данной проблематики лежит строгое различение эпистемической и алейаторной неопределённости: первая отражает недостаток знаний модели о предметной области, вторая — присущую данным внутреннюю случайность [20]. Стратегии их минимизации принципиально различны: против эпистемической неопределённости эффективны обогащение данных и ансамблевые подходы, тогда как алейаторная неопределённость требует учёта внутренней вариативности сенсоров и условий регистрации данных. Ключевую роль в решении этих задач приобретают калибровка вероятностных оценок [21; 22] и методы ССБ-детек-
ции [5; 6]. При этом глубокие нейронные сети систематически демонстрируют избыточную уверенность в своих предсказаниях [23], что представляет серьёзную проблему в областях применения, критически важных для безопасности.
Степень разработанности темы. В современной научной литературе сформировались четыре ключевых направления исследований: (1) методы пост-хок ООЭ-детекции и калибровки, (п) ансамблевые подходы, (ш) байесовские методы, а также (Гу) вероятностные эмбеддинги. Ансамблевые методы демонстрируют значительное повышение устойчивости и обеспечивают возможность оценки разброса предсказаний [9; 24—26]. Однако их эффективность существенно зависит от степени достижения подлинного разнообразия между составляющими моделями ансамбля и корректности агрегирования получаемых сигналов неопределённости [24—28].
Пост-хок методы ООЭ-детекции охватывают широкий спектр от эвристических приёмов [29—31] до принципиальных теоретически обоснованных подходов [32; 33]. Байесовские методы [34—39], в частности лапласовская аппроксимация [34] — вычислительно эффективная байесовская техника — предоставляют концептуально прозрачный путь к оценке неопределённости. Однако их практическая применимость критически зависит от получения устойчивых и репрезентативных оценок кривизны функции потерь [37; 40]. Практически значимые варианты данного подхода [35; 36] существенно облегчают масштабирование на большие сети, но не устраняют фундаментальных ограничений. Вероятностные эмбеддинги предоставляют богатый методологический инструментарий для фильтрации данных, агрегации информации и построения доверительных зон [12—17; 41—43]. Однако они настоятельно требуют унифицированной оценки в рамках строго сопоставимых экспериментальных протоколов.
Несмотря на достигнутый существенный прогресс, в области остаётся нерешённым ряд проблем. Во-первых, подавляющее большинство современных подходов к диверсификации ансамблей ограничиваются варьированием инициализации и обучающих данных, не обеспечивая подлинного разнообразия на уровне используемых признаков и ограничиваясь лишь диверсификацией выходных предсказаний.
Во-вторых, классические лапласовские аппроксимации существенно зависят от трудоёмких и вычислительно неустойчивых оценок кривизны функции
потерь, что ограничивает их практическое внедрение в крупномасштабных системах [37; 40].
В-третьих, в задачах retrieval и verification принципиально важными остаются аспекты влияния шума разметки на производительность модели, которые требуют специализированного исследования.
Наконец, в области вероятностных эмбеддингов отсутствуют унифицированные и строго воспроизводимые протоколы сравнения, что препятствует объективной оценке относительной эффективности вероятностных и детерминированных методов.
Целью данной работы является разработка и всестороннее исследование методов, существенно улучшающих надёжность оценок неопределённости и эффективность выявления данных вне распределения (OOD) в моделях глубокого обучения для компьютерного зрения, при обеспечении строгой воспроизводимости результатов и высокой практической применимости предложенных решений.
Для достижения поставленной цели необходимо решить следующие задачи:
1. Разработать метод saliency-диверсификации ансамблей (SDDE), использующий GradCAM-карты для явной диверсификации признаков в ансамбле. Обосновать эффективность логит-агрегации (MAL) для ансамблевых OOD-оценок с достижением новых результатов уровня state-of-the-art на OpenOOD бенчмарках [28].
2. Предложить лапласовскую аппроксимацию с тождественной кривизной (ICLA), отказывающуюся от явного вычисления гессиана и обеспечивающую более информативные оценки неопределённости для OOD-примеров при сохранении калибровки. Продемонстрировать превосходство над стандартными методами на датасетах CIFAR-10, CIFAR-100 и ImageNet-200 [44].
3. Исследовать влияние шума разметки на устойчивость моделей в задачах retrieval/verification в сравнении с классификацией, проанализировать различные типы шума, специфичные для задач image retrieval, и их влияние на итоговые метрики [45].
4. Сформировать единый воспроизводимый протокол сравнения методов неопределённости, включающий многосидовую оценку, отчёт по доверительным интервалам и прозрачные процедуры подбора гиперпа-
раметров с унифицированным сравнением вероятностных и детерминированных подходов на стандартных датасетах. Разработать метод для прямой оптимизации точности классификации через стохастизацию выходов модели [28; 44; 46; 47].
Научная новизна:
1. Предложен метод Saliency-Diversified Deep Ensembles (SDDE), использующий GradCAM-карты для явной диверсификации признаков в ансамбле и демонстрирующий улучшения в OOD-детекции и калибровке на CIFAR-10/100 и ImageNet при сопоставимой либо лучшей точности [28]. Обоснована и экспериментально подтверждена эффективность логит-агрегации (MAL) для ансамблей в задачах OOD-детекции, показано её преимущество относительно усреднения вероятностей (MSP) при сходной вычислительной стоимости. Метод достигает новых результатов уровня state-of-the-art на OpenOOD бенчмарках по точности, калибровке и OOD-детекции.
2. Разработана Identity Curvature Laplace Approximation (ICLA), позволяющая отказаться от явного вычисления гессиана и обеспечивающая более информативные оценки неопределённости для OOD-примеров при сохранении калибровки. Установлена связь между преимуществами ICLA и особенностями спектра эмпирического Фишера, а также межклассовой разделимостью, что позволяет объяснить области, в которых метод наиболее эффективен [44]. Эксперименты показывают, что ICLA обеспечивает более высокую точность OOD-детекции по сравнению со стандартными лапласовскими аппроксимациями на датасетах CIFAR-10, CIFAR-100 и ImageNet-200, при этом уровень калибровки остаётся сопоставимым с базовыми подходами.
3. Выявлена повышенная чувствительность задач retrieval и verification к шуму разметки по сравнению с классификацией. Показано, что при фиксированной доле шумных меток наибольший негативный эффект оказывает рост числа затронутых классов, а не концентрация шума в отдельных крупных классах [45]. Впервые исследованы различные типы шума разметки, специфичные для задач image retrieval, и изучено их влияние на производительность модели.
4. Предложен и апробирован единый воспроизводимый протокол сравнения методов неопределённости, включающий многосидовую оценку,
отчёт по доверительным интервалам и прозрачные процедуры подбора гиперпараметров, что повышает сопоставимость результатов и снижает риск экспериментальной предвзятости [28; 44].
Разработан протокол унифицированного сравнения вероятностных и детерминированных методов на датасетах CUB-200, Cars-196, In-shop и Stanford Online Products [46].
Предложен метод EXACT для прямой оптимизации точности классификации через стохастизацию выходов модели, демонстрирующий улучшения на датасетах SVHN, CIFAR-10, CIFAR-100 и ImageNet [47].
Практическая значимость диссертации состоит в следующем. Метод SDDE предоставляет простую и эффективную схему снижения корреляций между моделями ансамбля, значительно улучшая OOD-детекцию и калибровку [28]. Подход ICLA существенно снижает барьер внедрения лапласовских методов, устраняя необходимость в сложной оценке кривизны [44].
Анализ влияния шума разметки формирует фундаментальные принципы сбора данных и построения доверительных оценок [45]. Метод EXACT предлагает инновационный подход к прямой оптимизации точности классификации, что особенно важно в задачах с требованиями максимальной точности [47].
Практическая ценность работы также проявляется в детальных рекомендациях по интеграции предложенных методов в промышленные системы.
Методология и методы исследования. При проведении диссертационного исследования использовались методы машинного обучения, глубокого обучения, компьютерного зрения, байесовской статистики, теории вероятностей, линейной алгебры, численного анализа, разработки программного обеспечения, воспроизводимых экспериментов и статистической оценки результатов.
Основные положения, выносимые на защиту: диссертации заключаются в следующем:
1. Метод SDDE с saliency-диверсификацией через GradCAM-карты достигает новых результатов уровня state-of-the-art на OpenOOD бенчмарках по точности, калибровке и OOD-детекции, превосходя классические Deep Ensembles на CIFAR-10/100 и ImageNet. Логит-агрегация (MAL) для ансамблей обеспечивает более устойчивую и эффективную OOD-оценку по сравнению с усреднением вероятностей (MSP) при сходной вычислительной стоимости [28].
2. Метод ICLA с тождественной кривизной улучшает OOD-детекцию на CIFAR-10, CIFAR-100 и ImageNet-200 датасетах при сохранении аналогичных метрик калибровки, превосходя стандартные лапласовские методы за счёт более информативных оценок неопределённости для OOD-примеров [44].
3. В задачах retrieval/verification выявлена повышенная чувствительность к шуму разметки по сравнению с классификацией. Установлено, что наибольший негативный эффект оказывает рост числа затронутых классов, а не концентрация шума в отдельных крупных классах [45].
4. Предложен и апробирован единый воспроизводимый протокол сравнения методов неопределённости, включающий многосидовую оценку, отчёт по доверительным интервалам и прозрачные процедуры подбора гиперпараметров с унифицированным сравнением вероятностных и детерминированных подходов на стандартных датасетах. Разработан метод EXACT для прямой оптимизации точности классификации через стохастизацию выходов модели [46; 47].
Достоверность полученных результатов обеспечивается многоуровневой системой валидации. Воспроизводимость достигается прозрачными протоколами экспериментов с фиксацией всех гиперпараметров, версий программного обеспечения и контрольных сумм датасетов. Статистическая значимость подтверждается многосидовыми запусками (до 5 различных сидов) с расчётом доверительных интервалов и анализом устойчивости результатов.
Корректность выводов валидируется сравнением с современными бей-злайнами на репрезентативных наборах данных, включая CIFAR-10/100, ImageNet-200, CUB-200, Cars-196 и Stanford Online Products. Надёжность поддерживается публикацией исходных кодов в открытых репозиториях, детальными отчётами по вычислительной стоимости и полной документацией экспериментальных протоколов. Все имплементации предложенных методов доступны в открытых репозиториях:
- https://github.com/corl-team/sdde
- https://github.com/maxnygma/icla
- https://github.com/tinkoff-ai/probabilistic-embeddings
- https://github.com/ivan-chai/exact
Апробация работы. Основные результаты диссертации докладывались на престижных международных конференциях по компьютерному зрению и ма-
шинному обучению, получив высокую экспертную оценку научного сообщества. Представление кода в открытых репозиториях способствовало внешней валида-ции и воспроизводимости результатов. Результаты работы были представлены на следующих международных конференциях с независимым рецензированием:
— IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022, Нью-Орлеан, США
— IEEE International Conference on Image Processing (ICIP), 2024, Абу-Даби, ОАЭ
— IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2025, Тусон, США
Публикации. Основные результаты диссертационного исследования представлены в 5 высококачественных рецензируемых публикациях (2 статьи в журналах, 3 доклада на конференциях), индексируемых в базе данных Scopus и Web of Science, а также входящих в собственный перечень журналов МФТИ.
Личный вклад. Личное участие автора в представленных исследованиях заключается в следующем. В работе по исследованию вероятностных эмбеддингов [46] автор участвовал в обсуждении результатов исследования и подготовке публикации. При анализе устойчивости к шуму разметки [45] выполнен полный цикл научно-исследовательских работ: от планирования и разработки экспериментов до проведения исследований, реализации алгоритмов, подготовки публикации и представления результатов на конференции. Аналогичный объём работ выполнен при разработке метода SDDE [28], включая планирование экспериментов, их проведение, реализацию алгоритмов, подготовку публикации и представление на конференции. В проекте по разработке ICLA [44] автор участвовал в планировании и разработке экспериментов, а также в подготовке публикации. При работе над методом EXACT [47] проведена часть экспериментов, подготовлена публикация и осуществлено участие в обсуждении результатов исследования.
Объем и структура работы. Диссертация состоит из введения, 4 глав, заключения и 0 приложений. Полный объём диссертации составляет 144 страницы, включая 19 рисунков и 15 таблиц. Список литературы содержит 143 наименования.
Глава 1. Оценка неопределённости и OOD-детекция: обзор и
постановка задачи
Данная глава представляет систематический и всесторонний обзор современных методов оценки неопределённости и детекции данных вне распределения (Out-of-Distribution, OOD) в контексте задач компьютерного зрения (Computer Vision, CV). Проблема количественной оценки неопределённости приобретает особую актуальность в эпоху массового внедрения систем машинного обучения в критически важных областях, где ошибочные предсказания могут иметь серьёзные последствия.
В главе последовательно и детально рассматриваются фундаментальные типы неопределённости и их многообразные проявления в реальных сценариях применения систем компьютерного зрения. Вводятся ключевые метрики и критерии оценки качества методов. Подробно описываются современные пост-хок (post-hoc) методы OOD-детекции и калибровки вероятностей. Тщательно анализируются ансамблевые подходы и стратегии диверсификации моделей. Обстоятельно обсуждаются байесовские аппроксимации, в частности получившая широкое распространение лапласовская аппроксимация. Исследуются вероятностные эмбеддинги как важная область и богатый источник дополнительных инструментов для решения задач оценки неопределённости.
Структурированное изложение материала позволяет читателю получить целостное представление о современном состоянии области и её ключевых вызовах. Глава логически завершается чёткой формулировкой исследовательских вопросов и гипотез, которые определяют концептуальную рамку и методологическую основу для оригинальных вкладов, представленных в последующих главах диссертации.
1.1 Типы неопределённости и их проявления в компьютерном
зрении
Неопределённость предсказаний нейронной сети — это количественная мера «неуверенности» модели в собственном ответе. В литературе выделяют
два комплементарных типа неопределённости: алейаторную и эпистемическую [20].
1.1.1 Алейаторная неопределённость
Алейаторная (от лат. alea — «жребий») неопределённость обусловлена присущей данным случайностью [20].
К основным источникам такой неопределённости относятся:
— шум сенсоров — тепловой шум в матрицах цифровых камер, артефакты JPEG-компрессии;
— вариативность условий съёмки — изменения освещения в течение суток при уличной съёмке, динамическое размытие от движения объектов или камеры, различные углы обзора и перспективные искажения, частичные окклюзии объектов;
— низкое отношение сигнал/шум — съёмка в условиях недостаточной освещённости, медицинские изображения с низкой дозой излучения;
— неоднозначность визуальных сцен — силуэты людей и животных в кон-тровом свете, отражения в воде или стекле, полупрозрачные объекты.
В классификации изображений алейаторная неопределённость проявляется как перекрытие классов — например, при различении пород собак со схожей внешностью (хаски и маламут) или классификации изображений транспорта в сумерках, когда контуры автомобилей и грузовиков становятся неразличимыми. В задачах детекции и сегментации она проявляется как расплывчатость границ объектов (контуры облаков на небе, границы теней на асфальте) и неоднозначные контуры при сегментации волос человека на портретных фотографиях или выделении листвы деревьев на фоне неба.
Алейаторная неопределённость неустранима увеличением объёма обучающей выборки, но может быть адекватно учтена при обучении через различные подходы [48—52].
К основным методам работы с алейаторной неопределённостью относятся:
— робастные функции потерь — Focal Loss для борьбы с дисбалансом классов, Label Smoothing для смягчения жёстких меток;
— явное моделирование шума — добавление гауссовского шума к входным изображениям, использование Dropout как аппроксимации байесовского вывода;
— ансамблирование на уровне аугментаций — Test-Time Augmentation с усреднением предсказаний по повёрнутым, масштабированным и обрезанным версиям изображения;
— пост-хок калибровка вероятностей — температурное масштабирование логитов, изотоническая регрессия, метод Platt scaling.
1.1.2 Эпистемическая неопределённость
Эпистемическая (от греч. episteme — «знание») неопределённость связана с незнанием модели: недостатком данных, ограниченной репрезентативностью обучающего корпуса, неидентифицируемостью параметров и ограничениями архитектуры [20]. В контексте компьютерного зрения она проявляется в разнообразных сценариях.
Модель, обученная на ImageNet с преобладанием дневных изображений, демонстрирует высокую эпистемическую неопределённость при анализе ночных фотографий. Системы распознавания лиц, обученные на европеоидах, показывают повышенную неуверенность при работе с представителями других этнических групп. Системы медицинской диагностики, разработанные на снимках одного типа МРТ-сканера, могут давать неточные оценки при использовании оборудования другого производителя с иными характеристиками получения изображений. Эпистемическая неопределённость резко возрастает при встрече с данными вне распределения (OOD). Автомобильная камера, обученная распознавать дорожные знаки в городских условиях, будет неуверенно классифицировать знаки в сельской местности. Модели сегментации, тренированные на обычных RGB-изображениях, покажут высокую неопределённость при работе с инфракрасными снимками. Системы детекции объектов, разработанные для хорошей погоды, будут демонстрировать повышенную эпистемическую неопределённость в условиях тумана, снега или дождя.
При сильных распределительных сдвигах (domain shift) эта неопределённость может становиться критичной. К таким сдвигам относятся: переход от
синтетических данных (как в Grand Theft Auto для обучения автопилотов) к реальным дорожным сценариям; изменение стиля изображений (например, от фотографий к картинам или эскизам при обучении классификаторов произведений искусства); смена сезонов (модель, обученная на летних пейзажах, при анализе зимних сцен); различия в качестве камер (переход от высококачественных снимков к изображениям с мобильных устройств низкого разрешения).
В отличие от алейаторной, эпистемическая неопределённость потенциально устранима [40; 53; 54]. Её можно уменьшать несколькими способами: увеличением и диверсификацией обучающей выборки (добавление изображений из новых доменов, включение редких классов, сбор данных в различных условиях освещения и погоды); применением ансамблей моделей (например, комбинирование ResNet, EfficientNet и Vision Transformer для повышения ро-бастности предсказаний); использованием байесовских аппроксимаций (Monte Carlo Dropout, вариационные байесовские нейронные сети, лапласовская аппроксимация); применением активного обучения для целенаправленного расширения обучающей выборки наиболее информативными примерами (выбор изображений с максимальной неопределённостью для последующей разметки экспертами).
1.2 Постановка задачи OOD-детекции
Данный раздел формализует задачу детекции данных вне распределения (Out-of-Distribution, OOD) в контексте многоклассовой классификации изображений, следуя принятым в сообществе формулировкам.
Референсное распределение и определение OOD. Пусть задано референсное (in-distribution, ID) распределение PID над парами (х,у) с плотностью pío. Распределение Pood называется «вне распределения» относительно Pid, если для любой доли 6 Е (0,1) существует измеримая область ^5 такая, что существенная часть массы Pood сосредоточена на ^5, тогда как плотность PID на ^5 сколь угодно мала. Интуитивно: значимая часть Pood лежит в областях низкой плотности Рщ [5; 6]. Это определение подчёркивает относительную природу OOD: оно задано относительно выбранного PID.
Стандартная постановка (standard OOD detection). Рассматривается модель /е, обученная на VID для распознавания классов ^ID. На этапе инференса встречаются входы х ~ VID (ID) и входы х ~ ^ood (OOD), где семантические классы OOD не принадлежат ^щ. Требуется построить скор-функцию s(x) G R, которая принимает большие значения на OOD и малые на ID, и выбрать порог т для решающего правила
дх(х) = I[s(z) ^ т], §т(х) = 1 ^ OOD, дт(х) = 0 ^ ID.
Отчётность традиционно ведут по AUROC, AUPR и FPR@TPR; при этом различают Near-OOD (семантически близкие к ID наборы) и Far-OOD (далёкие по семантике), так как сложность задачи и относительный ранг методов существенно зависят от этого выбора [5; 6].
Полноспектральная OOD-детекция (full-spectrum). В full-spectrum OOD detection одновременно рассматриваются: (i) обобщение на ID-данные под сдвигом (covariate/semantic shift относительно Pid) и (ii) выявление истинных OOD-примеров с новыми семантиками. Тестовая выборка является смесью компонент «ID под сдвигом» и «OOD». Цель — поддерживать высокую точность по ID-компоненте и надёжно отделять OOD, что отражается в комбинированной отчётности: метрики классификации для ID и метрики детекции для OOD [55]. Эта постановка ближе к реальным условиям эксплуатации и существенно сложнее стандартной.
Решение с отказом и интеграция в распознаватель. Практическое решающее правило совмещает классификацию и детекцию: при s(x) < т система выдаёт класс
у(х) = argmaxре(с | х),
сеУю
а при s(x) ^ т — символ ± (отказ/эскалация). Порог т подбирают по валидации в зависимости от эксплуатационных требований (например, ограничение FPR при заданном TPR) и целевых метрик.
Замечания. Определение OOD всегда зависит от выбранного VID и протокола тестирования; важно явно фиксировать тип сдвига (Near/Far, corruption/shift) и режим (standard vs full-spectrum), чтобы сравнения методов были корректными и воспроизводимыми [56].
1.3 Риск-контролируемое распознавание и роль ООО-детекции
В критически важных приложениях требуется баланс между точностью и управляемым риском.
В автономных транспортных средствах система должна уверенно распознавать дорожные знаки в знакомых условиях, но немедленно передавать управление водителю при встрече с неизвестными объектами (например, упавшее дерево на дороге или нестандартная дорожная разметка). В медицинской диагностике алгоритм анализа рентгеновских снимков должен давать точные предсказания для типичных случаев, но обязательно направлять сложные или атипичные изображения (редкие патологии, снимки с артефактами от имплантов) на дополнительную экспертизу радиолога. В системах промышленной безопасности детекторы дефектов на производственных линиях должны надёжно выявлять известные типы брака, но останавливать конвейер при обнаружении аномальных образцов, которые могут указывать на новые виды неисправностей оборудования.
Концепция риск-контролируемого распознавания подразумевает реализацию следующих ключевых принципов:
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Априорное распределение параметров в задачах выбора моделей глубокого обучения2022 год, кандидат наук Грабовой Андрей Валериевич
Рандомизированный подход к обучению в условиях отсутствия разметки и малого количества данных2020 год, кандидат наук Бояров Андрей Александрович
Многомасштабное моделирование нефтегазовых процессов на основе активного обучения суррогатных моделей2025 год, кандидат наук Печко Константин Анатольевич
Теория и методы параметрической идентификации стохастических математических моделей2026 год, доктор наук Кротова Елена Львовна
Исследование и разработка методов и программных средств классификации текстовых документов2013 год, кандидат технических наук Гулин, Владимир Владимирович
Список литературы диссертационного исследования кандидат наук Дерека Станислав Артурович, 2026 год
/ / / /
R7 1 Р / i
—1- - - - —
4 6 8
CIFAR100 Near
10
4 6 8
CIFAR100 Far
4 6 8
С^АЯЮО
83.5
и
0
1 83.0 <
о 82.5
« 82.0 о
О 81.5
81.0
-•- Deep Ensemble -■- SDDE -♦- ADP -■- NCL -•- DICE
82.5
U 82.0 О ос
2 81.5 <
о 81.0
80.5
тз
§80.1 О
79.!
79.0
____\
А' -------1 >
•Г"
г?
1 /
81.5 81.0 80.5 80.0 79.5 79.0
г———^J 1
/у* Л -- >
яг ' 'г ' /
//
Wt ! ШС ' Т '
1 / / 1 »
6
#models
СЛ
оо
8
10
6
#models
10
6
#models
10
Рисунок 2.6 — Зависимость качества ООО-детекции (АШЮС) и точности классификации от количества моделей в ансамбле для различных методов. Представлены результаты для датасетов С1ЕА11-10 и СГОАЯ-ЮО. Иллюстрация взята из [28].
Полученные результаты имеют важное практическое значение, поскольку они демонстрируют, что метод ЗООБ не только улучшает качество ССВ-детек-ции, но и обеспечивает более эффективное использование вычислительных ресурсов за счёт возможности достижения высоких результатов с меньшим количеством моделей в ансамбле.
2.6 Выводы
В данной главе представлен и экспериментально валидирован метод Saliency-Diversified Deep Ensembles (SDDE), направленный на систематическое улучшение качества ансамблевых методов в задачах оценки неопределённости и детекции out-of-distribution данных.
Ключевые достижения. Метод SDDE систематически решает проблему коррелированности ошибок в ансамблях через диверсификацию используемых признаков на уровне карт внимания. В отличие от существующих методов (NCL, ADP, DICE), которые фокусируются на разнообразии выходных распределений, SDDE работает на уровне внутренних представлений, создавая ансамбли с различными стратегиями восприятия входных данных.
Экспериментальные результаты. Оценка на бенчмарке OpenOOD показывает, что SDDE достигает лучших результатов по OOD-детекции на да-тасетах CIFAR-10/100 и ImageNet-1K, при этом улучшая метрики калибровки (ECE, NLL, Brier score) без ухудшения точности классификации. Анализ зависимости качества от количества моделей показывает, что SDDE достигает максимальной производительности при 5-7 моделях, обеспечивая оптимальный баланс между качеством и вычислительными затратами.
Теоретические результаты. Исследование подтверждает выдвинутую гипотезу о взаимосвязи между разнообразием карт внимания и качеством ансамблевых предсказаний. Предложенный метод Maximum Average Logit (MAL) демонстрирует существенные преимущества над традиционным усреднением вероятностей (MSP) в задачах OOD-детекции, что делает его универсальным инструментом для повышения надёжности ансамблей.
Практическая значимость. SDDE предоставляет простую и масштабируемую схему повышения надёжности систем компьютерного зрения, совме-
стимую с существующими процедурами обучения. Метод эффективно решает фундаментальную проблему коррелированности ошибок в ансамблях, что важно для безопасного развёртывания в критически важных приложениях.
Ограничения и перспективы. Основным ограничением является умеренное увеличение вычислительных затрат на этапе обучения (20-30%) из-за необходимости вычисления Сга^АМ-карт. Эффективность метода зависит от способности архитектуры генерировать информативные БаИепсу-карты. Перспективными направлениями являются изучение различных типов эаНепсу-карт, разработка адаптивных схем диверсификации и интеграция с другими методами оценки неопределённости.
В контексте общих задач диссертации БОБЕ демонстрирует эффективность подхода, основанного на целенаправленном управлении разнообразием внутренних представлений, что открывает новые возможности для создания систем с улучшенной оценкой неопределённости и более высокой устойчивостью к различным типам сдвигов распределения данных.
Глава 3. Упрощения лапласовской аппроксимации для улучшения
OOD-детекции и калибровки
3.1 Мотивация и ограничения стандартной аппроксимации
Лапласа
Байесовские методы, несмотря на свою теоретическую привлекательность для оценки неопределённости в нейронных сетях [105], характеризуются существенными практическими ограничениями, которые снижают их применимость в реальных приложениях. Лапласовская аппроксимация [34], являясь одним из наиболее эффективных и математически обоснованных подходов к байесовскому выводу (см. раздел 1.7), тем не менее обладает рядом недостатков, которые затрудняют её использование в современных условиях.
Вычислительная сложность и масштабируемость. Стандартная лапласовская аппроксимация требует вычисления и хранения матрицы кова-риации параметров, размерность которой квадратично зависит от количества параметров модели. Для современных архитектур с миллионами параметров это приводит к непомерным требованиям к памяти и вычислительным ресурсам. Даже в случае Last-Layer Laplace Approximation (LLLA) [37], где аппроксимация применяется исключительно к последнему слою, оценка кривизны через различные аппроксимации (Fisher Information Matrix [106], Generalized Gauss-Newton [68], K-FAC [70]) требует значительных вычислительных ресурсов, которые могут превышать стоимость самого обучения модели.
Проблемы численной устойчивости. Эмпирические исследования показывают, что спектр Fisher Information Matrix в нейронных сетях характеризуется распределением с длинными хвостами [65]. Это означает, что большинство собственных значений принимает очень малые величины, в то время как небольшое их число достигает экстремально больших значений. Такая структура спектра приводит к плохой обусловленности матрицы ковариации, что требует применения сильного демпфирования и тщательной настройки гиперпараметра точности априора Л. Кроме того, распределение с длинными хвостами может приводить к нестабильным оценкам неопределённости и ухудшению качества OOD-детекции.
Несогласованность между кривизной модели и структурой данных. Основная проблема стандартной лапласовской аппроксимации состоит в том, что кривизна модели, определяемая через Fisher Information Matrix, может не соответствовать структуре классов в пространстве признаков. В частности, для датасетов с высокой межклассовой разделимостью (например, CIFAR-10 [98]) модели формируют хорошо разделимые представления в пространстве признаков, что приводит к формированию резких границ принятия решений. Однако кривизна модели, отражающая локальную геометрию функции потерь, может не учитывать глобальную структуру данных, что приводит к неадекватности оценок неопределённости.
Альтернативы с лучшим практическим профилем. Существующие альтернативные методы, такие как Deep Ensembles [67] и различные пост-хок подходы к OOD-детекции (см. раздел 3.3.2), часто обеспечивают сопоставимое или даже превосходящее качество оценки неопределённости при значительно более простой реализации и меньших вычислительных затратах. Это вызывает сомнения в практической ценности сложных байесовских аппроксимаций для современных задач компьютерного зрения.
С учётом выявленных ограничений возникает вопрос: можно ли сохранить преимущества байесовского подхода к оценке неопределённости, одновременно устранив его основные недостатки? Предлагаемый метод Identity Curvature Laplace Approximation (ICLA) даёт положительный ответ, показывая, что упрощение аппроксимации кривизны не только снижает вычислительную сложность, но и улучшает качество OOD-детекции за счёт более адекватного моделирования неопределённости.
3.2 Метод 1СЬЛ: тождественная кривизна и оптимизация точности
априора
3.2.1 Методы анализа спектральных свойств информации Фишера
и разделимости классов
В рамках исследования выдвигается гипотеза о том, что в широко используемых архитектурах нейронных сетей кривизна функции потерь может препятствовать корректной оценке неопределённости. Конкретно, локальная кривизна модели, измеряемая посредством вторых производных функции потерь, может вступать в противоречие с глобальной структурой ковари-ации классов, характерной для задач классификации. Данное наблюдение обусловливает необходимость разработки альтернативного подхода, лишённого указанных ограничений.
Методология анализа. Для подтверждения гипотезы необходимо оценить две характеристики: локальную кривизну модели и глобальную ковари-ацию классов. Кривизна модели анализируется через эмпирическую матрицу информации Фишера, определяемую следующим выражением:
N
п Ы)т (3.1)
п= 1
Для вычислительной эффективности используется диагональное представление [51] матрицы Фишера, которое сохраняет основные свойства исходной матрицы при значительном снижении вычислительной сложности.
Для оценки ковариации классов вводится метрика среднего поклассового косинусного сходства (МССБ), определяющая степень разделимости классов в пространстве признаков:
МССБ = 4 ^ ^ ^' У.т] , (3.2)
где у„л обозначает векторное признаковое представление ¿-го элемента класса п, Ыс — количество элементов в каждом классе, а нормализующий коэффициент
N = СЫс(С — — 1)/4 обеспечивает корректную интерпретацию метри-
ки.
Анализ в разделе 3.4.2 показывает, что спектр матрицы информации Фишера характеризуется длиннохвостым распределением, где несколько собственных значений принимают экстремально большие значения [65]. Кроме того, производительность ЬЬЬЛ снижается на высокоразделимых датасетах.
Для установления связи между разделимостью классов, кривизной и распределением собственных значений Фишера выдвигается гипотеза: штрафование длинных хвостов в матрице Фишера может улучшить производительность ЬЬЬЛ. Для проверки этой гипотезы применяется штраф Фишера:
FP = а
1 М
— ve logЫУг
i=i
(3.3)
где — — размер батча (xi, yi) ~ V, а а — гиперпараметр регуляризации. Этот штраф выполняет роль регуляризации кривизны модели, обеспечивая плоские минимумы путём снижения длинных хвостов матрицы Фишера [107—111]. Как альтернативу также используется Adaptive Sharpness-Aware Minimization (ASAM) [112], метод оптимизации для получения более плоского ландшафта кривизны. Анализ показывает, что применение данных методов улучшает производительность LLLA на высокоразделимых датасетах, что подтверждает связь между кривизной модели и разделимостью классов.
2
3.2.2 Identity Curvature Laplace Approximation
Систематический анализ эмпирических наблюдений мотивирует разработку принципиально нового упрощения ЬЬЬЛ, которое полностью устраняет вышеупомянутые фундаментальные проблемы. В рамках данного подхода исследуется матрица ковариации £е из уравнения 1.1, которая математически представляет собой сумму локального гессиана и произведения априорной точности с единичной матрицей.
В основе предлагаемого метода лежит радикальное упрощение процедуры лапласовской аппроксимации: вместо использования эмпирической или
приближённой матрицы Гессиана в качестве оценки кривизны, в качестве ковариационной матрицы апостериорного распределения параметров принимается масштабированная единичная матрица. Таким образом, апостериорная ковари-ация задаётся выражением:
£е = Л I. (3.4)
Предложенный подход получил название Identity Curvature Laplace Approximation (ICLA). В отличие от классических лапласовских аппроксимаций, ICLA полностью отказывается от использования эмпирических или приближённых оценок гессиана. Благодаря этому устраняется влияние сложной спектральной структуры матрицы Фишера, в частности — проблема длинных хвостов собственных значений.
Эксперименты показывают, что ICLA формирует более широкий и равномерный ландшафт неопределённости и значительно увеличивает энтропию для образцов вне распределения, что улучшает эффективность OOD-детекции. Как показывает анализ в разделе 3.4.3, ICLA наиболее эффективен на датасетах с высокой межклассовой разделимостью.
3.3 Экспериментальные результаты
3.3.1 Синтетические примеры: наглядная демонстрация эффекта
Полумесяцы. Для визуального исследования изменений, которые ICLA вносит в оценки неопределённости, был выбран датасет бинарной классификации "полумесяцы"с дополнительными 10 тестовыми выбросами. В данном эксперименте была использована простая двухслойная MLP с активациями ReLU и 20 скрытыми единицами. Проведено сравнение ландшафтов неопределённости, формируемых тремя методами: MAP, LLLA и ICLA. Результаты представлены на рисунке 3.1. Полученные результаты демонстрируют, что ICLA сохраняет общую структуру предсказательного распределения и обеспечивает более адекватные и точные оценки неопределённости для выбросов. Кроме
того, наблюдается, что поверхность неопределённости 1СЬЛ обусловливает более высокие оценки энтропии для выбросов, что является критически важным аспектом в задачах ООБ-детекции.
Рисунок 3.1 — Визуализация предсказательной неопределённости на синтетическом датасете «полумесяцы» с добавленными тестовыми выбросами: MAP (слева), стандартная LLLA (в центре), и ICLA (справа). Иллюстрация взята из [44].
Синусоидальная регрессия. Принципиально важно верифицировать, что полученные наблюдения не ограничиваются синтетическими задачами классификации и могут быть обобщены на синтетические задачи регрессии. Данные свойства демонстрируются на рисунке 3.2 посредством датасета синусоидальной регрессии. В данном эксперименте была применена аналогичная архитектура нейронной сети, и было проведено сравнение того же набора методов: MAP, LLLA и ICLA. Полученные результаты свидетельствуют о том, что ICLA обеспечивает оценки неопределённости, сопоставимые с LLLA, которая включает вычисление гессиана.
Рисунок 3.2 — Визуализация предсказательной неопределённости на синтетической задаче синусоидальной регрессии: MAP (слева), классическая LLLA (в центре), и ICLA (справа). Иллюстрация взята из [44].
3.3.2 Результаты в задачах OOD-детекции
Для экспериментального исследования OOD-детекции используется бенч-марк OpenOOD v1.5 [6], предоставляющий доступ к современным методам OOD-детекции. В качестве in-distribution датасетов используются CIFAR-10, CIFAR-100 и ImageNet-200 (подмножество ImageNet-1K) [113]. Бенчмарк включает части "Near OOD'^ "Far OOD": первая содержит датасеты, семантически близкие к ID, а вторая — датасеты совершенно иных категорий.
В рамках всех экспериментов в качестве базовой архитектуры нейронной сети применяется ResNet-18 [114], обучение которой осуществляется с помощью стохастического градиентного спуска (SGD) с коэффициентом момента 0.9. Начальное значение learning rate устанавливается равным 0.1 и плавно уменьшается до 10-6 по стратегии Cosine Annealing [115]. Для датасетов CIFAR-10 и CIFAR-100 обучение проводится на протяжении 100 эпох, а для ImageNet-200 — 90 эпох.
Для повышения статистической достоверности все эксперименты повторяются с тремя независимыми инициализациями случайных чисел; в таблицах и графиках приводятся усреднённые значения метрик и их стандартные отклонения. Предсказательное распределение для OOD-примеров вычисляется идентично тому, как это делается для in-distribution данных при оценке неопределённости.
Сравнительный анализ различных аппроксимаций Лапласа. В
данном разделе проводится детальное сравнение эффективности различных вариантов лапласовской аппроксимации — стандартной LLLA с использованием GGN, EF и K-FAC, а также предложенного метода ICLA — в контексте задачи обнаружения объектов вне распределения (OOD). В качестве основной метрики оценки используется площадь под ROC-кривой (AUROC) согласно протоколу OpenOOD [6]. Для обеспечения справедливости сравнения априорная точность для всех методов подбирается с помощью оптимизации маргинального правдоподобия [64].
Анализ результатов, представленных в таблице 8, показывает, что ICLA стабильно превосходит классические варианты лапласовской аппроксимации в большинстве экспериментальных сценариев. В частности, ICLA достигает наивысших значений AUROC в 5 из 6 проведённых экспериментов, что
подчёркивает его эффективность для задач ООО-детекции. Эти результаты свидетельствуют о том, что радикальное упрощение структуры ковариационной матрицы, лежащее в основе 1СЬЛ, не только не ухудшает, но зачастую и улучшает способность модели различать объекты вне распределения по сравнению с более сложными аппроксимациями кривизны.
Таблица 8 — Результаты ООО-детекции для различных аппроксимаций Лапласа. Все аппроксимации тестируются на множественных ООО источниках. Сообщаются средние значения и стандартные отклонения ЛИЯОС. Лучшие результаты среди различных методов выделены жирным шрифтом.
Датасет LLLAGGN LLLAEF LLLAK-FAC ICLA
CIFAR-10Near OOD 88.94± 0.30 89.54± 0.36 88.02± 0.28 90.01± 0.21
CIFAR-10Far OOD 91.54± 0.36 92.09± 0.30 90.73± 0.52 92.50± 0.38
CIFAR-100Near OOD 81.44± 0.09 81.66± o.io 80.30± 0.13 81.45± 0 .10
CIFAR-100Far OOD 80.00± 0.45 8°.17± 0.83 77.77± 0.53 80.79± 0.46
ImageNet-200Near ood 81.84± 0.10 81.86± 0.11 81.73± 0.10 81.88± o.io
ImageNet-200Far ood 89.39± 0.15 89.45± o.i4 88.94± 0.14 89.45± 0.14
Небайесовские подходы. Помимо сравнения с аппроксимациями Лапласа, проводится сопоставление ICLA с популярными пост-хок небайесовскими методами OOD-детекции из состава OpenOOD, включая Maximum Softmax Probability (MSP) [10], ODIN [59], ReAct [30], VIM [60] SHE [61] и ASH [62]. Результаты сравнения представлены в таблице 9. Полученные данные свидетельствуют о том, что ICLA превосходит указанные методы на "Near OOD"CIFAR-10 и CIFAR-100 и обеспечивает конкурентоспособную производительность в остальных экспериментальных сценариях.
Таблица 9 — Сравнение 1СЬЛ с современными небайесовскими методами ООЭ-детекции на различных датасетах. Для каждого метода приведены средние значения и стандартные отклонения ЛИКОС по нескольким ООО-источникам, обучение проводится только на т-^Б^ЬиМоп данных. Жирным выделены лучшие результаты среди всех методов для каждой задачи, подчёркнуты — вторые по величине.
MSP ODIN ReAct VIM SHE ASH ICLA ICLAzero
CIFAR-10Near 88.03 82.87 87.11 88.68 81.54 75.27 90.01 90.56
± 0.25 ± 1.85 ± 0.61 ± 0.28 ± 0.51 ± 1.88 ± 0.21 ± 0.23
CIFAR-10Far 90.73 87.96 90.42 93.48 85.32 78.49 92.50 93.18
± 0.43 ± 0.61 ± 1.41 ± 0.24 ± 1.43 ± 2.31 ± 0.38 ± 0.45
CIFAR-100Near 80.27 79.90 80.77 74.98 78.95 78.20 81.45 81.38
± 0.11 ± 0.11 ± 0.05 ± 0.13 ± 0.18 ± 2.21 ± 0.10 ± 0.28
CIFAR-100Far 77.76 79.28 80.39 81.70 76.92 80.58 80.79 82.49
± 0.44 ± 0.21 ± 0.49 ± 0.62 ± 1.16 ± 2.56 ± 0.46 ± 0.60
ImgNet-200Near 83.34 80.27 81.87 78.68 80.18 79.38 81.88 80.70
± 0.06 ± 0.08 ± 0.98 ± 0.24 ± 0.25 ± 1.93 ± 0.10 ± 0.10
ImgNet-200Far 90.13 91.71 92.31 91.26 89.81 92.74 89.45 89.82
± 0.09 ± 0.19 ± 0.56 ± 0.19 ± 0.61 ± 1.91 ± 0.14 ± 0.11
3.3.3 Точность классификации и метрики калибровки
Применение тождественной кривизны в аппроксимации Лапласа не влияет на точность классификации in-distribution, поскольку метод сохраняет оптимальное решение в окрестности 6Map [37]. Кроме того, метод не вносит существенных изменений в вероятности in-distribution, что обеспечивает сохранение качества калибровки (см. рисунок 3.3).
Для оценки калибровки используются метрики negative log-likelihood (NLL), expected calibration error (ECE) и Brier score. ICLA показывает метрики калибровки, сопоставимые с более вычислительно сложными вариантами аппроксимации Лапласа.
ОС
о
Рисунок 3.3 — Сравнение метрик калибровки моделей: expected calibration error (ECE), negative log-likelihood (NLL) и Brier score для датасетов CIFAR-10 (слева), CIFAR-100 (в центре) и ImageNet-200 (справа) при использовании различных вариантов аппроксимации Лапласа. Иллюстрация взята из [44].
3.4 Анализ
Для понимания основ эффективности ICLA применяется аналитический подход, описанный в разделе 3.2.1. Целью данного исследования является получение ответов на следующие вопросы:
1. Влияет ли стадия обучения на производительность стандартной аппроксимации Лапласа и ICLA?
2. Какова связь между структурой матрицы Фишера (т.е. кривизной модели) и данными, которые она используется для моделирования?
3. Можем ли мы объяснить выдающиеся результаты ICLA, связав их с разделимостью классов в пространстве признаков?
4. Как более гладкие решения (с пониженной длиннохвостостью), достигаемые применением штрафа Фишера, изменяют сравнение между LLLA и ICLA?
3.4.1 Анализ независимости от стадии обучения
Первоначально могло бы возникнуть предположение, что различия в производительности между LLLA и ICLA обусловлены стадией обучения, поскольку кривизна непрерывно эволюционирует на протяжении всего процесса обучения. Однако проведённые эмпирические исследования демонстрируют, что наблюдаемое явление не обнаруживает связи со стадией обучения модели. На рисунке 3.4 представлены аппроксимации для различных эпох обучения, которые свидетельствуют о том, что даже на начальных стадиях обучения наблюдается положительный разрыв в производительности, который сохраняется между стандартной last-layer аппроксимацией Лапласа и ICLA.
Рисунок 3.4 — Поэпохное сравнение между стандартной ЬЬЬЛ и 1СЬЛ для ООЭ-детекции. Иллюстрация взята из [44].
3.4.2 Спектральный анализ собственных значений Фишера
Анализ спектра собственных значений Л{ эмпирической матрицы Фишера, используемой в ЬЬЬЛ, выявляет фундаментальную особенность её структуры: почти все собственные значения оказываются близкими к нулю, тогда как небольшое число направлений характеризуется аномально большими значениями. Это приводит к выраженной длиннохвостой структуре спектра, что хорошо иллюстрируется на рисунке 3.5. Подобная неоднородность спектра не является случайной — она подтверждена в ряде работ по анализу кривизны параметрических моделей глубокого обучения [65; 66; 116] и отражает фундаментальные свойства оптимизации нейросетей. Длиннохвостое распределение собственных значений означает, что лишь ограниченное число направлений в пространстве параметров обладают высокой чувствительностью (крутой кривизной), тогда как большинство направлений остаются «плоскими». Это обстоятельство имеет ключевое значение для байесовской аппроксимации: матрицы с подобной спектральной структурой оказываются плохо приспособленными для точного
моделирования ковариации данных, поскольку существенная часть информации о неопределённости концентрируется в малом числе направлений. Таким образом, выявленная длиннохвостость спектра Фишера определяет ограничения стандартной аппроксимации Лапласа и мотивирует поиск альтернативных подходов к построению ковариационных матриц.
Index
Рисунок 3.5 — Спектральное распределение диагональных собственных значений эмпирической матрицы Фишера. Иллюстрация взята из [44].
3.4.3 Влияние разделимости классов в пространстве признаков
Согласно теоретическим основам лапласовской аппроксимации (раздел 1.7), информация о кривизне напрямую влияет на результирующую неопределённость через ковариацию. Это можно увидеть, поскольку Х-1 имеет отношение конгруэнтности к результирующей ковариации выходного распределения, т.е. ковариация выходного распределения и Фишера представляют одно и то же линейное преобразование, но в разных базисах.
Встает фундаментальный вопрос: насколько длиннохвостая структура кривизны отражает реальную ковариацию между классами? Для получения ответа проводится анализ на четырёх датасетах, различающихся по степени разделимости классов: С1ЕЛИ,-10, С1ЕЛИ,-100, 0100-5-8? и C100-5-NSP. В случае С100-5-8Р формируется выборка из пяти классов, каждый из которых
принадлежит к разным суперклассам CIFAR-100: «цветы», «пищевые контейнеры», «фрукты и овощи», «бытовые электроприборы» и «насекомые» — это пример ситуации с высокой разделимостью. Для C100-5-NSP, напротив, все пять классов выбираются из одного суперкласса «деревья», что моделирует сценарий с низкой межклассовой разделимостью.
Для количественной оценки степени разделимости классов в пространстве признаков применяется метрика межклассового сходства (MCCS), определяемая в уравнении 3.2. Эта метрика отражает, насколько близки друг к другу центроиды различных классов: чем ниже значение MCCS, тем выше разделимость классов, и наоборот. Для анализа взаимосвязи между структурой признакового пространства и эффективностью байесовских аппроксимаций MCCS сопоставляется с разрывом в производительности OOD-детекции между LLLA и ICLA. Под разрывом понимается среднее значение разницы метрик ("Near OOD'^ "Far OOD") между ICLA и LLLA, что позволяет выявить, как изменение разделимости классов влияет на относительное преимущество тождественной кривизны по сравнению со стандартной лапласовской аппроксимацией.
Наблюдения на рисунке 3.6 показывают связь между разделимостью классов и информативностью кривизны о ковариации данных.
Рисунок 3.6 — Визуализация взаимосвязи между метрикой межклассового сходства признаков (МСС8) и разрывом в производительности ООБ-детекции между ЬЬЬА и 1СЬА для четырёх датасетов: С1ЕАИ-10, С1ЕАИ-100, С100-5-8Р и C100-5-N8P. Иллюстрация взята из [44].
Для более глубокого анализа взаимосвязи между разделимостью классов и эффективностью ЬЬЬА был проведён специальный эксперимент. Исходя из набора С100-5-8Р, поэтапно обучались пять моделей, в каждой из которых один из исходных классов заменялся на класс из суперкласса «деревья». Таким образом, первая модель соответствовала С100-5-8Р (максимальная межклассовая разделимость), а последняя — С100-5-ЖР (все классы из одного суперкласса, минимальная разделимость). Такой поэтапный переход позволил проследить, как постепенное снижение разделимости влияет на разницу в производительности между 1СЬА и ЬЬЬА. Как видно из рисунка 3.7, по мере уменьшения разделимости классов стандартная ЬЬЬА начинает демонстрировать лучшие результаты по сравнению с ТСЬА. Это подчёркивает, что
преимущество тождественной кривизны наиболее выражено при высокой разделимости, а информативность кривизны возрастает по мере сближения классов в признаковом пространстве.
Data Setup
Рисунок 3.7 — Влияние степени разделимости классов на эффективность аппроксимаций Лапласа. Иллюстрация взята из [44].
3.4.4 Штраф Фишера и минимизация, учитывающая кривизну
В предыдущих разделах была выявлена взаимосвязь между разделимостью классов, спектральными свойствами кривизны и качеством оценки неопределённости. На заключительном этапе анализа рассматривается, как производительность ЬЬЬЛ зависит от гладкости найденного решения.
Штраф следа Фишера. Как было показано ранее, Фишер с длиннохвостым спектральным распределением не информативен для моделирования ковариации классов, что приводит к плохой производительности ЬЬЬЛ. Таким образом, для настроек с высокоразделимыми представлениями предпочтительной является более гладкая кривизна, т.е. с более низкой длиннохвостостью спектра Фишера.
Используя датасеты С1ЕАИ-100 и С100-5-8Р с более низкой разделимостью (раздел 3.4.3), применяется штраф Фишера (уравнение 3.3) с постепенным увеличением а, что влияет на производительность ЬЬЬА и 1СЬА. Рисунок 3.8 иллюстрирует исчезающий разрыв между ЬЬЬА и 1СЬА, подчёркивая связь между кривизной и разделимостью.
Fisher Penalty Fisher Penalty Fisher Penalty
Рисунок 3.8 — Влияние регуляризации с помощью штрафа Фишера на производительность OOD-детекции. (Слева) Динамика разницы в качестве OOD-детекции между ICLA и LLLA при различных значениях регуляризации. (В центре) Изменение AUROC для задачи OOD-детекции на датасете C100-5-SP. (Справа) Аналогичные результаты для CIFAR-100. Иллюстрация взята из [44].
оо оо
Sharpness-Aware Minimization. В контексте данного исследования ASAM может применяться по той же причине, что и штраф Фишера, поскольку предполагается, что достижение более плоских решений должно снизить разрыв в производительности OOD-детекции. Применяется обучение с ASAM для обеих моделей LLLA и ICLA, и производится сравнение его производительности со штрафом Фишера. Результаты представлены в таблице 10. Наблюдения показывают, что применение ASAM также снижает разрыв в производительности.
Таблица 10 — Результаты OOD-детекции с Adaptive Sharpness-Aware Minimization (ASAM) для датасета CIFAR-10.
Near OOD Far OOD
LLLA+FP 89.37 91.91
LLLA+ASAM 91.92 93.88
Gap with FP 0.62 0.60
Gap with ASAM 0.40 0.10
Анализ влияния штрафа Фишера и применения ASAM демонстрирует, что производительность LLLA и ICLA тесно связана с формой кривизны в пространстве параметров. В условиях высокой межклассовой разделимости спектр матрицы Фишера становится более длиннохвостым, что негативно сказывается на качестве стандартной лапласовской аппроксимации. Сглаживание кривизны — как за счёт регуляризации Фишера, так и с помощью методов sharpness-aware оптимизации — приводит к существенному росту эффективности LLLA и уменьшает разницу между LLLA и ICLA, подтверждая ключевую роль структуры кривизны в моделировании неопределённости.
3.5 Выводы
В данной главе подробно описан и подтверждён экспериментами новый подход Identity Curvature Laplace Approximation (ICLA), направленный на упрощение и повышение эффективности байесовских методов для оценки неопределённости в нейронных сетях.
Ключевые достижения. Метод ICLA решает проблему несогласованности между локальной кривизной модели и глобальной структурой данных в
задачах классификации. В отличие от существующих методов лапласовской аппроксимации, требующих сложных вычислений гессиана и подверженных проблемам численной устойчивости, ICLA устраняет необходимость в оценке кривизны, заменяя её тождественной матрицей с оптимизированной априорной точностью.
Это решение не только снижает вычислительную сложность, но и повышает адекватность оценок неопределённости для out-of-distribution данных.
Экспериментальные результаты. Комплексная оценка на бенчмарке OpenOOD демонстрирует, что ICLA достигает превосходных результатов по OOD-детекции на датасетах CIFAR-10, CIFAR-100 и ImageNet-200, превосходя стандартные варианты LLLA (GGN, EF, K-FAC) в 5 из 6 экспериментов. При этом метод сохраняет качество калибровки, сопоставимое с более вычислительно сложными аппроксимациями, что подтверждает его практическую применимость. Синтетические эксперименты на датасетах "полумесяцы"и синусоидальной регрессии наглядно демонстрируют способность ICLA формировать более широкие и информативные поверхности неопределённости.
Теоретические инсайты. Исследование выявило связь между спектральными свойствами матрицы Фишера и эффективностью лапласовской аппроксимации. Установлено, что распределение собственных значений с длинными хвостами, характерное для современных нейронных сетей, создаёт несоответствие между локальной кривизной и глобальной структурой ковариации классов. ICLA решает эту проблему, обеспечивая равномерное распределение неопределённости. Кроме того, показано, что методы сглаживания кривизны (Fisher penalty, ASAM) могут улучшить производительность стандартных методов LLLA, подтверждая теоретическую обоснованность подхода.
Практическая значимость. ICLA обеспечивает простое и масштабируемое решение для внедрения байесовских методов в производственные системы компьютерного зрения. Отсутствие необходимости в вычислении гессиана снижает сложность использования лапласовской аппроксимации, делая её доступной для широкого круга приложений. Метод наиболее эффективен в сценариях с высокой межклассовой разделимостью, что характерно для многих современных задач компьютерного зрения.
Ограничения и перспективы. Основным ограничением является зависимость эффективности от степени разделимости классов в пространстве признаков — на датасетах с низкой межклассовой разделимостью преимуще-
ства 1СЬА могут быть менее выраженными. Перспективными направлениями являются изучение адаптивных схем выбора между тождественной и вычисляемой кривизной, интеграция с методами диверсификации представлений (как в главе 2) и разработка гибридных подходов, сочетающих преимущества различных аппроксимаций.
1СЬА демонстрирует эффективность подхода, основанного на упрощении сложных байесовских конструкций при сохранении их ключевых преимуществ. Метод открывает новые возможности для создания систем с улучшенной оценкой неопределённости, что важно для безопасного развёртывания в критически важных приложениях, где корректная оценка доверия к предсказаниям критична.
Связь с общими целями диссертации. Полученные в данной главе результаты непосредственно решают поставленную в введении задачу разработки методов, обеспечивающих повышение надёжности оценок неопределённости и эффективности выявления данных вне распределения. 1СЬА демонстрирует, что упрощение сложных байесовских аппроксимаций способно обеспечивать не только снижение вычислительных затрат, но и улучшение качества ООО-детекции, что подтверждает выдвинутую гипотезу о возможности сохранения преимуществ байесовского подхода при устранении его основных недостатков. Установленная взаимосвязь между кривизной модели и разделимостью классов формирует теоретическую основу для дальнейших исследований в области оценки неопределённости и открывает новые направления для разработки методов, адаптирующихся к структурным особенностям данных.
Глава 4. Неопределённость в задачах поиска изображений, метрического машинного обучения и классификации. Применения для улучшения робастности к шуму в данных и фильтрации
грязных данных
В данной главе исследуются специфические проблемы оценки неопределённости в контексте метрического обучения и задач поиска изображений (image retrieval). Данное исследование принципиально отличается от предыдущих глав, посвящённых детекции данных вне распределения (OOD) и калибровке. Основной фокус исследования направлен на анализ робастности методов к различным типам шума в данных, включая шум в метках, что является критически важным аспектом для практических применений в реальных условиях.
Задачи поиска изображений характеризуются открытыми множествами (open-set scenarios), где тестовые данные могут содержать классы, не встречавшиеся в процессе обучения. В отличие от стандартных задач классификации, где неопределённость связана преимущественно с распределительным сдвигом, в задачах retrieval критически важным становится качество самих данных и их разметки.
Глава базируется на трёх ключевых исследованиях: систематическом анализе робастности метрического обучения к шуму разметки [45], унифицированном сравнении методов вероятностных эмбеддингов [46] и разработке метода EXACT для прямой оптимизации точности [47]. Данные работы формируют комплексный подход к решению проблем неопределённости в контексте задач с открытыми множествами.
Основные задачи главы включают: (1) выявление фундаментальных различий в поведении методов классификации и retrieval при наличии шума в данных, (2) систематическую оценку потенциала вероятностных эмбеддингов для оценки качества данных и фильтрации, (3) разработку и валидацию подхода прямой оптимизации точности для повышения робастности к шуму разметки, (4) формулирование практических рекомендаций по выбору методов в зависимости от специфики задачи и доступных ресурсов.
Полученные результаты демонстрируют, что качественная оценка неопределённости в задачах с открытыми множествами требует специализированных
подходов, учитывающих специфику метрического обучения и необходимость обеспечения робастности к шуму в данных. Эти результаты формируют важный компонент общей теории оценки неопределённости в машинном обучении, дополняя исследования детекции OOD и калибровки, рассмотренные в предыдущих главах.
4.1 Мотивация и особенности неопределённости в метрическом
обучении
Метрическое обучение представляет собой фундаментально иную парадигму по сравнению с классической классификацией. Классификационные задачи характеризуются замкнутыми множествами (closed-set), где все возможные классы известны на этапе обучения. В отличие от них, задачи поиска изображений и верификации часто имеют дело с открытыми множествами, где новые, ранее не встречавшиеся классы могут появляться на этапе тестирования.
Цель метрического обучения состоит в отображении данных в пространство эмбеддингов таким образом, чтобы эмбеддинги схожих данных располагались близко друг к другу, а эмбеддинги различных данных — далеко друг от друга [71; 117]. Подходы глубокого метрического обучения достигли современных результатов во многих задачах компьютерного зрения, включая верификацию лиц [85; 118], повторную идентификацию людей [119] и поиск изображений [87; 120].
Однако развитие крупномасштабных систем поиска изображений сталкивается с рядом фундаментальных проблем, которые требуют специализированных подходов к оценке и моделированию неопределённости. Данные проблемы можно сгруппировать в три основные категории, каждая из которых представляет собой активную область исследований.
4.1.1 Проблема качества данных и робастности к шуму разметки
Крупномасштабные датасеты являются основой успеха глубокого обучения в задачах поиска изображений. Однако ошибки ручной разметки и методы полуавтоматической аннотации могут приводить к шуму меток даже в популярных датасетах [121]. Несмотря на то что большинство данных может быть получено из Интернета, их аннотация представляет собой наиболее трудоёмкую часть процесса подготовки данных [122]. При работе с миллионами объектов ручная аннотация всех элементов становится практически невозможной [123; 124].
Для уменьшения объёма ручной работы при разметке данных были предложены разнообразные полуавтоматические и полуконтролируемые методы аннотации [125]. Тем не менее, как полностью ручная разметка, так и автоматизированные или полуавтоматические процедуры неизбежно приводят к появлению ошибок в итоговых метках. Согласно последним исследованиям, уровень ошибочных аннотаций в крупных датасетах может достигать и даже превышать 40% [121].
Ранее основное внимание в изучении шума меток в задачах компьютерного зрения уделялось именно классификации изображений [126; 127]. Однако влияние шума меток на методы глубокого метрического обучения и задачи поиска изображений до сих пор остаётся недостаточно исследованным. Это создаёт существенный пробел в понимании, поскольку специфика open-set сценариев и особенности метрических пространств могут радикально менять характер воздействия шума на итоговую производительность моделей.
Многие датасеты поиска изображений собираются с использованием ненадёжных методов, таких как сбор данных через поисковые системы [121; 128; 129], что приводит к шуму меток и ухудшению качества обучения. Ручная очистка крупномасштабных датасетов с миллионами образцов является дорогостоящей и требует значительных ресурсов. Согласно предшествующим исследованиям, методы аннотации данных, используемые в поиске изображений, могут производить специфические типы шума меток. К ним относятся концентрация шума в кластерах схожих изображений и существование «мусорных» классов, полностью состоящих из неправильно размеченных образцов [121; 130].
4.1.2 Ограничения детерминистических подходов и потребность в
моделировании неопределённости
Традиционные методы метрического обучения (детерминистические методы ) отображают входное изображение в единый вектор эмбеддинга. Однако такой подход имеет принципиальные ограничения, особенно в контексте работы с шумными данными и оценки качества предсказаний.
Основываясь на предшествующих исследованиях в области сетей смеси плотностей [41] и вариационных автоэнкодеров [42], исследователи предложили вероятностные расширения глубокого метрического обучения [12—17]. В рамках этого подхода, известного как вероятностные эмбеддинги (PE), алгоритм предсказывает распределение эмбеддингов вместо единого вектора.
В отличие от классических детерминистических методов метрического обучения, вероятностные эмбеддинги (PE) предоставляют ряд существенных преимуществ: (1) использование вероятностных функций потерь способствует устойчивости обучения в присутствии шума в данных [12]; (2) PE обеспечивают более точную агрегацию и сопоставление эмбеддинговых представлений, что особенно важно для сложных задач retrieval [13; 17]; (3) предсказанная моделью неопределённость может служить индикатором качества входных данных и использоваться для выявления аномалий или данных вне распределения [14]. Кроме того, оценка уверенности, предоставляемая PE, открывает возможности для построения систем классификации с отказом, где модель способна воздерживаться от принятия решения при недостаточной уверенности [13; 15; 131].
Тем не менее, методы PE получили ограниченное внимание в исследовательском сообществе. Недавние бенчмарки метрического обучения избегали сравнения с PE [71; 88], и остаётся открытым вопрос, какой подход лучше для задач поиска и верификации изображений. Более того, отсутствует систематическое сравнение различных PE методов между собой в унифицированных экспериментальных условиях.
4.1.3 Проблема субоптимальности суррогатных функций потерь
Третья фундаментальная проблема связана с природой функций потерь, используемых при обучении нейронных сетей. Точность является естественной метрикой оценки для задач классификации [132]. Однако её разрывная природа делает проблематичной прямую оптимизацию с использованием градиентных методов. Для решения этой проблемы исследователи разработали различные суррогатные функции потерь, такие как кросс-энтропия и hinge loss, которые, хотя и коррелируют с точностью, не оптимизируют её напрямую [133].
Важно отметить, что функции кросс-энтропии и hinge loss оказались более чувствительными к выбросам по сравнению с точностью [49]. Это особенно проблематично в контексте метрического обучения, где присутствие шумных меток может существенно исказить геометрию эмбеддингового пространства и привести к субоптимальным решениям.
Существующие подходы к релаксации 0-1 потерь, известные как релаксация 0-1, включают создание гладких аппроксимаций коэффициента ошибок классификации [134]. Однако эти методы ограничены бинарной классификацией и не были широко изучены за пределами линейных моделей. Более того, наивное расширение этих релаксаций на многоклассовые проблемы через подход one-vs-one создаёт функции потерь, которые принципиально отличаются от коэффициента ошибок.
4.1.4 Интеграционная перспектива
Рассмотренные проблемы — робастность к шуму данных, адекватное моделирование неопределённости и эффективная оптимизация целевых метрик — не являются независимыми. Они тесно взаимосвязаны и требуют комплексного подхода к решению. Шум в данных увеличивает неопределённость предсказаний, а субоптимальные функции потерь могут усугублять влияние этого шума на итоговое качество системы.
В контексте данной главы рассматриваются эти проблемы через призму трёх взаимодополняющих исследовательских направлений: (1) систематиче-
ский анализ робастности метрического обучения к различным типам шума разметки, (2) унифицированное сравнение методов вероятностных эмбеддин-гов для моделирования неопределённости, и (3) разработка методов прямой оптимизации точности через стохастические модели. Каждое из данных направлений вносит вклад в создание более надёжных и эффективных систем поиска изображений.
4.2 Робастность метрического обучения к шуму разметки
В данном разделе проводится систематическое исследование влияния различных типов шума разметки на качество систем поиска изображений. В отличие от предыдущих исследований, сосредоточенных на задачах классификации, впервые выполняется комплексный анализ специфических для метрического обучения типов шума и их воздействия на производительность моделей.
4.2.1 Характеристика шума в датасетах поиска изображений
Датасеты, используемые для поиска изображений, характеризуются особыми свойствами, определяющими уникальные схемы появления и распределения шума меток. Одной из ключевых особенностей является склонность шума к локализации внутри кластеров визуально схожих изображений, что приводит к выраженной неравномерности распределения ошибочных меток по классам [121; 130]. Кроме того, даже широко используемые и тщательно изученные датасеты, такие как Labeled Faces in the Wild (LFW)1, могут содержать так называемые «мусорные» классы, полностью состоящие из неверно размеченных примеров [85].
Критический вопрос заключается в том, как количество повреждённых классов влияет на итоговую производительность модели. Этот аспект принципи-
1Список известных ошибок разметки LFW доступен на официальном сайте: http://vis-www. cs.umass.edu/lfw/
ально отличается от предшествующих исследований в области классификации изображений, где предполагается наличие некоторого количества чистых данных для каждого класса.
4.2.2 Типы шума, специфичные для метрического обучения
Large class label noise. В этом варианте шума для заданной доли повреждённых образцов выбираются самые крупные (многочисленные) классы в датасете. Только внутри этих выбранных классов происходит случайное перемешивание меток между их образцами. Количество вовлечённых классов подбирается так, чтобы суммарное число искажённых примеров соответствовало целевому уровню шума. Такой паттерн приводит к тому, что при фиксированном числе повреждённых образцов страдает минимально возможное количество классов.
Small class label noise. Здесь, напротив, для внесения шума выбираются самые малочисленные классы. Внутри этих редких классов метки также перемешиваются между образцами, пока не будет достигнута нужная доля повреждённых данных. В результате small class label noise затрагивает максимальное число классов при том же общем количестве искажённых примеров, что и large class label noise.
Uniform label noise. В качестве эталонного случая используется классический равномерный шум меток [127], также называемый label flipping [121]. В этом сценарии случайно выбирается заданная доля всех образцов датасета, и каждому из них присваивается случайная метка из всего множества классов. Такой подход приводит к тому, что каждый класс в среднем получает повреждённые примеры пропорционально своему размеру, и ни один класс не оказывается полностью защищён или полностью испорчен.
Таким образом, описанные паттерны шума противоположны по охвату классов: large class label noise минимизирует число полностью повреждённых классов, а small class label noise, напротив, максимизирует его.
4.2.3 Экспериментальное сравнение робастности между задачами
Для количественной оценки робастности задач поиска изображений по сравнению с классификацией проводится систематическое сравнение производительности. Робастность количественно определяется как падение производительности при обучении модели на зашумлённом датасете по сравнению с обучением на чистом датасете.
Протокол эксперимента. Проводится сравнение моделей, обученных с различными уровнями шума от 0 (чистый датасет) до 10%. Для обеспечения справедливого сравнения используются одинаковые модели, цели обучения и методы оптимизации для всех задач. В качестве базовой архитектуры применяется ResNet50 [97] с функциями потерь ArcFace для задач поиска и верификации [4] и Normalized Softmax для классификации [78].
Эксперименты проводятся на репрезентативных датасетах:
— ImageNet [122] — классификация изображений
— Stanford Online Products (SOP) [87], In-shop [135] — поиск изображений. Оба датасета характеризуются выраженной несбалансированностью классов, как показано на рисунке 4.1
— MS-Celeb-1M [123], LFW [85] — распознавание и верификация лиц
SOP
MS-Celeb-lM
2000
3 1500
1Л 1Л
ТЗ 1000
500
1
IL
2000
(л 1500 а>
(Л (Л
£ 1000
500
20 40 #samples in class
Щ
5 10
#samples in class
6000
at
(Л (Л
го
и *
2000
100 200 #samples in class
Рисунок 4.1 — Размерные распределения классов в основных датасетах для поиска изображений. Классы, подвергшиеся small class label noise, отмечены красным, а затронутые large class label noise — зелёным цветом. Иллюстрация взята из [45].
о
о
о
Результаты сравнительного анализа. Результаты экспериментов представлены в таблице 11. Во всех задачах поиска наблюдается резкое сниже-
ние качества с увеличением уровня равномерного шума меток. Даже 5% шума меток вызывает относительное падение производительности до 10%. В противоположность этому, точность классификации в равных условиях показывает значительно меньшее падение.
Таблица 11 — Влияние равномерного шума меток на производительность модели для задач классификации изображений (1ша§еКе1) и верификации по сравнению с задачами поиска изображений. Все значения метрик показаны в %. Случаи, когда модель была неспособна обобщаться на тестовом множестве, помечены как ~ 0.
Датасет Метрика с1еап 0.01 0.05 0.1
1ша§еКе1 Лссигасу 67.32 67.09 66.42 65.80
¡пБЬор ЯШ 84.61 82.09 74.70 72.70
БОР ЯШ 63.49 63.68 60.72 58.78
LFW Я@1 67.22 67.36 « 0 « 0
LFW ТРЯ@10-3 99.27 99.23 « 0 « 0
Эти результаты демонстрируют, что классификация изображений более робастна к равномерному шуму меток, чем поиск изображений. Одним из наиболее интересных открытий является то, что при обучении модели на датасете М8-Се1еЬ-1М с уровнем шума меток не менее 5% её производительность становится близкой к производительности необученной модели.
Анализ кривых обучения для различных уровней шума показывает (Рисунок 4.2), что при 5% шума меток оптимизация функции потерь по-прежнему происходит, что означает, что обучение модели всё ещё сходится. Однако точность на тестовом множестве полностью падает. Данные результаты позволяют заключить, что алгоритмы поиска изображений чрезвычайно чувствительны к шуму меток, и их производительность может кардинально пострадать от даже небольшой доли шума меток.
40
<л <л о
20
0,
Label noise
1% - 4%
2% - 5%
3%
Training step 1е7
Рисунок 4.2 — Кривые обучения для датасета MS-Celeb-1M с различными уровнями равномерного шума меток. Иллюстрация взята из [45].
4.2.4 Влияние структуры шума на производительность
Результаты предыдущего эксперимента показывают, что поиск изображений не является робастным к шуму меток. В связи с этим возникает вопрос о том, как количество повреждённых классов влияет на производительность поиска. Для ответа на данный вопрос обучающее множество подвергается воздействию новых типов шума меток для поиска изображений, описанных в разделе 4.2.2.
Количественный анализ искажения классов. В таблице 12 представлено общее количество повреждённых элементов и повреждённых классов в экспериментах. Класс считается повреждённым, если хотя бы одна метка в этом классе была изменена во время процедуры создания шума.
Критическое открытие: приоритет количества повреждённых классов. Экспериментальные результаты выявляют фундаментальную закономерность: чем больше классов обучающего множества затронуты шумом меток, тем выше падение производительности, даже если общее количество повреждённых элементов остаётся неизменным. Например, уровень шума 5% на датасете InShop приводит к 10% падению качества для равномерного шума с 26% повреждённых классов. С другой стороны, large и small class noise с тем же уровнем шума 5% производят только 2% и 4,5% падение качества соответственно, в то время как количество повреждённых классов для этих типов шума составляет 0,05% и 2,5% соответственно.
Таблица 12 — Процент повреждённых классов для каждого датасета и паттерна шума для трёх уровней шума. Класс считается повреждённым, если хотя бы одна метка в этом классе была изменена во время процедуры создания шума.
Тип шума Датасет 0.01 0.05 0.1
Uniform InShop 6.0 26.0 44.3
Large Classes InShop 0.05 0.5 1.6
Small Classes InShop 2.5 11.1 19.2
Uniform SOP 5.0 22.6 40.0
Large Classes SOP 0.4 2.2 4.4
Small Classes SOP 2.6 13.2 23.8
Uniform MS-Celeb-IM 45.5 88.0 95.5
Large Classes MS-Celeb-IM 0.2 1.4 4.2
Small Classes MS-Celeb-IM 7.3 19.5 29.1
Механизм влияния на геометрию эмбеддингового пространства.
Шум меток, затрагивающий малые классы (small class label noise), вызывает более выраженное ухудшение качества по сравнению с шумом, сосредоточенным на крупных классах (large class label noise). Наиболее разрушительным оказывается равномерный шум, поскольку он охватывает максимальное число классов, что приводит к наибольшему падению производительности. Существенно, что наличие большого числа классов с незначительными искажениями оказывает более негативное влияние на итоговое качество, чем ситуация, когда отдельные классы полностью повреждены. Эти выводы чётко иллюстрируются на рисунке 4.3.
гч
@
*80
-i—" 1Л
£
75
64
©62
1л .01
60
99.4
@
ос о.
99.2
99.0
1/1
£ 98.8
67.4
гч 67.2 @
Ï 67.0 1/1
66.8 66.6
103 InShop
- Uniform Large classes Small classes
0 2 4 5 3 10
Noise level, % SOP
— Uniform - Large classes —>— Small classes
4 6
Noise level, % LFW verification
10
Uniform Small classes Large classes
0.0 0.5 1.0 1.5 2.0 2.5
Noise level, % LFW retrieval
3.0
3.5
4.0
Uniform Small classes Large classes
0.0 0.5 1.0 1.5 2.0 2.5
Noise level, %
3.0
3.5
4.0
Рисунок 4.3 — Влияние различных паттернов шума меток на производительность тестирования. Иллюстрация взята из [45].
Данное открытие имеет глубокие импликации для понимания робастности метрического обучения. В отличие от классификационных задач, где локальные ошибки в отдельных классах могут компенсироваться границами принятия решений, в метрическом обучении каждый повреждённый класс потенциально искажает глобальную геометрию эмбеддингового пространства.
4.2.5 Теоретическое обоснование пониженной робастности
Причины пониженной робастности поиска изображений по сравнению с задачами классификации коренятся в различии между open-set и closed-set постановками. В задачах поиска требуется способность модели переносить знания на ранее не встречавшиеся классы, тогда как классификация ограничивается фиксированным набором меток, совпадающим на обучении и тесте.
Результаты экспериментов показывают, что несмотря на успешную сходимость моделей при различных уровнях шума меток, уже при 5% зашумления наблюдается резкое обрушение точности на тестовых данных. Это свидетельствует о неспособности моделей поиска изображений к обобщению на новые классы в условиях шума, что подчёркивает актуальность дальнейших исследований устойчивости к ошибкам разметки в open-set задачах [121].
Фундаментальная причина данного явления заключается в том, что метрические функции потерь напрямую оптимизируют относительные расстояния между эмбеддингами различных классов. Когда шум меток нарушает эти отношения расстояний, вся структура эмбеддингового пространства становится нестабильной, что приводит к каскадному ухудшению производительности на всех классах, включая незашумлённые.
4.3 Вероятностные эмбеддинги: унифицированный анализ и применение для фильтрации грязных данных
Вероятностные эмбеддинги (Probabilistic Embeddings, PE) представляют естественное расширение детерминистического метрического обучения, позволяющее явно моделировать неопределённость в пространстве признаков. Данный раздел представляет собой систематическое изложение основных результатов исследования [46] в контексте общего нарратива диссертации.
4.3.1 Систематическое сравнение PE-методов
Как показано в обзоре литературы (раздел 1.8), различные исследовательские группы развивали PE независимо, что привело к фрагментированности литературы и отсутствию прямых сравнений между методами.
Рассматриваемые методы В рамках данного анализа рассматриваются все основные PE-методы, описанные в литературе: Hedged Instance Embeddings (HIB) [12], Probabilistic Face Embeddings (PFE) [13], Data Uncertainty Learning (DUL-cls/reg) [15], Sphere Confidence Face (SCF) [16], vMF Feature Learning (vMF-FL) [43] и vMF-loss [17]. Для сравнения используются современные детерминистические методы: ArcFace [4], CosFace [80], Proxy-Anchor [84], Multi-similarity [77] и другие.
Протокол оценки Для обеспечения справедливого сравнения реализован протокол оценки, вдохновлённый современными бенчмарками метрического обучения [71; 88]. Используются четыре репрезентативных датасета: CUB200-2011 [136] и Cars196 [137] (сотни классов), In-shop Clothes [135] и Stanford Online Products [87] (тысячи классов). Для каждого метода проводится байесовская оптимизация гиперпараметров с последующей оценкой на 5 случайных сидах.
Ключевые результаты Результаты систематического сравнения представлены в таблице 13. На датасетах с сотнями классов (CUB200, Cars196) результаты смешанные: некоторые PE-методы показывают сопоставимое качество с детерминистическими подходами, но явного преимущества не наблюдается. Напротив, на датасетах с тысячами классов (In-shop, SOP) PE-методы демонстрируют значительное превосходство в задачах поиска изображений.
Таблица 13 — Сравнительный анализ детерминистических и вероятностных подходов на всех используемых датасе-тах. В верхней части таблицы приведены результаты детерминистических методов, далее следуют вероятностные методы, а в нижней строке — нестандартная модификация DUL. Показатели, превосходящие лучшие детерминистические методы (ArcFace - DAS-MS), выделены подчёркиванием. Максимальные значения среди всех методов выделены полужирным. Все результаты приведены в процентах.
Метод
In-shop R@1 MAP@R Acc
SOP
R@1 MAP@R Acc
Cars196 R@1 MAP@R Acc
CUB200 R@1 MAP@R Acc
ArcFace
CosFace
Proxy-Anc.
Multi-sim.
Proxy-NCA
DAS-MS
78.6±о.з 87.5±о.2 71.1±o.2 86.5±o.4 67.5±o.9 76.2± 0.4
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.