Реидентификация людей для интеллектуальной видеоаналитики тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Мамедов Тимур Закирович

  • Мамедов Тимур Закирович
  • кандидат науккандидат наук
  • 2026, «Национальный исследовательский университет «Высшая школа экономики»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 118
Мамедов Тимур Закирович. Реидентификация людей для интеллектуальной видеоаналитики: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет «Высшая школа экономики». 2026. 118 с.

Оглавление диссертации кандидат наук Мамедов Тимур Закирович

Введение

Глава 1. Реидентификация людей

1.1 Постановка задачи

1.2 Обзор существующих подходов

1.2.1 «Классическая» реидентификация людей

1.2.2 Обобщающая реидентификация людей

1.2.3 Вывод

1.3 Наборы данных

1.3.1 Многокамерные данные

1.3.2 Однокамерные данные

1.3.3 Сравнение многокамерных и однокамерных данных

1.4 Протоколы тестирования

1.4.1 Оценочные метрики

1.4.2 «Классическая» реидентификация людей

1.4.3 Обобщающая реидентификация людей

1.5 Предварительная фильтрация изображений

1.5.1 Сбор и разметка данных

1.5.2 Модуль фильтрации (Filter Module)

1.5.3 Экспериментальная оценка

1.5.4 Практическое применение

1.6 Улучшение посредством self-supervised предобучения

1.6.1 Выбор реидентифицируемой области человеческого тела

1.6.2 Метод автоматизированного сбора данных

1.6.3 Self-supervised предобучение

1.6.4 Экспериментальная оценка

1.7 Обучение на «смеси» данных

1.7.1 Предложенный подход обучения

1.7.2 Проверка предложенной концепции

1.7.3 Подтверждение разной сложности данных

Стр.

1.7.4 Сравнение со state-of-the-art

1.7.5 Практическое применение к задаче сопровождения .... 53 1.8 Заключение

Глава 2. Сопровождение (трекинг) людей и их подсчет

2.1 Постановка задачи

2.2 Проблема распределенных вычислений

2.3 Обзор существующих подходов

2.3.1 Сопровождение через детектирование

2.3.2 Методы визуального сопровождения

2.4 Предложенный подход

2.4.1 Базовый метод

2.4.2 Модификация этапа детекции

2.4.3 Ограничение области детекции

2.4.4 Модификация этапа сопоставления детекций

2.4.5 Регрессия тела человека по детекции головы

2.5 Экспериментальная оценка

2.5.1 Оценочные метрики

2.5.2 Наборы данных

2.5.3 Поднятие сигнального отрезка

2.5.4 Линейная регрессия тела человека по детекции головы

2.5.5 Нейросетевая регрессия тела человека по детекции головы

2.5.6 Ограничение области детекции

2.5.7 Одноядерный алгоритм подсчета людей

2.6 Заключение

Глава 3. Оценка времени ожидания в очередях

3.1 Постановка задачи

3.2 Предложенный подход

3.2.1 Регрессия верхней части тела человека

3.2.2 Метод автоматизированного сбора данных для обучения регрессии верхней части тела человека

3.2.3 Аугментация случайных размеров для верхней части тела

3.2.4 Модификация этапа построения матрицы стоимостей

Стр.

3.3 Экспериментальная оценка

3.3.1 Предложенные оценочные метрики

3.3.2 Наборы данных

3.3.3 Демонстрация эффективности предложенного подхода

3.4 Заключение

Глава 4. Практическое применение в задаче подсчета

пассажиров в автобусах

Заключение

Список литературы

Список рисунков

Список таблиц

Приложение А. Сертификат на зарегистрированную

программу для ЭВМ

Приложение Б. Справка о внедрении предложенных

алгоритмов в ПО

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Реидентификация людей для интеллектуальной видеоаналитики»

Введение

В условиях стремительного развития технологий компьютерного зрения и искусственного интеллекта, задачи автоматического анализа видеоданных приобретают все большую актуальность. Анализ подобных данных позволяет решать множество практически важных проблем, связанных как с обеспечением безопасности жизней людей, так и с повышением рентабельности предприятий. Зачастую видеоаналитику внедряют в системы видеонаблюдения, так как существует необходимость в непрерывном анализе видеопоследовательностей, получаемых с реальных камер.

Размеры систем видеонаблюдения постоянно растут, что повышает значимость продуктов интеллектуальной видеоаналитики, позволяющих автоматизировать обработку и анализ данных с них. Однако в настоящее время существующие решения далеки от совершенства и зачастую уступают по своей точности человеку-оператору. Тем самым, текущие продукты интеллектуальной видеоаналитики не позволяют заменить или существенно снизить участие людей — это делает исследования в данной области актуальными.

Современные системы видеонаблюдения объединяют в единую сеть тысячи камер, каждая из которых охватывает только маленькую область. Ключевая научно-техническая проблема видеоаналитики — обнаружение и отслеживание человека внутри и между разными полями наблюдения камеры. Одной из важнейших задач в области интеллектуальной видеоаналитики является ре-идентификация людей — процесс распознавания и сопоставления изображений одного и того же человека, полученных с разных камер (рис. 1).

Алгоритмы реидентификации людей нашли широкое применение в следующих прикладных областях: видеонаблюдение, обеспечение общественной безопасности, поиск пропавших людей, управление потоками пассажиров, повышение качества предоставляемых услуг, а также анализ спортивных мероприятий. Так как рассматриваемая задача является практико-ориентированной и подразумевает работу с реальными данными, то при ее решении исследователи сталкиваются с рядом уникальных сложностей:

— значительные изменения внешнего вида человека из-за ракурса, освещения, позы;

— частичные перекрытия (окклюзии);

База данных («галерея»)

Рисунок 1 — Пример работы алгоритма реидеитификации. Для изображения-запроса, были найдены соответствующие примеры из базы данных («галереи»),

— разнообразие условий съемки на камерах с разным качеством и настройками.

Очевидным путем преодоления упомянутых трудностей является обучение алгоритмов реидеитификации на весьма крупных выборках, которые потенциально могут покрыть большую часть возникающих сценариев в реальных данных. Однако данный подход имеет несколько нюансов, которые делают его применение практически невозможным или слишком затратным:

— выборки должны быть максимально разнообразными как с точки зрения запечатленных ситуаций, так и визуальной составляющей;

— как следствие первого аспекта, данных должно быть очень много, речь идет о нескольких миллионах изображений, которые необходимо размечать вручную, что требует привлечения большого числа разметчиков и приводит к крупным денежным затратам;

— так как данные для реидентификации людей подразумевают многокамерный сценарий (один и тот же человек должен быть запечатлен на нескольких камерах), то возникает сложность в сборе данных подобного рода.

Ввиду описанных выше проблем, в задаче реидентификации людей наблюдается критический недостаток данных для обучения алгоритмов искусственного интеллекта. По этой причине исследователями в последнее время делается упор на разработку более продвинутых архитектур нейронных сетей, а

также создание специализированных методик их обучения, учитывающих природу рассматриваемой задачи.

Несмотря на заметные успехи в лабораторных условиях и на benchmark-датасетах, практическое применение современных алгоритмов реидентифика-ции в реальных условиях требует преодоления ряда нерешенных проблем, включая повышение устойчивости алгоритмов к сырым входным изображениям и адаптацию к новым сценам без дополнительных аннотаций.

Задача реидентификация людей может рассматриваться в качестве независимой задачи, а также алгоритмы ее решения могут применяться в виде составных частей для решения других практических проблем. В данной диссертации автором был сделан основной фокус на повышении качества ре-идентификации, как одной из самых важных задач видеоаналитики, а также на практическом ее приложении: сопровождении (трекинге) людей и их подсчете, оценке времени ожидания в очередях, и подсчете пассажиров в автобусах.

Для повышения устойчивости алгоритмов реидентификации к сырым входным изображениям предлагается концепция предварительной фильтрации входных картинок, основанная на специальном модуле фильтрации (Filter Module). Данный модуль оценивает пригодность изображения для последующего анализа, что позволяет нивелировать влияние заведомо шумных данных. Помимо самого Filter Module в этой работе рассматривается вопрос о способах его практического применения в реальных системах интеллектуальной видеоаналитики. Также достижение робастности реидентификации людей в предлагаемых подходах достигается за счет использования специализированных функций потерь во время обучения алгоритмов искусственного интеллекта.

Адаптация к новым сценам в рассматриваемой задаче может происходить двумя способами:

— с помощью подходов доменной адаптации;

— посредством обучения «обобщенного алгоритма».

Суть первого подхода заключается в том, что первоначально нейронная сеть обучается на размеченных данных для реидентификации, а потом дообучается на целевых неразмеченных изображениях, то есть происходит доменная адаптация к целевому домену. У такого решения есть несколько недостатков, один из них в том, что необходимо переобучать алгоритм под каждую новую сцену — это усложняет его практическое применение. Ввиду этого, в данной работе для исследований был выбран второй подход, подразумевающий обучение та-

кой нейронной сети, которая будет иметь высокую обобщающую способность и устойчива к изменению условий съемки без какого-либо дообучения.

Достижение высокой обобщающей способности алгоритма в настоящей диссертации достигается посредством двух техник: self-supervised предобучения и процедуры совместного обучения на «смеси» данных разной сложности (малых многокамерных и огромных однокамерных выборках). В данной работе показывается, что предобучение алгоритма на большом массиве однокамерных данных способствует повышению качества реидентификации, а грамотное использование «смеси» многокамерных и однокамернных выборок на этапе fine-tuning позволяет существенно улучшить обобщающую способность нейронной сети и уменьшить эффект «забывания» знаний.

Как было отмечено ранее, помимо самой задачи реидентификации людей в настоящей диссертации рассматривается практическое приложение ее алгоритмов. Решения проблем подсчета людей, оценки времени ожидания в очередях и подсчета пассажиров в автобусах основаны на методах трекинга людей, которые могут использовать реидентификацию. Так как речь идет о практическом применении, то особый упор делается на эффективности предлагаемых подходов.

Объектом исследования являются современные методы реидентифика-ции людей, а также подходы к их практическому применению в системах интеллектуальной видеоаналитики.

Предметом исследования являются нейросетевые модели для решения задачи реидентификации людей и процедуры обучения для повышения их обобщающей способности, а также методы детектирования и трекинга людей.

Целью данной работы является повышение качества и устойчивости ре-идентификации людей для интеллектуальной видеоаналитики с последующим ее применением для решения практико-ориентированных задач.

Для достижения данной цели были поставлены следующие задачи:

1. Разработать критерии оценки пригодности изображений для последующего использования в алгоритме реидентификации людей.

2. Собрать и разметить по разработанным критериям выборки для обучения и валидации модуля фильтрации.

3. Разработать легковесный модуль фильтрации с использованием подходов к классификации изображений, а также провалидировать качество полученного модуля в приложении к задаче реидентификации людей.

4. Исследовать влияние self-supervised предобучения на качество реиден-тификации людей. Выявить «узкие» места в данном подходе.

5. Разработать процедуру совместного обучения на «смеси» данных разной сложности для решения недостатков предварительно обучения.

6. Усовершенствовать существующий подход сопровождения людей и их подсчета с фокусом на практическую применимость и эффективность.

7. Разработать тестовый протокол для задачи оценки времени ожидания в очередях.

8. Разработать алгоритм оценки времени ожидания в очередях, основанный на методах трекинга и реидентификации людей, а также провести экспериментальную оценку полученного подхода на основе разработанного тестового протокола.

9. Разработать алгоритм подсчета людей в автобусах с последующей его валидацией посредством бизнес-метрик.

Научная новизна:

1. В этой работе впервые изучается вопрос предварительной фильтрации входных изображений с целью нивелирования влияния заведомо шумных изображений на качество реидентификации людей.

2. В данной диссертации впервые исследуются недостатки self-supervised предобучения и, как следствие, впервые предлагается подход совместного обучения на «смеси» данных, имеющих разную сложность.

3. В настоящей работе были достигнуты state-of-the-art результаты на задаче обобщающей реидентификации людей. При проведении экспериментальной оценки использовались общепринятые в литературе протоколы тестирования для данной задачи.

4. В этой работе впервые предложен подход сопровождения людей по де-текциям голов с последующей их регрессией в полный рост человека для подсчета людей, пересекших специальный сигнальный отрезок.

5. В данной диссертации впервые предлагается тестовый протокол для задачи оценки времени ожидания в очередях, а также алгоритм решения упомянутой проблемы, учитывающий ее специфику, и основанный на методах трекинга и реидентификации людей.

Результаты исследований, представленные в данной диссертационной работе, обладают высокой практической значимостью, так как алгоритмы реидентификации людей используются в современных интеллектуальных си-

стемах видеоаналитики. Последние, в свою очередь, применяются для решения множества практически важных задач. Более того, в рамках настоящей работы отдельно изучаются вопросы практического приложения разработанных подходов: например, зарегистрированное ПО для подсчета числа пассажиров в автобусах, основанное на методах сопровождения и реидентификации людей.

Основные положения, выносимые на защиту:

1. Разработан легковесный модуль фильтрации изображений перед их подачей на вход основному алгоритму реидентификации. Данный модуль позволяет существенно повысить устойчивость реидентификации к шумным входным картинкам, что является важным аспектом для систем интеллектуальной видеоаналитики, используемым на практике.

2. Исследовано влияние self-supervised предобучения на качество ре-идентификации людей. Показано, что качественное предварительное обучение на больших выборках однокамерных данных позволяет улучшить точность алгоритмов. Помимо этого, были выявлены «узкие» места в данном подходе, связанные с эффектом «забывания» знаний нейросетью.

3. Для решения проблемы «забывания» был разработан совершенно новый подход совместного обучения на «смеси» многокамерных и однокамерных данных, имеющих разную сложность в контексте рассматриваемой задачи. Предложенный подход позволяет достигать state-of-the-art результатов на задаче обобщающей реидентификации людей.

4. Разработаны парктико-ориентированные методы трекинга и подсчета людей, а также оценки времени ожидания в очередях. Предложенные подходы нашли свое практическое применение в зарегистрированном ПО для подсчета числа пассажиров в автобусах.

Методология исследования в данной диссертации включает разработку алгоритмов для решения задачи реидентификации людей и последующую оценку их эффективности на общедоступных наборах данных CUHK03-NP [1], Market-1501 [2], MSMT17 [3], DukeMTMC-reID [4] и RandPerson [5] с использованием метрик Rankn и тАР. Для задач сопровождения (трекинга) и подсчета людей, а также оценки времени ожидания в очередях применялись видеопоследовательности из внутренней базы, собранной компанией ООО «Технологии Видеоанализа», а также датасет TownCentre [6]. Оценка качества решений в

этих задачах проводилась с использованием тестового протокола, максимально приближенного к реальным «бизнес-метрикам», включая предложенные в этой работе показатели и метрики, описанные в [7].

Достоверность полученных результатов обеспечивается общепринятыми в рассматриваемых задачах протоколами экспериментальной оценки полученных методов на публично (или приватно) доступных тестовых наборах данных. Также достоверность результатов в данной работе подтверждают сравнения с другими подходами, представленными в литературе. Помимо всего прочего, стоит отметить, что все заявленные в настоящей диссертации результаты были опубликованы в рецензируемых журналах.

Публикации. Основные результаты по теме диссертации изложены в 6 печатных изданиях, все они изданы в периодических научных журналах, индексируемых Web of Science и Scopus, а 4 из них — еще в тезисах докладов. Зарегистрирована 1 программа для ЭВМ.

Публикации повышенного уровня:

1. Approaches to Improve the Quality of Person Re-Identification for Practical Use / T. Mamedov, D. Kuplyakov, and A. Konushin // Sensors 23, no. 17 (2023): 7382. (WoS, Scopus, Q1).

2. ReMix: Training Generalized Person Re-identification on a Mixture of Data / T. Mamedov, A. Konushin, and V. Konushin //In Proceedings of the Winter Conference on Applications of Computer Vision (WACV), Tucson, Arizona, USA, pp. 8175-8185. 2025. (WoS, Scopus, Core A).

Публикации стандартного уровня:

3. Video Analytics Using Detection on Sparse Frames / T.Z. Mamedov, D.A. Kuplyakov, and A.S. Konushin // Programming and Computer Software 48, no. 3 (2022): 155-163. (WoS, Scopus, Q4).

Прочие публикации:

4. Practical People Counting Algorithm / T. Mamedov, D. Kuplyakov, and A. Konushin //In Proceedings of the 31th International Conference on Computer Graphics and Machine Vision, Nizhny Novgorod, Russia, vol. 31, pp. 453-463. 2021. (Scopus).

5. Queue Waiting Time Estimation Using Person Re-identification by Upper Body / T. Mamedov, D. Kuplyakov, and A. Konushin //In Proceedings of the 31th International Conference on Computer Graphics and Machine Vision, Nizhny Novgorod, Russia, pp. 27-30. 2021. (Scopus).

6. A Distributed Tracking Algorithm for Counting People in Video by Head Detection / D. Kuplyakov, Y. Geraskin, T. Mamedov, and A. Konushin // In Proceedings of the 30th International Conference on Computer Graphics and Machine Vision, Saint Peterburg, Russia, vol. 2744, pp. 1-12. 2020. (Scopus).

Зарегистрированные программы для ЭВМ:

7. Багров Н.Ю., Звездаков С.В., Купляков Д.А., Николашкин А.Г., Сергеев А.Е., Мамедов Т.З. Tevian Passenger Counter. Номер регистрации: 2023685224 от 23.11.2023. Правообладатель: Общество с ограниченной ответственностью «Технологии Видеоанализа».

Апробация работы. Основные результаты данной диссертационной работы докладывались на следующих конференциях:

— IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025), Тусон, Аризона, США, 28 февраля - 4 марта 2025 года. Тема доклада: «ReMix: Training Generalized Person Re-identification on a Mixture of Data»;

— 14-я Международная конференция «Интеллектуализация обработки информации», Москва, Россия, 6-9 декабря 2022 года. Тема доклада: «Improving the Quality of Person Re-identification by Self-supervised Pre-training»;

— 31-я Международная конференция по компьютерной графике и машинному зрению, Нижний Новгород, Россия, 27-30 сентября 2021 года. Темы докладов: «Practical People Counting Algorithm» и «Queue Waiting Time Estimation Using Person Re-identification by Upper Body»;

— 30-я Международная конференция по компьютерной графике и машинному зрению, Санкт-Петербург, Россия, 20-25 сентября 2020 года. Тема доклада: «A Distributed Tracking Algorithm for Counting People in Video by Head Detection».

Личным вкладом автора данной диссертации в работах [8-12] является проектирование, разработка, обучение предложенных алгоритмов, а также их экспериментальная оценка с последующим обоснованием полученных результатов, и написание публикаций. Научному руководителю Конушину A.C., Куплякову Д.А. и Конушину В.С. в упомянутых трудах принадлежит консультация по проведению исследований. В [13] вкладом автора стали проведение экспериментов, валидациях полученных результатов и написание статьи.

Объем и структура работы. Диссертация состоит из введения, 4 глав, заключения и 2 приложений. Полный объём диссертации составляет 118 страниц, включая 23 рисунка и 20 таблиц. Список литературы содержит 101 наименование.

Глава 1. Реидентификация людей

1.1 Постановка задачи

С неформальной точки зрения задача реидентификации людей подразумевает поиск человека, запечатленного на изображении-запросе, среди других изображений, находящихся в базе данных, называемой «галереей».

Для более формальной постановки рассматриваемой задачи введем понятия «Запросов» и «Галереи», которые являются множествами вида Q = {{хг,уг} с,)}^ и д = {(х3,у3,с3^^ где:

— хг е [0;255]^хНх3 и х3 е [0;255]^хНх3 — цветные И^В-изображения людей, имеющие ширину W и высоту Н;

— Уг е У = {1, 2, ...,М} и у3 е У — идентификаторы людей, запечатленных на данных изображениях;

— С{ е С = {1, 2,..., К} и с3 е С — номера камер, с которых были получены эти изображения.

На вход алгоритм реидентификации получает изображение-запрос из «Запросов» и множество картинок {xj} из «Галереи», а на выход выдает отсортированный по убыванию список V, состоящий из степеней уверенности Р3 е К[0;1] в том, что на изображениях Х{ и х3 запечатлен один и тот же человек. Чем Р^ ближе к 1, тем алгоритм более уверен в том, что рассматриваемые картинки «принадлежат» одному человеку.

Во время проведения экспериментальной оценки в литературе учитывается дополнительное ограничение на список V — в него входят элементы Рз (Уг = У г) V ((у г = Уг)&(сг = ¿¿)). Иными словами, выходной список состоит только из тех степеней уверенности, которые соответствуют либо парам изображений с разными людьми, либо с одними и теми же людьми, но запечатленными на разные камеры. И уже на основе такого списка считаются метрики Яапкм и тАР (разд. 1.4.1). Таким образом оценивается насколько хорошо алгоритм способен выделять изображения искомого человека, полученные с других камер, среди картинок иных людей, но с той же камеры, что и изображение-запрос.

1.2 Обзор существующих подходов

В связи со своей практической важностью и широкой применимостью в видеоаналитике, алгоритмы реидентификации людей активно развиваются в настоящее время. В современной литературе принято выделять сразу несколько направлений в данной задаче, основанные на проблемах, с которыми приходится сталкиваться в реальных сценариях, например:

— «классическая» реидентификация людей — целью данной подзадачи является достижение максимального качества работы в рамках одного домена. Иными словами, в «классической» реидентификации домен, в котором будет применен алгоритм, совпадает с таковым в обучении;

— обобщающая реидентификация людей — более практико-ориентирован-ное направление, подразумевающее несовпадение домена в обучающей и тестовых выборках. Такой сценарий является наиболее приближенным к реальному использованию, ведь заранее неизвестно в какой именно среде будет использоваться нейронная сеть;

— реидентификация людей по силуэтам — к данной категории относятся алгоритмы, устойчивые к смене одежды людей;

— видимо-инфракрасная реидентификация людей — группа методов, способных сопоставлять людей с цветных изображений с ними же на кадрах, полученных с инфракрасной камеры, и наоборот.

Учитывая практическую направленность данной диссертационной работы, автором был сделан основной фокус на задаче обобщающей реидентификации людей. При этом, для «плавности» повествования и достижения всеобщности исследований, в настоящем разделе изучаются существующие в литературе подходы решения как обобщающей реидентификации, так и «классической».

1.2.1 «Классическая» реидентификация людей

Алгоритмы «классической» реидентификации особенно стремительно начали развиваться с появлением сверточных нейронных сетей. До того, как методы глубокого обучения получили свою популярность, работа алгоритмов

Рисунок 1.1 — Демонстрация применения аугментации Random Erasing. Сверху представлены «оригинальные» изображения, а снизу — их аугментации.

реидентификации сводилась к изучению частичных или локальных особенностей изображений, которые могли быть получены совершенно разными способами.

Например, некоторые авторы в своих работах [14-16] разделяли изображения людей на горизонтальные полосы, чтобы извлечь цветовые и текстурные особенности. В других трудах можно встретить использование более сложных стратегий поиска ключевых признаков, позволяющих произвести реидентифи-кацию. Например, в [17] было принято решение разбивать изображения не на полосы, а на множество треугольников, чтобы получить как можно больше признаков. Также стоит отметить то, что даже во времена, когда сверточные нейронные сети не были широко распространены, исследователи уже начали искать подходы для получения пространственной информации на изображениях [18; 19], которые в разы улучшали результаты.

Развитие сверточных нейронных сетей дало дополнительный импульс в совершенствовании решений рассматриваемой задачи, так как оно открыло простор для качественного извлечения векторов особенностей для изображений. Для примера, в [20; 21] были предложены архитектуры, разбивающие изображение человека на части (условно, на верхнюю, среднюю и нижнюю части тела) для последующего извлечения и агрегации признаков. Работа [22] стала в свое время одной из самых популярных в данной теме, ведь в ней было представлено сразу несколько практико-ориентированных подходов к улучшению качества реидентификации. Так, например, ее авторы показали, что правильное использование слоев Batch Normalization [23] во время обучения и инференса модели может существенно повысить качество реидентификации.

Рисунок 1.2 — Пример синтетических данных, используемых во время обучения

«классической» реидентификации людей.

В [24] была представлена аугментация Random Erasing, суть которой заключается в следующем: в изображения людей в произвольных местах добавляются случайные фигуры, симулирующие таким образом перекрытия (рис. 1.1). Подобный подход позволил увеличить количество данных для обучения и при этом частично решил упомянутую ранее проблему окклюзий за счет улучшения общности нейронной сети.

Основная проблема реидентификации людей заключается в недостаточном объеме доступных для обучения выборок. Связана она со спецификой рассматриваемой задачи — последняя подразумевает многокамерный сценарий, который существенно осложняет сбор и разметку данных подобного рода. Поэтому для преодоления возникающих трудностей в методах «классической» реидентификации зачастую прибегают к использованию синтетических данных, сгенерированных либо в автоматическом, либо полуавтоматическом режиме.

Чаще всего генерация данных для обучения происходит с помощью игровых движков [25] (например, Unreal Engine) или непосредственно самих игр [26] (например, Grand Theft Auto V). То есть генерируются сцены с заранее заданным сценарием поведения персонажей (рис. 1.2) и в практически автоматическом режиме происходит сбор размеченных данных, которые впоследствии можно применять для обучения алгоритмов реидентификации. За счет использования программных средств у исследователей появляется практически безграничная возможность составления обучающих выборок — ведь с помощью игровых движков можно задавать произвольное поведение персонажей, менять их одежду, внешний вид, окружающую среду и т.д.

В настоящее время наилучших результатов в задаче «классической» ре-идентификации людей удается достигать за счет использования архитектуры Vision Transformer (ViT) [27]. Впервые ViT в приложении к рассматриваемой задаче была применена в [28]. В работах [29-31] авторы пошли еще дальше и использовали комбинацию сверточных нейронных сетей и Vision Transformer, чтобы извлечь пользу от обеих архитектур для получения более репрезентативных векторов особенностей для изображений.

CLIP-подобные [32] подходы также не прошли мимо задачи реиденти-фикации. Так, например, в [33] была представлена двухстадийная процедура обучения алгоритма «классической» реидентификации людей. Используя две модальности, авторы смогли существенно улучшить качество решения рассматриваемой задачи.

1.2.2 Обобщающая реидентификация людей

Как было отмечено в разделе 1.2, данное направление основной задачи реидентификации людей подразумевает обучение таких алгоритмов, которые будут иметь высокую обобщающую способность и устойчивы к изменению условий съемки (к смене доменов) без какого-либо дообучения. Ввиду того, что подобный сценарий приближен к реальному применению методов реиденти-фикации в видеоаналитике, эта подзадача получила особую популярность в сообществе в последние годы.

Одним из подходов к улучшению способности нейронной сети к обобщению является использование специальных слоев нормализации [34-36]. Помимо этого, в [37;38] было показано, что комбинация «общепринятых» Batch Normalization и Instance Normalization [39] также способствует повышению обобщающей способности алгоритма искусственного интеллекта при решении рассматриваемой задачи.

Другим направлением исследований в данной области является разработка специализированных архитектур. В [40] был представлен новый residual-блок, состоящий из нескольких сверточных потоков, позволяющих обнаруживать особенности на разных масштабах. Авторы работы [41] пошли еще дальше и обновили предложенную ранее архитектуру интегрировав в нее

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Мамедов Тимур Закирович, 2026 год

Список литературы

1. Deepreid: Deep filter pairing neural network for person re-identification / Wei Li, Rui Zhao, Tong Xiao, Xiaogang Wang // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2014. — Pp. 152-159.

2. Scalable person re-identification: A benchmark / Liang Zheng, Liyue Shen, Lu Tian et al. // Proceedings of the IEEE international conference on computer vision. — 2015. — Pp. 1116-1124.

3. Person transfer gan to bridge domain gap for person re-identification / Longhui Wei, Shiliang Zhang, Wen Gao, Qi Tian // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2018. — Pp. 79-88.

4. Performance measures and a data set for multi-target, multi-camera tracking / Ergys Ristani, Francesco Solera, Roger Zou et al. // European conference on computer vision / Springer. — 2016. — Pp. 17-35.

5. Wang Yanan, Liao Shengcai, Shao Ling. Surpassing real-world source training data: Random 3d characters for generalizable person re-identification // Proceedings of the 28th ACM international conference on multimedia. — 2020. — Pp. 3422-3430.

6. Benfold Ben, Reid Ian. Stable multi-target tracking in real-time surveillance video // CVPR 2011 / IEEE. — 2011. — Pp. 3457-3464.

7. A distributed tracking algorithm for counting people in video / DA Kuplyakov, EV Shalnov, VS Konushin, AS Konushin // Programming and Computer Software. — 2019. — Vol. 45. — Pp. 163-170.

8. Mamedov Timur, Kuplyakov Denis, Konushin Anton. Practical People Counting Algorithm // Proceedings of the 31th International Conference on Computer Graphics and Machine Vision. — 2021.

9. Mamedov Timur, Kuplyakov Denis, Konushin Anton. Queue Waiting Time Estimation Using Person Re-identification by Upper Body // Proceedings of the 31th International Conference on Computer Graphics and Machine Vision. — 2021.

10. Mamedov T.Z., Kuplyakov D.A., Konushin A.S. Video Analytics Using Detection on Sparse Frames // Programming and Computer Software. — 2022. — Vol. 48, no. 3. — Pp. 155-163.

11. Mamedov Timur, Kuplyakov Denis, Konushin Anton. Approaches to improve the quality of person re-identification for practical use // Sensors. — 2023. — Vol. 23, no. 17. — P. 7382.

12. Mamedov Timur, Konushin Anton, Konushin Vadim. ReMix: Training Generalized Person Re-Identification on a Mixture of Data // 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV). — 2025. — Pp. 8186-8196.

13. A distributed tracking algorithm for counting people in video by head detection / Denis Kuplyakov, Yaroslav Geraskin, Timur Mamedov, Anton Konushin // Proceedings of the 30th International Conference on Computer Graphics and Machine Vision. — 2020.

14. Gray Douglas, Tao Hai. Viewpoint invariant pedestrian recognition with an ensemble of localized features // Computer Vision-ECCV 2008: 10th European Conference on Computer Vision, Marseille, France, October 12-18, 2008, Proceedings, Part I 10 / Springer. — 2008. — Pp. 262-275.

15. Person re-identification by support vector ranking / C Engel, P Baumgartner, M Holzmann, JF Nutzel // British Machine Vision Conference, BMVC. — 2010. — Pp. 1-11.

16. Zheng Wei-Shi, Gong Shaogang, Xiang Tao. Reidentification by relative distance comparison // IEEE transactions on pattern analysis and machine intelligence. — 2012. — Vol. 35, no. 3. — Pp. 653-668.

17. Gheissari Niloofar, Sebastian Thomas B, Hartley Richard. Person reidentification using spatiotemporal appearance // 2006 IEEE computer society conference on computer vision and pattern recognition (CVPR'06) / IEEE. — Vol. 2. — 2006. — Pp. 1528-1535.

18. Custom pictorial structures for re-identification. / Dong Seon Cheng, Marco Cristani, Michele Stoppa et al. // Bmvc / Citeseer. — Vol. 1. — 2011. — P. 6.

19. Das Abir, Chakraborty Anirban, Roy-Chowdhury Amit K. Consistent re-identification in a camera network // Computer Vision-ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part II 13 / Springer. — 2014. — Pp. 330-345.

20. Part-aligned bilinear representations for person re-identification / Yumin Suh, Jingdong Wang, Siyu Tang et al. // Proceedings of the European conference on computer vision (ECCV). — 2018. — Pp. 402-419.

21. Learning discriminative features with multiple granularities for person re-identification / Guanshuo Wang, Yufeng Yuan, Xiong Chen et al. // Proceedings of the 26th ACM international conference on Multimedia. — 2018. — Pp. 274-282.

22. Bag of tricks and a strong baseline for deep person re-identification / Hao Luo, Youzhi Gu, Xingyu Liao et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition workshops. — 2019. — Pp. 0-0.

23. Ioffe Sergey, Szegedy Christian. Batch normalization: Accelerating deep network training by reducing internal covariate shift // International conference on machine learning / pmlr. — 2015. — Pp. 448-456.

24. Random erasing data augmentation / Zhun Zhong, Liang Zheng, Guo-liang Kang et al. // Proceedings of the AAAI conference on artificial intelligence. — Vol. 34. — 2020. — Pp. 13001-13008.

25. Unrealperson: An adaptive pipeline towards costless person re-identification / Tianyu Zhang, Lingxi Xie, Longhui Wei et al. // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2021. — Pp. 11506-11515.

26. Taking a closer look at synthesis: Fine-grained attribute analysis for person re-identification / Suncheng Xiang, Yuzhuo Fu, Guanjie You, Ting Liu // ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) / IEEE. — 2021. — Pp. 3765-3769.

27. An image is worth 16x16 words: Transformers for image recognition at scale / Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov et al. // arXiv preprint arXiv:2010.11929. — 2020.

28. Transreid: Transformer-based object re-identification / Shuting He, Hao Luo, Pichao Wang et al. // Proceedings of the IEEE/CVF international conference on computer vision. — 2021. — Pp. 15013-15022.

29. Diverse part discovery: Occluded person re-identification with part-aware transformer / Yulin Li, Jianfeng He, Tianzhu Zhang et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2021.

— Pp. 2898-2907.

30. Learning disentangled representation implicitly via transformer for occluded person re-identification / Mengxi Jia, Xinhua Cheng, Shijian Lu, Jian Zhang // IEEE Transactions on Multimedia. — 2022. — Vol. 25. — Pp. 1294-1305.

31. Lai Shenqi, Chai Zhenhua, Wei Xiaolin. Transformer meets part model: Adaptive part division for person re-identification // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2021. — Pp. 4150-4157.

32. Learning transferable visual models from natural language supervision / Alec Radford, Jong Wook Kim, Chris Hallacy et al. // International conference on machine learning / PmLR. — 2021. — Pp. 8748-8763.

33. Li Siyuan, Sun Li, Li Qingli. CLIP-ReID: exploiting vision-language model for image re-identification without concrete text labels // Proceedings of the AAAI Conference on Artificial Intelligence. — Vol. 37. — 2023. — Pp. 1405-1413.

34. Style normalization and restitution for generalizable person re-identification / Xin Jin, Cuiling Lan, Wenjun Zeng et al. // proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2020. — Pp. 3143-3152.

35. Meta batch-instance normalization for generalizable person re-identification / Seokeon Choi, Taekyung Kim, Minki Jeong et al. // Proceedings of the IEEE/CVF conference on Computer Vision and Pattern Recognition. — 2021.

— Pp. 3425-3435.

36. Dynamically transformed instance normalization network for generalizable person re-identification / Bingliang Jiao, Lingqiao Liu, Liying Gao et al. // European Conference on Computer Vision / Springer. — 2022. — Pp. 285-301.

37. Two at once: Enhancing learning and generalization capacities via ibn-net / Xingang Pan, Ping Luo, Jianping Shi, Xiaoou Tang // Proceedings of the European Conference on Computer Vision (ECCV). — 2018. — Pp. 464-479.

38. Jia Jieru, Ruan Qiuqi, Hospedales Timothy M. Frustratingly easy person re-identification: Generalizing person re-id in practice // arXiv preprint arX-iv:1905.03422. — 2019.

39. Ulyanov Dmitry, Vedaldi Andrea, Lempitsky Victor. Instance normalization: The missing ingredient for fast stylization // arXiv preprint arXiv:1607.08022. — 2016.

40. Omni-scale feature learning for person re-identification / Kaiyang Zhou, Yongx-in Yang, Andrea Cavallaro, Tao Xiang // Proceedings of the IEEE/CVF international conference on computer vision. — 2019. — Pp. 3702-3712.

41. Learning generalisable omni-scale representations for person re-identification / Kaiyang Zhou, Yongxin Yang, Andrea Cavallaro, Tao Xiang // IEEE transactions on pattern analysis and machine intelligence. — 2021. — Vol. 44, no. 9. — Pp. 5056-5069.

42. Liao Shengcai, Shao Ling. Interpretable and generalizable person re-identification with query-adaptive convolution and temporal lifting // Computer Vision-ECCV 2020: 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XI 16 / Springer. — 2020. — Pp. 456-474.

43. Liao Shengcai, Shao Ling. Transmatcher: Deep image matching through transformers for generalizable person re-identification // Advances in Neural Information Processing Systems. — 2021. — Vol. 34. — Pp. 1992-2003.

44. Liao Shengcai, Shao Ling. Graph sampling based deep metric learning for gen-eralizable person re-identification // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2022. — Pp. 7359-7368.

45. Part-Aware Transformer for Generalizable Person Re-identification / Hao Ni, Yuke Li, Lianli Gao et al. // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2023. — Pp. 11280-11289.

46. Generalizable Person Re-identification via Balancing Alignment and Uniformity / Yoonki Cho, Jaeyoon Kim, Woo J Kim et al. // Advances in Neural Information Processing Systems. — 2024. — Vol. 37. — Pp. 47069-47093.

47. Song Myungseo, Park Jin-Woo, Lee Jong-Seok. Exploring the Camera Bias of Person Re-identification // arXiv preprint arXiv:2502.10195. — 2025.

48. Zhao Huazhong, Qi Lei, Geng Xin. CLIP-DFGS: A Hard Sample Mining Method for CLIP in Generalizable Person Re-Identification // ACM Transactions on Multimedia Computing, Communications and Applications. — 2024. — Vol. 21, no. 1. — Pp. 1-20.

49. Zhao Huazhong, Qi Lei, Geng Xin. CILP-FGDI: Exploiting Vision-Language Model for Generalizable Person Re-Identification // IEEE Transactions on Information Forensics and Security. — 2025.

50. Unsupervised pre-training for person re-identification / Dengpan Fu, Dongdong Chen, Jianmin Bao et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2021. — Pp. 14750-14759.

51. Mobilenetv2: Inverted residuals and linear bottlenecks / Mark Sandler, Andrew Howard, Menglong Zhu et al. // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2018. — Pp. 4510-4520.

52. Dropout: a simple way to prevent neural networks from overfitting / Nitish Sri-vastava, Geoffrey Hinton, Alex Krizhevsky et al. // The journal of machine learning research. — 2014. — Vol. 15, no. 1. — Pp. 1929-1958.

53. Masked autoencoders are scalable vision learners / Kaiming He, Xinlei Chen, Saining Xie et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2022. — Pp. 16000-16009.

54. Noroozi Mehdi, Favaro Paolo. Unsupervised learning of visual representations by solving jigsaw puzzles // European conference on computer vision / Springer. — 2016. — Pp. 69-84.

55. Gidaris Spyros, Singh Praveer, Komodakis Nikos. Unsupervised representation learning by predicting image rotations // arXiv preprint arXiv:1803.07728. — 2018.

56. Imagenet: A large-scale hierarchical image database / Jia Deng, Wei Dong, Richard Socher et al. // 2009 IEEE conference on computer vision and pattern recognition / Ieee. — 2009. — Pp. 248-255.

57. Improved baselines with momentum contrastive learning / Xinlei Chen, Hao-qi Fan, Ross Girshick, Kaiming He // arXiv preprint arXiv:2003.04297. — 2020.

58. A density-based algorithm for discovering clusters in large spatial databases with noise / Martin Ester, Hans-Peter Kriegel, Jorg Sander et al. // kdd. — Vol. 96. — 1996. — Pp. 226-231.

59. Camera-aware proxies for unsupervised person re-identification / Menglin Wang, Baisheng Lai, Jianqiang Huang et al. // Proceedings of the AAAI conference on artificial intelligence. — Vol. 35. — 2021. — Pp. 2764-2772.

60. Deep residual learning for image recognition / Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — Pp. 770-778.

61. Chen Hao, Lagadec Benoit, Bremond Francois. Ice: Inter-instance contrastive encoding for unsupervised person re-identification // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2021. — Pp. 14960-14969.

62. Meta distribution alignment for generalizable person re-identification / Hao Ni, Jingkuan Song, Xiaopeng Luo et al. // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2022. — Pp. 2487-2496.

63. Multiple domain experts collaborative learning: Multi-source domain generalization for person re-identification / Shijie Yu, Feng Zhu, Dapeng Chen et al. // arXiv preprint arXiv:2105.12355. — 2021.

64. Learning to generalize unseen domains via memory-based multi-source meta-learning for person re-identification / Yuyang Zhao, Zhun Zhong, Fengx-iang Yang et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2021. — Pp. 6277-6286.

65. Generalizable person re-identification with relevance-aware mixture of experts / Yongxing Dai, Xiaotong Li, Jun Liu et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2021. — Pp. 16145-16154.

66. A novel mix-normalization method for generalizable multi-source person re-identification / Lei Qi, Lei Wang, Yinghuan Shi, Xin Geng // IEEE Transactions on Multimedia. — 2022.

67. Meta: Mimicking embedding via others' aggregation for generalizable person re-identification / Boqiang Xu, Jian Liang, Lingxiao He, Zhenan Sun // Proceedings of the European conference on computer vision (ECCV). — 2022.

68. Style interleaved learning for generalizable person re-identification / Wen-tao Tan, Changxing Ding, Pengfei Wang et al. // IEEE Transactions on Multimedia. — 2023.

69. Wojke Nicolai, Bewley Alex, Paulus Dietrich. Simple Online and Realtime Tracking with a Deep Association Metric // 2017 IEEE International Conference on Image Processing (ICIP) / IEEE. — 2017. — Pp. 3645-3649.

70. Leal-Taixe L. Motchallenge 2015: Towards a benchmark for multi-target tracking // arXiv preprint arXiv:1504.01942. — 2015.

71. Milan Anton. MOT16: A benchmark for multi-object tracking // arXiv preprint arXiv:1603.00831. — 2016.

72. Bernardin Keni, Stiefelhagen Rainer. Evaluating multiple object tracking performance: the clear mot metrics // EURASIP Journal on Image and Video Processing. — 2008. — Vol. 2008. — Pp. 1-10.

73. Li Yuan, Huang Chang, Nevatia Ram. Learning to associate: Hybridboosted multi-target tracker for crowded scene // 2009 IEEE conference on computer vision and pattern recognition / IEEE. — 2009. — Pp. 2953-2960.

74. 2 T: Multiple people multiple parts tracker / Hamid Izadinia, Imran Saleemi, Wenhui Li, Mubarak Shah // Computer Vision-ECCV 2012: 12th European Conference on Computer Vision, Florence, Italy, October 7-13, 2012, Proceedings, Part VI 12 / Springer. — 2012. — Pp. 100-114.

75. Zhang Li, Li Yuan, Nevatia Ramakant. Global data association for multi-object tracking using network flows // 2008 IEEE conference on computer vision and pattern recognition / IEEE. — 2008. — Pp. 1-8.

76. Kuhn Harold W. The Hungarian method for the assignment problem // Naval research logistics quarterly. — 1955. — Vol. 2, no. 1-2. — Pp. 83-97.

77. Poi: Multiple object tracking with high performance detection and appearance feature / Fengwei Yu, Wenbo Li, Quanquan Li et al. // Computer Vision-ECCV 2016 Workshops: Amsterdam, The Netherlands, October 8-10 and 15-16,

2016, Proceedings, Part II 14 / Springer. — 2016. — Pp. 36-42.

78. Simple online and realtime tracking / Alex Bewley, Zongyuan Ge, Lionel Ott et al. // 2016 IEEE international conference on image processing (ICIP) / Ieee.

— 2016. — Pp. 3464-3468.

79. Bochinski Erik, Eiselein Volker, Sikora Thomas. High-speed tracking-by-detection without using image information // 2017 14th IEEE international conference on advanced video and signal based surveillance (AVSS) / IEEE. —

2017. — Pp. 1-6.

80. Part-based multiple-person tracking with partial occlusion handling / Guang Shu, Afshin Dehghan, Omar Oreifej et al. // 2012 IEEE Conference on Computer Vision and Pattern Recognition / IEEE. — 2012. — Pp. 1815-1821.

81. Dehghan Afshin, Modiri Assari Shayan, Shah Mubarak. Gmmcp tracker: Globally optimal generalized maximum multi clique problem for multiple object tracking // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2015. — Pp. 4091-4099.

82. Roshan Zamir Amir, Dehghan Afshin, Shah Mubarak. Gmcp-tracker: Global multi-object tracking using generalized minimum clique graphs // Computer Vision-ECCV 2012: 12th European Conference on Computer Vision, Florence, Italy, October 7-13, 2012, Proceedings, Part II 12 / Springer. — 2012. — Pp. 343-356.

83. Shalnov EV, Konushin VS, Konushin AS. An improvement on an MCM-C-based video tracking algorithm // Pattern Recognition and Image Analysis.

— 2015. — Vol. 25. — Pp. 532-540.

84. Kuplyakov Denis, Shalnov Evgeny, Konushin Anton. Markov chain Monte Carlo based video tracking algorithm // Programming and Computer Software. — 2017. — Vol. 43. — Pp. 224-229.

85. Bytetrack: Multi-object tracking by associating every detection box / Yi-fu Zhang, Peize Sun, Yi Jiang et al. // European conference on computer vision / Springer. — 2022. — Pp. 1-21.

86. Strongsort: Make deepsort great again / Yunhao Du, Zhicheng Zhao, Yang Song et al. // IEEE Transactions on Multimedia. — 2023. — Vol. 25. — Pp. 8725-8737.

87. A multi-cut formulation for joint segmentation and tracking of multiple objects / Margret Keuper, Siyu Tang, Yu Zhongjie et al. // arXiv preprint arXiv:1607.06317. — 2016.

88. Choi Wongun. Near-online multi-target tracking with aggregated local flow descriptor // Proceedings of the IEEE international conference on computer vision. — 2015. — Pp. 3029-3037.

89. Recurrent autoregressive networks for online multi-object tracking / Kuan Fang, Yu Xiang, Xiaocheng Li, Silvio Savarese // 2018 IEEE Winter Conference on Applications of Computer Vision (WACV) / IEEE. — 2018. — Pp. 466-475.

90. Multi-object tracking with quadruplet convolutional neural networks / Jeany Son, Mooyeol Baek, Minsu Cho, Bohyung Han // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — Pp. 5620-5629.

91. Staple: Complementary learners for real-time tracking / Luca Bertinetto, Jack Valmadre, Stuart Golodetz et al. // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — Pp. 1401-1409.

92. Eco: Efficient convolution operators for tracking / Martin Danelljan, Goutam Bhat, Fahad Shahbaz Khan, Michael Felsberg // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — Pp. 6638-6646.

93. AutoTrack: Towards high-performance visual tracking for UAV with automatic spatio-temporal regularization / Yiming Li, Changhong Fu, Fangqiang Ding et al. // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2020. — Pp. 11923-11932.

94. DR 2 track: towards real-time visual tracking for UAV via distractor repressed dynamic regression / Changhong Fu, Fangqiang Ding, Yiming Li et al. // 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) / IEEE. — 2020. — Pp. 1597-1604.

95. Discriminative correlation filter with channel and spatial reliability / Alan Lukezic, Tomas Vojir, Luka "Cehovin Zajc et al. // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — Pp. 6309-6318.

96. Vojir Tomas, Noskova Jana, Matas Jiri. Robust scale-adaptive mean-shift for tracking // Pattern Recognition Letters. — 2014. — Vol. 49. — Pp. 250-258.

97. Faster R-CNN: Towards real-time object detection with region proposal networks / Shaoqing Ren, Kaiming He, Ross Girshick, Jian Sun // IEEE transactions on pattern analysis and machine intelligence. — 2016. — Vol. 39, no. 6. — Pp. 1137-1149.

98. Ssd: Single shot multibox detector / Wei Liu, Dragomir Anguelov, Dumitru Er-han et al. // Computer Vision-ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11-14, 2016, Proceedings, Part I 14 / Springer. — 2016. — Pp. 21-37.

99. Crowdhuman: A benchmark for detecting human in a crowd / Shuai Shao, Zijian Zhao, Boxun Li et al. // arXiv preprint arXiv:1805.00123. — 2018.

100. Mobilenets: Efficient convolutional neural networks for mobile vision applications / Andrew G Howard, Menglong Zhu, Bo Chen et al. // arXiv preprint arXiv:1704.04861. — 2017.

101. Wu Yuxin, Kirillov Alexander, Massa Francisco et al. Detectron2. — https: //github.com/facebookresearch/detectron2. — 2019.

Список рисунков

1 Пример работы алгоритма реидентификации. Для

изображения-запроса были найдены соответствующие примеры из базы данных («галереи»).......................... 6

1.1 Демонстрация применения аугментации Random Erasing. Сверху представлены «оригинальные» изображения, а снизу — их аугментации................................. 16

1.2 Пример синтетических данных, используемых во время обучения «классической» реидентификации людей................. 17

1.3 Примеры изображений из однокамерного датасета, полученного при помощи предложенного метода автоматизированного сбора данных. 23

1.4 Примеры некорректных данных, способных привести к ошибкам реидентификации: отсутствие человека в кадре, наличие сразу двух людей, частичное попадание тела в кадр и чрезмерная затемненность изображения........................ 26

1.5 Пример процедуры разметки. Красным цветом выделены «некорректные» изображения, не выделены — «корректные». Из трека видно, что искомый человек — девушка в черной толстовке. Восьмое изображение отмечено как «некорректное», так как по нему сложно выявить целевого человека; двенадцатое — на нем искомый человек сильно перекрыт другим человеком.......... 27

1.6 Архитектура Filter Module......................... 29

1.7 Пример кадра с реальной камеры видеонаблюдения, демонстрирующий, что детекции верхней части тела обладают лучшей видимостью по сравнению с детекциями в полный рост (границы объектов выделены для наглядности)............. 34

1.8 Схема метода MoCo v2........................... 36

1.9 Сравнение многокамерных и однокамерных данных. В первых изображения одного и того же человека сильно различаются по

фону, освещению и ракурсу, во вторых — отличаются минимально. . 39

1.10 Схема предложенного подхода. В начале каждой эпохи изображения из многокамерного датасета проходят через моментум-кодировщик для расчета центроидов (нижняя часть схемы). Параллельно из однокамерного набора случайным образом выбираются видео, по которым формируются кластеры и присваиваются псевдо-метки (верхняя часть схемы). Затем размеченные многокамерные и псевдоразмеченные однокамерные данные подаются в кодировщик. Для обучения используются функции потерь: Instance Loss, Augmentation Loss и Centroids Loss — для всех данных, а Camera Centroids Loss — только для

многокамерных............................... 40

1.11 Сравнение выдачи из топ-5 изображений для датасета Магке^1501 между предложенным подходом и методом QAConv-GS [44]. Зеленые рамки обозначают корректные результаты, красные — ошибочные.................................. 50

2.1 Пример подсчета людей. Красным жирным отрезком на данном рисунке обозначен сигнальный отрезок. Другие кривые на примере соответствуют траекториям движения людей.............. 61

2.2 Сравнение детектора голов и детектора тел в случае с окклюзиями. Как можно видеть из примера, с помощью первого детектора на

кадре удалось найти на одного человека больше............. 63

2.3 Пример сцены, на которой человеку сложно понять, где именно находится уровень голов людей...................... 67

2.4 Пример сопоставления детекций голов и тел. На левом рисунке розовый и голубой прямоугольники — детекции голов без пар, синяя — детекция силуэта без пары, зеленая — детекция головы с парной детекцией тела. На правом рисунке изображен результат работы линейной регрессии........................ 70

2.5 Нейросетевая регрессия тела человека по детекции головы......71

3.1 Сравнение эвристической и нейросетевой регрессии верхней части

тела человека................................ 87

3.2 Архитектура нейросетевой регрессии верхней части тела........ 88

3.3 Пример работы предложенной аугментации случайных размеров для верхней части тела. Красный прямоугольник — исходная детекция, синий — результат применения аугментации......... 90

4.1 Иллюстрация логики работы работы зарегистрированного ПО

Tevian Passenger Counter для подсчета числа пассажиров в автобусах. 97

А.1 Сертификат на зарегистрированную программу для ЭВМ.......117

Б.1 Справка о внедрении предложенных алгоритмов в ПО.........118

Список таблиц

1 Сводная информация о многокамерных наборах данных, применяемых для обучения и тестирования алгоритмов реидентификации.............................. 22

2 Сводная информация о наборах данных, используемых для обучения и тестирования Filter Module. В обучающую часть попали изображения из соответствующей выборки в датасете для реидентификации, а валидационную часть составляют изображения «Запросов» и «Галереи».......................... 28

3 Экспериментальная оценка зависимости качества реидентификации от порога т на вероятность, примененного к Filter Module: случай, когда нейронная сеть для реидентификации обучена на MSMT17 Merged, а протестирована на наборе Market-1501............ 30

4 Экспериментальная оценка зависимости качества реидентификации от порога т на вероятность, примененного к Filter Module: случай, когда нейронная сеть для реидентификации обучена на MSMT17 Merged, а протестирована на наборе DukeMTMC-reID......... 31

5 Экспериментальная оценка эффективности self-supervised предобучения для обобщающей реидентификации по верхней части тела человека с использованием кросс-датасетного тестового протокола.................................. 37

6 Влияние использования однокамерных данных в self-supervised предобучении и в предлагаемом подходе совместного обучения на «смеси» данных. В данных экспериментах для обучения использовался датасет MSMT17-merged в качестве многокамерных данных и LUPerson — в качестве однокамерных (где это применимо). 46

7 Последовательное применение однокамерных данных в разных функциях потерь. В данной табоице под «в Ссеп только как центроиды» понимается случай, когда однокамерные данные используются в Centroids Loss только в качестве центроидов. В данных экспериментах для обучения использовался датасет MSMT7-merged в качестве многокамерных данных и LUPerson — в качестве однокамерных. Тестирование производилось на многокамерном датасете DukeMTMC-reID................ 47

8 Анализ значений параметров температуры. В данных экспериментах для обучения использовался датасет MSMT7-merged в качестве многокамерных данных и LUPerson — в качестве однокамерных. Тестирование производилось на многокамерном

9 Сравнение предложенного подхода с другими современными методами в кросс-датасетном сценарии. В данном сравнении участвуют две версии предложенного подхода: с использованием однокамерных данных во время обучения и без («предлож. (без однокам.)» в таблице). В этих экспериментах датасет ЬИРегэоп использовался в качестве однокамерных данных............ 51

10 Сравнение предложенного подхода с другими современными методами с применением кросс-датасетного протокола с несколькими источниками. В данных экспериментах в качестве

11 Влияние применения однокамерных данных при обучении

алгоритма реидентификации людей на качество сопровождения. В данных экспериментах для обучения реидентификации использовался датасет MSMT17-merged в качестве многокамерных данных и LUPerson — в качестве однокамерных (где это применимо). Метод Deep SORT был выбран для сопровождения людей..................................... 53

датасете DukeMTMC-reID

48

однокамерных данных используется датасет LUPerson. Обозначения: C3 — CUHK03-NP, M — Market-1501, D -DukeMTMC-reID, MS — MSMT17.............

52

12 Базовая информация об отобранных видеопоследовательностях для оценки качества алгоритма сопровождения людей и их подсчета. Формат задан в виде «ширинахвысота кадра в пикселях@число кадров в секунду».............................. 75

13 Результаты экспериментальной оценки алгоритма подсчета людей с поднятыми сигнальными отрезками.................... 76

14 Результаты экспериментальной оценки алгоритма подсчета людей с линейной регрессией тела человека по детекции головы........ 77

15 Результаты экспериментальной оценки алгоритма подсчета людей с нейросетевой регрессией тела человека по детекции головы...... 78

16 Результаты экспериментальной оценки алгоритма подсчета людей с ограничением области детекции...................... 79

17 Полученные размеры ROI для видеопоследовательностей. В процентах указана доля числа пикселей ROI от общего числа пикселей кадра............................... 80

18 Результаты экспериментальной оценки одноядерного алгоритма подсчета людей............................... 81

19 Базовая информация о собранных видеозаписях для тестирования алгоритма оценки времени ожидания в очередях. Формат задан в

виде «ширинахвысота кадра в пикселях@число кадров в секунду». . 93

20 Результаты тестирования алгоритма оценки времени ожидания в очередях................................... 94

Приложение А Сертификат на зарегистрированную программу для ЭВМ

российская федерация

RU

2023685224

федеральная служба по интеллектуальной собственности

(12) ГОСУДАРСТВЕННАЯ РЕГИСТРАЦИЯ ПРОГРАММЫ ДЛЯ ЭВМ

Номер регистрации (свидетельства): 2023685224

Дата регистрации: 23.11.2023

Номер и дата поступления заявки: 2023684975 23.11.2023

Дата публикации и номер бюллетеня: 23.11.2023 Бюл. № 12

Авторы:

Багров Никита Юрьевич ^Ц), Звездаков Сергей Васильевич ^Ц), Купляков Денис Анатольевич ^Ц), Николашкин Алексей Герасимович ^Ц), Сергеев Александр Евгеньевич ^Ц), Мамедов Тимур Закирович ^Ц)

Правообладатель: Общество с ограниченной ответственностью "Технологии Видеоанализа" ^Ц)

Название программы для ЭВМ: Tevian Passenger Counter

Реферат:

Система Tevian Passenger Counter предназначена для использования в общественном транспорте с целью мониторинга и автоматизированного учета пассажиропотока. Данная система способна считывать видеопоток, получаемый от RTSP-камер, направленных на двери транспортного средства, и проводить аналитическую обработку видеоданных для подсчета пассажиров, входящих и выходящих из транспортного средства. Подсчитанные данные передаются на бортовой компьютер транспортного средства с использованием протокола IBIS. Система обладает рядом конфигурационных параметров, позволяющих адаптировать систему под конкретные требования и сценарии использования.

Язык программирования: C++, JavaScript

Объем программы для ЭВМ: 274.46 Мб

Рисунок А.1 — Сертификат на зарегистрированную программу для ЭВМ.

Приложение Б Справка о внедрении предложенных алгоритмов в ПО

ООО «Технологии видеоанализа»

119634, г. Москва, ул. Скульптора Мухиной, дом 7,1 этаж, пои. II, комн. 2В

окпо 64556723, ОГРН 1107746005751, КПП 772901001, ИНН 7729647374 1г^оШеу1вп.ги, +7 910-433-73-72

Справха о внедрении

Разработанные Мамеловым Тимуром Эакировичем алгоритмы реидентнфикации, сопровокдеения м подсчета людей, а также оценки времехм ок^АнкА в оо4редях являются составными чдстдмм сспедющих продуктов компанми 000 «Технологии теувп РегзопвОК, ТеУап

РесодпШоп Р1,а1То1^м и Теусап Раэзепдег Соип1ег. Все упомянутое программное обеспечение нашло шмрокое применение на россисском м мировом рынках:.

Теу1ап КесодпШоп Р1а1Тог^ и Теу1ап Раззепдег Соип1ег впляотся зapeгиcтpиoввнхныйn программами для Эвм (номера регистрации: 2025684509 от 115.09.2025 п 2023685224 от 23.11.2023). Реализованные в рамках ПО Теу1ап Раэзепдег Соип1ег алг^с^р^^^-^^^ы^! подснета пассажиров в oKщe<Eтвенкoм транспорте показали точность 95% на данной задауе, согласно тдcтниювaниAM внутрл комlпдемH:

Рисунок Б.1 — Справка о внедрении предложенных алгоритмов в ПО.

■:еу1вп

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.