Метод устойчивого комплексирования данных для обнаружения и оценки пространственного положения объектов в системах технического зрения мобильных роботов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Филатов Николай Сергеевич

  • Филатов Николай Сергеевич
  • кандидат науккандидат наук
  • 2026, «Санкт-Петербургский политехнический университет Петра Великого»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 120
Филатов Николай Сергеевич. Метод устойчивого комплексирования данных для обнаружения и оценки пространственного положения объектов в системах технического зрения мобильных роботов: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Санкт-Петербургский политехнический университет Петра Великого». 2026. 120 с.

Оглавление диссертации кандидат наук Филатов Николай Сергеевич

Введение

1 Трехмерное обнаружение объектов в мобильной робототехнике

1.1 Роль трехмерного обнаружения объектов в автономных роботах

1.2 Постановка задачи мультимодального комплексирования данных и трехмерного обнаружения объектов

1.3 Основные датчики для восприятия трехмерной окружающей среды

1.4 Области эксплуатации и ограничения применения автономных систем

1.5 Выводы

2 Тенденции развития трехмерного обнаружения объектов

2.1 Эталонные наборы данных

2.2 Методы, использующие только облако точек

2.3 Методы, использующие только камеру

2.4 Мультимодальные методы

2.5 Анализ публикационной активности

2.6 Выводы

3 Разработка метода комплексирования мультимодальных данных

3.1 Анализ быстродействия существующих подходов

3.2 Формулировка гипотез для разрабатываемого алгоритма

3.3 Непрерывный набор признаков для эффективного мультимодального трехмерного обнаружения объектов

3.4 Экспериментальная проверка предложенной архитектуры

3.5 Выводы

4 Разработка мультимодального маскированного автоэнкодера в скрытом пространстве для трехмерного обнаружения объектов

4.1 Маскированные автоэнкодеры в глубоком обучении

4.2 Архитектура маскированного автоэнкодера и задачи восстановления признаков

4.3 Применение маскированного автоэнкодера для трехмерного обнаружения

объектов

4.4 Выводы

Заключение

Список терминов

Список литературы

Приложение А Акты о внедрении результатов диссертационной работы

Введение

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Метод устойчивого комплексирования данных для обнаружения и оценки пространственного положения объектов в системах технического зрения мобильных роботов»

Актуальность темы исследования

Трёхмерное обнаружение объектов является ключевым компонентом мобильных робототехнических платформ и автономного транспорта. От качества и задержки восприятия напрямую зависят безопасность движения, стабильность траекторного планирования и общий уровень автономности. При этом на безопасность автономной мобильной робототехнической системы влияет не только качество и временная задержка обнаружения объектов, но и отказоустойчивость системы к возможным сбоям датчиков. В реальных условиях часть облака точек сенсора LiDAR (лидар) может отсутствовать или содержать очень мало информации из-за окклюзий, технических неполадок, плохих погодных условий. Аналогично видеокамеры могут выходить из строя, загрязняться или предоставлять малое количество информации при плохом освещении. Дополнительным вызовом становится требование к высокому быстродействию на ограниченном аппаратном обеспечении, типичном для мобильных роботов. Вклад в исследование методов трехмерного обнаружения объектов и их ограничений вносят ряд зарубежных и отечественных ученых, таких как: Wang H., Yan J., Bai X., Юдин Д.А., Мелехин А.А.

Анализ существующих решений [1; 2; 3] показывает, что нередко быстродействие достигается ценой снижения качества, а высокая точность - за счёт сложных схем, неустойчивых к сценариям частичных сбоев датчиков. Таким образом, не существует универсального способа, одинаково удовлетворяющего требованиям высокой скорости работы, высокого качества и устойчивости к сбоям в работе датчиков. В связи с этим разработка устойчивого метода комплексирования мультимодальных данных для обнаружения и оценки пространственного положения объектов, который бы обеспечивал высокое качество, быстродействие и отказоустойчивость к частичной потере информации с датчиков, представляет высокую научную и прикладную значимость.

Степень разработанности темы исследования

Задачи трёхмерного обнаружения объектов в робототехнических системах технического зрения традиционно решаются на основе данных LiDAR, которые обеспечивают точные измерения глубины и высокую устойчивость к изменению освещённости (Шибаев В. М., Зуев М.А.). Для обработки облаков точек применяются два базовых подхода: непосредственная работа с точками [4] и дискретизация в воксельные представления [5]. Развиваются и методы, учитывающие разрежённость облака точек: модели на механизме внимания с учётом разрежённости (Wang H.) [6], разрежённые трёхмерные свёртки (Graham В., Engelcke M.) [7], а также свёртки с увеличенным эффективным ядром при разрежённой выборке (Chen Y.) [8].

Параллельно активно исследуются методы, позволяющие получать трехмерные прогнозирования объектов только по данным видеокамеры (Маньшин И.М., Красноперов Н.С.), без использования стереопар [9; 10; 11], некоторые из таких методов также используют временные последовательности кадров для улучшения точности прогнозирований [12]. Основным преимуществом таких методов является удешевление оборудования для создания автономных мобильных платформ за счет более низкой стоимости видеокамер по сравнению с лидарами.

Наиболее высокие результаты демонстрируют мультимодальные системы, объединяющие преимущества нескольких сенсоров (LiDAR, камеры, радар), поэтому разработка методов комплексирования мультимодальных данных является активным полем исследований. Например, предложены методы, обогащающие облако точек дополнительными точками на основе данных видеокамеры [13], методы, приводящие признаки разных модальностей в одно пространство (Liu Z.) [14], методы, в которых модальности могут быть использованы независимо, но стимулируется обмен признаками через перекрестное внимание (Yang Z.) [15].

Кроме того, в ряде работ исследуется отказоустойчивость методов трехмерного обнаружения объектов к сбоям датчиков, что дополнительно показывает преимущества мультимодальных систем, поскольку они обеспечивают

повышенную отказоустойчивость за счет избыточности в данных, получаемых с различных датчиков (Liang Т.). Показано, что для достижения устойчивости к частичным отказам датчиков при использовании нескольких модальностей необходимо применять специализированные методы обучения и подходы к проектированию нейросетевой архитектуры.

Цель и задачи работы

Целью работы является разработка и исследование мультимодального метода трёхмерного обнаружения объектов, обладающего повышенным быстродействием и увеличенной устойчивостью к отказам датчиков. Для достижения поставленной цели были решены следующие задачи:

1. Анализ быстродействия отдельных модулей открытых методов трехмерного обнаружения для выявления существующих ограничений и неэффективных подходов.

2. Разработка метода комплексирования мультимодальных данных.

3. Разработка архитектурных решений, повышающих отказоустойчивость системы к частичной потере информации с датчиков, а также методов их обучения.

4. Проведение исследований и оценка показателей точности обнаружения объектов, быстродействия, отказоустойчивости к потере данных с датчиков, сравнение с существующими открытыми методами мультимодального трехмерного обнаружения объектов.

Объектом исследования являются алгоритмы и программно-аппаратные средства системы технического зрения в робототехнических системах мобильных платформ для трехмерного обнаружения объектов.

Предметом исследования являются методы эффективного комплексирования мультимодальных данных, а также методы, повышающие отказоустойчивость системы к сценариям частичной потери данных с датчиков мобильного робота.

Научная новизна

1. Разработана архитектура нейронной сети, отличающаяся непрерывным набором признаков в последовательности с использованием радиального и

зигзагообразного разбиений и демонстрирующая одновременно высокое быстродействие и высокие показатели качества трехмерного обнаружения объектов.

2. Предложен метод комплексирования данных, отличительной чертой которого является использование слабого соответствия между признаками камеры и облака точек с помощью полярного угла, что позволяет значительно сократить время, затрачиваемое на комплексирование мультимодальных данных в системе технического зрения мобильного робота.

3. Предложен метод обучения, повышающий устойчивость к частичному отказу датчиков мобильного робота с использованием маскированного автоэнкодера в скрытом пространстве и четырех, ранее не предложенных, сценариев маскирования признаков, поощряющих выучивание соответствия позиций и признаков для данных разных модальностей.

Теоретическая и практическая значимость исследования

Теоретическая значимость исследования заключается в развитии методов комплексирования мультимодальных данных для трехмерного обнаружения объектов в мобильных робототехнических платформах, а также в расширении опыта применения маскированных автоэнкодеров для улучшения отказоустойчивости к частичной потере данных с датчиков за счет предложения новых сценариев маскирования и восстановления признаков при использовании маскированного автоэнкодера.

Практическая значимость исследования состоит в разработке архитектуры, которая обеспечивает высокое быстродействие на графических ускорителях потребительского уровня и высокие показатели качества трёхмерного обнаружения объектов, что позволяет использовать систему в задачах навигации и планирования движения автономных мобильных платформ.

Разработанный метод повышения устойчивости к частичной потере данных с датчиков повышает надежность и безопасность работы системы в ряде нештатных ситуаций.

Таким образом, результаты данной работы применимы в реальных системах

мобильной робототехники за счет невысоких требований к вычислительным ресурсам и повышенной отказоустойчивости.

Методология и методы исследования

Экспериментальное исследование проводилось с использованием программных реализаций методов на языке программирования Python с использованием библиотеки глубокого обучения PyTorch [16]. Реализованные модели были обучены и протестированы на открытом наборе данных NuScenes [17], для оценки качества и сравнения с аналогичными решениями использовались общепринятые метрики обнаружения объектов mAP и NDS. Для обучения моделей и тестирования их быстродействия использовались графические процессоры: NVIDIA RTX 3060, NVIDIA A100.

Положения, выносимые на защиту

1. Архитектура нейронной сети, основанная на предложенном методе набора признаков в последовательности с использованием радиального и зигзагообразного разбиений, демонстрирующая высокое быстродействие и высокие показатели качества трехмерного обнаружения объектов.

2. Метод комплексирования мультимодальных данных датчиков мобильного робота для трехмерного обнаружения объектов, использующий приблизительное сопоставление признаков облака точек, обеспечивающий высокое быстродействие.

3. Метод повышения отказоустойчивости трехмерного обнаружения объектов к частичной потере информации с датчиков мобильного робота с помощью применения маскированного автоэнкодера в скрытом пространстве с использованием предложенных стратегий маскирования и восстановления признаков.

Степень достоверности полученных результатов

Достоверность и научная обоснованность результатов, полученных в диссертации, обеспечена корректным и обоснованным применением существующих методик оценки качества с использованием открытого набора данных NuScenes и сравнением результатов с другими передовыми методами на единой фиксированной выборке данных, не участвовавшей в обучении метода. При

выдвижении гипотез и внесении гиперпараметров в разработанную систему проводились серии экспериментов, подтверждающих оптимальность выбранных параметров. Проведенные исследования сопоставляются с результатами отечественных и зарубежных авторов, а также подтверждаются научной экспертизой на конференциях и при публикации материалов в рецензируемых научных изданиях.

Публикации и апробация результатов

Результаты диссертации были представлены в качестве докладов на международных научно-технических конференциях: «Нейроинформатика-2024», «Нейроинформатика-2021».

Результаты работы опубликованы в журналах: «Системы. Методы. Технологии» (2025), «Робототехника и техническая кибернетика» (2025), «Наука и бизнес: пути развития» (2025), «Advances in Neural Computation, Machine Learning, and Cognitive Research VIII» (2024), «Advances in Neural Computation, Machine Learning, and Cognitive Research V» (2022). По теме диссертации опубликовано 5 печатных работ, в том числе 3 в изданиях, входящих в перечень ВАК, и 2 в изданиях, индексируемых в базе Scopus.

Личный вклад автора

Автором лично получены основные результаты диссертационной работы, в том числе разработан метод комплексирования данных и оптимизированные радиальные и зигзагообразные способы набора признаков для эффективной обработки. Автором предложена архитектура с маскированным автоэнкодером в скрытом пространстве, повышающая отказоустойчивость к сценариям частичной потери данных с датчиков. Автор играл ключевую роль в реализации архитектур и получении результатов всех экспериментов.

Соответствие диссертации паспорту научной специальности

Диссертационная работа выполнена в соответствии с паспортом специальности 2.5.4. Роботы, мехатроника и робототехнические системы по пунктам:

- п.5. Методы, алгоритмы, программные и аппаратные средства управления

роботами, робототехническими и мехатронными системами, включая адаптивное, оптимальное, супервизорное управление.

- п.6. Математическое и программное обеспечение, компьютерные методы и средства обработки информации в реальном времени в роботах, робототехнических и мехатронных системах.

Структура и объем работы

Диссертация состоит из введения, четырех глав, заключения, списка терминов, списка литературы и одного приложения. Содержание работы изложено на 120 страницах, включает 27 рисунков, 17 таблиц, 108 источников цитируемой литературы.

1 Трехмерное обнаружение объектов в мобильной робототехнике

1.1 Роль трехмерного обнаружения объектов в автономных роботах

Мобильные роботы и автономные транспортные средства представляют собой сложные киберфизические системы, объединяющие датчики, а также модули восприятия, принятия решений и управления для безопасной работы в динамических и часто непредсказуемых условиях. В общем виде такие системы строятся на основе конвейера автономности - иерархической архитектуры, преобразующей необработанные данные датчиков в целенаправленное поведение робота. Несмотря на вариативность реализации в различных приложениях (например, автономные автомобили, беспилотные летательные аппараты, промышленные роботы), базовые модули системы включают:

- сбор данных - получение информации с лидара, камер, радара, инерциальных измерительных устройств (IMU) и других специализированных датчиков;

- восприятие - интерпретация сенсорных данных для обнаружения объектов, понимания сцены и отслеживания динамических элементов;

- локализация - определение положения и ориентации робота, зачастую с использованием SLAM (Simultaneous Localization and Mapping) или интеграции GPS;

- планирование - построение траекторий или последовательностей действий на основе целей робота, его окружения и текущего состояния;

- управление - преобразование высокоуровневых планов в низкоуровневые управляющие команды для движения или манипуляции объектами.

Эти модули функционируют как независимо, решая частные задачи автономности, так и во взаимодействии, обеспечивая обновление восприятия для планирования, передачу данных из планирования в систему управления и обратную связь с сенсорами в реальном времени. В соответствии со стандартом SAE J3016 [18], автономные системы классифицируются по уровням автоматизации от 0 (отсутствие автоматизации) до 5 (полностью автономная

система), где более высокие уровни сводят к минимуму участие человека в принятии решений и управлении транспортным средством [19].

Развитие мобильных платформ с автономной навигацией обусловлено необходимостью повышения безопасности, эффективности и доступности перемещений в транспортной и производственной инфраструктуре. К данному классу относятся мобильные робототехнические платформы различного назначения, включая автономные транспортные средства (АТС) как частный случай, а также складские и производственные роботы, роботизированные платформы доставки, автономная спецтехника и сервисные робототехнические системы, функционирующие в городской среде и на закрытых территориях.

Для автомобилей с ручным управлением характерен высокий уровень аварийности: частота дорожно-транспортных происшествий, зафиксированных полицией, составляет 4,68 инцидента на миллион миль пробега (IPMM), тогда как система автономного вождения Waymo (ADS) демонстрирует снижение данного показателя до 2,1 IPMM, что соответствует 55% сокращению числа аварий. Кроме того, частота ДТП с травмами составляет 0,6 IPMM для ADS по сравнению с 2,8 IPMM для автомобилей с ручным управлением, что указывает на 80% сокращение аварий с пострадавшими.

Помимо снижения аварийности, платформы с автономной навигацией (включая АТС) обеспечивают:

- оптимизацию движения: системы автономного управления повышают эффективность разгона, торможения и маршрутизации, уменьшая заторы и расход топлива;

- повышение доступности: автономные транспортные средства обеспечивают мобильность для людей, неспособных управлять автомобилем самостоятельно (например, пожилых людей и лиц с ограниченными возможностями);

- повышение безопасности: внедрение АТС в транспортные парки позволяет минимизировать влияние усталости, отвлеченности или других факторов, снижающих безопасность движения.

Для мобильной робототехники указанные эффекты имеют самостоятельную прикладную ценность: автономные робототехнические платформы позволяют автоматизировать перемещения грузов и оборудования, выполнять мониторинг и инспекцию инфраструктуры, обеспечивать сервисные функции в средах с повышенными рисками для человека (например, в неблагоприятных погодных условиях, на промышленных объектах или в зонах с ограниченным доступом). При этом требования к безопасности и предсказуемости поведения робота зачастую являются более жёсткими, так как робот функционирует в непосредственной близости к людям и оборудованию, а его ошибки приводят не только к снижению эффективности, но и к потенциально опасным ситуациям при навигации и маневрировании.

Несмотря на эти преимущества, реализация мобильных платформ с автономной навигацией связана с рядом технических трудностей, особенно в области восприятия, принятия решений и обеспечения безопасности. В частности, трехмерное обнаружение объектов играет ключевую роль в автономности, поскольку ошибки в обнаружении препятствий, пешеходов и других участников движения могут оказывать критическое влияние на работу систем управления. В мобильной робототехнике это выражается в ухудшении оценки свободного пространства, ошибках планирования траектории и снижении устойчивости к нештатным сценариям, включая деградацию данных датчиков. Согласно SAE J3016, уровни автоматизации выше 2 требуют наличия системы автономного вождения, способной выполнять часть динамической задачи вождения без вмешательства человека, что делает надежную систему технического зрения необходимым условием для достижения высоких уровней автономности [18].

Несмотря на значительные достижения в области трехмерного обнаружения объектов, существующие методы сохраняют чувствительность к различным сложным ситуациям, возможным в реальных условиях. Так, ошибки калибровки датчиков, размытие вследствие движения или перекрытие объектов могут заметно снижать точность обнаружения, особенно в критически важных сценариях [20]. Для эффективной работы в сложных условиях, таких как непредсказуемый

пешеходный трафик и динамичные транспортные потоки, требуются усовершенствованные методы комплексирования данных и глубокого обучения [21]. Согласно ГОСТ Р 71476-2024 [22], для систем искусственного интеллекта определяется понятие робастности, которое, например, означает способность системы выполнять свои функции в приемлемых пределах несмотря на внешнее вмешательство или жесткие условия окружающей среды, что в контексте данной работы идентично устойчивости системы к частичной потере информации с датчиков. Таким образом, повышение устойчивости обнаружения объектов является столь же важной задачей, как и увеличение его точности.

Одним из ключевых направлений повышения устойчивости систем технического зрения является интеграция мультимодальных сенсорных данных. Объединение информации с лидара, камер и радара позволяет компенсировать недостатки отдельных сенсоров: лидар обеспечивает точные измерения глубины, камеры предоставляют детализированную семантическую информацию, а радар устойчив к неблагоприятным погодным условиям. Такая интеграция позволяет улучшить работу систем в сложных условиях, например, в дождь, туман или при слабом освещении [21].

В отличие от двухмерного обнаружения объектов, трехмерное обнаружение объектов предоставляет более полные пространственные характеристики, включая трехмерные координаты объекта, его ориентацию и размеры. Это обеспечивает:

- повышение надежности системы предотвращения столкновений: трехмерные ограничивающие рамки и точные измерения расстояний позволяют строить безопасные траектории движения;

- повышение точности манипуляции объектами: для мобильных манипуляторов и складских роботов точные обнаружения объектов необходимы для выполнения операций захвата и штабелирования;

- улучшение восприятия сложных сцен: плотные городские улицы и промышленные объекты требуют высокой детализации пространственного понимания.

Эффективность алгоритмов трехмерного обнаружения объектов зависит от:

- интеграции с другими модулями: результаты обнаружения должны синхронизироваться с локализацией и планированием маршрутов;

- ограничений по вычислительным ресурсам: реализация встраиваемых решений требует высокой скорости обработки при ограниченном энергопотреблении;

- надежности и избыточности: критически важные системы, например, автономные автомобили, требуют дублирующих датчиков и механизмов обработки сбоев;

- обработки разреженных и зашумленных данных: методы машинного обучения помогают компенсировать недостатки данных, возникающие из-за низкой плотности точек облака лидара [21];

- адаптации к динамическим условиям: окружающая среда может быстро изменяться, например, перемещение других транспортных средств, изменение освещения, что требует постоянного обновления восприятия сцены;

- устойчивости к внешним факторам: исследования показывают необходимость создания надежных эталонных наборов данных (К1ТТ1 [23], пиБсепеБ [17], Waymo [24]) для оценки устойчивости алгоритмов к шумам и погодным условиям.

В общей информационной схеме автономного робота трехмерное обнаружение объектов выполняет роль критического связующего звена между сенсорной системой и высокоуровневыми модулями локализации и планирования (Рисунок 1.1). Оно преобразует необработанные данные с датчиков в семантически значимую информацию, которая затем используется для построения карт, анализа сцены и разработки решений по передвижению.

Данные сенсоров —> Синхронизация и предобработка —► Трехмерное обнаружение объектов —> Планирование и управление

Рисунок 1.1 - Роль сенсоров и модуля трехмерного обнаружения объектов в информационной системе автономного робота

Приведённая схема подчёркивает, что модуль трёхмерного обнаружения объектов является ключевым элементом контура автономной навигации, поскольку формирует представление о препятствиях и участниках движения, используемое модулями планирования и управления. При этом качество функционирования данного модуля в существенной степени определяется корректностью согласования сенсорных данных и устойчивостью обработки при деградациях измерений. В связи с этим далее вводится формальная постановка задачи мультимодального комплексирования данных и трёхмерного обнаружения объектов для автономной робототехнической платформы.

1.2 Постановка задачи мультимодального комплексирования данных и

трехмерного обнаружения объектов

В настоящей работе рассматривается задача мультимодального трёхмерного обнаружения объектов в системе координат автономной робототехнической платформы на основе данных лидара и одной или нескольких видеокамер. При этом мультимодальное обнаружение включает в себя подзадачу комплексирования данных, под которой понимается согласование и объединение измерений различных сенсоров для формирования совместного пространства признаков для использования в трехмерном обнаружении.

Рассмотрим формальную постановку задачи мультимодального трехмерного обнаружения объектов: имеется набор данных датчиков, для которых проведена калибровка внутренних параметров (для видеокамер), внешняя калибровка, связывающая систему координат сенсора и систему координат автономной платформы, для доступных датчиков также проведена временная синхронизация, позволяющая проводить совместную обработку различных датчиков с некоторой частотой, по имеющимся данным необходимо разработать систему, обеспечивающую обнаружение объектов интереса в системе координат автономной платформы (1).

Ьк е ( Ск1 ак <рк, кь, б,),

где Ь - множестве трехмерных обнаружений объектов в момент времени 1

- Искомое отображение данных датчиков в трехмерные обнаружения с обучаемыми параметрами в;

= [р^ е М4)-множества облакаточек в момент времени 1:, содержащие данные о трехмерных координатах точек и интенсивности отражения; 11,м - Изображения с М камер в момент времени 1; К1:м- Параметры внутренней калибровки камер; Т1:м- Параметры внешней калибровки камер; Тр- Параметры внешней калибровки для облака точек лидара; Ьк- трехмерное обнаружение объекта к; ск е М3 - координаты центра объекта к; йк е М3 - трехмерные габариты объекта к; рк- ориентация объекта к, угол рыскания; Бк - оценка достоверности обнаружения объекта.

Комплексирование данных в рамках (1) является критическим этапом, поскольку согласование измерений различных модальностей определяет качество совместных признаков и, как следствие, точность и устойчивость обнаружения. На практике комплексирование включает следующие типовые операции:

- приведение данных к согласованным системам координат с использованием внешней калибровки и, при необходимости, компенсации временных рассогласований;

- установление соответствий между пространственными элементами облака точек и областями изображения (явно или неявно в признаковом пространстве);

- объединение геометрических признаков лидара и семантических признаков камер в совместном представлении;

- обеспечение корректной работы при различии полей зрения сенсоров и при наличии взаимных окклюзий.

В реальных условиях данные сенсоров подвержены шуму, а также частичному перекрытию обзора или отказу из-за непредвиденных ситуаций, поэтому метод комплексирования данных должен обеспечивать устойчивость к таким ситуациям за счет избыточности данных.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Филатов Николай Сергеевич, 2026 год

Список литературы

1. Yan, J. Cross modal transformer: Towards fast and robust 3D object detection / J. Yan [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 18268-18278.

2. Filatov, N. Continuous Token Partitioning for Real-Time Multi-modal 3D Object Detection / N. Filatov, R. Potekhin // International Conference on Neuroinformatics. - Cham : Springer Nature Switzerland, 2024. - P. 426-437.

3. Wang, H. UniTR: A unified and efficient multi-modal transformer for bird's-eye-view representation / H. Wang [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 6792-6802.

4. Shi, S. PointRCNN: 3D object proposal generation and detection from point cloud / S. Shi, X. Wang, H. Li // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2019. - P. 770-779.

5. Deng, J. Voxel R-CNN: Towards high performance voxel-based 3D object detection / J. Deng [и др.] // Proceedings of the AAAI Conference on Artificial Intelligence. - 2021. - Vol. 35, No. 2. - P. 1201-1209.

6. Liu, Z. Flatformer: Flattened window attention for efficient point cloud transformer / Z. Liu [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 1200-1211.

7. Graham, B. 3D semantic segmentation with submanifold sparse convolutional networks / B. Graham, M. Engelcke, L. van der Maaten // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2018. - P. 92249232.

8. Chen, Y. LargeKernel3D: Scaling up kernels in 3D sparse CNNs / Y. Chen [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 13488-13498.

9. Wang, T. FCOS3D: Fully convolutional one-stage monocular 3D object detection / T. Wang [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2021. - P. 913-922.

10. Zhou, X. Objects as Points / X. Zhou, D. Wang, P. Krahenbuhl // arXiv. -2019. - arXiv:1904.07850. - URL: http://arxiv.org/abs/1904.07850 (дата обращения: 28.07.2024).

11. Wang, Y. DETR3D: 3D object detection from multi-view images via 3D-to-2D queries / Y. Wang [и др.] // Conference on Robot Learning. - PMLR, 2022. - P. 180191.

12. Li, Z. BEVFormer: Learning Bird's-Eye-View Representation from Multicamera Images via Spatiotemporal Transformers / Z. Li [и др.] // Computer Vision -ECCV 2022 / под ред. S. Avidan [и др.]. - Cham : Springer Nature Switzerland, 2022.

- Vol. 13669. - P. 1-18.

13. Yin, T. Multimodal Virtual Point 3D Detection / T. Yin, X. Zhou, P. Krahenbuhl // Advances in Neural Information Processing Systems. - 2021. - Vol. 34.

14. Liang, T. BEVFusion: A simple and robust lidar-camera fusion framework / T. Liang [и др.] // Advances in Neural Information Processing Systems. - 2022. - Vol. 35. - P. 10421-10434.

15. Yang, Z. Deeplnteraction: 3D object detection via modality interaction / Z. Yang, J. Chen, Z. Miao, W. Li, X. Zhu, L. Zhang // Advances in Neural Information Processing Systems. - 2022. - Vol. 35. - P. 1992-2005.

16. Paszke, A. PyTorch: An imperative style, high-performance deep learning library / A. Paszke [и др.] // Advances in Neural Information Processing Systems. - 2019.

- Vol. 32.

17. Caesar, H. nuScenes: A multimodal dataset for autonomous driving / H. Caesar [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2020. - P. 11621-11631.

18. SAE J3016™ APR2021. Taxonomy and Definitions for Terms Related to Driving Automation Systems for On-Road Motor Vehicles. - Warrendale, PA : SAE International, 2021. - URL: https://www.sae.org/standards/j3016_202104-taxonomy-definitions-terms-related-driving-automation-systems-road-motor-vehicles (дата обращения: 08.03.2025).

19. Kusano, K. D. Comparison of Waymo rider-only crash data to human

benchmarks at 7.1 million miles / K. D. Kusano [и др.] // Traffic Injury Prevention. -2024. - Vol. 25, Suppl. 1. - P. 8.

20. Song, Z. Robustness-Aware 3D Object Detection in Autonomous Driving: A Review and Outlook / Z. Song, L. Liu, F. Jia, Y. Luo, C. Jia, G. Zhang, L. Yang, L. Wang // IEEE Transactions on Intelligent Transportation Systems. - 2024. - Vol. 25, No. 11. - P. 15407-15436.

21. Fawole, O. A. Recent Advances in 3D Object Detection for Self-Driving Vehicles: A Survey / O. A. Fawole, D. B. Rawat // AI. - 2024. - Vol. 5, No. 3. - P. 12551285.

22. ГОСТ Р 71476-2024. Искусственный интеллект. Концепции и терминология искусственного интеллекта [Электронный ресурс]. URL: https://internet-law.ru/gosts/gost/83860/ (дата обращения: 15.01.2025).

23. Geiger, A. Are we ready for autonomous driving? The KITTI vision benchmark suite / A. Geiger, P. Lenz, R. Urtasun // 2012 IEEE Conference on Computer Vision and Pattern Recognition. - IEEE, 2012. - P. 3354-3361.

24. Sun, P. Scalability in perception for autonomous driving: Waymo Open Dataset / P. Sun [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2020. - P. 2446-2454.

25. Hafemann, P. Parametric Modelling of the Exterior Design of Autonomous Shuttles / P. Hafemann, M. Daumoser, M. Lienkamp // Proceedings of the Design Society. - Cambridge University Press, 2023. - Vol. 3. - P. 2875-2884.

26. Hafemann, P. Positioning and Body Integration of Sensors in Autonomous Shuttle Vehicles / P. Hafemann, L. I. Prat, M. Lienkamp // Stuttgarter Symposium für Produktentwicklung : (7; Stuttgart; 2023). - 2023. - [Электронный ресурс]. - URL: https://mediatum.ub.tum.de/1715733 (дата обращения: 12.02.2025).

27. Panasewicz, K. Perspective of Future Use of Autonomous Robotaxes in Cities / K. Panasewicz, A. A. Jorge. - 2023. - Wydzial Inzynierii Zarz^dzania Politechniki Bialostockiej. - [Электронный ресурс]. - URL: https://wiz.pb.edu.pl/akademia-zarzadzania/wp-content/uploads/sites/3/2023/09/4.2.-K.-Panasewicz-A.-A.-Jorge-Perspective-of-future-use-of-autonomous-robotaxes-in-

cities.pdf (дата обращения: 12.02.2025).

28. Li, M. Optimal Configuration Method of Multi-source Sensors for Autonomous Vehicles Considering Three-dimensional Perception / M. Li [и др.] // 2024 39th Youth Academic Annual Conference of Chinese Association of Automation (YAC). - IEEE, 2024. - P. 2267-2272.

29. Xie, Y. Advanced Sensing and Control Technologies for Autonomous Robots / Y. Xie, S. Wang, S. Zheng, Z. Hu // Sensors. - 2024. - Vol. 24, No. 17. - Art. 5478.

30. Sifat, A. H. Towards computational awareness in autonomous robots: an empirical study of computational kernels / A. H. Sifat [и др.] // Complex Intelligent Systems. - 2023. - Vol. 9, No. 6. - P. 6269-6295.

31. Howard, A. Searching for MobileNetV3 / A. Howard [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2019. - P. 1314-1324.

32. Wang, C.-C. EfficientNet-eLite: Extremely lightweight and efficient CNN models for edge devices by network candidate search / C.-C. Wang, C.-T. Chiu, J.-Y. Chang // Journal of Signal Processing Systems. - 2023. - Vol. 95, No. 5. - P. 657-669.

33. Talpes, E. Compute solution for Tesla's full self-driving computer / E. Talpes [и др.] // IEEE Micro. - 2020. - Vol. 40, No. 2. - P. 25-35.

34. Trivedi, A. R. Intelligent Sensing-to-Action for Robust Autonomy at the Edge: Opportunities and Challenges / A. R. Trivedi [и др.] // arXiv. - 2025. -arXiv:2502.02692 [Электронный ресурс]. - URL: http://arxiv.org/abs/2502.02692 (дата обращения: 09.02.2025).

35. Valkov, I. Reliable distribution of computational load in robot teams / I. Valkov, P. Trinder, N. Chechina // Autonomous Robots. - 2021. - Vol. 45, No. 3. - P. 351-369.

36. Chang, M.-F. Argoverse: 3D tracking and forecasting with rich maps / M.-F. Chang [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2019. - P. 8748-8757.

37. Шибаев, В. М. Технология LiDAR в автономных транспортных средствах / В. М. Шибаев, М. А. Зуев, К. С. Баланев // Информатика. Экономика.

Управление - Informatics. Economics. Management. - 2024. - Т. 3, № 2. - С. 02190225.

38. Qi, C. R. PointNet++: Deep hierarchical feature learning on point sets in a metric space / C. R. Qi, L. Yi, H. Su, L. J. Guibas // Advances in Neural Information Processing Systems. - 2017. - Vol. 30. - P. 5099-5108.

39. Yan, Y. SECOND: Sparsely embedded convolutional detection / Y. Yan, Y. Mao, B. Li // Sensors. - 2018. - Vol. 18, No. 10. - P. 3337.

40. Wang, H. DSVT: Dynamic sparse voxel transformer with rotated sets / H. Wang [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 13520-13529.

41. Lai, X. Spherical Transformer for LiDAR-based 3D Recognition / X. Lai, Y. Chen, F. Lu [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 17545-17555.

42. He, T. Mono3D++: Monocular 3D Vehicle Detection with Two-Scale 3D Hypotheses and Task Priors / T. He, S. Soatto // Proceedings of the AAAI Conference on Artificial Intelligence. - 2019. - Vol. 33, No. 01. - P. 8409-8416.

43. Mousavian, A. 3D Bounding Box Estimation Using Deep Learning and Geometry / A. Mousavian, D. Anguelov, J. Flynn [и др.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2017. - P. 7074-7082.

44. Chabot, F. Deep MANTA: A Coarse-to-Fine Many-Task Network for Joint 2D and 3D Vehicle Analysis from Monocular Image / F. Chabot, H. Rebut, J. L. B. Darde [и др.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2017. - P. 2040-2049.

45. Зубов, И. Г. Оценка ракурса транспортного средства, полученного монокулярной камерой / И. Г. Зубов // Цифровая обработка сигналов и её применение - DSPA-2019 : труды междунар. конф. - М., 2019. - С. 381-388.

46. Wang, Y. Pseudo-LiDAR from Visual Depth Estimation: Bridging the Gap in 3D Object Detection for Autonomous Driving / Y. Wang, W. Chao, D. Garg [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2019. - P. 8445-8453.

47. Philion, J. Lift, Splat, Shoot: Encoding Images from Arbitrary Camera Rigs by Implicitly Unprojecting to 3D / J. Philion, S. Fidler // Computer Vision - ECCV 2020 / ed. by A. Vedaldi [и др.]. - Cham : Springer International Publishing, 2020. - Vol. 12359. - P. 194-210.

48. Reading, C. Categorical Depth Distribution Network for Monocular 3D Object Detection / C. Reading, A. Harakeh, L. Chai [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2021. - P. 85558564.

49. Manhardt, F. RoI-10D: Monocular Lifting of 2D Detection to 6D Pose and Metric Shape / F. Manhardt, W. Kehl, A. Gaidon // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2019. - P. 2069-2078.

50. Ku, J. Monocular 3D Object Detection Leveraging Accurate Proposals and Shape Reconstruction / J. Ku, A. D. Pon, S. L. Waslander // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2019. - P. 11867-11876.

51. Liu, Z. SMOKE: Single-Stage Monocular 3D Object Detection via Keypoint Estimation / Z. Liu, Z. Wu, R. Toth // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops. - 2020. - P. 996-997.

52. Лупенко, Н. Л. Анализ методов определения абсолютного расстояния до объекта по изображению с одной видеокамеры с использованием нейронных сетей / Н. Л. Лупенко, Р. П. Богуш, Х. Чен // Вестник Полоцкого государственного университета. Сер. C, Фундаментальные науки. - 2024. - № 2(43). - С. 24-33.

53. Liu, Y. PETR: Position Embedding Transformation for Multi-view 3D Object Detection / Y. Liu, T. Wang, X. Zhang, J. Sun // Computer Vision - ECCV 2022 / ed. by S. Avidan [et al.]. - Cham : Springer Nature Switzerland, 2022. - Vol. 13687. -P. 531-548.

54. Liu, F. Ray Denoising: Depth-aware Hard Negative Sampling for Multiview 3D Object Detection / F. Liu, T. Huang, Q. Zhang [et al.] // Computer Vision -ECCV 2024 / ed. by A. Leonardis [et al.]. - Cham : Springer Nature Switzerland, 2024. - Lecture Notes in Computer Science. - Vol. 15107. - P. 200-217.

55. Wang, S. Exploring Object-Centric Temporal Modeling for Efficient Multi-

View 3D Object Detection / S. Wang, Y. Liu, T. Wang, Y. Li, X. Zhang // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 3621-3631.

56. Han, C. Exploring Recurrent Long-Term Temporal Fusion for Multi-View 3D Perception / C. Han, J. Luo, M. Yang [et al.] // IEEE Robotics and Automation Letters. - 2024. - Vol. 9, No. 7. - P. 6544-6551.

57. Lin, X. Sparse4D v3: Advancing End-to-End 3D Detection and Tracking / X. Lin, Z. Pei, T. Lin [и др.] // arXiv. - 2023. - arXiv:2311.11722 [Электронный ресурс]. - URL: http://arxiv.org/abs/2311.11722 (дата обращения: 09.02.2026)..

58. Юдин, Д. А. Распознавание транспортных средств и регистрация их траектории движения на последовательности изображений / Д. А. Юдин, А. Ю. Горшкова, А. И. Кныш, С. М. Фролов // Вестник Белгородского государственного технологического университета им. В. Г. Шухова. - 2016. - № 6. - С. 139-148.

59. Маньшин, И. М. Определение расстояния до объекта с помощью монокулярного зрения / И. М. Маньшин, Н. С. Красноперов // Научный аспект. -2023. - Т. 5, № 1. - С. 538-546.

60. Chen, Y. FocalFormer3D: Focusing on Hard Instance for 3D Object Detection / Y. Chen, Z. Yu, Y. Chen [et al.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 8394-8405.

61. Yin, J. IS-Fusion: Instance-Scene Collaborative Fusion for Multimodal 3D Object Detection / J. Yin, J. Shen, R. Chen [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2024. - P. 14905-14915.

62. Wang, Y. Multi-Modal 3D Object Detection in Autonomous Driving: A Survey / Y. Wang, Q. Mao, H. Zhu [et al.] // International Journal of Computer Vision. -2023. - Vol. 131. - P. 2122-2152.

63. Chen, X. Multi-View 3D Object Detection Network for Autonomous Driving / X. Chen, H. Ma, J. Wan [et al.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2017. - P. 1907-1915.

64. Ren, S. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks / S. Ren, K. He, R. Girshick, J. Sun // Advances in Neural Information Processing Systems. - 2015. - Vol. 28. - P. 91-99.

65. Girshick, R. Fast R-CNN / R. Girshick // Proceedings of the IEEE International Conference on Computer Vision. - 2015. - P. 1440-1448.

66. Sindagi, V. A. MVX-Net: Multimodal VoxelNet for 3D Object Detection / V. A. Sindagi, Y. Zhou, O. Tuzel // 2019 International Conference on Robotics and Automation (ICRA). - IEEE, 2019. - P. 7276-7282.

67. Zhou, Y. VoxelNet: End-to-End Learning for Point Cloud Based 3D Object Detection / Y. Zhou, O. Tuzel // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2018. - P. 4490-4499.

68. Юдин, Д. А. Открытый программный модуль иерархической локализации роботов на разреженной 3D-карте с применением мультимодального распознавания места / Д. А. Юдин, А. А. Мелехин, С. А. Линок // Интеллектуальный транспорт. - 2025. - Т. 9, № 1 (33). - С. 33-42.

69. Xu, S. FusionPainting: Multimodal Fusion with Adaptive Attention for 3D Object Detection / S. Xu [и др.] // 2021 IEEE International Intelligent Transportation Systems Conference (ITSC). - IEEE, 2021. - P. 3047-3054.

70. Cong, P. Input-Output Balanced Framework for Long-Tailed LiDAR Semantic Segmentation / P. Cong, X. Zhu, Y. Ma // 2021 IEEE International Conference on Multimedia and Expo (ICME). - IEEE, 2021. - P. 1-6.

71. Qi, C. R. PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation / C. R. Qi [и др.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2017. - P. 652-660.

72. Liang, T. BEVFusion: A Simple and Robust LiDAR-Camera Fusion Framework / T. Liang [и др.] // Advances in Neural Information Processing Systems. -2022. - Vol. 35. - P. 10421-10434.

73. Liu, Z. BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-Eye View Representation / Z. Liu, H. Tang, A. Amini [и др.] // arXiv. - 2022. -arXiv:2205.13542 [Электронный ресурс]. - URL: http://arxiv.org/abs/2205.13542 (дата обращения: 09.02.2026).

74. Zhou, X. Objects as Points / X. Zhou, D. Wang, P. Krahenbuhl // arXiv. -2019. - arXiv:1904.07850 [Электронный ресурс]. - URL:

http://arxiv.org/abs/1904.07850 (дата обращения: 09.02.2026).

75. Simonelli, A. Disentangling Monocular 3D Object Detection / A. Simonelli [и др.] // Proceedings of the IEEE International Conference on Computer Vision. - 2019.

- P. 1991-1999.

76. Zhu, B. Class-Balanced Grouping and Sampling for Point Cloud 3D Object Detection / B. Zhu [и др.] // arXiv. - 2019. - arXiv: 1908.09492 [Электронный ресурс].

- URL: http://arxiv.org/abs/1908.09492 (дата обращения: 09.02.2026).

77. Yin, T. Center-Based 3D Object Detection and Tracking / T. Yin, X. Zhou, P. Krahenbuhl // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2021. - P. 11784-11793.

78. Wang, H. UniTR: A Unified and Efficient Multi-Modal Transformer for Bird's-Eye-View Representation / H. Wang [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 6792-6802.

79. Team, G. Gemma 3 Technical Report // arXiv. - 2025. - arXiv:2503.19786 [Электронный ресурс]. - URL: http://arxiv.org/abs/2503.19786 (дата обращения: 09.02.2026).

80. Vora, S. PointPainting: Sequential Fusion for 3D Object Detection / S. Vora, A. H. Lang, B. Helou, O. Beijbom // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2020. - P. 4604-4612.

81. Bai, X. TransFusion: Robust LiDAR-Camera Fusion for 3D Object Detection with Transformers / X. Bai, Z. Hu, X. Wang, J. Qiao, X. Fu, D. Zhang, X. Zhu // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2022. - P. 1090-1099.

82. Yan, J. Cross Modal Transformer: Towards Fast and Robust 3D Object Detection / J. Yan [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 18268-18278.

83. Wang, H. UniTR: A Unified and Efficient Multi-Modal Transformer for Bird's-Eye-View Representation / H. Wang [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 6792-6802.

84. Liu, Z. BEVFusion: Multi-Task Multi-Sensor Fusion with Unified Bird's-

Eye View Representation / Z. Liu, H. Tang, A. Amini [и др.] // 2023 IEEE International Conference on Robotics and Automation (ICRA). - IEEE, 2023. - P. 2774-2781.

85. Yang, Z. DeepInteraction: 3D Object Detection via Modality Interaction / Z. Yang, J. Chen, Z. Miao [и др.] // Advances in Neural Information Processing Systems. -2022. - Vol. 35. - P. 1992-2005.

86. Yan, J. Cross Modal Transformer: Towards Fast and Robust 3D Object Detection / J. Yan [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. - 2023. - P. 18268-18278.

87. Philion, J. Lift, Splat, Shoot: Encoding Images from Arbitrary Camera Rigs by Implicitly Unprojecting to 3D / J. Philion, S. Fidler // Computer Vision - ECCV 2020 / ed. A. Vedaldi [et al.] - Cham : Springer International Publishing, 2020. - Vol. 12359.

- P. 194-210.

88. Zhou, Y. End-to-End Multi-View Fusion for 3D Object Detection in LiDAR Point Clouds / Y. Zhou, P. Sun, Y. Zhang [и др.] // Conference on Robot Learning. -PMLR, 2020. - P. 923-932.

89. Wang, H. DSVT: Dynamic Sparse Voxel Transformer with Rotated Sets / H. Wang, C. Shi, S. Shi [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 13520-13529.

90. Zhou, Y. End-to-End Multi-View Fusion for 3D Object Detection in LiDAR Point Clouds / Y. Zhou, P. Sun, Y. Zhang [и др.] // Conference on Robot Learning. -PMLR, 2020. - P. 923-932. (Повтор позиции 88 — обычно одну из них удаляют.)

91. Dosovitskiy, A. An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale / A. Dosovitskiy [и др.] // International Conference on Learning Representations. - 2021.

92. Loshchilov, I. Decoupled Weight Decay Regularization / I. Loshchilov, F. Hutter // International Conference on Learning Representations. - 2019.

93. Smith, L. N. Super-Convergence: Very Fast Training of Neural Networks Using Large Learning Rates / L. N. Smith, N. Topin // Artificial Intelligence and Machine Learning for Multi-Domain Operations Applications. - Proc. SPIE. - 2019. - Vol. 11006.

- P. 369-386.

94. Devlin, J. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding / J. Devlin, M.-W. Chang, K. Lee, K. Toutanova // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT), Vol. 1 (Long and Short Papers). - 2019. - P. 4171-4186.

95. Bao, H. BEiT: BERT Pre-Training of Image Transformers / H. Bao, L. Dong, S. Piao, F. Wei // International Conference on Learning Representations. - 2022.

96. Baevski, A. data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language / A. Baevski, W.-N. Hsu, Q. Xu, A. Babu, J. Gu, M. Auli // International Conference on Machine Learning. - PMLR, 2022. - P. 1298-1312.

97. He, K. Masked Autoencoders Are Scalable Vision Learners / K. He, X. Chen, S. Xie, Y. Li, P. Dollar, R. Girshick // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2022. - P. 16000-16009.

98. Gao, P. ConvMAE: Masked Convolution Meets Masked Autoencoders / P. Gao, Y. Ma, Z. Lin [и др.] // arXiv. - 2022. - arXiv:2205.03892 [Электронный ресурс].

- URL: http://arxiv.org/abs/2205.03892 (дата обращения: 09.02.2026).

99. He, K. Deep Residual Learning for Image Recognition / K. He, X. Zhang, S. Ren, J. Sun // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. - 2016. - P. 770-778.

100. Liu, Z. A ConvNet for the 2020s / Z. Liu, H. Mao, C.-Y. Wu [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition.

- 2022. - P. 11976-11986.

101. Ryali, C. Hiera: A Hierarchical Vision Transformer without the Bells-and-Whistles / C. Ryali, Y.-T. Hu, D. Bolya [и др.] // International Conference on Machine Learning. - PMLR, 2023. - P. 29441-29454.

102. Li, Y. MViTv2: Improved Multiscale Vision Transformers for Classification and Detection / Y. Li, K. Zhang, K. Li [и др.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2022. - P. 48044814.

103. Woo, S. ConvNeXt V2: Co-designing and Scaling ConvNets with Masked

Autoencoders / S. Woo, S. Debnath, R. N. S. [h gp.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 16133-16142.

104. Xie, G. Masked Autoencoder for Pre-Training on 3D Point Cloud Object Detection / G. Xie, J. Zhang, Y. Wang [h gp.] // Mathematics. - 2022. - Vol. 10, No. 19. - Art. 3549.

105. Chen, A. PIMAE: Point Cloud and Image Interactive Masked Autoencoders for 3D Object Detection / A. Chen, Y. Zhang, Y. Zhao [h gp.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2023. - P. 52915301.

106. He, K. Momentum Contrast for Unsupervised Visual Representation Learning / K. He, H. Fan, Y. Wu, S. Xie, R. Girshick // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. - 2020. - P. 9729-9738.

107. Chen, T. A Simple Framework for Contrastive Learning of Visual Representations / T. Chen, S. Kornblith, M. Norouzi, G. Hinton // International Conference on Machine Learning. - PMLR, 2020. - P. 1597-1607.

108. Zhang, Y. CMAE-3D: Contrastive Masked AutoEncoders for Self-Supervised 3D Object Detection / Y. Zhang, J. Chen, D. Huang // International Journal of Computer Vision. - 2025. - Vol. 133, No. 5. - P. 2783-2804.

Приложение А

Акты о внедрении результатов диссертационной работы

ИНН 7807249479 , КПП 780701001, ОКВЭД 62.01 198206, Санкт-Петербург г, ш Петергофское, д. 73, литера Т, помещ. 1

Н, офис 26/2

УТВЕРЖДАЮ

Результатов кандидатской диссертационной работы Н.С. Филатова «Метод

устойчивого комплексирования данных для обнаружения и оценки пространственного положения объектов в системах технического зрения

мобильных роботов» в внутреннюю систему аннотирования данных

Настоящим подтверждается, что результаты кандидатской диссертационной работы по разработке метода устойчивого комплексирования мультимодальных данных для ЗО-обнаружения объектов интегрированы в программный комплекс интеллектуальной системы аннотирования данных для автопромышленности.

Эффективность внедрения определяется экономией вычислительных ресурсов при обработке внутренних наборов данных. Кроме того, предложенное решение позволяет применять решение системы на рабочем месте эксперта по аннотированию данных в реальном времени.

В процессе внедрения были разработаны и переданы следующие программные компоненты:

- метод комплексирования данных и трехмерного обнаружения объектов в контейнеризированной среде (Docker);

- программный модуль преобразования результатов работы системы;

- программный модуль параллельной обработки элементов набора

скз

СИСТЕМЫ КОМПЬЮТЕРНОГО ЗРЕНИЙ

t!

АКТ ВНЕДРЕНИЯ

данных.

Было успешно проведено функциональное тестирование системы ручными и автоматическим тестами, для оценки автоматизированного рабочего места аннотирования данных была получена обратная связь от трех экспертов, которую можно охарактеризовать как положительную, с выявлением нескольких рекомендуемых сценариев использования.

По итогам проведенных работ были созданы псевдо аннотации для всех внутренних наборов данных, которые позволили получить полезную статистику по составу и характеристикам собранных данных, а также потенциально подготовить почву для развития следующих перспективных проектов, таких как:

- автономные складские роботы;

- развитие автономной сельскохозяйственной техники;

- роботы доставки последней мили.

Результаты диссертационной работы внедрены в полном объёме и представляют интерес для разработки систем компьютерного зрения, в частности при решении задач планирования движения автономных роботов.

Руководитель по внедрению

С.И. Федоренко

«11 » ч^^^к л 2025

г.

МИНИСТЕРСТВО НАУКИ И ВЫСШЕГО ОБРАЗОВАНИЯ РОССИЙСКОЙ ФЕДЕРАЦИИ

ФЕДЕРАЛЬНОЕ ГОСУДАРСТВЕННОЕ АВТОНОМНОЕ НАУЧНОЕ УЧРЕЖДЕНИЕ «центральный НАУчно-исследовател ьский и опытно-конструкторский институт робототехники и технической кибернетики»

(ЦНИИ РТК)

Настоящий акт подтверждает, что результаты диссертационного исследования Филатова Николая Сергеевича на тему «Метод устойчивого комплексирования данных для обнаружения и оценки пространственного положения объектов в системах технического зрения мобильных роботов», представленного на соискание учёной степени кандидата технических наук, внедрены в процесс разработки мобильных наземных робототехнических комплексов.

Предложенные в диссертации рекомендации по проектированию систем технического зрения мобильных роботов, включая методы построения вычислительно эффективных алгоритмов комплексирования мультимодальных данных, применены в ходе НИР «Поток-Н» «Исследование методов создания самообучающихся систем видеонаблюдения и видеоаналитики на базе комплексирования технологий пространственно-временной фильтрации видеопотока и нейронных сетей», выполненного Федеральным государственным автономным научным учреждением «Центральный научно-исследовательский и опытно-конструкторский институт робототехники и технической кибернетики» в рамках Государственного задания Минобрнауки Российской Федерации.

УТВЕРЖДАЮ

АКТ

о внедрении результатов диссертационного исследования Филатова Николая Сергеевича

Ученый секретарь к.т.н., доцент

Б.А. Спасский

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.