Разработка и исследование алгоритмов анализа сетевой инфраструктуры и интернет-трафика в условиях ограниченных вычислительных мощностей тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Изюмов Павел Сергеевич

  • Изюмов Павел Сергеевич
  • кандидат науккандидат наук
  • 2025, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 112
Изюмов Павел Сергеевич. Разработка и исследование алгоритмов анализа сетевой инфраструктуры и интернет-трафика в условиях ограниченных вычислительных мощностей: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2025. 112 с.

Оглавление диссертации кандидат наук Изюмов Павел Сергеевич

Введение

Глава 1. Актуальные проблемы управления интернет сетей

и методы их решения

1.1 Общие проблемы анализа трафика и сетей

1.2 Обзор существующих решений анализа интернет трафика

1.3 Обзор существующих решений оценки производительности сетей

Глава 2. Анализ и исследование стендовых и синтетических

данных трафика и состояния сетей

2.1 Данные из открытых источников записей трафика

2.2 Применение методов генерации признаков в задачах анализа трафика

2.2.1 Применение метода AGMV

2.2.2 Применение метода CapoNef

2.3 Выводы по результатам второй главы

Глава 3. Анализ данных о производительности сети

3.1 Сравнительный обзор и анализ платформ мониторинга и

сбора показателей быстродействия интернет-сетей

3.2 Особенности работы платформы RIPE Atlas

3.3 Калибровка получаемых значений времени отклика

3.4 Преобразование распределений (Distribution transforming)

3.5 Преобразование распределений с использованием приближений параметрическими распределениями

3.5.1 Подбор параметрического распределения для оценки наблюдаемых данных

3.5.2 Применения калибровки с использованием полученной оценки функции распределения

3.6 Выводы по 3 главе

Стр.

Глава 4. Анализ и прогнозирование времени отклика на

территории РФ

4.1 Предобработка собранных показателей ИТТ

4.2 Кластерный анализ временных рядов ИТТ

4.3 Методы оценки и прогнозирования ИТТ в сети

4.3.1 Анализ зависимости времени отклика от расстояния

4.3.2 Анализ и декомпозиция временных рядов

4.3.3 Спектральный анализ полученных значений ИТТ

4.4 Анализ вычислительной сложности

4.5 Выводы по результатам 4 главы

Заключение

Словарь терминов

Список литературы

Список рисунков

Список таблиц

Приложение А. Листинги программного кода

Приложение Б

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Разработка и исследование алгоритмов анализа сетевой инфраструктуры и интернет-трафика в условиях ограниченных вычислительных мощностей»

Введение

Современные интернет-сети становятся все более сложными, а также характеризуются высокой динамичностью изменений, что предъявляет высокие требования к методам их анализа и оценке производительности в режиме реального времени или близким к таковым по скорости. Эффективность работы сети напрямую зависит от множества факторов, включая нагрузку на каналы передачи данных, количество активных пользователей, процесс маршрутизации, а также используемые типы устройств. Все это влияет на качество обслуживания (QoS - Quality-of-Service) в условиях ограниченного вычислительного ресурса. С увеличением объема данных и числа подключенных устройств требуется разработка новых подходов для мониторинга и анализа работы сетей в реальном времени.

Однако в условиях ограниченного вычислительного ресурса, а также необходимости обеспечения быстродействия и масштабируемости, использование сложных моделей машинного обучения, таких как глубокие нейронные сети, оказывается не всегда оправданным. Эти модели требуют значительных вычислительных мощностей и памяти, что усложняет процесс внедрения в реальных системах с ограниченными ресурсами. Многие современные исследования указывают на необходимость в поиске альтернатив для задач сетевого мониторинга, в частности при применении устройств периферии сети (edge device) [1—3]. Также стоит подчеркнуть, что различные ресурсоемкие методы (в частности нейросетевые подходы) требуют больших серверных мощностей, а значит необходима передача данных с точки сбора до данного сервера, что может не проходить по ограничениям по времени, а также нарушать требования безопасности при транспортировке чувствительных данных. В связи с перечисленными проблемами требуется разработка и применение легковесных алгоритмов, которые позволяют на должном уровне точности анализировать производительность интернет-сетей при минимальных затратах ресурсов и таким образом не теряя свою эффективность с ростом сетевой инфраструктуры и увеличением количества пользователей.

Целью данной работы является исследование и разработка методологии анализа записей сетевого трафика, методов прогнозирования времени отклика узлов сети для применения на периферийных сетевых устройствах с высокой вычислительной нагрузкой.

Для достижения данной цели были поставлены следующие задачи:

1. Исследовать записи сетевого трафика из открытых источников, провести сравнительный анализ методов генерации и преобразования признаков, провести разработку моделей классификаторов трафика с учётом ограничений вычислительной сложности, сформировать признаковое пространство для повышения метрик классификации трафика.

2. Провести исследование распределенных систем измерений параметров интернет сетей, разработать методы предобработки и калибровки получаемых показателей.

3. Разработать методы анализа и прогнозирования времени отклика при учёте применения периферийных сетевых устройств с высокой вычислительной нагрузкой.

Основные положения, выносимые на защиту:

1. Проведенный разведочный анализ, исследование и разработка методологии анализа данных сетевого домена позволили выявить ковариационный сдвиг в ряде датасетов и улучшить модели классификации (увеличение accuracy не менее чем на 0,2), а также выявить оптимальные методы предобработки.

2. Анализ и исследование особенностей программно-аппаратных платформ системы RIPE Atlas привел к разработке методов предобработки и калибровки получаемых данных, которые позволяют компенсировать временную задержку у 63% устройств, обеспечивая их функциональную эквивалентность 37% эталонных устройств и совместимость с едиными аналитическими методами.

3. Разработанные и исследованные алгоритмы динамической кластеризации измерительных зондов по показателям времени отклика на территории РФ с применением методов машинного обучения позволили выделить 32% аномальных узлов, фильтрация которых привела к снижению ошибки (RMSE) прогнозирования времени приема-передачи до 50%.

4. Разработанные и исследованные алгоритмы прогнозирования времени приема-передачи (round-trip-time, RTT) в детектируемых кластерах измерительных зондов позволили использовать на 3 порядка меньше операций с плавающей запятой (FLOPs) при достижении сопоставимой точности в сравнении с передовыми нейросетевыми подходами.

Достоверность полученных результатов обеспечивается использованием методов статистического анализа, машинного обучения, математическим моделированием, совпадением результатов исследования с экспериментальными данными, а также непосредственным участием автора в получении исходных данных и проведении экспериментов.

Апробация работы. Основные результаты работы докладывались на следующих научных конференциях:

1. VI международная конференция «Информационные технологии и технические средства управления» (ICCT-2022), Институт проблем управлений им. В.А.Трапезникова РАН совместно с Астраханским государственным техническим университетом, 2022 г.

2. X Международная конференция «Инжиниринг & Телекоммуникации — En&T-2023» МФТИ, Долгопрудный

3. 65-й Всероссийская научная конференция МФТИ в честь 115-летия Л.Д. Ландау 2023, МФТИ, Долгопрудный

4. XXVI Международная конференция «Цифровая обработка сигналов и ее применение — DSPA-2024», Институт проблем управления им. В.А.Трапезникова РАН, Москва, Россия.

5. XI Международная конференция «Инжиниринг & Телекоммуникации — En&T-2024» МФТИ, Москва.

Публикации. Основные результаты по теме диссертации изложены в 6 печатных работах, 1 из которых издана в журналах, рекомендованных ВАК, 2 - в рецензируемых изданиях, входящих в базу данных Scopus, 3 -в тезисах докладов. Получено 1 свидетельство о регистрации программы для ЭВМ.

Объем и структура работы. Диссертация состоит из введения, 4 глав, заключения и 2 приложений. Полный объём диссертации составляет 112 страниц, включая 45 рисунков и 20 таблиц. Список литературы содержит 108 наименований.

Глава 1. Актуальные проблемы управления интернет сетей и

методы их решения

1.1 Общие проблемы анализа трафика и сетей

Задачи анализа состояния сети и сетевого трафика, выявление различных свойств его содержимого играют важную роль в современных сетях. Эти задачи являются важным аспектом обеспечения необходимого уровня QoE (Quality of Experience, качество восприятия пользователем) и QoS (Quality of Service, качество обслуживания) за счет предоставления различным классам трафика различных приоритетов в обслуживании. Также они тесно связаны с построениями систем обнаружения вторжений (Network Intrusion Detection). Данные задачи становятся сложнее из-за роста различных приложений, распространения зашифрованных протоколов и общего роста трафика. За счет чего возрастает сложность традиционных алгоритмов, например таких как классификация на основе блоков данных(Payload-Based Classification).

Задача управления интернет-трафиком является актуальной в условиях широкого распространением интернета среди населения всего мира. Особенно эта проблема обостряется начиная с 2010-х годов в связи с ростом мирового объема трафика. На это указывают многие научные научные работы, например согласно данным одного из них за последние 10 лет объем трафика возрос почти в 10 раз [4]. Также на это указывают и сами телекоммуникационные компании. Так например, согласно данным компании «De CIX» за период в 5 лет во Франкфурте объем трафика вырос более чем в 2 раза (Рисунок 1.1) [5]

Общемировым трендом является также рост использования протоколов шифрования и методов скрытия (обфускации) данных и распространение использующих их различных мобильных и десктопных приложений. Так, например, согласно данным компании Google [6] процент использования протокола HTTPS на ОС Windows в России на момент конца 2022 года составляет более 93% (Рисунок 1.2), а с платформ на ОС Android более 96%.

12.01 11 ОТ 10.0 Т 9.0 Т 8.0 Т 7.0 Т 3.0 Т 5.0 Т 4.0 Т 3.0 Т 2.0 Т ГОТ 0.0

мА

2010

2019

□ средний трафик бит/сек ■ пиковый трафик бнт'сек

Current 7580.9 G Averaged 5206.8 G Graph Peak 11613 0 G DE-СIX АН-Time Peak 11513.00

Created al 3022-04-25 15 03 JTC Copyright 2022 DE-CIX Management GmbH

jf

2020

2021

2022

Рисунок 1.1 — Средний и пиковый объемы трафика во Франкфурте в период

с 2018 по 2022 год

-Бразилия f -у......

Франция __ Индонезия ,_.Индия Япония

Россия _нТурци;

0%

Jan D1 2Û16 Jan 01, 2017 Jan D1 2018 Jan Ci 1,201 a Jan 01 2020 Jan 01, 2021 Jan 01 2022

Рисунок 1.2 — Рост процента использования HTTPS протокола в трафике, проходящем через сервисы компании Google

Эти факторы приводят к уменьшению эффективности традиционных методов, таких как идентификация на основе портов(port-based identification), классификация на основе блоков данных(payload-based identification) и анализ пакетов на основе их содержания (DPI - deep packet inspection). На эту проблему указывают различные современные исследования [7], [8], [9]. В связи с этим возникает необходимость в разработке альтернативных методов и инструменты, основанные на

машинном обучении и статистическом анализе являются перспективными и развивающимися [10]

Еще одним фактором, усложняющим анализ современных сетей является рост трафика IoT сегмента(он же «интернет вещей» -использование различных «умных» бытовых устройств, обменивающихся данными по сети, Рисунок 1.3). Рост IoT является быстрым и революционным, но он также представляет значительные проблемы, особенно в области сетевого анализа и безопасности. Сложность и неоднородность сетей IoT, наряду с их быстрым расширением, привели к появлению различных проблем, которые необходимо решать для обеспечения надежной и безопасной работы. IoT расширяется по всему миру, интегрируясь в различные приложения, такие как умные города, сети и военные системы, что увеличивает сложность и неоднородность сети [11—13]. Некоторые исследования подчеркивают, что распространение устройств Интернета вещей привело к проблемам в хранении данных, конфиденциальности, протоколах связи и управлении устройствами из-за их ограниченной емкости и мощности [14]. Также сети IoT уязвимы для кибератак. Примером таковых является инцидент с вредоносным ПО Mirai, который использовал устройства IoT для распределенных атак типа «отказ в обслуживании»(deпial-of-service attack, DoS-атака). Это подчеркивает необходимость надежных систем обнаружения сетевых вторжений (NIDS)

[11; 15].

Традиционные методы сетевой мониторинга является неэффективным для IoT из-за разнообразия устройств. Поэтому в настоящее время разрабатываются различные методы, основанные на машинном обучении для распознавания типов устройств посредством анализа сетевого трафика, что позволяет достичь высокой точности в идентификации устройств IoT [17]. И поскольку IoT продолжает развиваться и расширяться, разработка эффективных и безопасных решений для управления сетями имеет решающее значение.

Также важность поиска альтернативных моделей оценки сети связана также и с экологическим аспектом. Использование глубоких нейронных сетей, в частности NLP моделей, приводит к значительным выбросам CO2 при их обучении. Согласно исследованиям, использование больших вычислительных мощностей в ходе процесса обучения приводят к большим

Умные носимые

устройства

Сенсоры

1оТ сети

Рисунок 1.3 — Схематичное изображение концепции 1оТ [16]

выбросам С02 и для некоторых моделей объем выбросов сопоставим с несколькими жизненными циклами автомобилей [18].

1.2 Обзор существующих решений анализа интернет трафика

В последние несколько лет фокус исследований науки о данных сместился в сторону использования глубоких нейронных сетей ^N^5 и это можно наблюдать во многих областях [19—21]. Эту тенденцию можно легко объяснить: главное преимущество DNN заключается в том, что они могут выполнять некоторое неявное извлечение признаков самостоятельно, без необходимости в глубоком анализе специализированных инженеров по извлечению признаков из данных. Однако стоит подчеркнуть, что для создания эффективной нейронной сети, инженер должен разработать ее архитектуру, а это уже довольно трудоемкая задача. Главная же проблема заключается в том, что DNN имеют более высокую вычислительную сложность по сравнению с другими алгоритмами, в частности которые включают явное извлечение признаков. Однако стоит подчеркнуть, что последние достижения в разработке оборудования могут позволить

смягчить недостатки DNN в вопросе высокой вычислительной сложности. Эти достижения позволят подчеркнуть главный плюс DNN, который заключается в том, что они обеспечивают высокую точность для широкого спектра задач [22].

Одновременно с этим классические методы анализа сетевого трафика, включая такие подходы, как глубокий анализ пакетов (Deep Packet Inspection, DPI), постепенно утрачивают свою эффективность в связи с ростом объёмов трафика, массовым распространением криптографических протоколов и динамичной эволюцией сетевой инфраструктуры, включающей появление новых протоколов передачи данных. Как отмечается в работе [23], увеличение доли зашифрованного трафика делает невозможным применение DPI для детального анализа содержимого пакетов, что существенно снижает применимость данного метода в современных сетях.

Тем не менее, на современном этапе развития информационных технологий возникает острая потребность в разработке и внедрении методов обработки данных, в частности интернет-трафика и данных, генерируемых вредоносным программным обеспечением, с учётом жёстких аппаратных ограничений. Особый интерес представляют сценарии, в которых обработка осуществляется на устройствах с ограниченными вычислительными ресурсами, такими как промежуточные сетевые маршрутизаторы или даже роутеры. В таких условиях традиционные подходы, основанные на глубоких нейронных сетях (DNN), зачастую оказываются неприменимыми из-за высокой вычислительной сложности и значительных требований к памяти и энергопотреблению.

В этом контексте значительное внимание привлекают алгоритмы «классического» машинного обучения, которые, хотя и могут уступать DNN по точности, обладают существенно более низкой вычислительной сложностью и меньшими требованиями к ресурсам. Такие свойства делают их особенно перспективными для использования в системах реального времени, где критически важны быстродействие и энергоэффективность — например, в задачах прогнозирования аварий на транспортных магистралях [24] или активного шумоподавления в аудиосистемах [25]. Спектр приложений, ограниченных вычислительными, временными и энергетическими ресурсами, является широким и продолжает активно

расширяться, что подчёркивает значимость таких задач по сравнению с теми, что решаются с использованием глубокого обучения.

Рассмотрим подробнее недостатки старых методов. Классические методы анализа сети, такие как DPI, port-based-analysis и payload analysis долгое время являлись фундаментальными при управлении сетями и обеспечении их безопасности. Однако в наши дни применение этих становиться все более затруднительным в условия сложности сегодняшних современных сетей. [26; 27]

Deep Packet Inspection (DPI): DPI - это метод, который изучает часть данных (payload, полезную нагрузку) пакета и его заголовок [28; 29]. Данные метод выходит за рамки простой информации о заголовках, позволяя идентифицировать приложения, обнаруживать вторжения в сеть и обеспечивать требуемый уровень качества обслуживания (QoS)[27; 30].

DPI используется для сопоставления входящего трафика с базой данных сигнатур, представляющих атаки, уязвимости, вирусы и типы трафика. [28]

Например, он может идентифицировать конкретные приложения или вредоносные программы, отыскивая уникальные паттерны в полезной нагрузке (payload) пакетов [27]. DPI является ключевой технологией в системах обнаружения и предотвращения вторжений [30; 31]

Port-Based Analysis: Этот метод классифицирует сетевой трафик на основе номеров портов, которые традиционно ассоциируются с определенными приложениями или сервисами. Например, порт 80 обычно используется для HTTP-трафика, а порт 21 - для FTP [26].

Payload Analysis: Он включает в себя проверку фактического содержимого данных (полезной нагрузки) сетевых пакетов для идентификации приложения или обнаружения вредоносного содержимого. Анализ полезной нагрузки является более глубоким, чем анализ на основе портов, но при этом требует больших вычислительных затрат [32]. В отличие от DPI анализирует меньший перечень данных, за счет чего может потреблять меньше вычислительных ресурсов.

Рассмотрим причины, в силу которых данные методы начинают терять свою эффективность в современных сетях:

1. Развитие и эволюция современных сетей. Современные сетевые сервисы все чаще используют нестандартные порты и обфускацию(то есть

маскировку) протоколов, что снижает точность классификации на основе портов [26].

2. Шифрование трафика. Широкое распространение технологий шифрования, таких как TLS (Transport Layer Security), затрудняет проверку полезной нагрузки пакетов (payloads). Традиционные методы DPI основаны на инспекции открытого (незашифрованного) содержимого, что невозможно в случае зашифрованного трафика. Содержимое пакетов скрыто, что делает методы, основанные на полезной(payload) нагрузке, менее эффективными [33; 34].

3. Полиморфные атаки: Полиморфные вредоносные программы и атаки могут менять свои сигнатуры, что затрудняет их обнаружение с помощью DPI на основе заранее определенных шаблонов. Традиционные методы, основанные на сигнатурах, с трудом справляются с этими эволюционирующими угрозами (Рисунок 1.4)[35; 36]

/

Дешифратор

Тело вируса

Зашифрованное тело вируса

Движок мутаций (используется для неограниченного кол-ва различных дешифраторов)

Зашифрованное

тело вируса

Дешифрованное

тело вируса

Процесс инфецирования

Рисунок 1.4 — Общая схема действия полиморфных атак

4. Вычислительная сложность: DPI - это метод, требующий больших вычислительных затрат, поскольку он включает в себя глубокую проверку полезной нагрузки пакетов [30; 32]. Это может привести к снижению производительности, особенно в высокоскоростных сетях [30]. Сопоставление регулярных выражений (распространенная техника в DPI) может оказаться довольно ресурсоемкой [37].

5. Сложность данных: Современные сети генерируют огромные объемы данных, что затрудняет анализ трафика в режиме реального времени с помощью традиционных методов. Данные методы анализа

сетей часто не справляются с масштабами и динамикой современного сетевого трафика [38].

6. Проблемы конфиденциальности: Глубокая инспекция пакетов (DPI) предполагает изучение содержимого сетевых соединений, что вызывает серьезные опасения по поводу конфиденциальности [39]. Пользователи становятся все более чувствительными к последствиям мониторинга сети для конфиденциальности, что усложняет развертывание решений на основе DPI [40].

7. Атаки на основе искусственного интеллекта. Злоумышленники используют искусственный интеллект для обхода традиционных мер безопасности. Защита систем от таких атак становится все более актуальной [41].

На Рисунке 1.5 отображена схема этапов обработки сетевых данных, демонстрирующая, как сетевые пакеты проходят через различные блоки, включая парсер, проверку контрольной суммы, менеджер трафика и депарсер, что подчеркивает сложность классического сетевого анализа. В связи с этими проблемами исследователи изучают новые методы, такие как машинное обучение и искусственный интеллект, для повышения эффективности анализа сетевого трафика и безопасности сетей [33; 34]. Например, машинное обучение можно использовать для выявления закономерностей в зашифрованном трафике без необходимости расшифровки полезной нагрузки [34].

&

ts1

&

Traffic manager

Packet Queuing, Replication & Scheduling

Парсер Верификация контрольной суммы

Трафик менеджер

~ГП

Депарсер

Рисунок 1.5

Блок-схема этапов работы метода Deep Packet Inspection

(DPI)

1.3 Обзор существующих решений оценки производительности

сетей

Анализ производительности современных сетей сталкивается с рядом проблем, в частности с задачей выявления и устранении различных проблемных узлов, например так называемых «бутылочных горлышек» (элемент, ограничивающий пропускную способность пути) (Рисунок 1.6). Традиционные методы часто не оправдывают ожиданий из-за сложности и динамичности современных сетей. Машинное обучение предлагает многообещающие альтернативы для преодоления этих ограничений.

Source 50 Sink

Рисунок 1.6 — Пример проблемы «бутылочного горлышка» в устройстве

сетей [42]

Традиционные методы анализа производительности сети, такие как основанные на теории очередей, часто сталкиваются со сложностью и нестационарными рабочими нагрузками современных сетей, таких как платформы IoT и распределенные системы. Эти методы обычно требуют обширных человеческих знаний и подходов проб и ошибок, которые могут быть неэффективными и подверженными ошибкам [43; 44]. Кроме того, они не могут эффективно обрабатывать стохастическую природу сетевых весов или динамические взаимодействия в многоуровневых распределенных системах [44; 45].

Методы машинного обучения предоставляют инновационные решения для анализа производительности сети и выявления узких мест. Например, метод опорных векторов (SVM) использовался для обнаружения аномалий производительности и выявления узких мест в облачных центрах обработки данных, предлагая высокую точность и низкие накладные расходы по сравнению с традиционными статистическими методами [46]. Аналогичным образом, модели машинного обучения, такие как кластеризация k-средних и искусственные нейронные сети, применялись для прогнозирования пропускной способности сети и использования ресурсов, демонстрируя высокую точность в выявлении узких мест в высокоскоростных сетевых средах [47].

Несмотря на достигнутые результаты, остаются проблемы в эффективном внедрении методов машинного обучения в системы анализа производительности сети. Сложность сетевых сред, необходимость сбора данных в реальном времени и интеграция с существующей инфраструктурой являются значительными препятствиями [43; 48]. Поэтому дальнейшую работу следует сосредоточить на повышении эффективности методов в сравнении с нейросетевыми методами, в частности графовыми нейронными сетями (sampling techniques in graph neural networks), и улучшении совместимости решений машинного обучения с текущими аппаратными и программными системами [48; 49].

Рассмотрим более детально различные подходы в анализе сетевой инфраструктуры. Время отклика (или же задержка), пропускная способность (скорость передачи данных) и наличие в сети проблемных узлов являются фундаментальными показателями производительности в компьютерных сетях. Исторически они отслеживались с помощью систем, основанных на правилах (rule-based systems), и таких протоколов, как SNMP (Simple Network Management Protocol), а также с помощью выборки пакетов (NetFlow/sFlow/IPFIX) и активных измерений (чаще всего -ping и traceroute). SNMP опрашивает счетчики устройств (процессор, байты интерфейса и т. д.) и использует пороговые значения для выявления проблем, а сборщики потоков (flow samplers) собирают сводки о потоках трафика. Однако эти традиционные подходы становятся все более недостаточными в современных высокоскоростных и динамически меняющихся сетях. Например, SNMP фокусируется на состоянии устройств

и «не обеспечивает погружение в паттерны сетевого трафика», а его модель опроса может сама по себе создавать большую нагрузку в больших сетях [50]. Аналогично, статические пороговые значения, основанные на правилах, не могут адаптироваться к изменяющемуся трафику: они часто приводят к перегрузке операторов и реагируют только после возникновения проблем [51]. В сложных современных сетях (с виртуализацией, облачными сервисами, IoT 4G/5G и т. д.) простые опросы или пороговые оповещения могут не обнаружить тонких перегрузок или аномалий. Как отмечается в одном из аналитических материалов, «традиционный мониторинг сети в значительной степени зависит от вмешательства человека и систем, основанных на правилах (rule-based systems)», что приводит к медленному времени реагирования и трудностям с выявлением аномалий в динамическом трафике [51]. Поэтому администраторы сетей чаще обращаются к более богатой телеметрии (такие как экспорт потоков, захват пакетов) и аналитике.

Современные сети генерируют огромные потоки разнородных данных (например, от устройств IoT и пользователей сотовой связи). В таких условиях традиционные методы не справляются с масштабом и сложностью [52]. Например, опрос миллиона датчиков IoT по протоколу SNMP перегрузит как сами устройства, так и сервер управления, а фиксированные пороговые значения не смогут уловить нестационарные характеристики трафика. В исследованиях отмечается, что «традиционные методы управления сетью для мониторинга и анализа данных сталкиваются с проблемами в эффективной обработке больших данных в режиме реального времени», особенно когда структура трафика усложняется за счет мобильности и неоднородности. Мониторинг на основе потоков (NetFlow/sFlow) частично смягчает эту проблему, агрегируя трафик вместо постоянных опросов; он обеспечивает «более глубокую видимость моделей сетевого трафика» и лучше масштабируется [50]. Тем не менее, даже данные о потоках собираются выборочно и могут упускать короткие всплески или малозаметные проблемы с производительностью. По сути, статическая аналитика, основанная на правилах (с использованием счетчиков SNMP или фиксированных формул), теряет свою актуальность в связи с объемом и динамичностью современного трафика.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Изюмов Павел Сергеевич, 2025 год

Список литературы

1. LightweightNet: Toward fast and lightweight convolutional neural networks via architecture distillation [Текст] / T.-B. Xu [и др.] // Pattern Recognit. — 2019. — Т. 88. — С. 272—284.

2. Lightweight Deep Learning: An Overview [Текст] / C.-H. Wang [и др.] // IEEE Consumer Electronics Magazine. — 2024. — Т. 13. — С. 51—64.

3. Liu, X. Analysis on Lightweight Network Methods and Technologies [Text] / X. Liu // Highlights in Science, Engineering and Technology. — 2022.

4. Reva, A. Method of the network topology transformation to quasihomogeneous structure [Text] / A. Reva, Y. Davydovskyi // Radioelectronic and computer systems. — 2018. — No. 2. — P. 43—51.

5. DE CIX Company, Frankfurt statistics [Электронный ресурс]. — URL: https: / /www. de- cix. net / en/locations / frankfurt / statistics (дата обр. 22.07.2022).

6. Google Company, Transparency report [Электронный ресурс]. — URL: https : / / transparencyreport . google . com / https / overview ? hl = en (дата обр. 10.01.2023).

7. El-Maghraby, R. T. A survey on deep packet inspection [Текст] / R. T. El-Maghraby, N. M. Abd Elazim, A. M. Bahaa-Eldin // 2017 12th International Conference on Computer Engineering and Systems (ICCES). - 2017. - С. 188-197.

8. Kumar, K. Network Traffic Classification Techniques: A Survey [Текст] / K. Kumar, M. Punia, Vandana // 2023 Seventh International Conference on Image Information Processing (ICIIP). — 2023. — С. 205—211.

9. Challenges and Advances in Analyzing TLS 1.3-Encrypted Traffic: A Comprehensive Survey [Text] / J. Zhou [et al.] // Electronics. — 2024. — Vol. 13, no. 20. — URL: https://www.mdpi.com/2079-9292/13/20/4000.

10. Getman, A. I. A Survey of Network Traffic Classification [Text] / A. I. Getman, M. K. Ikonnikova // Proceedings of the Institute for System Programming of the RAS. — 2020. — Vol. 32, no. 6. — P. 137—154. — URL: http://dx.doi.org/10.15514/ISPRAS-2020-32(6)-11.

11. Network Intrusion Detection for IoT Security Based on Learning Techniques [Текст] / N. Chaabouni [и др.] // IEEE Communications Surveys & Tutorials. - 2019. - Т. 21. - С. 2671-2701.

12. Reliability Analysis of IoT Networks with Community Structures [Текст] / Y.-c. Mo [и др.] // IEEE Transactions on Network Science and Engineering. — 2020. — Т. 7. — С. 304—315.

13. Wijethilaka, S. Survey on Network Slicing for Internet of Things Realization in 5G Networks [Текст] / S. Wijethilaka, M. Liyanage // IEEE Communications Surveys & Tutorials. — 2021. — Т. 23. — С. 957—994.

14. Achkouty, F. RDSC: Range-Based Device Spatial Clustering for IoT Networks [Текст] / F. Achkouty, L. Gallon, R. Chbeir // Sensors (Basel, Switzerland). — 2024. — Т. 24.

15. Cyberattack Data Analysis in IoT Environments using Big Data [Текст] / N. Patidar [и др.] // ArXiv. — 2024. — Т. abs/2406.10302.

16. Tajdini, M. Internet of Things Security Problems [Текст] / M. Tajdini, V. Sokolov. — 2019. — Февр.

17. IoT Devices Recognition Through Network Traffic Analysis [Текст] / M. R. Shahid [и др.] // 2018 IEEE International Conference on Big Data (Big Data). - 2018. - С. 5187-5192.

18. Strubell, E. Energy and policy considerations for modern deep learning research [Text] / E. Strubell, A. Ganesh, A. McCallum // Proceedings of the AAAI Conference on Artificial Intelligence. — 2020. — Vol. 34, no. 9. - P. 13693-13696.

19. Deep learning on image denoising: An overview [Текст] / C. Tian [и др.] // Neural Networks. — 2020. — Т. 131. — С. 251—275. — URL: https://www. sciencedirect.com/science/article/pii/S0893608020302665.

20. Rezaei, S. Deep Learning for Encrypted Traffic Classification: An Overview [Текст] / S. Rezaei, X. Liu // IEEE Communications Magazine. — 2019. — Т. 57, № 5. — С. 76—81.

21. Ferdowsi, A. Deep Learning for Reliable Mobile Edge Analytics in Intelligent Transportation Systems: An Overview [Текст] / A. Ferdowsi, U. Challita, W. Saad // IEEE Vehicular Technology Magazine. — 2019. — Т. 14, № 1. — С. 62—70.

22. Liu, H. Machine Learning and Deep Learning Methods for Intrusion Detection Systems: A Survey [Текст] / H. Liu, B. Lang // Applied Sciences. — 2019. — Т. 9, № 20. — URL: https://www.mdpi.com/2076-3417/9/20/4396.

23. BlindBox: Deep Packet Inspection over Encrypted Traffic [Текст] / J. Sherry [и др.] // SIGCOMM Comput. Commun. Rev. — New York, NY, USA, 2015. — Авг. — Т. 45, № 4. — С. 213—226. — URL: https: //doi.org/10.1145/2829988.2787502.

24. Theofilatos, A. Comparing Machine Learning and Deep Learning Methods for Real-Time Crash Prediction [Текст] / A. Theofilatos, C. Chen, C. Antoniou // Transportation Research Record. — 2019. — Т. 2673, № 8. - С. 169-178. - eprint: https://doi.org/10.1177/ 0361198119841571. - URL: https://doi.org/10.1177/0361198119841571.

25. A nonlinear adaptive noise canceller with multiple reference channels for speech enhancement using both bone-and air-conducted measurements [Текст] / Y. Xiao [и др.] // 2018 International Symposium on Intelligent Signal Processing and Communication Systems (ISPACS). — 2018. — С. 258-263.

26. Joint Analysis of Port and Protocol via Endpoint Measurement: An Empirical Study [Текст] / C. Hou [и др.] // 2020 21st Asia-Pacific Network Operations and Management Symposium (APNOMS). — IEEE, 2020. — С. 231—234.

27. Guest Editorial Deep Packet Inspection: Algorithms, Hardware and Applications [Текст] / Y.-D. Lin [и др.] // IEEE Journal on Selected Areas in Communications. — 2014. — Т. 32, № 10. — С. 1781—1783.

28. Chaudhary, A. Software Based Implementation Methodologies for Deep Packet Inspection [Текст] / A. Chaudhary, A. Sardana // 2011 International Conference on Information Science and Applications. — IEEE, 2011. — С. 1—10.

29. Oklilas, A. F. Monitoring and Indentification Packet in Wireless With Deep Packet Inspection Method [Текст] / A. F. Oklilas, Tasmi // IOP Conference Series: Materials Science and Engineering. — 2017. — Т. 190. — С. 012011. - URL: http://dx.doi.org/10.1088/1757-899x/190/ 1/012011.

30. Shubbar, R. Fast 2D filter with low false positive for network packet inspection [Текст] / R. Shubbar, M. Ahmadi // IET Networks. — 2017. — Т. 6, № 6. - С. 224-231. - URL: http://dx.doi.org/10.1049/iet-net.2017.0055.

31. Parvat, T. J. A Novel Approach to Deep Packet Inspection for Intrusion Detection [Текст] / T. J. Parvat, P. Chandra // Procedia Computer Science. - 2015. - Т. 45. - С. 506-513. - URL: http://dx.doi.org/10. 1016/j.procs.2015.03.091.

32. Khandait, P. Efficient Keyword Matching for Deep Packet Inspection based Network Traffic Classification [Текст] / P. Khandait, N. Hubballi, B. Mazumdar // 2020 International Conference on COMmunication Systems & NETworkS (COMSNETS). - IEEE, 2020. - URL: http: //dx.doi.org/10.1109/comsnets48256.2020.9027353.

33. Artificial Intelligence-Based Anomaly Detection Technology over Encrypted Traffic: A Systematic Literature Review [Текст] / I. H. Ji [и др.] // Sensors. - 2024. - Т. 24, № 3. - С. 898. - URL: http: //dx.doi.org/10.3390/s24030898.

34. Machine Learning-Powered Encrypted Network Traffic Analysis: A Comprehensive Survey [Text] / M. Shen [et al.] // IEEE Communications Surveys; Tutorials. - 2023. - Vol. 25, no. 1. - P. 791-824. - URL: http://dx.doi.org/10.1109/comst.2022.3208196.

35. A Novel Deep Packet Inspection Method for Polymorphic Network [Text] / M. Xue [et al.] // 2024 Sixth International Conference on Next Generation Data-driven Networks (NGDN). — IEEE, 2024. — P. 268-271. - URL: http://dx.doi.org/10.1109/ngdn61651.2024. 10744179.

36. Towards Novel Malicious Packet Recognition: A Few-Shot Learning Approach [Текст] / K. Stein [и др.]. — 2024. — URL: https://arxiv. org/abs/2409.11254.

37. Reconfigurable regular expression matching architecture for real-time pattern update and payload inspection [Текст] / J. Nam [и др.] // Journal of Network and Computer Applications. — 2022. — Т. 208. — С. 103507. — URL: http://dx.doi.org/10.1016/jjnca.2022.103507.

38. Advanced Network Representation Learning for Container Shipping Network Analysis [Текст] / L. Jiang [и др.] // IEEE Network. — 2021. — Т. 35, № 2. - С. 182-187. - URL: http://dx.doi.org/10.1109/mnet.011. 2000444.

39. R1DIT: Privacy-Preserving Malware Traffic Classification With Attention-Based Neural Networks [Текст] / O. Barut [и др.] // IEEE Transactions on Network and Service Management. — 2023. — Т. 20, № 2. - С. 2071-2085. - URL: http://dx.doi.org/10.1109/tnsm.2022. 3211254.

40. Belenguer, A. GowFed: A novel federated network intrusion detection system [Текст] / A. Belenguer, J. A. Pascual, J. Navaridas // Journal of Network and Computer Applications. — 2023. — Т. 217. — URL: https: //www.sciencedirect.com/science/article/pii/S1084804523000723.

41. Roshan, K. Untargeted White-box Adversarial Attack with Heuristic Defence Methods in Real-time Deep Learning based Network Intrusion Detection System [Текст] / K. Roshan, A. Zafar, S. B. U. Haque. — 2023. — URL: https://arxiv.org/abs/2310.03334.

42. Locating internet bottlenecks: algorithms, measurements, and implications [Текст] / N. Hu [и др.] // Proceedings of the 2004 Conference on Applications, Technologies, Architectures, and Protocols for Computer Communications. — Portland, Oregon, USA : Association for Computing Machinery, 2004. - С. 41-54. - (SIGCOMM '04). - URL: https: //doi.org/10.1145/1015467.1015474.

43. Adaptive Performance Analysis in IoT Platforms [Текст] / C. Ouedraogo [и др.] // IEEE Transactions on Network and Service Management. — 2022. — Т. 19. — С. 4764—4778.

44. Alsayasneh, M. On the Identification of Performance Bottlenecks in Multitier Distributed Systems [Текст] : PhD thesis / Alsayasneh Maha. — Université Grenoble Alpes, 2020. — Thèse dirigée par Noël De Palma.

45. Âkerblom, N. Online learning of network bottlenecks via minimax paths [Текст] / N. Âkerblom, F. Hoseini, M. Chehreghani // Machine Learning. — 2021. — Т. 112. — С. 131—150.

46. Anomaly Detection and Bottleneck Identification of The Distributed Application in Cloud Data Center using Software-Defined Networking [Текст] / A. El-shamy [и др.] // Egyptian Informatics Journal. — 2021.

47. Chauhan, H. S. Applying Machine Learning to Identify NUMA End-System Bottlenecks for Network I/O [Text] : Master's thesis / Chauhan Harshvardhan Singh. — Davis : University of California, 2017. — Submitted in partial satisfaction of the requirements for the degree of Master of Science in Computer Science.

48. Mai, L. Optimizing Network Performance in Distributed Machine Learning [Текст] / L. Mai, C. Hong, P. Costa. — 2015.

49. Empirical analysis of performance bottlenecks in graph neural network training and inference with GPUs [Текст] / Z. Wang [и др.] // Neurocomputing. — 2021. — Т. 446. — С. 165—191.

50. Kentik. The Evolution of Network Monitoring: From SNMP to Modern Network Observability [Text] / Kentik. — URL: https ://www. kentik. com / kentipedia / evolution - of - network - monitoring - snmp - to - network -observability/ (visited on 04/15/2025).

51. LOGIC, N. The Future of Network Monitoring [Text] / N. LOGIC. — URL: https://www.netflowlogic.com/the-future-of-network-monitoring-how - ai - and - machine - learning - are - changing - the - game/ (visited on 04/15/2025).

52. Abbasi, M. Deep Learning for Network Traffic Monitoring and Analysis (NTMA): A Survey [Текст] / M. Abbasi, A. Shahraki, A. Taherkordi // Computer Communications. — 2021. — Март. — Т. 170. — С. 19—41. — URL: http://dx.doi.org/10.1016/j.comcom.2021.01.021.

53. Aboubakar, M. A review of IoT network management: Current status and perspectives [Текст] / M. Aboubakar, M. Kellil, P. Roux // Journal of King Saud University - Computer and Information Sciences. — 2022. — Июль. - Т. 34, № 7. - С. 4163-4176. - URL: http://dx.doi.org/10. 1016/j.jksuci.2021.03.006.

54. Graf, F. Monitoring performance metrics in low-power wireless systems [Текст] / F. Graf, T. Watteyne, M. Villnow // ICT Express. — 2024. — Т. 10, № 5. — С. 989—1018. — URL: https://www.sciencedirect.com/ science/article/pii/S2405959524000912.

55. Mirza, M. A Machine Learning Approach to Problems in Computer Network Performance Analysis [Текст] : дис. ... канд. / Mirza Mariyam. — Madison, WI, USA : University of Wisconsin-Madison, 2012. — Date of final oral examination: 05/25/12.

56. Qasim Jebur Al-Zaidawi, M. Advanced Deep Learning Models for Improved IoT Network Monitoring Using Hybrid Optimization and MCDM Techniques [Текст] / M. Qasim Jebur Al-Zaidawi, M. Qevik // Symmetry. — 2025. — Т. 17, № 3. — URL: https://www.mdpi.com/2073-8994/17/3/388.

57. Netdata. IoT Monitoring Challenges: Key Issues & How To Overcome Them [Электронный ресурс] / Netdata. — URL: https://www.netdata. cloud/blog/iot-monitoring-challenges/ (дата обр. 15.04.2025).

58. Characterization of Encrypted and VPN Traffic using Time-related Features [Текст] / G. Draper-Gil [и др.] // Proceedings of the 2nd International Conference on Information Systems Security and Privacy - ICISSP. - INSTICC. SciTePress, 2016. - С. 407-414.

59. Abu Al-Haija, Q. Machine-Learning-Based Darknet Traffic Detection System for IoT Applications [Текст] / Q. Abu Al-Haija, M. Krichen, W. Abu Elhaija // Electronics. — 2022. — Т. 11, № 4. — URL: https: //www.mdpi.com/2079-9292/11/4/556.

60. DIDroid: Android Malware Classification and Characterization Using Deep Image Learning [Текст] / A. Rahali [и др.] // Proceedings of the 2020 10th International Conference on Communication and Network Security. — Tokyo, Japan : Association for Computing Machinery, 2021. —

С. 70-82. - (ICCNS '20). - URL: https://doi.org/10.1145/3442520. 3442522.

61. Fast and memory-efficient regular expression matching for deep packet inspection [Текст] / F. Yu [и др.] // Proceedings of the 2006 ACM/IEEE Symposium on Architecture for Networking and Communications Systems. — San Jose, California, USA : Association for Computing Machinery, 2006. - С. 93-102. - (ANCS '06). - URL: https://doi.org/ 10.1145/1185347.1185360.

62. FlowSifter: A counting automata approach to layer 7 field extraction for deep flow inspection [Текст] / C. Meiners [и др.] // 2012 Proceedings IEEE INFOCOM. - 2012. - С. 1746-1754.

63. Using per-Source measurements to improve performance of Internet traffic classification [Текст] / S. Bregni [и др.] // 2010 IEEE Latin-American Conference on Communications. — 2010. — С. 1—5.

64. Bayati, A. Gaussian Process Regression Ensemble Model for Network Traffic Prediction [Текст] / A. Bayati, K.-K. Nguyen, M. Cheriet // IEEE Access. - 2020. - Т. 8. - С. 176540-176554.

65. Sharafaldin, I. Toward Generating a New Intrusion Detection Dataset and Intrusion Traffic Characterization [Текст] / I. Sharafaldin, A. H. Lashkari, A. A. Ghorbani // International Conference on Information Systems Security and Privacy. — 2018. — С. 108—116. — URL: https ://api. semanticscholar.org/CorpusID:4707749.

66. Moore, A. W. Internet traffic classification using bayesian analysis techniques [Текст] / A. W. Moore, D. Zuev // SIGMETRICS Perform. Eval. Rev. — New York, NY, USA, 2005. — Июнь. — Т. 33, № 1. — С. 50-60. - URL: https://doi.org/10.1145/1071690.1064220.

67. Attribute Selection Via Multi-Objective Evolutionary Computation Applied to Multi-Skill Contact Center Data Classification [Текст] / F. Jimenez [и др.] // 2015 IEEE Symposium Series on Computational Intelligence. — 2015. — С. 488—495.

68. Saber, A. Encrypted Network Traffic Identification: LDA-KNN Approach [Текст] / A. Saber, B. Fergani, M. Abbas // Proceedings of the 9 ème édition du colloque Tendances dans les Applications Mathématiques en Tunisie Algérie et Maroc. — 02.2019. — С. 1—3.

69. Manju, N. Ensemble Feature Selection and Classification of Internet Traffic using XGBoost Classifier [Текст] / N. Manju, B. S. Harish, V. Prajwal // International Journal of Computer Network and Information Security. — 2019. — Июль. — Т. 11, № 7. — С. 37—44. — URL: http://dx.doi.org/10.5815/ijcnis.2019.07.06.

70. Jamil, H. A. Feature Selection and Machine Learning Classification for Live P2P Traffic [Текст] / H. A. Jamil // Proceedings of the International Conference on Industrial Engineering and Operations Management (IEOM). - 2019. - С. 1-9.

71. NetWeb. UNIBS:Data sharing [Text] / NetWeb. — URL: http://netweb. ing.unibs.it/~ntw/tools/traces/ (visited on 03/01/2021).

72. Ma, C. Improved KNN Algorithm for Fine-Grained Classification of Encrypted Network Flow [Текст] / C. Ma, X. Du, L. Cao // Electronics. — 2020. — Т. 9, № 2. — URL: https://www.mdpi.com/2079-9292/9/2/324.

73. Droid-Sec: deep learning in android malware detection [Текст] / Z. Yuan [и др.] // Proceedings of the 2014 ACM Conference on SIGCOMM. — Chicago, Illinois, USA : Association for Computing Machinery, 2014. — С. 371-372. - (SIGCOMM '14). - URL: https://doi.org/10.1145/ 2619239.2631434.

74. Semantics-Aware Android Malware Classification Using Weighted Contextual API Dependency Graphs [Текст] / M. Zhang [и др.] // Proceedings of the 2014 ACM SIGSAC Conference on Computer and Communications Security. — Scottsdale, Arizona, USA : Association for Computing Machinery, 2014. — С. 1105—1116. — (CCS '14). — URL: https://doi.org/10.1145/2660267.2660359.

75. DroidCat: Effective Android Malware Detection and Categorization via App-Level Profiling [Текст] / H. Cai [и др.] // IEEE Transactions on Information Forensics and Security. — 2019. — Т. 14, № 6. — С. 1455-1470.

76. DroidDelver: An Android Malware Detection System Using Deep Belief Network Based on API Call Blocks [Текст] / S. Hou [и др.] //. Т. 9998. — 06.2016. — С. 54—66.

77. Nix, R. Classification of Android apps and malware using deep neural networks [Текст] / R. Nix, J. Zhang // 2017 International Joint Conference on Neural Networks (IJCNN). — 2017. — С. 1871—1878.

78. SciKit-Learn. An extra-trees classifier [Text] / SciKit-Learn. — URL: scikit - learn . org / stable / modules / generated / sklearn . ensemble . ExtraTreesClassifier.html (visited on 03/01/2021).

79. Huang, T. H.-D. R2-D2: ColoR-inspired Convolutional NeuRal Network (CNN)-based AndroiD Malware Detections [Текст] / T. H.-D. Huang, H.-Y. Kao // 2018 IEEE International Conference on Big Data (Big Data). — 2018. — С. 2633—2642.

80. EntropLyzer: Android Malware Classification and Characterization Using Entropy Analysis of Dynamic Characteristics [Текст] / D. S. Keyes [и др.] // 2021 Reconciling Data Analytics, Automation, Privacy, and Security: A Big Data Challenge (RDAAPS). — 2021. — С. 1—12.

81. Nigmatullin, R. Accumulated Generalized Mean Value - a New Approach to Flow-Based Feature Generation for Encrypted Traffic Characterization [Текст] / R. Nigmatullin, A. Ivchenko, S. Dorokhin //. — 01.2021. — С. 165-169.

82. Deep packet: a novel approach for encrypted traffic classification using deep learning [Текст] / M. Lotfollahi [и др.] // Soft Computing. — 2019. — Май. - Т. 24, № 3. - С. 1999-2012. - URL: http://dx.doi.org/10. 1007/s00500-019-04030-2.

83. Nigmatullin, R. A Novel Approach to Radiometric Identification [Текст] / R. Nigmatullin, S. Dorokhin, A. Ivchenko // Machine Learning and Artificial Intelligence. — IOS Press, 12.2020. — URL: http://dx.doi. org/10.3233/FAIA200806.

84. Differentiation of Different Sorts of Sugars by the CAPoNeF Method [Текст] / R. R. Nigmatullin [и др.] // Electroanalysis. — 2021. — Сент. — Т. 33, № 12. - С. 2508-2515. - URL: http://dx.doi.org/10.1002/elan. 202100291.

85. Building a standard measurement platform [Текст] / M. Bagnulo [и др.] // IEEE Communications Magazine. — 2014. — Т. 52. — С. 165-173.

86. Bajpai, V. A Survey on Internet Performance Measurement Platforms and Related Standardization Efforts [Text] / V. Bajpai, J. Schonwalder // IEEE Communications Surveys. — 2015. — Vol. 17, no. 3. — P. 1313—1341.

87. Measuring home broadband performance [Текст] / S. Sundaresan [и др.] // Communications of the ACM. — 2012. — Нояб. — Т. 55, № 11. — С. 100-109. - URL: http://dx.doi.org/10.1145/2366316.2366337.

88. RIPE Atlas: A Global Internet Measurement Network [Text] / M. Candela [et al.] // The Internet Protocol Journal. — 2015. — Jan. — Vol. 18.

89. Turrs Devices [Electronic Resource]. — URL: www.turris.com (visited on 08/15/2024).

90. Bajpai, V. Managing SamKnows probes using NETCONF [Text] / V. Bajpai, R. Krejci // 2014 IEEE Network Operations and Management Symposium (NOMS). — 2014. — P. 1—2.

91. Developing Realistic Distributed Denial of Service (DDoS) Attack Dataset and Taxonomy [Text] / I. Sharafaldin [et al.] // 2019 International Carnahan Conference on Security Technology (ICCST). — 2019. — P. 1—8.

92. Bajpai, V. Lessons Learned From Using the RIPE Atlas Platform for Measurement Research [Text] / V. Bajpai, S. J. Eravuchira, J. Schönwälder // SIGCOMM Comput. Commun. Rev. — New York, NY, USA, 2015. - July. - Vol. 45, no. 3. - P. 35-42. - URL: https: //doi.org/10.1145/2805789.2805796.

93. RIPE. RIPE Atlas [Electronic Resource] / RIPE. — URL: https://atlas. ripe.net/.

94. Permeability prediction and uncertainty quantification base on Bayesian neural network and data distribution domain transformation [Текст] / L. MingXuan [и др.]. — 01.2023.

95. Scikit-learn: Machine Learning Without Learning the Machinery [Text] / G. Varoquaux [et al.] // GetMobile: Mobile Computing and Communications. — 2015. — June. — Vol. 19, no. 1. — P. 29—33. — URL: http://dx.doi.org/10.1145/2786984.2786995.

96. Quantifying Interference between Measurements on the RIPE Atlas Platform [Текст] / T. Holterbach [и др.] // Proceedings of the 2015 Internet Measurement Conference. — ACM, 10.2015. — С. 437—443. — (IMC '15). - URL: http://dx.doi.org/10.1145/2815675.2815710.

97. Missing measurements on RIPE Atlas [Текст] / W. Shao [и др.]. — 2017. — URL: https://arxiv.org/abs/1701.00938.

98. Harold, J. Theory of probability [Text] / J. Harold. — Oxford : Clarendon Press, 1948.

99. Weng, L. What is Wasserstein distance? [Электронный ресурс] / L. Weng. — URL: https://lilianweng.github.io/posts/2017-08-20-gan/#what-is-wasserstein-distance (дата обр. 15.03.2025).

100. Ramdas, A. On Wasserstein Two-Sample Testing and Related Families of Nonparametric Tests [Текст] / A. Ramdas, N. Trillos, M. Cuturi // Entropy. — 2017. — Янв. — Т. 19, № 2. — С. 47. — URL: http://dx.doi. org/10.3390/e19020047.

101. С., В. С. Вычисление расстояния по Вассерштейну между распределениями вероятностей на прямой [Текст] / В. С. С. // Теория вероятности и ее применение. — 1973. — Т. 18, № 4. — С. 824—827.

102. Sakoe, H. Dynamic programming algorithm optimization for spoken word recognition [Текст] / H. Sakoe, S. Chiba // IEEE Transactions on Acoustics, Speech, and Signal Processing. — 1978. — Т. 26, № 1. — С. 43-49.

103. Izyumov, P. S. Analysis of Network State by RIPE Atlas Distributed Measurement System [Text] / P. S. Izyumov, A. V. Ivchenko // 2024 26th International Conference on Digital Signal Processing and its Applications (DSPA). IEEE. - 2024.

104. Введение в анализ временных рядов. Учебное пособие для вузов. [Текст] / Н. Артамонов [и др.]. — Вологда : ВолНЦ РАН, 2021. — 134 с.

105. Cooley, J. W. An algorithm for the machine calculation of complex Fourier series [Текст] / J. W. Cooley, J. W. Tukey // Mathematics of Computation. - 1965. - Т. 19, № 90. - С. 297-301.

106. IBM. Enhanced Network Timing Calculations for Web Response Time Metrics. [Electronic Resource] / IBM. — URL: https://www.ibm.com/ docs/bg/ itcam- transactions /7.4.0?topic=appendixes- enhanced- network-timing-calculations-web-response-time-metrics.

107. Ge, Z. GNN-based End-to-end Delay Prediction in Software Defined Networking [Текст] : Master's thesis / Ge Zhun. — Ottawa, Canada : University of Ottawa, 2022. — Thesis submitted in partial fulfillment of the requirements for the Master of Applied Science Electrical and Computer Engineering degree, School of Electrical Engineering and Computer Science, Faculty of Engineering.

108. Probabilistic Delay Forecasting in 5G Using Recurrent and Attention-Based Architectures [Текст] / S. Mostafavi [и др.]. — 2025. — URL: https: //arxiv.org/abs/2503.15297.

Список рисунков

1.1 Средний и пиковый объемы трафика во Франкфурте в период с 2018 по 2022 год ........................................................8

1.2 Рост процента использования HTTPS протокола в трафике, проходящем через сервисы компании Google........................8

1.3 Схематичное изображение концепции IoT [16] ......................10

1.4 Общая схема действия полиморфных атак ..........................13

1.5 Блок-схема этапов работы метода Deep Packet Inspection (DPI) . 14

1.6 Пример проблемы «бутылочного горлышка» в устройстве сетей

[42] ..........................................................................15

2.1 Баланс VPN и не-VPN трафика в ISCXVPN (2016)................26

2.2 Баланс Tor и не-Tor трафика в ISCXTor2016........................26

2.3 Баланс используемых портов отправителем в данных Tor сетей ISCXTor2016..............................................................26

2.4 Accuracy для лучших кандидатов (комбинации

гиперпараметров) с и без использования AGMV а) - Для бинарной классификации на наборе данных ISCXVPN для алгоритма случайного леса (RandomForest), б) - Для мультиклассовой классификации на наборе данных CCCS-CIC-AndMal (Before reboot сценарий) для моделей случайного леса (RandForest), дерева решений (Tree), машины

опорных векторов (SVM) и градиентного бустинга (XGB) .... 38

2.5 Метрика accuracy для мультиклассовой классификации с и без использования AGMV, оцененная на кроссвалидации на 5 подвыборках для набора данных CCCS-CIC-AndMal (сценарий датасета Before reboot ) ......................... 39

2.6 Метрика accuracy для бинарной классификации для набора данных ISCXVPN с и без использования преобразования признаков, оцененная на кроссвалидации на 5 подвыборках . . . 42

2.7 Схема генерации признаков из исходных файлов.......... 43

2.8 Результаты применения метода генерации признаков (CAPoNeF) и базовых признаков (IAT) для алгоритмов случайного леса (Randomforest) и градиентного бустинга (XGB) . 45

3.1 Измерительное оборудование SamKnows - «WhiteBox» ...... 48

3.2 Аппаратный зонд RIPE Atlas - Probe V5 .............. 48

3.3 Карта покрытия измерительными зондами платформы RIPE Atlas 49

3.4 Распределение времени отклика до первого узла маршрута в зависимости от типа устройства .................... 54

3.5 Результат калибровки RTT до первого узла маршрута...... 55

3.6 Концептуальная схема разрабатываемого метода калибровки . . 57

3.7 Пример применения квантильтрансформера на данных RIPE Atlas 58

3.8 Пример применения квантильтрансформера на данных RIPE Atlas(логарифмический масштаб)................... 58

3.9 KDE-оценка плотности вероятности времени отклика для различных типов устройств ...................... 60

3.10 Результаты сравнения KDE наблюдаемых данных и рассматриваемых параметрических распределений ........ 62

3.11 Данные с устройств «system:V4» и «system:V3» .......... 63

3.12 Сравнение дивергенции Джефриса до и после применения калибровки ................................ 64

3.13 Сравнение Расстояния Вассерштейна до и после применения калибровки ................................ 64

3.14 Сравнение дивергенции Джефриса до и после применения калибровки (увеличенный масштаб) ................. 65

3.15 Сравнение расстояния Вассерштейна до и после применения калибровки (увеличенный масштаб) ................. 66

4.1 Места расположения зондов, задействованных в проведенных измерениях ................................ 68

4.2 Разброс времени между измерениями на примере устройства id_probe = 12794 ............................ 69

4.3 Распределение количества успешно проведенных замеров на устройстве ................................ 69

4.4 Значения коэффициента силуэта при применении алгоритма кластеризации для различного выставленного количества кластеров................................. 71

4.5 Визуальное отображение применения кластеризации к временным рядам времени отклика. Черным отображены полученные ядра кластеров, а серым - множество временных рядов, отнесенных к этому кластеру................. 71

4.6 Результаты анализа зависимости времени отклика от

расстояния. На рисунке а) отображены диаграммы размаха для коэффициента R2 для обученных регрессионных моделей зависимости медианного времени отклика от географического расположения станций. SVR - регрессия методом опорных векторов, Lasso и Ridge - линейные регрессии с регуляризацией соответствующего типа, LinReg - линейная регрессия без регуляризации. На рисунке б) - визуализация результатов

применения линеинои регрессии с регуляризациеи типа Lasso . . 73

4.7 а) - наблюдаемые данные и оценка модели (прямая). Треугольными метками изображены «аномальные» измерения. б) - исходный вид полученных данных до предобработки на примере устройства prb_id=11337. Временной шаг между отчетами 20 мин ............................ 75

4.8 График медианной PACF после предобработки данных...... 76

4.9 График измерения времени отклика с течением времени для устройства prb_id = 12794 до и после применения фильтра Савицого-Галлея. Временной шаг между отсчётами At = 20 мин 76

4.10 График медианы частичной автокорреляции (PACF) для полученных данных после применения фильтра Савицкого-Галея 77

4.11 График медианы частичной автокорреляции (PACF) для полученных данных после применения фильтра Савицкого-Галея и однократного дифференцирования ряда с шагом d=1................................ 77

4.12 Диаграммы размаха для спектрограмм времени отклика с рассматриваемых устройств...................... 78

4.13 Медианная спектральная картина для времени отклика для рассматриваемых устройств для значений периода, выраженного в сутках......................... 78

4.14 Отнормированные показатели времени отклика для трех случайных устройств из трех городов. Время между отсчётами

At = 20 мин............................... 79

4.15 Результат применения полосового фильтра Баттерворта на данных с трех случайных устройств из трех регионов ....... 79

4.16 Пример применения исследуемого подхода на примере устройства с идентификатором prb_id=162. Train - обучающая выборка, Test - отложенная, Forecast - результат оценки модели . 81

Список таблиц

1 Сравнение подходов к способам мониторинга сетей........ 23

2 Количественное описание изучаемых данных по категориям вредоносных программ......................... 27

3 Метрики качества для задачи классификации........... 29

4 Сравнение результатов базовой версии AGMV (* не упомянуто;

** Accuracy составила 99% ; Pr - Précision, Rc - Recall)...... 37

5 Средние показатели метрики accuracy для мультиклассовой классификации на наборе данных CCCS-CIC-AndMal....... 39

6 Сравнение количества операций (FLOPs) для моделей, решающих задачи классификации VPN/non-VPN трафика .... 41

7 Средние показатели метрики accuracy для бинарной классификации для набора данных ISCXVPN ........... 41

8 Средние значения метрик precision(Pr) и recall(Rc) для задачи мультиклассовой классификации на наборе данных CCCS-CIC-AndMal ........................... 42

9 Описание использованных в работе методов генерации

признаков (в формулах используется Dyi = y— < y >)...... 44

10 Стоимость в баллах различных измерений в расчете на один запрос к одному зонду ......................... 52

11 Результаты калибровки, выраженные в показаниях статистических тестов Манна-Уитни (U-test) и Колмогорова-Смирнова (KS-test). U/D - значение статистики в тестах ................................... 56

12 Изменение статистик в ходе калибровки полученных данных . . 58

13 Результаты сравнения наблюдаемых данных и рассматриваемых параметрических распределений, выраженные в расстоянии (дивергенции) Джефриса от табличного распределения до оценки по KDE. Обозначения распределений: normal -нормальное, lognormal - логнормальное, skewnorm - смещенное нормальное, gennorm - обощенное нормальное........... 61

14 Распределение устройств по типу и версии в предобработанной выборке....................................................................69

15 Соотношение детектируемых кластеров в используемых зондах. . 72

16 Оптимальные гиперпараметры для моделей, использованных

для оценки зависимости г^ от расстояния между узлами..........74

17 Медианное время пиковой нагрузки для трех устройств в

разных городах ..........................................................79

18 Сравнение вычислительной сложности, FLOPs и памяти моделей 84

19 Сравнение метрик рассматриваемых подходов ......................84

20 Аномальные узлы, обнаруженные в ходе анализа данных о времени отклика. ЯТТт - оценка времени отклика моделью,

ЯТТоЬз - результат измерений.....................110

Приложение А Листинги программного кода

Листинг А.1 Основной фрагмент программы calibration.py, используемый для калибровки данных из системы RIPE Atlas

import pandas as pd import numpy as np

from scipy.stats import lognorm, skewnorm

def make_calibration(data_ref, data_uncalib, pdf_type='gamma'):

Калибрует данные в data_uncalib базируясь на данных data_ref. Обычно data_ref - это даннные с устройств system V3

if pdf_type=='gamma':

dstr = gamma elif pdf_type=='lognorm':

dstr = lognorm else :

print('Unsupported pdf_type') return None

ref_params = dstr.fit(data_ref) uncalib_params = dstr.fit(data_uncalib)

cdf_values = dstr.cdf(data_uncalib, *uncalib_params) data_calibr = dstr.ppf(cdf_values, *ref_params)

return data_calibr

25

Приложение Б

Таблица 20 — Аномальные узлы, обнаруженные в ходе анализа данных о времени отклика. ЯТТт - оценка времени отклика моделью, ЯТТ0ь3 -результат измерений

RIPE ASN Удаление, RTTm, RTTobsi Название AS Город

id км мс мс

10249 8359 1717,5 32,8 58,7 MTS Тюмень

11072 56330 1736,5 33,1 48,5 KURGAN-AS Курган

13533 61400 4,8 7,0 20,6 NETRACK-AS Москва

14608 20485 467,9 13,9 25,7 TRANS- Воронеж

TELECOM

16854 201285 90,5 8,3 31,8 KIRZHACH- Киржач

TELECOM

18641 33871 2890,4 50,5 62,7 Norilsk-Telecom-AS Норильск

19921 41668 723,0 17,8 36,2 ERTH-KAZAN-AS Казань

20727 41668 724,4 17,8 36,2 ERTH-KAZAN-AS Казань

22712 31213 612,3 16,1 77,8 MF-NWGSM-AS Псков

26966 6856 573,1 15,5 24,7 IC-VORONEZH-AS Белгород

27300 50071 989,6 21,8 39,2 SRDV-AS Северодвинск

28137 39028 781,0 18,7 38,2 ULSK-AS Димитровград

28543 210616 1219,6 25,3 37,3 SIBMEDVED-AS Новороссийск

28622 51004 6639,5 107,1 117,3 SCTS-AS Южно-

Сахалинск

28664 12683 1342,4 27,2 39,9 STATEL-AS Минеральные

воды

31468 206012 373,4 12,5 23,1 AXIOSTV-AS Липецк

33318 8359 19,9 7,2 40,3 MTS Москва

I УНИВЕРСИТЕТ ИННОПОЛИС

Автономная некоммерческая организация высшего образования

«Университет Иннополис»

Место нахождения: 420500, Россия, Республика Татарстан. Верхнеуслонский муниципальный район город Иннополис. ул. Университетская, д. 1 Тел (Tel): +7 (843) 203-92-53 Факс (Fax): 231-77-18

ОГРН 1121600006142, ИНН/КПП 1655258235/ 161501001

Заинтересованным лицам

г. Иннополис

ШсГА-Цж 2Q25 г.

Акт о практическом использовании результатов диссертационной работы

Настоящим актом AHO ВО «Университет Иннополис» (далее -Университет Иннополис) подтверждает, что результаты диссертационной работы Изюмова Павла Сергеевича «Разработка и исследование алгоритмов анализа сетевой инфраструктуры и интернет-трафика в условиях ограниченных вычислительных мощностей», представленной на соискание ученой степени кандидата технических наук по специальности 2.3.1 - «Системный анализ, управление и обработка информации, статистика», используются в рамках выполнения исследовательских проектов Университета Иннополис.

шошШжш фвдшрашщш

ж

СВИДЕТЕЛЬСТВО

о государственной регистрации программы для ЭВМ

№ 2025664540

Инструмент для сбора, предобработки и калибровки

данных о работе сети

Правообладатель: ИзЮМОв Павел Сергеевич ^и)

Авторы: Изюмов Павел Сергеевич Ивченко Александр Владимирович ^^

ЩИ1 Ж

ж ж ж ж

ж ж ж ж ж ж ж ж ж ж ж ж ж ж

Заявка № 2025663192

Дата поступления 21 мая 2025 г.

Дата государственной регистрации в Реестре программ для ЭВМ 04 иЮНЯ 2025 г.

Руководитель Федеральной службы по интеллектуальной собственности

ДОКУМЕНТ ПОДПИСАН'ЗПЕ KTPQHНОИ ПОДПИСЬЮ

Се стифи кат О692е7с1сЙЬ0£{Иеед«7О sel 2026 Владелец Зубов Юрий Сергеевич

Действителен с 10.07^2i noG3.1C.2025

Ю.С. Зубов

Ж Ж

ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж ж

)ЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖЖ<

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.