Построение и управление устойчивостью распределенных информационно-вычислительных систем при параметрической неопределенности тема диссертации и автореферата по ВАК РФ 00.00.00, доктор наук Гончаренко Владимир Анатольевич
- Специальность ВАК РФ00.00.00
- Количество страниц 452
Оглавление диссертации доктор наук Гончаренко Владимир Анатольевич
ВВЕДЕНИЕ
Глава 1. АНАЛИЗ ПРОБЛЕМЫ ОБЕСПЕЧЕНИЯ УСТОЙЧИВОСТИ РАСПРЕДЕЛЕННЫХ ИНФОРМАЦИОННО-ВЫЧИСЛИТЕЛЬНЫХ СИСТЕМ ПРИ ПАРАМЕТРИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТИ
1.1 Анализ особенностей построения и управления устойчивостью современных распределенных информационно-вычислительных систем
1.2 Анализ основных факторов нарушения устойчивости функционирования распределенных систем
1.3 Анализ основных причин и видов неопределенности в задачах исследования информационно-вычислительных систем
1.4 Исследование путей обеспечения устойчивости функционирования распределенных информационно-вычислительных систем в условиях неопределенности и дестабилизирующих воздействий
1.5 Формулировка научной проблемы и основные направления ее решения
1.6 Выводы по главе
Глава 2. КОНЦЕПТУАЛЬНЫЕ И МЕТОДОЛОГИЧЕСКИЕ ОСНОВЫ ОЦЕНИВАНИЯ И ОБЕСПЕЧЕНИЯ УСТОЙЧИВОСТИ ФУНКЦИОНИРОВАНИЯ ИНФОРМАЦИОННО-ВЫЧИСЛИТЕЛЬНЫХ СИСТЕМ ПРИ ПАРАМЕТРИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТИ
2.1 Классификация видов устойчивости распределенных информационно -вычислительных систем
2.2 Разработка концепции построения устойчивых к воздействиям распределенных информационно-вычислительных систем при параметрической неопределенности
2.3 Формирование показателей и критериев оценивания качества функционирования информационно-вычислительных систем
2.4 Обоснование методологических подходов к оцениванию и обеспечению устойчивости функционирования информационно-вычислительных систем при параметрической неопределенности
2.5 Оценивание устойчивости информационно-телекоммуникационной сети на основе учета связности маршрутов
2.6 Минимизация времени восстановления вычислительной сети на основе оптимизации времени сетевого мониторинга
2.7 Архитектурные решения по построению адаптивной системы обеспечения устойчивости функционирования объектов
2.8 Выводы по главе
Глава 3. МОДЕЛИ И МЕТОДЫ ИССЛЕДОВАНИЯ СТОХАСТИЧЕСКИХ ПРОЦЕССОВ И СИСТЕМ ОБСЛУЖИВАНИЯ С ПАРАМЕТРИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТЬЮ НА ОСНОВЕ КОМПОЗИЦИОННОГО ПОДХОДА
3.1 Сравнительный анализ подходов к формализации и моделированию вычислительных систем при параметрической неопределенности
3.2 Разработка композиционного подхода представления случайных процессов с параметрической неопределенностью на основе произвольных фазовых функций
3.3 Аппроксимационное формирование исходных распределений на основе композиционного подхода и метода производных
3.4 Аналитическое моделирование стохастических систем обслуживания с параметрической неопределенностью
3.5 Декомпозиционный расчет сетевых моделей обслуживания с параметрической неопределенностью
3.6 Имитационное моделирование систем и сетей массового обслуживания с параметрической неопределенностью
3.7 Выводы по главе
Глава 4. МОДЕЛИ И АЛГОРИТМЫ АДАПТИВНОГО УПРАВЛЕНИЯ НАГРУЗКОЙ В КЛАСТЕРНЫХ ВЫЧИСЛИТЕЛЬНЫХ СИСТЕМАХ
4.1 Анализ моделей и алгоритмов управления балансировкой нагрузки в кластерных вычислительных системах
4.2 Разработка моделей и алгоритмов адаптивной балансировки нагрузки на основе моделей с кратчайшей очередью и кратчайшей задержкой
4.3 Разработка аналитической модели двухканальной кластерной системы с присоединением заявок к кратчайшей очереди и переходом между очередями
236
4.4 Моделирование распределенной кластерной системы с задержкой переходов между очередями
4.5 Имитационное моделирование многоканальных кластерных систем с адаптивной балансировкой нагрузки
4.6 Выводы по главе
Глава 5. МЕТОДЫ СИНТЕЗА НАГРУЗОУСТОЙЧИВЫХ
ИНФОРМАЦИОННО-ВЫЧИСЛИТЕЛЬНЫХ СИСТЕМ ЦЕНТРОВ ОБРАБОТКИ ДАННЫХ В УСЛОВИЯХ ПАРАМЕТРИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТИ
5.1 Постановка задач синтеза нагрузоустойчивых информационно-вычислительных систем в условиях неопределенности среды функционирования
269
5.2 Разработка методов обоснования требуемой производительности информационно-вычислительных систем при неопределенности параметров рабочей нагрузки
5.3 Блочный синтез распределенных организационно-технических систем
5.4 Разработка метода выбора оптимальной конфигурации ЯЛЮ-массивов системы хранения данных в условиях неопределенности на основе генетического алгоритма
5.5 Разработка метода определения нагрузоустойчивости информационно -вычислительных систем на основе технологии нагрузочного зондирования
5.6 Выводы по главе
Глава 6. ПРОГРАММНЫЕ КОМПЛЕКСЫ И СИСТЕМЫ КОМПЬЮТЕРНОГО И ИМИТАЦИОННОГО МОДЕЛИРОВАНИЯ КОМПОНЕНТОВ ИНФОРМАЦИОННО-ВЫЧИСЛИТЕЛЬНЫХ СИСТЕМ ПРИ ПАРАМЕТРИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТИ
6.1 Общая характеристика разработанных комплексов программ и систем компьютерного и имитационного моделирования
6.2 Программный комплекс оценивания устойчивости сетевых структур критически важных объектов на основе учета связности маршрутов
6.3 Программа моделирования систем массового обслуживания фазового типа со случайными параметрами
6.4 Программа моделирования трехканальной адаптивной кластерной системы с присоединением заявок к кратчайшей очереди и переходом между очередями
354
6.5 Программный комплекс оценивания нагрузоустойчивости критических информационных систем методом нагрузочного зондирования
6.6 Программа определения оптимальной конфигурации RAID-массивов с помощью генетического алгоритма
6.7 Результаты моделирования объектов информационной инфраструктуры ОАО «РЖД» при параметрической неопределенности
6.8 Выводы по главе
ЗАКЛЮЧЕНИЕ
СПИСОК СОКРАЩЕНИЙ
СПИСОК ТЕРМИНОВ
СПИСОК ЛИТЕРАТУРЫ
ПРИЛОЖЕНИЕ А Акты о внедрении результатов работы
ПРИЛОЖЕНИЕ Б Свидетельства о регистрации программ, авторское свидетельство на изобретение
ПРИЛОЖЕНИЕ В Моделирование случайных потоков с неопределенностью и теоремы о рандомизации
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы и алгоритмы распределения нагрузки между вычислительными ресурсами информационных систем2024 год, кандидат наук Викулов Егор Олегович
Адаптивное робастное управление в l1 постановке1998 год, доктор физико-математических наук Соколов, Виктор Федорович
Модели потоков данных и информационных систем на транспорте2006 год, доктор технических наук Бутакова, Мария Александровна
Управление качеством обслуживания в распределенных информационных системах мониторинга на основе рекурсивных байесовских оценок2018 год, кандидат наук Чудинова, Ксения Владиславовна
Аналитические и программные методы оценки характеристик производительности вычислительных систем с приоритетным обслуживанием2024 год, кандидат наук Соколов Александр Михайлович
Введение диссертации (часть автореферата) на тему «Построение и управление устойчивостью распределенных информационно-вычислительных систем при параметрической неопределенности»
ВВЕДЕНИЕ
Наука - это попытка привести хаотическое многообразие нашего чувственного опыта в соответствие с некоторой единой системой мышления.
Альберт Эйнштейн
Актуальность темы исследования. Современную эпоху характеризует стремительное развитие информационно-коммуникационных технологий, сопровождаемое значительным ростом объемов обрабатываемой информации и повышением требований к надежности и эффективности информационно -вычислительных систем (ИВС). Распределенные информационно-вычислительные системы (РИВС), в частности, входящие в состав Центров обработки данных (ЦОД), стали неотъемлемой частью критической информационной инфраструктуры современного общества.
Их бесперебойное функционирование в условиях постоянно растущих объемов обрабатываемых данных, динамически изменяющейся нагрузки, кибератак, отказов и других дестабилизирующих факторов является ключевым требованием эффективности государства и бизнеса.
Практика показывает, что традиционные подходы к проектированию и эксплуатации систем оказываются уязвимыми из-за различных факторов неопределенности — колебаний рабочей нагрузки, внешних возмущений и атак, непредсказуемости сбоев и отказов, неточности входных данных, ошибок проектирования. Лишь за 2021-2024 годы 53% операторов дата-центров столкнулись с крупными сбоями, причем почти треть из них продолжалась дольше суток, что заметно превышает статистику четырёхлетней давности. Проектирование систем под среднюю загруженность в 70% приводит к выходу системы из строя при нагрузке 110%.
Особенно остро встаёт вопрос обеспечения устойчивости систем при параметрической неопределенности, когда рабочие характеристики (интенсивность потока запросов, время обработки, частота отказов) известны лишь
приблизительно или подвержены случайным колебаниям. Традиционные подходы к проектированию и эксплуатации, использующие детерминированные или усредненные модели, зачастую не способны гарантировать требуемый уровень стабильности в таких условиях.
В этой связи особую важность и актуальность приобретают проведение теоретических исследований и решение практических задач в области обеспечения устойчивого функционирования критических информационных систем на всех этапах жизненного цикла, сочетающих анализ и учет факторов неопределенности, прогнозирование возмущений и адаптивное управление ресурсами. Все вышеперечисленное определяет актуальность темы диссертационного исследования.
Степень разработанности темы исследования. В настоящее время имеются значительные теоретические и практические наработки в области анализа, оптимизации и построения распределенных ИВС. Однако реализация возрастающих требований к обеспечению устойчивости таких систем сдерживается отсутствием полноценного научно-методического обеспечения оптимального управления их функционированием в условиях неопределенности и возмущающих воздействий.
Основная причина заключается в том, что существующие модели обеспечения устойчивости носят предварительный характер и нуждаются в дальнейшей конкретизации, учитывающей реальные сценарии воздействий дестабилизирующих факторов на сложные системы. Большая часть опубликованных исследований ограничивается узконаправленными прикладными задачами, преимущественно ориентированными на вопросы защиты от кибератак и адресованными локальным инженерным задачам конкретных программно-аппаратных средств. В то же время проблема носит междисциплинарный характер.
Фундаментальные основы теории надежности заложены в трудах Р. Барлоу, Ф. Прошана, Б.В. Гнеденко, И.А. Ушакова, А.М. Половко, в области теории живучести и отказоустойчивости - А. Авиджениса, И.А. Рябинина, В.Ф. Крапивина, Г.Н. Черкесова, И.Б. Шубинского, В.А. Богатырева.
Вопросы адаптивного управления и устойчивости распределённых систем являются сравнительно новыми и лежат на стыке нескольких дисциплин. Вопросы адаптивного управления сложными системами, создания современных адаптивных систем достаточно подробно рассмотрены в работах Л.А. Растригина, Я. З. Цыпкина, А. Л. Фрадкова. Вопросам модельного представления работоспособных состояний систем, количественной оценки показателей живучести посвящены работы И.А. Рябинина, А.Г. Додонова, В.Ф. Крапивина, Б.С. Флейшмана и др. Вопросам управления ресурсами и параллельными вычислениями в распределенных системах посвящены работы В.В. Липаева, В.Н. Кустова, А.Г. Басырова. Вопросам адаптивного управления процессами защиты информации, обеспечения киберустойчивости и кибербезопасности информационных систем посвящены работы И.В. Котенко, И.Б. Саенко, А.А. Воробьева, С.А. Петренко, С.И. Макаренко.
В то же время основы теории устойчивости стохастических систем, вопросы нахождения количественных оценок устойчивости, использования разнообразных метрик, установления связи устойчивости со скоростью вхождения системы в стационарный режим разработаны в работах S.P. Meyn, S. Foss, J.W. Cohen, O.J.Boxma, Д. Штойяна, А.А. Боровкова, В.М. Золотарева, В.В. Калашникова, Г.Ш. Цициашвили и др. Однако, при этом не учитываются особенности управления как важнейшего процесса организации функционирования реальных систем. Перспективным направлением управления устойчивостью является проактивное управление сложными системами, развиваемое в трудах Б.В. Соколова, М.Ю. Охтилева, Д.Н. Верзилина.
Для исследования современных вычислительных систем используется математический аппарат теории массового обслуживания (ТМО), основы которого заложены А.К. Эрлангом, А.Я. Хинчиным, Б.В. Гнеденко, Д.Д. Кендаллом, Ф. Поллачеком и др. Современное развитие теории, включая численные, аппроксимационные методы, учитывающие ограниченность статистики, возможность задержек и отказов в узлах, управления параметрами представлено работами P.W. Glynn, W.Whitt, B. Zwart, Т.И. Алиева, В.В.Рыкова, Ю.И. Рыжикова,
A.Д. Хомоненко, В.П. Бубнова, Г.П. Башарина, В.А. Каштанова, П.П. Бочарова,
B.Н. Тарасова, Н.А.Бахаревой, А.А.Назарова, С.П.Моисеевой, В.А. Лохвицкого.
Однако исследование случайных процессов с параметрической неопределенностью в теории массового обслуживания и теории надежности остается менее разработанной областью, несмотря на важные концептуальные работы D.R. Cox, J.F.C. Kingman, А.М. Горцева, Н.И. Головко, В.А. Смагина, к которым можно также отнести современные работы C.G. Corlu, A. Akcay, W. Xie, Г.А. Михайлова, М.А.Бурановой, В.Г.Карташевского.
Вопросы учета различных видов неопределенности в описании сложных систем разрабатывались в рамках целого ряда теорий неопределенности, обобщающих классическую аксиоматическую теорию вероятностей А.Н.Колмогорова, а также теорию субъективных вероятностей Ф.Рамсея и Ф. де Финетти, теорию логических вероятностей Дж.Кейнса и Р.Карнапа. Все они направлены на изучение и управление различными видами неопределенности и предлагают свои собственные механизмы. Энтропийная теория К.Э. Шеннона и А.Реньи ввела концепцию энтропии как меры неопределённости и дала новое понимание информационных процессов. Теория нечетких множеств Л.А. Заде позволила оперировать неопределённостью и размытостью данных. Теория возможностей Д. Дюбуа и А. Прада предложила дополнительный взгляд на неопределённость через неаддитивные меры возможности и необходимости [123]. Теория свидетельств А.Д. Демпстера и Г. Шафера обобщает вероятностный подход на основе функций доверия и правдоподобия [337]. Из новых теорий неопределенности, претендующих на обобщение и универсальный подход к описанию различных видов неопределенности, можно выделить теорию случайных множеств Ж. Матерона [181] и И.С. Молчанова, интервально-возможностную теорию неопределенности Н.Н. Дидука [116], эвентологию О.Ю. Воробьева [33], теорию неопределенности Баодина Лю [321], вводящую понятия неопределенной (нечеткой) случайной величины.
Таким образом, несмотря на значительное количество исследований, посвящённых вопросам повышения производительности, надежности,
устойчивости информационно-вычислительных систем, проблема адаптации этих систем к неопределенности и изменяющимся условиям внешней среды остаётся недостаточно изученной. Большинство существующих подходов ориентированы на статическое управление ресурсами и оптимизацию производительности в условиях определённости параметров, тогда как современные условия требуют гибкости и способности к быстрой перестройке в ответ на внешние изменения. Кроме того, необходимо учитывать, что традиционные подходы к управлению ресурсами часто оказываются неэффективными в условиях высокой динамичности потоков задач и нестабильных характеристик окружающей среды. Поэтому разработка новых моделей и методов для адаптивных кластерных ИВС приобретает особую актуальность.
Указанные обстоятельства определяют существование проблемной ситуации: объективного противоречия между имеющейся возрастающей потребностью в прогнозировании поведения распределенных ИВС (непрерывности функционирования, отказоустойчивости, производительности в условиях кибератак, динамики нагрузки, параметрической неопределенности среды) и ограниченностью существующих научных подходов к обеспечению комплексного управления устойчивостью на всех уровнях, динамической адаптации к стохастическим возмущениям и неполноте данных, к методологии синтеза нагрузоустойчивых систем, интеграции прогнозирования, оценивания и компенсации дестабилизирующих факторов в единый адаптивный контур управления.
Из данной противоречивой ситуации вытекает актуальность важной научной проблемы исследования - разработка концептуальных и методологических основ, моделей, методов и комплексов программ для обеспечения устойчивого функционирования распределенных информационно-вычислительных систем в условиях дестабилизирующих воздействий и параметрической неопределенности на основе методологии, интегрирующей моделирование стохастических процессов, адаптивное управление ресурсами и синтез верифицируемых конфигураций.
Объект исследования - распределенные информационно-вычислительные системы критической информационной инфраструктуры в сфере транспорта, связи, оборонной и ракетно-космической промышленности, функционирующие в условиях параметрической неопределенности.
Предмет исследования - концептуальные и методологические основы, подходы, модели, методы и алгоритмы анализа, управления и синтеза распределенных информационно-вычислительных систем при параметрической неопределенности - критической информационной инфраструктуры и ее элементов (автоматизированных информационно-телекоммуникационных систем, автоматизированных систем критического применения).
Цель диссертационной работы состоит в обеспечении гарантированного уровня устойчивости функционирования распределенных информационно-вычислительных систем в условиях дестабилизирующих воздействий и параметрической неопределенности на основе технологий композиционного моделирования, адаптивного управления и параметрического синтеза.
Для достижения поставленной цели в диссертационной работе требуется решить следующие основные задачи исследования:
1. Анализ проблемы обеспечения устойчивости функционирования распределенных ИВС в условиях параметрической неопределенности.
2. Исследование путей обеспечения устойчивости функционирования распределенных ИВС в условиях дестабилизирующих воздействий
3. Разработка концептуальных основ и методологии оценивания и обеспечения устойчивости распределенных информационно-вычислительных систем в условиях неопределенности и дестабилизирующих факторов на основе адаптивных технологий, включая предложения по построению системы адаптивного обеспечения устойчивости ИВС.
4. Разработка математического аппарата описания случайных процессов обслуживания и математических моделей функционирования распределенных информационно-вычислительных систем в условиях неопределенности и воздействия возмущающих факторов
5. Разработка методов и алгоритмов адаптивного перераспределения нагрузки в кластерных вычислительных системах
6. Разработка методов синтеза нагрузоустойчивых информационно -вычислительных систем центров обработки данных в условиях неопределенности среды функционирования на основе адаптивных технологий
7. Разработка алгоритмического и программного обеспечения компьютерного и имитационного моделирования компонентов информационно-вычислительных систем для оценки устойчивости их функционирования.
Научная новизна. В работе получены оригинальные научные и прикладные результаты по созданию математических моделей и методов исследования информационно-вычислительных систем в условиях параметрической неопределённости, отличающиеся следующей научной новизной:
1. Разработаны новая концепция построения устойчивых к воздействиям систем и методология обеспечения комплексной устойчивости (надежность, производительность, киберустойчивость) РИВС ЦОД к дестабилизирующим воздействиям, в рамках концепции построения устойчивых к воздействиям систем, за счет создания единого адаптивного контура управления, который интегрирует: мониторинг состояния и оценку устойчивости в условиях неполноты данных, прогнозирование возмущений на основе стохастических моделей с неопределенностью, проактивную и реактивную компенсацию возмущений адаптивными алгоритмами, верификацию устойчивости на этапе синтеза системы, устраняя разрозненность традиционных решений для отдельных аспектов устойчивости, интеграцию оценки связности маршрутов и минимизации времени восстановления на основе сетевого мониторинга в условиях неполноты данных, а также архитектурные решения по обеспечению устойчивости РИВС.
2. Разработан принципиально новый математический аппарат на основе композиционного подхода для моделирования и анализа стохастических процессов и систем обслуживания с параметрической неопределенностью, в отличие от известных моделей, опирающихся на распределения с детерминированными параметрами. Новизна подтверждается: формализацией случайных потоков с
неопределенностью через рандомизацию параметров и выражением большого класса распределений интегральным уравнением Фредгольма 1-го рода в виде композиции интегрального ядра и фазовой функции; разработкой аппроксимационного метода формирования распределений с произвольной фазовой функцией, расширяющего существующие методы анализа систем массового обслуживания; разработкой численно-аналитического метода расчета нового класса моделей с неопределенностью с трансцендентными функциями на основе спектрального разложения интегрального уравнения Линдли; методикой расчета сетевых моделей обслуживания с учетом параметрической неопределенности.
3. Предложены новые адаптивные алгоритмы балансировки нагрузки в кластерных системах (с присоединением к кратчайшей очереди/к очереди с кратчайшей задержкой и переходом между очередями), обеспечивающие более эффективное распределение нагрузки в условиях ее неопределенности и задержек управления на основе реального состояния системы и текущих условий работы, а также методы расчета вероятностно-временных характеристик таких систем, в том числе с учетом гетерогенности узлов кластера с асимметрией производительностей, возможной неравномерности входных потоков, задержек передачи между узлами кластера.
4. Впервые разработаны научно обоснованные методы синтеза нагрузоустойчивых конфигураций ЦОД на этапе проектирования с учетом неопределенности исходных данных, в отличие от реактивных подходов постфактумной оптимизации. Новизна заключается: в методе обоснования производительности с учетом интервальной неопределенности характеристик рабочей нагрузки; в методе определения нагрузоустойчивости ИВС на основе технологий нагрузочного зондирования; в методе синтеза оптимальных конфигураций СХД на основе КАГО-массивов с использованием модифицированных генетических алгоритмов, напрямую учитывающих диапазон неопределенности параметров надежности, производительности и эффективности использования дисков.
Создан комплекс оригинальных программных средств (имитационного моделирования, анализа, управления, синтеза), принципиально новых по своей функциональности: моделирующих поведение РИВС с параметрической неопределенностью на основе композиционного подхода; реализующих разработанные адаптивные алгоритмы балансировки (ПКО/ПМО) и оценки устойчивости; автоматизирующих синтез верифицируемых нагрузоустойчивых конфигураций (включая RAID), что впервые обеспечивает инструментальную поддержку полного цикла исследования, проектирования и управления устойчивостью РИВС в условиях неопределенности.
Теоретическая значимость диссертационной работы заключается в существенном развитии научного аппарата для исследования и проектирования сложных распределенных систем, функционирующих в условиях параметрической неопределенности среды. Значимость конкретных положений, выносимых на защиту, выражается в следующем:
1. Предложенные концептуальные основы и методология оценивания и обеспечения устойчивости функционирования РИВС в условиях дестабилизирующих воздействий вносят значительный вклад в развитие теории устойчивости сложных распределенных систем и теории адаптивного управления. Она обеспечивает теоретическое обоснование для комплексного подхода к обеспечению устойчивости, интегрирующего оценку состояния (включая методы оценки связности при неполноте данных), прогнозирование возмущений на основе стохастических моделей с неопределенностью и динамическую адаптацию управления ресурсами (робастная оптимизация времени восстановления). Методология закладывает основы для создания формальных моделей и системы методов обеспечения устойчивости РИВС к комбинированным дестабилизирующим факторам.
2. Разработанные подходы, математические модели процессов массового обслуживания с параметрической неопределенностью и методы их исследования на основе композиционного подхода фундаментально расширяет теоретическую базу теории случайных процессов и теории массового обслуживания. Введение
класса моделей, основанных на композиции интегральных ядер и фазовых функций (включая рандомизацию параметров и аппроксимацию Фредгольма) создает новый мощный инструмент для строгого математического описания и анализа систем, где ключевые параметры распределений (входных потоков, времен обслуживания) неизвестны точно или подвержены стохастическим вариациям, а не просто являются известными детерминированными величинами. Разработанные аналитические (спектральный метод для трансцендентных уравнений) и численные методы расчета таких моделей восполняют существенный пробел в арсенале теоретических методов исследования стохастических систем.
3. Разработанные методы и алгоритмы адаптивной балансировки нагрузки в кластерных вычислительных системах (JSQ/TBQ, JSD/TBQ и др.) существенно развивают теоретические основы управления ресурсами в распределенных системах и теории управляемых СМО. Их новизна заключается в теоретическом учете ключевых факторов реальной эксплуатации: параметрической неопределенности (в оценках загрузки, времени выполнения), задержек управления (миграция, переключение) и асимметрии производительности узлов. Полученные аналитические соотношения для систем типа JSQ/TBQ и методы поиска оптимальных параметров обогащают математический аппарат для анализа и синтеза алгоритмов балансировки в нестационарных и неопределенных средах.
4. Методы синтеза нагрузоустойчивых информационно-вычислительных систем центров обработки данных в условиях параметрической неопределенности представляют значительный вклад в теорию синтеза сложных систем и теорию надежности, адаптированные к условиям параметрической неопределенности. Методы обоснования производительности и нагрузоустойчивости с использованием параметрической идентификации, нагрузочного зондирования и интервального анализа, а также метод синтеза конфигураций (RAID) на основе модифицированных генетических алгоритмов с робастными критериями, предлагают принципиально новые теоретические подходы к проектированию систем, изначально обладающих свойством нагрузоустойчивости. Они снимают
ограничение традиционных детерминированных или усредненных подходов к синтезу, формализуя учет неопределенности на этапе проектирования.
5. Разработанные программные комплексы и системы компьютерного и имитационного моделирования компонентов информационно-вычислительных систем при параметрической неопределенности имеют высокую теоретическую значимость как инструменты верификации и развития теории. Они реализуют на практике предложенные теоретические модели (композиционные СМО), методы (оценки устойчивости, балансировки нагрузки) и алгоритмы (верификации нагрузоустойчивости, синтеза конфигурации ЯЛЮ-массивов), предоставляя уникальный инструментарий для их экспериментального исследования, уточнения и дальнейшего развития. Эти комплексы формализуют и делают воспроизводимыми сложные теоретические концепции, способствуя их интеграции в научный оборот и создавая основу для новых теоретических обобщений на основе результатов вычислительных экспериментов.
В целом, диссертация вносит весомый вклад в развитие следующих теоретических областей: теорию массового обслуживания и стохастических процессов (за счет принципиально новых моделей и методов анализа с параметрической неопределенностью); теорию устойчивости сложных систем (через разработку формальной методологии и критериев адаптивной устойчивости РИВС); теорию адаптивного и робастного управления (благодаря новым алгоритмам управления ресурсами, явно учитывающим неопределенность и задержки); теорию синтеза систем (посредством разработки методов проектирования, гарантирующих устойчивость к неопределенности на этапе создания системы); вычислительные методы и имитационное моделирование (через создание специализированных инструментов для исследования сложных стохастических систем).
Работа преодолевает разобщенность этих теоретических направлений применительно к проблеме устойчивости РИВС в неопределенной среде, предлагая целостный теоретический фундамент и новый методологический аппарат для дальнейших исследований в этой критически важной области.
Практическая значимость диссертационной работы заключается в создании научно обоснованных, готовых к внедрению решений для повышения надежности, эффективности и киберустойчивости реальных распределенных ИВС и ЦОД в условиях неопределенности. Результаты диссертационного исследования были внедрены и использованы (см. Приложение А):
1) в в/ч 08317 (г.Краснознаменск) в рамках проведенной опытно-испытательной работы (шифр «Е 0602-4») при комплексных испытаниях ЦУП КА 14Ф132;
2) в ЗАО «ЭВРИКА» (Санкт-Петербург) при разработке методики построения системы адаптивного обеспечения устойчивости функционирования глобальных АС в условиях разнородных деструктивных воздействий и рекомендаций по построению устойчивых к воздействиям распределенных ИВС на основе адаптивных алгоритмов управления производительностью;
3) в ПАО «Межгосударственная акционерная корпорация «Вымпел» (Москва) в составной части проекта «Создание на основе ЕПИМ и испытание комплекса имитационного моделирования применения наземных и космических средств с учетом их взаимодействия» (шифр «Покер-ВК»), реализуемого по Договору с Фондом перспективных исследований;
4) в Санкт-Петербургском Федеральном исследовательском центре РАН при выполнении государственного задания FFZF-2025-0020 на проведение НИР по теме «Разработка методологии, методов и интеллектуальных технологий обеспечения жизнеспособности существующих и перспективных отечественных интегрированных государственных и коммерческих информационно-управляющих и телекоммуникационных систем, сетей и цепей поставок на различных этапах их жизненного цикла (2025-2027гг.), а также НИР по теме «Создание экспериментального образца программного комплекса автономного группового управления многоспутниковыми группировками малоразмерных КА наблюдения земной поверхности и околоземного космического пространства на основе комплексирования классических подходов, нейросетевых технологий и искусственного интеллекта», шифр «Комплекс-СГ-3.1.2.1».
5) в учебном процессе на кафедре №3 (Автоматизированного управления РВиА) Михайловской военной артиллерийской академии при изучении дисциплин «Моделирование и проектирование систем», «Защита информации», «Сети и телекоммуникации», «Эксплуатация АССН»;
6) в учебном процессе на кафедре №24 (Информационно-вычислительных систем и сетей) Военно-космической академии имени А.Ф. Можайского при изучении дисциплин «Технологии построения и обеспечения устойчивости современных вычислительных систем и сетей»; «Моделирование и проектирование систем», «Защита информации».
Значимость положений, выносимых на защиту, выражается в их следующих прикладных возможностях:
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методика нечеткой балансировки нагрузки открытого виртуального исследовательского пространства на основе имитационного эксперимента2010 год, кандидат технических наук Николаев, Андрей Валерьевич
Методы анализа и синтеза разрывных систем адаптивного управления технологическими процессами2009 год, кандидат наук Пашков, Николай Николаевич
Исследование распределения ресурсов в интерактивных сервисах инфокоммуникационных сетей2014 год, кандидат наук Парфёнов, Денис Игоревич
Разработка методов, алгоритмов и программ моделирования сетей с дозированной балансировкой нагрузки2013 год, кандидат наук Сапрыкин, Алексей Николаевич
Разработка моделей загруженности топологически сложных информационно-вычислительных сетей и алгоритмов маршрутизации трафика на основе методов стохастической динамики и теории перколяции2022 год, доктор наук Лесько Сергей Александрович
Список литературы диссертационного исследования доктор наук Гончаренко Владимир Анатольевич, 2025 год
По источнику
возможной
неоднозначности
игровая неопределенность
неточность
случайность
нечетковозможностная
многокритериальная
полезностная
структурная
логическая многозначность
противоречивость знаний
неопределенность логического вывода
стохастическая
нестохастическая
полистохастическая
Рисунок 1.2 - Классификация факторов и видов неопределенности
1. Неизвестность - ситуация соответствует начальной стадии изучения объекта, когда информация об объекте практически отсутствует.
2. Недостоверность - ситуация соответствует первым этапам сбора информации, когда процесс изучения объекта временно приостановлен или не хватает для этого ресурсов (возможностей). При этом не исключается возможность дальнейшего результативного изучения объекта, которое может привести либо к
ситуации определенности, в которой все элементы описаны однозначно, либо к ситуации неоднозначности.
3. Неоднозначность - ситуация, когда даже при наличии всей требуемой достоверной информации полностью определенное описание не получено и не может быть получено, поскольку неопределенность свойственна самой сущности рассматриваемой ситуации.
По характеру недостоверности можно выделить следующие ее виды:
неполнота - собрана еще не вся возможная информация из всего объема информации об объекте (например, при сборе статистики сбоев не учтены ночные периоды - часть событий потеряна);
недостаточность - собрана еще не вся необходимая информация для качественного решения задачи(анализ отказоустойчивости требует данных о редких сбоях, а собраны только штатные режимы - критичные события не изучены);
недоопределенностъ - ситуация, когда для некоторых элементов или их параметров заданы (получены) не их точные значения (описания), а лишь множества, которым эти значения (описания) принадлежат [189];
неадекватность - ситуация, возникающая при замещающем описании параметров (элементов) системы по аналогии с существующими системами, либо при намеренном искажении информации с целью упрощения системы (например, замещение - скорость обработки данных на новом SSD принята как у старого HDD, т.к. данных нет; упрощение - сложное распределение времени отклика сети заменено экспоненциальным для удобства расчетов).
Остановимся более подробно на третьем уровне неопределенности -неоднозначности. Здесь на первый план выступает критерий классификации по источникам (причинам) возможной неоднозначности.
Факторы неопределенности делятся на три группы:
1) физическая неопределенность, обусловленная внешней средой;
2) субъективная неопределенность, порождаемая субъективным восприятием человеком окружающего мира;
3) логическая неопределенность, обусловленная спецификой человеческих знаний, трудно поддающихся однозначному толкованию, структуризации и алгоритмизации.
При этом два последних вида могут относиться как к знаниям конкретного человека (субъекта), так и знаниям, накопленным человечеством в искусственных носителях информации [220].
Наиболее существенной по своему влиянию на объект исследования является внешняя среда - основной источник неопределенности, под которой понимается совокупность элементов окружающего систему мира, не входящих в ее состав, но оказывающих на нее то или иное воздействие [139]. Кроме того, к среде часто относят недостаточно изученные элементы и факторы, включая и те, которые имеют внутрисистемный характер.
Неопределенность, связанная с трудностью выделения системы из внешней среды, проявляется в неструктурируемости (неформализуемости) системы, т.е. в невозможности построения соответствующей математической модели, и относится к субъективной неопределенности. Широкая подгруппа лингвистической неопределенности порождается, с одной стороны, неопределенностью значений слов (полисемией), в том числе нечеткостью, а с другой стороны, неоднозначностью смысла фраз (амбивалентностью).
Отметим несколько важных моментов в классификации видов неопределенности.
Во-первых, в чистом виде тот или иной вид неопределенности не проявляется. Так, учет физической неопределенности может усложниться появлением лингвистической неопределенности (нечеткости) или неточности в описании вероятностных распределений [32, 76, 193]. Может возникать поливероятностная ситуация, когда об исходном распределении имеются неполные сведения (несколько правдоподобных гипотез о распределении, системе его ограничений и др.). Таким образом,различные виды неопределенности могут накладываться один на другой.
Во-вторых, классификация не касается вопроса, какие элементы задачи исследования имеют неопределенное описание: постановка задачи, цель исследования, критерии (условия)оценивания (выбора), состояния среды и системы, ограничения (требования к системе), множество альтернатив и т.д. Например, неопределенность описания целей отражается в многокритериальности оценивания (выбора) альтернатив и может иметь случайный или нечеткий характер. Неопределенность описания среды может проявляться в виде и физической, и лингвистической неопределенности.
Попытки создать единый математический аппарат для описания различных видов неопределенности предпринимаются давно. Еще до создания в 1933 году А.Н. Колмогоровым математического аппарата аксиоматической теории вероятностей, представляющей стохастическую неопределенность, существовали и активно развивались теория логических вероятностей Дж. Кейнса (1921), рассматривавшая вероятность как меру уверенности в истинности утверждения, и теория субъективных вероятностей Ф.П. Рамсея (1926) и Б. де Финетти (1931), основанная на личном восприятии вероятности и предполагающая, что вероятность - это степень веры индивида в событие. Энтропийная теория информации К.Э. Шеннона (1948) ввела концепцию энтропии как меры неопределённости и дала новое понимание информационных процессов.
Теория нечетких множеств Л.А. Заде (1965) [350] позволила оперировать неопределённостью и размытостью данных. Дальнейшее развитие концепции нечеткости Д.Дюбуа и А. Прадом (1978) привело к созданию теории возможностей [123]. В отличие от теории вероятностей [215, 266], которая описывает случайные события, и теории нечетких множеств [193, 350], оперирующей функциями принадлежности, теория возможностей описывает неопределенность, связанную с неполной информацией, она фокусируется на описании неопределенности и неполной информации с помощью функций возможности и необходимости. Функция возможности описывает степень возможности события, а функция необходимости — степень необходимости события. Это позволяет более точно описывать неопределенность и неполную информацию.
Параллельно А.Д.Демпстером и А.Шафером [337] была разработана теория свидетельств (1968), предложившая математический аппарат для объединения подходов к описанию неопределенности, введя принцип комбинирования вероятностей и доверительных интервалов. Формально неопределенность представляется с помощью некоторого универсального множества X, элементами которого могут быть исходы решения или эксперимента, диапазон изменения физической величины, возможные семантические значения фразы. Неопределенность состоит в том, что точно неизвестно, какой элемент xeX в действительности имел, имеет или будет иметь место. Конкретная интерпретация неопределенности может быть самой различной: степень истинности некоторого высказывания, вероятность некоторого события, неполная уверенность субъекта в своих действиях, частичная принадлежность некоторому подмножеству и т.д. Подобный подход можно трактовать и в терминах объективной и субъективной вероятностей [18].
Попытка разработки единой теории неопределенности предпринята Н.Н. Дидуком [116] на базе теории вероятностей, теории информации, теории нечетких множеств, математической статистики, теории игр, теории математических структур и др. С помощью предлагаемого математического аппарата строится погружение ситуаций конкретного (частного) типа неопределенности в класс пространств неопределенности. Неопределенные параметры задаются как интервалы с функциями правдоподобия, комбинируя интервальный анализ и теорию возможностей.
Еще один универсальная теория неопределенности, названная эвентологией и стремящаяся обобщить классические и современные подходы к изучению неопределенности, предложена в работах О.Ю. Воробьева [33]. Эвентология предполагает одновременное рассмотрение случайности, необратимости, амбивалентности и других типов неопределенности, используя методы теории вероятностей, теории возможностей, теории информации и теорию нечётких множеств. Объединяет понятия вероятности и «убеждённость» через концепцию
со-событий. Отделяет понятие изменчивости от незнания, используя два пространства (вероятности и убеждённости).
Наиболее развитая теория неопределенности предложена в работах Баодинга Лю [321], в которой предложена концепция «неопределенной меры» и «неопределенных случайных величин». Основная идея заключается в объединении классических теорий вероятностей и нечётких множеств в единую систему. Вводит меру неопределенности через энтропию нечетких множеств (нечеткую энтропию).
1.4 Исследование путей обеспечения устойчивости функционирования
распределенных информационно-вычислительных систем в условиях неопределенности и дестабилизирующих воздействий
Теория устойчивости сложных систем, в частности, ИС, пока не оформилась в стройную концепцию и на данный момент представляет собой совокупность разнообразных теоретических и практических методов, сформированных на основе ряда научных теорий и направлений (см. рис. 1.3).
На настоящий момент существует четыре основных подхода к построению устойчивых к воздействиям систем:
- обеспечение стойкости (выбор элементной базы с высокими показателями безотказности и стойкости к воздействию дестабилизирующих факторов);
- обеспечение избыточности (введение различных видов резервирования -структурного, функционального, временного, информационного и др.);
- обеспечение адаптации (обеспечение адаптивности архитектуры системы к внешним воздействиям и отказам с помощью динамического изменения параметров, реконфигурации и постепенной деградации технических характеристик устройств и систем) [10];
- обеспечение упреждения (прогнозирование внешних воздействий и упреждение нарушения устойчивости системы на основе интеллектуальных методов и средств управления) [156, 157, 197, 207, 275].
Общая теория систем Анализ
(системология) систем
Теория агрегативных Теория случайных Теория Теория массового Теория Теория Теория Теория
систем процессов восстановления обслуживания живучести надежности эффективности игр
Теория автоматического управления
Теория управляемых динамических систем
Теория управления ресурсами
Теория обработки и обмена информацией
Искусственный интеллект
Теория принятия решений
(кибернетика)
Прикладная Общая теория Информатика
кибернетика информации
Рисунок 1.3 - Место теории устойчивости в системно-кибернетических знаниях
Первый подход основан на разработке высоконадёжной элементной базы и требует значительного совершенствования технологий производства.
Второй подход является в настоящее время доминирующим и используется как при обеспечении высокой надежности (отказоустойчивости) при не очень надёжной элементной базе, так и при обеспечении живучести в условиях внешних деструктивных воздействий по элементам информационной инфраструктуры (ИИ).
Однако, при отсутствии адаптивных интеллектуальных технологий замены отказавших элементов и систем, перестроения их структуры даже высокорезервированные системы превращаются в груду металла. Поэтому третий подход имеет значительные перспективы.
Развитие адаптивных технологий приводит нас к четвертому подходу, который позволяет заблаговременно отреагировать на косвенные признаки нарушения устойчивости и является перспективой для построения современных распределенных информационных систем.
Основными инструментами построения и функционирования устойчивых к воздействиям распределенных информационных систем на основе адаптивного управления являются:
1) наличие механизмов адаптации архитектуры системы под реальную рабочую нагрузку и внешние воздействия;
2) наличие развитых (распределенных и резервируемых) средств управления сетевой инфраструктурой;
3) распределенность архитектуры средств управления сетевой инфраструктурой;
4) возможность удаленного интеллектуального управления всей совокупностью распределенных в ИВС компонентов в любое время из любой точки защищенного доступа;
5) интеллектуальная обработка отказов, включая механизмы парирования отказов на основе обучающих алгоритмов;
6) адаптивность сетевой инфраструктуры к изменяющимся потребностям приложений, включая изменение функций элементов и структуры их взаимосвязей;
7) резервирование не отдельных устройств, а определенных функций, сервисов, наличие нескольких способов реализации одной функциональности;
8) динамическое перераспределение и масштабирование ресурсов ИС в реальном масштабе времени по мере увеличения нагрузки;
9) обеспечение высокой надежности и готовности всех компонентов системы для поддержания непрерывности выполняемых операций;
10) возможность автоматического развертывания и восстановления программного обеспечения;
11) возможность перераспределения и перемещения центров управления инфраструктурой по сети в зависимости от обстановки.
12) стандартизация информационных ресурсов и используемых для этого программных и технических средств.
Одним из методов повышения устойчивости является адаптивное управление производительностью системы, решающей следующие задачи:
- сбор и анализ статистической информации, выявление критичных областей в информационной системе с точки зрения производительности;
- прогнозирование загруженности, потенциальных сбоев или проблем производительности информационной системы;
- получение и подготовка информации для принятия решений при формировании приоритетов и планов развития информационной системы;
- адаптивное изменение режима работы системы.
Центр обработки данных (ЦОД) представляет собой объединение большого количества программных и аппаратных платформ различного типа (таких как серверы, дисковые массивы, ленточные библиотеки, средства резервирования и репликации данных, средства обеспечения надежного функционирования). Основой ЦОД является вычислительная инфраструктура. Целью решений по созданию вычислительной инфраструктуры ЦОД является:
1) сведение к минимуму ущерба при возможных внешних и внутренних воздействиях;
2) прогнозирование и предотвращение таких воздействий;
3) обеспечение масштабируемости по производительности, безопасности, объемам обработки, хранения и предоставления данных.
В качестве архитектурных решений для построения как отдельных ЦОД, так и сетевой информационной инфраструктуры РИВС в целом при решении задач обеспечения устойчивости их функционирования целесообразно применить кластерные технологии. Кластер - это группа соединенных между собой и координируемых серверов, совместно выполняющих общий набор приложений, воспринимаемая клиентами и приложениями как единая система.
Кластерные решения обычно делятся на три основных категории:
1. Кластеры высокой готовности (High-Availability Clusters - HA-кластеры), или отказоустойчивые кластеры, применяются для недопущения прекращения обслуживания в случае выхода из строя основного сервера. Как правило, в этом случае используется дублирующий сервер.
2. Кластеры с балансировкой нагрузки (Load-Balancing Clusters - LB-кластеры) обеспечивают более эффективное использование ресурсов вычислительной системы за счет автоматического перераспределения нагрузки с помощью коммутатора-диспетчера [60].
3. Кластеры высокой производительности (High Performance Computing Clusters - HPC-кластеры) обычно применяются для организации научных вычислений, где требуется высокая масштабируемость и использование всех процессорных мощностей для решения одной задачи. Задача должна быть способна к распараллеливанию.
Существуют кластеры, которые могут объединять некоторые функции (балансировки нагрузки, обеспечения высокой отказоустойчивости или высокой производительности). Они могут использоваться в дата-центрах, облачных инфраструктурах, веб-приложениях, базах данных и других распределенных системах [137]. Общая архитектура таких систем может отличаться в зависимости от конкретных требований, но в целом она включает следующие компоненты:
Балансировщик нагрузки. Принимает входящий трафик и распределяет его между несколькими узлами (серверами или контейнерами) в кластере в зависимости от текущей нагрузки. Это обеспечивает равномерную загрузку узлов и предотвращение перегрузки отдельных серверов. Это может быть аппаратный или программный балансировщик, например, NGINX, HAProxy или AWS Elastic Load Balancer.
Сервера приложений. Несколько серверов, на которых развернуты приложения или службы. Они могут быть виртуальными или физическими машинами. Каждый сервер может обрабатывать часть нагрузки кластера и выполнять бизнес-логику. Используются механизмы сессии, такие как sticky sessions или внешние хранилища сессий (например, Redis).
Системы хранения данных. Высокодоступное решение для хранения данных, такое как кластер баз данных (например, MySQL Cluster, PostgreSQL с репликацией) или NoSQL решения (например, MongoDB с шардированием и репликацией). Это обеспечивает отказоустойчивость и доступность данных [101].
Мониторинг и управление. Системы мониторинга (например, Prometheus, Grafana, Zabbix) для отслеживания состояния узлов, производительности и доступности. В случае сбоя узла мониторинг может быстро перенаправить трафик на остальные работающие узлы. Также могут использоваться инструменты управления (например, Kubernetes) для автоматического развертывания, масштабирования и восстановления приложений.
Резервирование и восстановление. Регулярное создание резервных копий данных и использование технологий для быстрого восстановления в случае отказа одного или нескольких компонентов. Это может включать в себя использование RAID, репликации и резервного копирования в облачные хранилища, резервирования на уровне приложений.
Примерами реализации таких кластеров являются:
Kubernetes. Система управления контейнерами, которая обеспечивает автоматизацию развертывания, масштабирования и управления контейнеризированными приложениями. Поддерживает функции, такие как балансировка нагрузки, отказоустойчивость и масштабирование.
HAProxy. Балансировщик нагрузки и прокси-сервер, который может маршрутизировать трафик к нескольким узлам, обеспечивая отказоустойчивость и высокую производительность.
SLURM (Simple Linux Utility for Resource Management): Один из самых популярных менеджеров заданий для HPC-кластеров. SLURM поддерживает балансировку нагрузки, отказоустойчивость и масштабируемость.
Apache Mesos. Платформа для управления ресурсами в кластере, которая позволяет организовывать высокопроизводительные и отказоустойчивые распределённые системы.
Одним из путей по обеспечению устойчивости функционирования ЦОДов лежит концепция кластеризации глобальных сетей [127]. Концепция предусматривает построение глобальной многоуровневой кластерной системы, когда кластерными технологиями охвачены как отдельные объекты, так и глобальная сеть в целом. Например, балансировка нагрузки [60] или резервирование могут производиться между территориально удаленными объектами, что требует соответствующего обоснования временных задержек в управлении (диспетчеризации) и обработке данных.
Концепция предусматривает построение глобальной многоуровневой кластерной системы, когда кластерными технологиями охвачены как отдельные объекты, так и глобальная сеть в целом. Например, балансировка нагрузки [53] или резервирование могут производиться между территориально удаленными объектами, что требует соответствующего обоснования временных задержек в управлении (диспетчеризации) и обработке данных.
Рассмотрим основные решения по кластеризации глобальных сетей для обеспечения жизнеспособности глобальных АС.
1. Кластеризация с распределёнными ресурсами.
Это наиболее жизнеспособная и распространенная архитектура для корпоративных ГАС [127]. Перечислим ее ключевые принципы:
Распределенность ресурсов: ВЗУ каждого объекта (узла) физически принадлежат ему и управляются его ПО, но логически определяются как системные резервирующие ресурсы, доступные всему кластеру.
Специализация узлов: Серверы и объекты выполняют определенные функции.
Высокая масштабируемость и отказоустойчивость: Достигается за счет избыточности и распределенности. Однако за это часто приходится платить снижением производительности приложений из-за временных задержек на доступ к удаленным ресурсам и алгоритмических затрат на избыточность.
На ВЗУ каждого объекта хранится информация и ПО, необходимое для восстановления работы других объектов кластера. Проблемы масштабируемости в
такой архитектуре упираются в основном в физические возможности системы передачи данных (СПД). Для эффективной работы требуется высокоскоростная СПД с большой пропускной способностью. В противном случае значительные задержки не позволят эффективно реализовать алгоритм распределенной нагрузки. Для увеличения надежности и упрощения управления данными целесообразно применять отказоустойчивые КЛГО-массивы.
Рисунок 1.4 - Кластерная система с распределенными ресурсами
2. Многоуровневая кластеризация.
Данный подход предполагает создание иерархической структуры, где кластеризация применяется на разных уровнях: отдельные компьютеры, узлы, объекты и вся ГАС в целом. Глобальный кластер поддерживает жизнеспособность системы, обеспечивая разделение приложений и данных.
Многоуровневый кластер описывается как среда «клиент — сервер приложений — сервер БД».
Уровень 1: Клиенты и серверы приложений имеют совместный доступ к данным.
Уровень 2: Серверы БД управляют доступом к данным и их целостностью. Уровень 3: Глобальный кластер обеспечивает живучесть всей системы в
целом.
Рисунок 1.5 - Многоуровневая кластеризация
Такая организация кластеров позволяет:
- физически разделить приложения и данные;
- специализировать компьютеры по функциям (например, серверы приложений для конкретных вычислений, серверы БД — с высокоскоростными дисками большого объема);
- повысить надежность за счет резервирования не только на уровне приложений, но и на уровне сервера данных (например, создание зеркальных кластеров СУБД).
Для разделения служебного и пользовательского трафика внутри кластера может использоваться высокоскоростное кольцо FDDI.
3. Масштабируемая кластеризация.
Масштабируемость — ключевое свойство ГАС, обеспечивающее возможность наращивания нагрузки и перераспределения ресурсов. Высокомасштабируемые кластеры должны быть построены так, чтобы объем операций по управлению доступом к данным принципиально не увеличивался с ростом системы.
Ключевые требования:
- исключение или замена сетевых элементов, снижающих эффективность.
- использование высокопроизводительных компьютеров и устройств ввода-вывода, чья скорость приближается к скорости процессоров.
- минимизация потоков обращений за информацией в распределенном ВП.
- оптимизация размещения данных (как локально, так и на разделяемых ресурсах).
ПО кластеризованной АС должно проектироваться с учетом статического и динамического разделения задач и данных:
• если приложение поддерживает разделение задач и данных, оптимальна архитектура без общего доступа к ресурсам;
• если приложение поддерживает только разделение задач, лучше подходит кластер с совместно используемыми ресурсами.
Корректно организованный масштабируемый кластер позволяет проводить модернизацию и обслуживание без прекращения работы.
4. Кластеризация с попарным резервированием объектов.
В таких системах часть компьютеров работает в резервном режиме. Такая архитектура обеспечивает высокий уровень жизнеспособности и равномерное распределение нагрузки между основными и резервными средствами кластера. При отказе основного компьютера резервный автоматически берет на себя его функции, обрабатывая все данные и предотвращая фатальный сбой.
Основные требования к кластеру с резервированием:
- наличие достаточного резервного пространства на МД для хранения данных, дублирования приложений и работы в ОП;
- наличие резервных каналов в локальных и глобальных сетях для автоматического изменения топологии;
- географическое разнесение объектов для обеспечения катастрофоустойчивости и реализации допустимой деградации системы.
- заблаговременное создание копий системного ПО и данных на резервных средствах.
Рисунок 1.6 - Кластеризованная ГАС с попарным резервированием объектов В кластеризованных ГАС используется комплексный подход к избыточности: постоянный обмен информацией о состоянии узлов, мониторинг и администрирование позволяют не только быстро восстанавливать распределенный вычислительный процесс, но и равномерно распределять нагрузку, обеспечивая оптимальную производительность всей системы.
1.5 Формулировка научной проблемы и основные направления ее решения
Современная эпоха характеризуется быстрым развитием информационно -коммуникационных технологий, сопровождающимся постоянным ростом объемов обрабатываемой информации и повышенными требованиями к надежности и
эффективности информационно-вычислительных систем (ИВС). Особенно важную роль играют распределенные информационно-вычислительные системы (РИВС), составляющие основу критической информационной инфраструктуры многих сфер экономики и обороны страны. Именно от стабильного функционирования таких систем зависят успешность государственных инициатив и коммерческая конкурентоспособность предприятий.
Проведенный анализ современных вызовов и ограничений в области проектирования и эксплуатации распределенных информационно-вычислительных систем (РИВС) выявил объективное противоречие между растущими требованиями к гарантированной устойчивости, надежности и производительности критической информационной инфраструктуры в условиях действия разнородных дестабилизирующих факторов и параметрической неопределенности, с одной стороны, и недостаточной разработанностью научно-методического аппарата для комплексного управления устойчивостью таких систем на всех этапах их жизненного цикла - с другой.
Современные РИВС сталкиваются с рядом серьезных вызовов: о постоянно растущие объемы данных и динамика нагрузок приводят к возникновению пиковых нагрузок, перегрузок и падений производительности;
о рост частоты и разнообразия кибератак делает системы уязвимыми к широкомасштабным нападениям, негативно влияющим на доступность и надежность сервисов;
о неопределенность рабочих характеристик, возникающая вследствие колебаний нагрузок, погрешностей измерений и неполных данных, усложняет предсказуемость поведения систем и вызывает трудности в выборе оптимальной стратегии управления ими.
Существующие теоретические положения и практические подходы, основанные на детерминированных или усредненных моделях, не позволяют в полной мере обеспечить требуемый уровень устойчивости РИВС. Это обусловлено неспособностью традиционных методов адекватно учитывать принципиальную «размытость» ключевых параметров (интенсивность потоков запросов, время
обслуживания, частота отказов), их стохастическую изменчивость, а также комбинированное воздействие кибератак, аппаратных сбоев и динамически изменяющейся нагрузки. Большинство решений фокусируется на реагировании на уже произошедшие инциденты или на оптимизации отдельных аспектов функционирования, что приводит к разрозненности управления и невозможности проактивного обеспечения устойчивости.
Таким образом, складывается проблемная ситуация, требующая разрешения указанного противоречия. Ее суть заключается в необходимости создания гарантированно устойчивых РИВС, способных функционировать в условиях параметрической неопределенности и дестабилизирующих воздействий, при недостаточной теоретической и методической разработанности основ для их построения и адаптивного управления.
Из данной проблемной ситуации вытекает научная проблема, состоящая в разработке концептуальных и методологических основ, математических моделей, методов и алгоритмического обеспечения для построения и управления устойчивостью распределенных информационно-вычислительных систем в условиях параметрической неопределенности, обеспечивающих интеграцию прогнозирования, оценивания, адаптивной компенсации возмущений и синтеза верифицируемых конфигураций в единый контур управления.
Цель данной работы состоит в обеспечении гарантированного уровня устойчивости функционирования распределенных информационно-вычислительных систем в условиях дестабилизирующих воздействий и параметрической неопределенности на основе технологий композиционного моделирования, адаптивного управления и параметрического синтеза. Основными направлениями решения сформулированной научной проблемы являются:
1. Разработка новой концепции и методологии обеспечения комплексной устойчивости РИВС. Это направление предполагает создание теоретического фундамента для интеграции управления надежностью, производительностью и киберустойчивостью на основе единого адаптивного контура, объединяющего мониторинг состояния в условиях неполноты данных,
прогнозирование возмущений с использованием стохастических моделей с неопределенностью, проактивное и реактивное управление ресурсами, а также верификацию устойчивости на этапе проектирования системы.
2. Создание и развитие математического аппарата для моделирования и анализа РИВС в условиях параметрической неопределенности. Ключевым аспектом данного направления является разработка композиционного подхода к формализации случайных процессов и систем массового обслуживания с неопределенными параметрами, включая аппроксимационные методы и методы их аналитического и численного исследования.
3. Разработка адаптивных алгоритмов управления ресурсами РИВС. Направление нацелено на создание новых эффективных методов и алгоритмов балансировки нагрузки, явно учитывающих неопределенность оценок состояния системы, задержки управления и гетерогенность узлов кластера, а также на разработку аналитических методов расчета их характеристик.
4. Разработка методов синтеза нагрузоустойчивых конфигураций РИВС на этапе проектирования. Это направление предполагает создание научно обоснованных методов параметрического синтеза систем, изначально обладающих устойчивостью к неопределенности рабочей нагрузки и дестабилизирующим воздействиям, включая обоснование производительности, выбор оптимальных конфигураций подсистем (в т.ч. СХД на основе RAID) с использованием модифицированных генетических алгоритмов и методов нагрузочного зондирования.
5. Создание комплекса программных средств для моделирования, анализа и синтеза устойчивых РИВС. Данное направление заключается в разработке инструментальной поддержки полного жизненного цикла исследования и проектирования устойчивых систем, включая программные комплексы имитационного моделирования, оценки устойчивости, адаптивного управления и синтеза верифицируемых конфигураций, работающих в условиях параметрической неопределенности.
Реализация указанных направлений позволит преодолеть существующий разрыв между теоретическими исследованиями и практическими потребностями в создании критически важных информационно-вычислительных систем, способных гарантированно функционировать в современных условиях неопределенности и противодействия.
1.6 Выводы по главе
1. Учитывая высокую динамичность и параметрическую неопределенность в работе современных РИВС (непредсказуемость нагрузок, изменение ресурсов в serverless-архитектурах), ключевой рекомендацией является переход от реактивных к проактивным и прогнозирующим системам управления. Такие системы должны использовать методы искусственного интеллекта и машинного обучения для прогнозирования состояний и упреждающего синтеза управляющих воздействий, обеспечивая автономность функционирования уровня Tier-4 -уровень 4 (в классификации надежности ЦОД).
2. Для повышения отказоустойчивости, живучести и производительности рекомендуется широкое внедрение кластерных технологий (кластеров HA - High-Availability (высокой доступности), LB - Load-Balancing (балансировки нагрузки), HPC - High Performance Computing (высокопроизводительных вычислений)) как на уровне отдельных ЦОД, так и в рамках глобальной сетевой инфраструктуры. Это позволяет обеспечить избыточность, балансировку нагрузки и возможность геораспределенной обработки, что критически важно для минимизации ущерба и времени восстановления при дестабилизирующих воздействиях.
3. При проектировании, модернизации и эксплуатации РИВС необходимо учитывать комплексную природу неопределенности (неизвестность, недостоверность, неоднозначность), вызванную как внешней средой, так и внутренними процессами системы. Рекомендуется использовать современный математический аппарат (теория нечетких множеств, теория возможностей, теория
свидетельств, эвентология) для формализации и управления неопределенностью в моделях и расчетах.
4. Учитывая появление новых киберугроз (атаки на цепочки поставок, AI-управляемые атаки), обеспечение устойчивости невозможно без встроенных (а не добавленных) механизмов безопасности. Рекомендуется внедрение квантово-стойкой криптографии (NIST PQC - National Institute of Standards and Technology Post-Quantum Cryptography (Пост-Квантовая Криптография Национального Института Стандартов и Технологий (США).
5. Высокое энергопотребление и неэффективность (PUE - Power Usage Effectiveness (Показатель Эффективности Использования Энергии) >1.5) являются значительными ограничивающими факторами для российских ЦОД. Рекомендуется активное внедрение перспективных технологий охлаждения (жидкостное, иммерсионное), оптимизация алгоритмов распределения нагрузки для снижения энергозатрат и разработка стандартов энергоэффективности, сопоставимых с мировыми лидерами (например, PUE - М ~1.1).
6. Для обоснования параметров и структуры РИВС, устойчивых к возмущениям, необходимы специализированные методы оценки нагрузоустойчивости и вероятностно-временных характеристик в условиях неопределенности. Рекомендуется создание методик проведения испытаний, которые позволяли бы моделировать различные дестабилизирующие воздействия и оценивать такие ключевые показатели, как RTO - Recovery Time Objective (Целевое Время Восстановления), RPO — Recovery Point Objective (Целевая Точка Восстановления), с учетом ограничений по стоимости и допустимому ущербу, RPO=0 означает отсутствие потерь данных.
Глава 2. КОНЦЕПТУАЛЬНЫЕ И МЕТОДОЛОГИЧЕСКИЕ ОСНОВЫ ОЦЕНИВАНИЯ И ОБЕСПЕЧЕНИЯ УСТОЙЧИВОСТИ ФУНКЦИОНИРОВАНИЯ ИНФОРМАЦИОННО-ВЫЧИСЛИТЕЛЬНЫХ СИСТЕМ ПРИ ПАРАМЕТРИЧЕСКОЙ НЕОПРЕДЕЛЕННОСТИ
Упади семь раз, встань восемь.
Японская пословица. Даже самое крепкое дерево сломать проще, чем побеги бамбука или ивы, изгибающиеся на ветру.
Брюс Ли
2.1 Классификация видов устойчивости распределенных информационно-вычислительных систем
Устойчивость — это ключевое понятие в теории динамических систем, которое описывает способность системы сохранять своё состояние или возвращаться к нему после возмущений. В зависимости от контекста, устойчивость может быть определена по-разному. Рассмотрим основные типы устойчивости [29].
Устойчивость по Лагранжу описывает способность системы оставаться в пределах заданной области фазового пространства. Это означает, что нахождении системы в определённом состоянии она не выйдет за пределы этой области под воздействием возмущений. Устойчивость по Пуассону описывает способность системы возвращаться к своему исходному состоянию после возмущений. Это более строгий критерий, чем устойчивость по Лагранжу, так как требует не только сохранения состояния, но и возврата к нему. Устойчивость по Ляпунову описывает способность системы возвращаться к своему равновесному состоянию после возмущений. Это наиболее строгий критерий устойчивости, так как требует не только сохранения состояния, но и асимптотического возвращения к нему. Практическая устойчивость описывает способность системы сохранять своё состояние в пределах заданных допусков. Это более мягкий критерий, чем устойчивость по Ляпунову, так как допускает небольшие отклонения от
равновесного состояния. Устойчивость при постоянно действующих возмущениях — это способность системы сохранять своё состояние или возвращаться к нему после воздействия постоянных возмущений. В целом, все эти виды устойчивости разрабатывались для исследования детерминированных систем, т.е. в которых случайными факторами можно пренебречь, либо они носят характер «малой» помехи [29]. При исследовании устойчивости сложных стохастических систем возникает другая ситуация. Как писал А.Я. Хинчин [272], в таких системах «элементы случайности отнюдь не имеют характера небольших «возмущений», нарушающих собой плавный и закономерный ход явления; напротив, они представляют собой основную черту в картине изучаемых процессов».
При анализе устойчивости РИВС строгие критерии устойчивости по Ляпунову (устойчивость в малом) и Пуассону (возвратность в начальное состояние) мало применимы. Вероятностным аналогом критерия устойчивости по Лагранжу может служить требование ограниченности времени ожидания при заданной интенсивности входного потока и времени обслуживания, или условие р = Х/^ < 1. Вероятностным аналогом практической устойчивости системы является требование, чтобы с вероятностью P > 1 - s (например, 99.99%) ее ключевые параметры (длина очереди, время отклика) не превышали заданных границ.
Наиболее близким аналогом для сложных систем является устойчивость при постоянно действующих (в частности, параметрических) возмущениях, когда система не выходит за границы практической устойчивости. Например, система работает под постоянной низкоинтенсивной DDoS-атакой или в условиях перманентных случайных колебаний нагрузки. Она должна не просто обеспечить работоспособность, но и продолжать соблюдать SLA.
Существует огромное количество видов устойчивости систем, и это неудивительно. Свойство устойчивости является системообразующим фундаментальным свойствам систем, то есть способности противостоять внешним и внутренним возмущающим воздействиям и возвращаться в исходное или равновесное состояние. Для различных типов систем разработаны свои теории устойчивости, учитывающие специфику каждой из них. Многим из этих видов
устойчивости даны определения в ГОСТах [353, 357, 358, 366, 378]. При этом различают понятия устойчивости функционирования системы, устойчивости управления системой и устойчивости системы к определенному фактору.
Устойчивость управления — это не просто еще один вид устойчивости в одном ряду с отказоустойчивостью. Это мета-устойчивость, свойство более высокого уровня, которое: 1) координирует и усиливает частные виды устойчивости для достижения устойчивости функционирования; 2) является критическим компонентом для реализации адаптивных и проактивных свойств сложной системы; 3) при неправильной реализации сама может стать источником дестабилизации и разрушить устойчивое функционирование системы. Устойчивость управления обеспечивает устойчивое функционирование. Частные виды устойчивости являются основой для управления.
В соответствии с [29] под устойчивостью функционирования сложной системы понимают сохранение некоторого свойства процесса функционирования по отношению к возмущению или неопределенности некоторых параметров системы или ее математической модели.
Применительно к сетевым объектам ГОСТ Р 53111-2008 трактует устойчивость функционирования как способность сети выполнять свои функции при выходе из строя части элементов сети в результате воздействия дестабилизирующих факторов. В соответствии с ГОСТ 34.003-90 под устойчивостью АСУ военного назначения понимается комплексное свойство системы, характеризуемое живучестью, помехоустойчивостью и надежностью (рис.2.1).
ФАКТОРЫ ВОЗДЕЙСТВИЯ ИЗМЕНЕНИЯ В СИСТЕМЕ
СВОЙСТВО
ЖИВУЧЕСТЬ
Преднамеренные и непреднамеренные деструктивные воздействия
Массовое разрушение элементов системы
УСТОЙЧИВОСТЬ
и
НАДЕЖНОСТЬ
Ошибки в создании системы, старение элементов
Одиночные самопроизвольные отказы элементов
ПОМЕХОУСТОЙЧИВОСТЬ Помехи, структурные ошибки
Искажение информации
Рисунок 2.1 - Характеристика основных свойств устойчивости систем
При этом имеется два ряда синонимичных терминов к слову устойчивость -стабильность, стойкость, прочность, твердость, несгибаемость, с одной стороны, и упругость, эластичность, гибкость, приспособляемость, адаптивность, с другой стороны. Таким образом, необходимо говорить по крайней мере о двух существенных сторонах устойчивости - способности сохранять и способности восстанавливать свои характеристики в условиях возмущений [50].
Поэтому дадим общее определение устойчивости функционирования сложной системы с учетом этих сторон.
Определение. Устойчивость функционирования сложной системы -комплексное свойство системы, характеризующее её способность выполнять свои функции в условиях действия различных возмущающих факторов, а также восстанавливать свои характеристики при выводе из устойчивого состояния [103].
Теперь перечислим основные виды устойчивости в зависимости от воздействующих факторов, с которыми приходится сталкиваться инженерам и ученым при эксплуатации и исследовании распределенных ИВС:
1) отказоустойчивость (устойчивость к отказам техники);
2) ошибкоустойчивость (устойчивость к ошибкам ПО);
3) термоустойчивость и влагоустойчивость (стойкость к внешним климатическим факторам);
4) помехоустойчивость (устойчивость к радиоэлектронным воздействиям);
5) удароустойчивость, ударопрочность (устойчивость к механическим воздействиям);
6) живучесть [187] (устойчивость к повреждению элементов системы;
7) нагрузоустойчивость (устойчивость к резкому увеличени рабочей нагрузки);
8) киберустойчивость (устойчивость к программно-аппаратным воздействиям) [158, 159];
9) катастрофоустойчивость (устойчивость к техногенным катастрофам и стихийным бедствиям).
Рассмотрим наиболее часто используемые виды устойчивости к информационным системам.
Отказоустойчивость - способность системы продолжать корректно функционировать при отказах отдельных компонентов (серверов, дисков, сетевых коммутаторов). Достигается за счет избыточности (резервирования) — аппаратной (RAID, кластеризация) и программной (репликация данных, failover) [370].
Ошибкоустойчивость - устойчивость к ошибкам в программном обеспечении и алгоритмах. Включает техники обработки исключений, транзакционность (откат к согласованному состоянию), использование формально верифицированных компонентов [378].
Киберустойчивость - способность системы противостоять, поглощать и восстанавливаться после целенаправленных кибератак (DDoS, внедрение вредоносного ПО, несанкционированный доступ). Включает не только защиту (брандмауэры, IDS/IPS), но и функции обнаружения, реагирования и восстановления [59, 158, 201, 373].
Нагрузоустойчивость - способность системы сохранять работоспособность и соответствие SLA при резком или аномально высоком росте нагрузки (например, флеш-трафик во время распродаж, DDoS-атака). Обеспечивается масштабируемостью (горизонтальной и вертикальной) и адаптивными алгоритмами балансировки нагрузки.
Катастрофоустойчивость - высшая форма устойчивости, обеспечивающая функционирование системы после масштабных аварий (пожар, наводнение, отказ ЦОД). Реализуется через географически распределенную архитектуру с активными или пассивными центрами восстановления, синхронной или асинхронной репликацией данных.
Также часто в отношении ИВС выделяют понятие живучести [355,366, 376], часто используемое в критических инфраструктурах. Объединяет в себе отказоустойчивость, катастрофоустойчивость и способность выполнять основные функции в условиях частичных повреждений (деградационный режим работы).
Таким образом, современная РИВС — это не просто набор аппаратных и программных компонентов, а сложный организм, обладающий целым спектром свойств устойчивости. Проектирование такой системы требует комплексного подхода, учитывающего все перечисленные ранее виды угроз и неопределенностей, а также компромиссов между уровнем устойчивости, стоимостью и сложностью реализации. Концепция, изложенная в диссертации, интегрирует мониторинг, прогнозирование и адаптивное управление, и является закономерным ответом на вызовы, диктуемые этим многообразием видов устойчивости.
2.2 Разработка концепции построения устойчивых к воздействиям распределенных информационно-вычислительных систем при параметрической неопределенности
2.2.1 Общая характеристика концепции и принципы построения
устойчивых систем
В соответствии с [381] критическая информационная инфраструктура
(КИИ) Российской Федерации — это информационные системы, информационно -телекоммуникационные сети, автоматизированные системы управления субъектов критической информационной инфраструктуры, а также сети электросвязи, которые используются для организации взаимодействия таких объектов. Таким образом, КИИ — это совокупность систем, от которых напрямую зависит функционирование ключевых отраслей. Нарушение работы таких систем может привести к серьёзным социальным, экономическим и экологическим последствиям (рис. 2.2). Таким образом, информационная система КИИ — это объект КИИ, наряду с ИТКС и АСУ.
Процесс внедрения перспективных информационных технологий при создании распределенных информационных систем критической информационной инфраструктуры осложняется большим количеством различных источников и потребителей информации, их организационной и территориальной
распределенностью, непрерывным изменением состава и содержания решаемых задач, и как следствие, повышением рисков нарушения работоспособности таких систем. Поэтому требуются адекватные решения по построению устойчивой информационной инфраструктуры критических объектов, предотвращению угроз нарушения их устойчивого функционирования [124, 172, 204]. Информационно-вычислительные системы и сети КИИ должны быть адаптированы к потоку решаемых задач и к воздействию дестабилизирующих факторов [204].
Рисунок 2.2 - Субъекты и объекты КИИ
Организационно-технические системы в условиях противоборства и борьбы за спорные ресурсы решают свои задачи в следующем составе (рис.2.3):
- целевая подсистема - подсистема, выполняющая целевые задачи функционирования системы (разведка, контроль, управление, анализ, обработка данных, эксплуатация и т.д.);
- атакующая подсистема - подсистема, нарушающая нормальное выполнение задач целевой подсистемой противника;
- защитная подсистема - подсистема, обеспечивающая защиту основной деятельности целевой подсистемы от атакующей подсистемы противника;
- управляющая подсистема - подсистема, осуществляющая процессы переработки информации и вырабатывающая управляющие воздействия на остальные подсистемы.
СИСТЕМА А
СИСТЕМА Б
Атакующая подсистема Б
Целевая подсистема Б
Защитная подсистема Б
и
?! с
к
пз ^
к ^
со пз с^
с
>
Рисунок 2.3 - Модель функционирования системы в условиях деструктивных воздействий
Данная модель применима не только в отношении военной сферы и автоматизированных систем специального назначения (АССН). В гражданской сфере в качестве атакующей подсистемы АИС могут выступать системы активного противодействия инфраструктуре злоумышленника, например, Иопвуро18 (ловушки), имитирующие уязвимые системы для изучения злоумышленника, средства деактивации угроз, блокирующие вредоносные процессы на конечных точках или автоматически изымающие скомпрометированных файлов, ответные действия в правовом поле, например, автоматическая отправка жалоб на заблокированные фишинговые сайты хостинг-провайдерам и в CERT-группы.
Одной из наиболее уязвимых составляющих АИС является ИТ-инфраструктура. Поэтому основной задачей управления АИС как динамической распределенной системой является обеспечение устойчивости ее функционирования на основе адаптации внутреннего состояния системы к постоянно изменяющейся внешней среде [74, 171].
Таким образом, главной задачей обеспечения устойчивости функционирования системы является создание условий для непрерывного функционирования системы в период ее использования по назначению в окружении дестабилизирующих воздействий внешней и внутренней среды, а также реализация эффективных способов (методик) восстановления системы после нарушения процесса функционирования [50, 53, 124].
Для решения данной задачи была разработана концепция построения устойчивых к воздействиям систем [ 53], общая структура которой приведена на рис.2.4. Концепция опирается на базовые основы построения распределенных систем, описание свойств устойчивости и системы дестабилизирующих факторов, концептуальную модель системы обеспечения устойчивости [50], методологию анализа устойчивости и методологию синтеза системы обеспечения устойчивости [202].
Базовые основы построения распределенных автоматизированных систем
Концепция построения РАС Концепция технологий обработки информации Условия функционирования РАС
Описание свойств устойчивости
Принципы обеспечения устойчивости Требования к устойчивости Показатели устойчивости Элементы системы ОУ
=!__ -
Система дестабилизирующих факторов
Описание источников дестабилизации Угрозы дестабилизации Показатели воздействий Модели воздействий
Концептуальная модель системы обеспечения устойчивости (СОУ)
Цели и задачи ОУ Требования к системе Состав и структура Интеграция с другими системами Взаимосвязь показателей
Методология анализа устойчивости
Исходные данные Условия неопределенности Математические модели Методы анализа
Требования
Методология синтеза системы обеспечения устойчивости
Подсистема управления устойчивостью
функции
задачи
средства
система
Конструктивные элементы
Информационная инфраструктура
Условия повышения устойчивости
Рисунок 2.4 - Общая структура концепции построения устойчивых систем Базовые основы построения распределенных систем, механизмы их функционирования и взаимодействия с внешней средой подробно изложены в [30].
Свойства устойчивости проявляются через принципы обеспечения устойчивости, требования к устойчивости, показатели устойчивости и элементы системы обеспечения устойчивости.
Основными принципами построения и функционирования устойчивой к воздействиям информационной инфраструктуры распределенных автоматизированных систем являются [53]:
1) высокая надежность (стойкость к сбоям и отказам вычислителей, памяти и средств передачи данных; обеспечение высокой надежности и непрерывной готовности всех компонентов системы);
2) функциональная избыточность (отсутствие единой точки отказа на различных уровнях иерархии; резервирование не отдельных устройств, а функций, сервисов; наличие нескольких способов реализации одной функциональности; резервирование функциональных задач отдельных объектов за счет ресурсов, заложенных в смежных объектах);
3) быстрая восстанавливаемость (минимизация и оптимизация циркулирующей в АССН информации; восстановление и сохранность информации как на отдельных компьютерах, так и на распределенных БД; унификация, стандартизация и модульность информационных ресурсов, программных и технических средств);
4) иерархическая адаптивность (адаптивность сетевой инфраструктуры к изменяющимся потребностям приложений, включая изменение функций элементов и структуры их взаимосвязей; возможность изменения архитектуры, включая реконфигурацию, деградацию и восстановление функционального состояния; динамическое перераспределение ресурсов и нагрузки между объектами; масштабирование ресурсов в реальном масштабе времени по мере увеличения нагрузки);
5) распределенная самоорганизация (возможность автоматического развертывания программного обеспечения; возможность автономного функционирования распределенных подсистем);
6) интеллектуальная управляемость (интеллектуальная обработка отказов, включая механизмы упреждения нарушений и парирования отказов на основе обучающих алгоритмов; удаленное интеллектуальное управление компонентами в любое время из любой точки защищенного доступа; возможность перемещения центров управления инфраструктурой по сети; распределенность архитектуры средств управления сетевой инфраструктурой);
7) комплексная защищенность (превентивная минимизация уязвимостей; адекватность, непрерывность и многоуровневость защиты; самозащита системы защиты).
Методология анализа устойчивости должна учитывать как процедуру формирования исходных данных, так и условия неопределенности, возникающие при построении модели и реализации системы в реальных условиях функционирования. В предлагаемой концепции данный аспект детально проработан и реализован в формальном аппарате представления случайных процессов обслуживания с возмущающими воздействиями и неопределенностью параметров [76]. Математические модели и методы анализа должны учитывать сетевую структуру исследуемого объекта и природу дестабилизирующих факторов [66, 186, 202, 366]. Методология синтеза системы обеспечения устойчивости предполагает определение основных требований к функциям, задачам, средствам и системе в целом [161, 165, 202, 282]. Например, в [334] синтез подсистемы управления устойчивостью проводится на основе контроля скорости передачи для гетерогенной сети с произвольной топологией и временными задержками. Метод основан на подходе Ляпунова для получения достаточного состояния, при котором гарантируется глобальная асимптотическая устойчивость равновесия.
2.2.2 Концептуальная модель системы с адаптивным управлением
устойчивостью
Описание концептуальной модели обычно включает цель (главную задачу) функционирования системы, принципы её построения и функционирования, общую структуру (состав элементов системы и среды, взаимосвязей и их
характеристик), существенные свойства системы и реализуемого ею процесса, показатели и требования, предъявляемые к их значениям, а также механизмы функционирования и взаимодействия с внешней средой [30].
Концептуальная модель системы обеспечения устойчивости распределенных ИВС основана на принципах стойкости, избыточности, адаптации и упреждения [50, 46]. На рис.2.5 приведена структура концептуальной модели системы с адаптивным управлением устойчивостью. Адаптивные системы предназначены для управления объектами и процессами в условиях априорной и текущей неопределенности в описании моделей объектов и внешних возмущений (внешней среды), когда такая неопределенность существенно влияет на качество управления и его результаты. Система с адаптивным управлением устойчивостью состоит из объекта управления (информационно-вычислительной системы) и системы обеспечения устойчивости, включающей регулятор (подсистему мониторинга и управления) и подсистему адаптации и целеполагания [10, 50, 74].
Входы X, V и и соответствуют целевым, деструктивным и управляющим воздействиям. Целевые воздействия на объект представляют собой воздействия рабочей нагрузки, формируемой потоком решаемых задач. Регулятор (подсистема мониторинга и управления) на основании сигналов с датчиков о входах X, V, состоянии А и выходе У формирует сигнал управления и в соответствии с алгоритмом адаптации ф и целью управления 2. Подсистема адаптации и целеполагания представляет собой второй контур управления, получающий информацию с входов и выхода системы, а также с выхода регулятора [74].
При проектировании системы с адаптивным управлением устойчивостью, моделировании и исследовании процессов ее функционирования возникает необходимость учета неопределенности информации о состоянии объекта, характеристиках его входных и выходных потоков. Неопределенность может быть различных типов и обобщенно представляется мерой неопределенности Р: Х'=Р(Х), А'=Р(А), У=Р(У), т.е. некоторым формальным преобразованием над исходными данными [76], затрудняющим исследование.
ВНЕШНЯЯ
СРЕДА
Рабочая нагрузка
I Деструктивные
V
воздействия
недостоверность
неоднозначность
Целевые воздействия
недостоверность
неоднозначность
п
V
±
п
V ''
Система с
недостоверность (неполнота,
недостаточность и т.д.) управлением
У = У (X ,и V)
неоднозначность
(физическая, лингвист.)
Объект управления (состояние А)
Управляющие воздействия
и = и (X' V, А, У, 2, ф)
X ' = Р( X )
V ' = Р(V)
X"
недостоверность
неоднозначность
Выходные воздействия
Мониторинг состояния
А = Р( А)
Подсистема мониторинга и управления
77
У = Р(У)
и
Цели
ф
^ Алгоритм адаптации
Подсистема адаптации и целеполагания
У"
Система обеспечения устойчивости
Рисунок 2.5 - Структура концептуальной модели системы с адаптивным управлением устойчивостью
Будем различать три различных уровня неопределенности - неизвестность, соответствующая начальному этапу изучения объекта, когда информация об объекте практически отсутствует; недостоверность, когда процесс сбора исходных данных ещё не завершен из-за нехватки ресурсов (неполнота, недостаточность, недоопределенность и т.д.); и неоднозначность, когда вся требуемая информация об объекте собрана, но полностью определенное описание объекта не получено, поскольку неопределенность свойственна самой природе описываемого объекта (случайность, нечёткость, полисемия, многозначность и т.д.). Описание моделей сложных систем с неопределенностью и методов их исследования последовательно изложены в работах [76, 64].
Поскольку объект управления представляет собой распределенную сетевую инфраструктуру, адаптивное управление устойчивостью будет относиться к различным объектам системы, разнесенным на большие расстояния. Главной
проблемой при этом будет учет запаздывания управления и передачи данных между удаленными объектами.
Основные требования обеспечения устойчивости функционирования ИВС предполагают [205]:
- устойчивость к сбоям и отказам, как объектов, так и средств передачи данных;
- возможность перераспределения нагрузки между объектами в различных ситуациях;
- восстановление и сохранность информации как на отдельных компьютерах, так и на распределенных БД;
- возможность эксплуатации в режиме 7x24 не менее 5 лет с показателями готовности, близкими к 0,9999 и выше;
- резервирование обмена информацией при любых негативных условиях с показателями не хуже 0,9999;
- резервирование функциональных задач отдельных объектов за счет ресурсов, заложенных в смежных объектах;
- возможность изменения архитектуры (реконфигурация, деградация и восстановление функционального состояния).
Таким образом, при проведении концептуального моделирования сформулирована проблема построения адаптивно управляемой распределенной автоматизированной системы, предложены принципы построения и функционирования ИВС, устойчивых к воздействиям, рассмотрена обладающая новизной обобщенная концептуальная модель системы обеспечения устойчивости функционирования ИВС с неопределенностью исходных данных на основе адаптивных технологий. Показаны возможности использования кластерных технологий для обеспечения устойчивости функционирования ИВС в условиях деструктивных воздействий. Сделан вывод о необходимости создания на этапе проектирования целевой системой адаптивной системы обеспечения ее устойчивости. Изложенная концепция может быть практически использована при
построении систем обеспечения устойчивости ИВС, в качестве компонентов которых могут выступать как уже имеющиеся в структуре информационных объектов элементы систем обеспечения информационной безопасности [4], управления сетью, резервного копирования, так и новые элементы, основанные на глобальном адаптивном управлении устойчивым функционированием ИВС.
2.2.3 Комбинированный подход к построению жизнеспособных киберфизических систем в условиях неопределенности
Понятие устойчивости в настоящее время очень тесно взаимосвязано с новой концепцией жизнеспособности сложной системы [120, 131].
В настоящее время имеет многочисленный синонимический ряд, поскольку зачастую авторы вкладывают в это понятие различный смысл. Исходный английский термин viability, развиваемый в работах С.Бира [291] с 1972 г. и переводимый как как «жизнеспособность», также переводят как «жизнестойкость», «жизненность», «живучесть», «выживаемость», «состоятельность». В то же время в 1973 году К.Холлингом [309] для экологических систем был введен термин resilience, переведенный в русскоязычной литературе также как «жизнеспособность». В гуманитарных же сферах данный термин переводился как «жизнестойкость», а в области компьютерной безопасности и ИТ-технологий переводится как «киберустойчивость». Понятие «жизнеспособность» имеет множество сходных по смыслу русских и английских понятий: liveness (жизнеспособность, живость, живучесть), survivability (выживаемость, живучесть, жизнеспособность), resilience (эластичность, гибкость, жизнестойкость), sustainability (устойчивость, состоятельность, жизнеспособность), vitality (живость, живучесть, жизнеспособность). Кроме того, множество терминов уже активно используется в описании свойств организационно-технических систем. Так, термин reliability давно используется в ГОСТах, как понятие надежности, хотя часто переводится и как достоверность, термин availability переводился как пригодность, готовность, а также доступность. До недавних пор понятие устойчивости (stability) автоматизированной системы трактовалось как
комплексное свойство, объединявшее надежность, живучесть и помехоустойчивость (ГОСТ 34.003-90). Сейчас на такую же объединяющую роль претендует понятие жизнеспособности, обозначающее способность системы сохранять свою функциональность и структуру в условиях внутренних и внешних изменений. Исходя из анализа употребления данных терминов, можно констатировать, что жизнеспособность - более широкое понятие, включающее в себя жизнестойкость, устойчивость, живучесть, адаптивность, долговечность, восстанавливаемость [148]. Терминологическое разнообразие отражает многослойные аспекты жизнеспособности, включая как устойчивость к изменениям, способность к восстановлению после сбоев, долговременную эксплуатацию и адаптацию к изменениям окружающей среды.
Основная цель управления динамической распределённой системой [147] заключается в поддержании её жизнеспособности на основе адаптации внутренних параметров к постоянно изменяющимся условиям внешней среды. Под жизнеспособностью системы подразумевается её способность сохранять свою функциональность и жизненно важные функции при неопределённых динамически изменяющихся условиях, а также восстанавливать свои характеристики после выхода из состояния равновесия [87].
Жизнеспособность киберфизических систем зависит от множества факторов, среди которых можно выделить следующие:
1) технические факторы (надежность техники и ПО, резервирование компонентов, самовосстанавливаемость [46, 111, 211, 355]);
2) функциональные факторы (гибкость в условиях изменений, резервирование функций, эффективность координации между элементами);
3) управленческие факторы (качество управления [147], адекватность решений, степень автоматизации);
4) экономические факторы: (доступность ресурсов для модернизации, оптимизация расходов, экономическая выгода);
5) социальные факторы (квалификация персонала, мотивация сотрудников, соответствие требованиям пользователей);
6) экологические факторы (природные факторы, устойчивость к катаклизмам, энергопотребление, влияние на окружающую среду);
7) политико-правовые факторы (зрелое законодательство, политическая стабильность, санкции и ограничения);
8) информационная безопасность (защищенность от кибератак, надежность хранения и обработки данных, сохранение конфиденциальности данных).
Все эти факторы в комплексе определяют способность автоматизированной системы оставаться работоспособной и эффективной в условиях разнообразных вызовов и угроз, сохраняя свою функциональность и адаптируя к изменениям окружающей среды.
Рассмотрим более подробно технические факторы, влияющие на жизнеспособность КФС.
1. Надежность оборудования и программного обеспечения:
о качество комплектующих: высококачественные комплектующие снижают вероятность отказов и увеличивают срок службы системы;
о надёжность программного обеспечения: хорошо спроектированная и протестированная программа минимизирует количество ошибок и сбоев.
2. Адаптация структуры вычислительной системы:
о гибкость архитектуры: система должна уметь адаптироваться к изменениям в среде, что включает возможность добавления или удаления компонентов, изменения их роли и перераспределения задач;
о интеграция новых технологий: модернизация системы должна происходить плавно и безболезненно, чтобы не нарушать ее работу.
3. Механизмы резервирования и восстановления:
о резервирование данных: наличие механизмов дублирования и восстановления данных для исключения потерь важной информации в случае сбоев и отказов;
о резервирование компонентов: дублирование критически важных компонентов системы (серверов, дисков, блоков питания и т.д.) обеспечивает отказоустойчивость.
4. Мультикомпонентность и избыточность:
о многокомпонентностъ: использование многокомпонентных
(кластерных) систем повышает устойчивость к сбоям, так как выход из строя одного компонента не приведет к падению или остановке системы;
о избыточность: наличие избыточных компонентов позволяет системе продолжать работу даже при отказе некоторых из них.
5. Качество управления и мониторинга:
о система управления: должны быть предусмотрены механизмы управления, которые позволяют отслеживать состояние системы и своевременно реагировать на сбои;
о мониторинг и диагностика: постоянный мониторинг состояния системы помогает вовремя обнаружить проблемы и принять меры до их возникновения.
6. Обеспечение устойчивости к внешним угрозам:
о защита от внешних угроз: система должна обладать механизмами защиты от внешних угроз, таких как кибератаки, перебои питания, отказы в поставках ресурсов и т.п.;
о средства защиты: включение в систему антивирусных программ, межсетевых экранов и других защитных мер помогает снизить риск проникновения вредоносных программ.
7. Резистентность к отказам и сбоям:
о сбоеустойчивостъ: система должна иметь возможность продолжать работу даже при частичных сбоях, обеспечивая минимальное влияние на основную функциональность;
о самоисправляющие механизмы: встроенные механизмы самопроизвольного восстановления [111] и коррекции ошибок позволяют уменьшить время простоя и устранения проблем.
8. Устойчивость к сбоям на уровне архитектуры:
о распределение задач: использование распределенных архитектурных решений, таких как кластеризация, помогает повысить устойчивость системы к сбоям отдельных компонентов;
о многоуровневые системы: многокомпонентные системы легче переносят сбои на уровне отдельных модулей, так как их работа поддерживается другими частями системы.
9. Оптимизация использования ресурсов:
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.