Динамическое и непрерывное байесовское обновление в многoагентном моделировании тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Чжоу Цзянцзин
- Специальность ВАК РФ00.00.00
- Количество страниц 124
Оглавление диссертации кандидат наук Чжоу Цзянцзин
Введение
Глава 1 Класс дискретных игр с неопределенностью в движении и структуре на основе динамического байесовского обновления
1.1 Модель дискретной игры с неопределенностью в движении и структуре
1.1.1 Обзор неопределенности в движении и структуре в дискретных играх
1.1.2 Моделирование структурной неопределенности в дискретных играх
1.1.3 Параметрическая неопределенность в уравнениях движения
1.2 Модель дискретной игры с неопределенностью в движении и структуре с использованием динамического байесовского обновления
1.2.1 Предварительная информация для Байесовского обновления
1.2.2 Динамическое обновление Байеса
1.2.3 Связанные теоремы о слабой сходимости представлений
1.3 Дискретная игра по управлению загрязнением с неопределенностью
в движении и структуре
1.3.1 Постановка задачи и полученное некооперативное решение
1.3.2 Числовая симуляция задачи контроля загрязнения с неопределенностью структуры движения
1.4 Заключение
Глава 2 Класс дискретных игр с неопределенностью в движении и выигрыше на основе динамического байесовского обновления
2.1 Дискретные игры с неопределенностью в движении и выигрышах
2.1.1 Обзор неопределенности в движении и выигрышах в дискретных играх
2.1.2 Параметрическая неопределенность в уравнениях движения
2.1.3 Параметрическая неопределенность в функциях выигрыша
2.2 Дискретная модель игры с неопределённостью в движении и выигрышах, учитывающая динамическое байесовское обновление
2.2.1 Динамическое байесовское обновление для неопределенности в выигрышах
2.2.2 Теоремы о сильной сходимости представления при неопределенности уравнения движения
2.2.3 Теоремы о сильной сходимости представлений при неопределенности выигрышей
2.3 Приложения
2.3.1 Игра рыболовства бесконечной продолжительности при неопределенности в выигрышах и движении
2.3.2 Задача контроля загрязнения за конечное время при неопределенности в движении и выигрышах
2.4 Заключения
Глава 3 Класс дифференциальных игр с неопределенностью в движении и выигрышах на основе непрерывного байесовского обновления
3.1 Модель дифференциальной игры с неопределенностью в движении
и выигрышах
3.1.1 Обзор неопределенности в движении и выигрышах в дифференциальных играх
3.1.2 Параметрическая неопределенность в уравнениях движения в дифференциальных играх
3.1.3 Параметрическая неопределенность в функциях выигрыша в дифференциальных играх
3.2 Модель дифференциальной игры с неопределенностью в движении
и выигрышах с использованием непрерывного байесовского обновления87
3.2.1 Непрерывное байесовское обновление
3.2.2 Теоремы о сильной сходимости представлений при неопределенности в уравнении движения
3.2.3 Теоремы о сильной сходимости представлений при неопределенности функции выигрыша
3.3 Контроль загрязнения в непрерывном времени с неопределенностью
в движении и выигрышах
3.3.1 Квантование неопределенности
3.3.2 Построение равновесия Нэша с непрерывным обновлением представлений в контроле загрязнения
3.3.3 Сравнительные симуляции динамического и непрерывного байесовского обновления
3.4 Заключение
Заключение
Благодарности
Список литературы
Введение
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Дифференциальные игры с неопределенными моментами переключений2026 год, кандидат наук Е Пэйчэнь
Динамическое и непрерывное обновление информации в моделях конфликтного управления2022 год, доктор наук Петросян Ованес Леонович
Кооперативные решения в теоретико-игровых моделях природопользования и инвестирования с динамическим обновлением информации2026 год, кандидат наук Ван Цзэян
Оптимальное управление сложными системами в задачах эколого-экономического менеджмента2025 год, кандидат наук Ву Ийлунь
Развитие метода сравнения для управляемых систем и вычислительная сложность вспомогательных подзадач2002 год, доктор физико-математических наук Лакеев, Анатолий Валентинович
Введение диссертации (часть автореферата) на тему «Динамическое и непрерывное байесовское обновление в многoагентном моделировании»
Актуальность темы диссертации
Неопределенность является фундаментальной характеристикой многих реальных систем, особенно в таких областях, как управление окружающей средой, «рыбные войны» и экономика. Внутренняя сложность и непредсказуемость этих систем делают принятие решений крайне сложной задачей для политиков и лидеров отрасли. Традиционные модели, особенно те, что применяются в теории игр, часто основываются на детерминированных предположениях, согласно которым игроки обладают полной информацией о динамике системы и структурах выигрышей. Однако такие предположения редко выполняются на практике. Динамическая природа экологических процессов и экономических рынков состоит в том, что ключевые параметры — такие как скорость поглощения загрязнений, темпы восстановления ресурсов и даже рыночные реакции — часто неизвестны или известны только частично.
Данная диссертация решает эти критические проблемы, вводя динамическое байесовское обновление для игр с дискретным временем и непрерывное байесовское обновление для дифференциальных игр. Эти подходы позволяют игрокам итеративно обновлять свои представления о неизвестных параметрах по мере получения новой информации. Меняя свои стратегии в ответ на эти изменения, игроки могут принимать более обоснованные решения даже в условиях неопределенности. Эта способность особенно актуальна в таких сферах, как контроль загрязнений, где долгосрочные экологические последствия выбросов и меры по их сокращению до конца не изучены, и в «рыбных войнах», где доступность природных ресурсов меняется из-за факторов, находящихся вне человеческого контроля.
Управление окружающей средой является одной из самых актуальных глобальных задач, включая такие вопросы, как изменение климата, контроль загрязнений и истощение ресурсов, которые находятся в центре внимания поли-
тической, научной и промышленной повестки. Неопределенности в этих областях многочисленны и разнообразны. Например, точная взаимосвязь между выбросами углерода и повышением глобальной температуры остается предметом продолжающихся научных исследований. Аналогично, скорости, с которыми океаны и леса поглощают загрязнения, значительно варьируются в зависимости от местных условий, что делает трудным прогнозирование долгосрочных последствий человеческой деятельности для экосистем.
Необходимость адаптивного и гибкого принятия решений в этом контексте критически важна. Статические модели, которые не учитывают неопределенности, часто приводят к субоптимальным решениям, которые либо переоценивают, либо недооценивают необходимые меры. Например, чрезмерно консервативные подходы могут иметь неоправданно высокие экономические расходы на отрасли, тогда как излишне оптимистичные стратегии могут привести к деградации окружающей среды или неспособности выполнить международные обязательства, к примеру, Парижское соглашение.
Интеграция байесовского обновления в динамические игры предоставляет более точный и эффективный подход к принятию решений в области экологии. Это позволяет политикам и промышленности корректировать свои стратегии по мере получения новых данных, улучшая точность прогнозов и эффективность мер. Этот адаптивный процесс особенно полезен в долгосрочном управлении окружающей средой, где последствия сегодняшних действий могут проявиться только через десятилетия. Возможность пересматривать стратегии с течением времени по мере появления новых научных знаний и экологических сигналов является ключевым преимуществом динамического байесовского подхода.
Ресурсоемкие отрасли, такие как рыбное хозяйство, лесное хозяйство и добыча полезных ископаемых, сталкиваются с аналогичными проблемами из-за непредсказуемости экологических факторов и доступности ресурсов. Во многих случаях количество доступных для добычи ресурсов колеблется из-за природных процессов, таких как погодные условия или экологические циклы.
Например, в рыбном хозяйстве скорость восстановления рыбных запасов определяется сложным взаимодействием биологических, экологических и экономических факторов. Рыбаки должны определять объемы вылова, не истощая ресурс, что осложняется неполной информацией о текущем состоянии рыбных популяций. В этом контексте динамическое и непрерывное байесовское обнов-
ление позволяет игрокам (компаниям, правительствам или кооперативам) корректировать свои стратегии на основе новых данных о запасах, рыночных ценах и экологических условиях.
В играх по контролю за загрязнением, где страны или отрасли сталкиваются с неопределенностями относительно своих и чужих затрат на сокращение выбросов, асимметрия информации может приводить к субоптимальным или даже конфликтным стратегиям. Получая сигналы (например, рыночные цены на углеродные квоты или наблюдаемые изменения уровней загрязнения), игроки могут обновлять свои представления о неизвестных параметрах, таких как затраты на сокращение выбросов у других игроков, и корректировать свои политики соответственно. Этот адаптивный подход особенно ценен в международных экологических соглашениях, где страны должны координировать свои усилия для достижения глобальных целей, таких как сокращение выбросов парниковых газов несмотря на недостаток знаний об экологических и экономических последствиях своих действий.
Таким образом, внедрение динамического и непрерывного байесовского обновления в модели теории игр открывает новые возможности для адаптивного и реалистичного подхода к принятию решений в условиях неопределенности и изменяющихся систем.
Степень разработанности проблемы в литературе
Изучение динамических игр, особенно тех, которые связаны с неопределенностями в движении и выигрышах, значительно развивалось за последние несколько десятилетий. Исторически большинство моделей теории игр исходили из предположения о совершенной информации, где игроки полностью осведомлены обо всех параметрах и структуре игры [59, 23, 85, 25, 50]. Структура игры относится к правилам, которые определяют эволюцию игры, включая расчет выигрышей и формулировку уравнений движения [68]. Однако в реальных приложениях это предположение редко выполняется. Разнообразные формы неопределенности, такие как экологическая волатильность [1], неполные данные и непредсказуемое поведение других игроков [48], являются общими проблемами в динамических системах [77, 28, 76]. Эти неопределенности особенно значимы в области управления окружающей средой, где неизвестные параметры могут сильно повлиять на результаты динамических систем [45, 51]. Например, в контроле за загрязнением непредсказуемые факторы, такие как
скорость, с которой загрязнение рассеивается в атмосфере или океанах, представляют собой значительные проблемы для принимающих решения. Это привело к росту исследований, направленных на разработку методов управления этими неопределенностями, при этом байесовское обновление стало ключевым подходом в динамических играх [51, 29, 84].
Ранние модели динамических игр в основном концентрировались на детерминированных системах, где состояние игры развивалось предсказуемо на основе известных уравнений и фиксированных параметров [77, 76, 41]. Эти работы заложили основы теории динамических игр с акцентом на равновесие Нэша и методы оптимизации в многопользовательских сценариях.
Наш метод динамического байесовского обновления тесно связан с онлайн-байесовским обучением [16, 46, 79], где распределения версий по неизвестным параметрам обновляются поочередно с каждым новым сигналом или наблюдением. В области обработки сигналов байесовский подход предоставляет надежную основу для оценки неизвестных параметров [12, 74]. Интегрируя предварительные знания с постоянно поступающими сигналами, байесовские методы позволяют исследователям динамически обновлять свои представления о неизвестных параметрах. Каждое новое поступление уточняет апостериорное распределение, постепенно улучшая точность модели [27, 87, 75]. В нашей модели внимание сосредоточено на поэтапном обновлении ожидаемого распределения неизвестного параметра при получении каждого нового сигнала.
Expected trajectory Real
trajectory
О
t
t+1 t+2
Рис. 1: Реальная траектория и ожидаемая траектория В моделях игр с динамическим байесовским обновлением на рисунке 1 пред-
полагается, что игроки:
1. В текущий момент времени £ = 0,1,..., ж имеют информацию об уравнениях движения, функциях выигрыша и своих представлениях относительно неизвестного параметра на сокращенном временном интервале £,£ + 1,... ,£ + Т, длина которого определяется информационным горизонтом
Т.
2. Непрерывно или в любой момент времени £ = £, £ + 1,..., £ + Т получают обновлённую информацию об уравнениях движения, функциях выигрыша и неизвестном параметре, адаптируясь в реальном времени к обновлённой информации.
Однако в отличие от традиционного байесовского обучения [52, 34], где цель обычно заключается в обновлении полного апостериорного распределения, наш подход отслеживает конкретный итеративный процесс обновления математического ожидания неизвестного среднего нормального распределения. Это непрерывное обновление представлений оказалось особенно эффективным в динамических играх, где неопределенность является ключевой проблемой для предсказания результатов [56, 98]. Интегрируя этот подход, новые модели теории игр были адаптированы для лучшего учета реальных сценариев, что повышает точность и актуальность решений в случаях, когда у игроков нет совершенной информации [70, 39, 40].
Неопределенность в параметрах уравнения движения относится к ситуациям, когда правила эволюции системы известны, но конкретные параметры остаются неизвестными. Точно так же неопределенность в параметрах функции выигрыша означает, что расчет выигрыша известен, но некоторые параметры не определены. Эти неопределенности часто упрощаются как неопределенность в уравнении движения или функции выигрыша. С другой стороны, неопределенность в структуре игры означает, что точные правила, регулирующие эволюцию игры и расчет выигрыша, не полностью известны.
В динамических играх неопределенность структуры и движения обычно имеет два основных источника: параметры уравнения движения [51] и структура самой игры [63, 70]. Неопределённость в структуре и выигрышах возникает из-за неизвестных параметров в уравнениях, описывающих эволюцию системы, в то время как неопределённость в выигрышах в игре связана с неизвестными
вознаграждениями или штрафами за различные действия [98, 63]. Оба вида неопределенности усложняют процесс принятия решений для игроков, вынуждая их непрерывно обновлять свои стратегии на основе неполной или изменяющейся информации [56, 35, 36].
В работе [63] представлен метод динамического обновления, который позволяет игрокам получать непрерывные обновления о неопределённости структуры игры по мере её развития. Этот метод впоследствии был расширен в ряде исследований [63, 64, 66, 67, 96, 26], предлагая комплексный подход для решения вопросов неопределённости в динамических играх.
В этих моделях информация об уравнениях движения и функциях выигрыша обновляется через определённые интервалы времени, при этом временные рамки, в которые игроки могут получать новую информацию, определяются информационным горизонтом. Этот подход позволяет игрокам принимать более рациональные стратегические решения по мере того, как игра развивается и поступает новая информация.
Другим важным вкладом стала работа [64], в которой метод динамического обновления был применён к стохастическим прогнозам в дифференциальных играх. Игроки получали информацию о состоянии системы в реальном времени, что позволяло им непрерывно корректировать свои представления о неизвестных параметрах в уравнениях движения [64, 26]. Это оказалось особенно эффективным в кооперативных играх, где игроки делились информацией для достижения взаимовыгодных результатов [26, 95, 96].
Введение метода непрерывного обновления, исследованного в [70], значительно продвинуло развитие этой области, позволяя игрокам уточнять свои представления о динамике системы в реальном времени. Это оказалось особенно полезным в дифференциальных играх, где состояние системы эволюционирует непрерывно [70, 39]. Сочетание динамического и непрерывного обновления чрезвычайно эффективно для решения проблемы неопределённости в движении и структуре в различных приложениях, включая управление окружающей средой и экономику [35, 36].
В играх по извлечению ресурсов, например, где доступность ресурсов (таких как запасы рыбы или темпы восстановления лесов) колеблется непредсказуемо, динамическое обновление предоставляет устойчивый и адаптируемый подход к управлению неопределённостями [56, 88]. В исследовании [88] байесовское об-
новление применяется к модели стохастической дифференциальной игры, свои стратегии на основе новой информации о доступности ресурсов.
Байесовское обновление также оказалось чрезвычайно эффективным в контексте кооперативных дифференциальных игр, где игроки работают вместе для достижения общих целей. Исследование [26] продемонстрировало, что, делясь информацией и непрерывно обновляя свои представления о динамике системы, игроки могут достигать более эффективных и стабильных результатов в кооперативных играх.
Теория дифференциальных игр была определена в [32] и положила начало созданию формальной математической основы для моделирования принятия решений: в играх п лиц в непрерывном времени. В этом случае стратегии игроков эволюционируют непрерывно, по мере поступления новой информации, что имеет множество приложений в некооперативных играх, связанных с управлением ресурсами [91], экономической конкуренцией [82] и военной тактикой [86]. Равновесие Нэша остается основным понятием для определения оптимальных стратегий в некооперативных дифференциальных играх, важный вклад в которые внесли работы [2, 14].
Таким образом, применение динамического и непрерывного байесовского обновления вышло за рамки теоретических моделей и стало применяться в реальных задачах. Например, в контроле загрязнения воздуха, где уровень загрязнения зависит от непредсказуемых метеорологических факторов, байесовское обновление позволяет непрерывно обновлять стратегии на основе данных в реальном времени, что приводит к более рациональным решениям [51, 70]. Точно так же в играх по добыче ресурсов, таких как рыболовство или лесоводство, доступность ресурсов часто непредсказуемо колеблется. Динамическое обновление позволяет игрокам более эффективно реагировать на эти колебания, обеспечивая устойчивое использование ресурсов с течением времени [56, 88].
В заключение, байесовское обновление является мощным инструментом в теории динамических игр, решая неопределенности в движении, структуре и выигрышах. Непрерывно уточняя стратегии с помощью обновлений в реальном времени, игроки могут принимать более адаптивные решения в сложных условиях. По мере развития исследований динамическое и непрерывное байесовское обновление останется важнейшим инструментом для улучшения принятия решений в неопределенных динамических системах.
Цель и задачи диссертации
Цель диссертации заключается в разработке новых классов моделей управления конфликтами, включая динамические игры с неопределенностью в движении и структуре, динамические игры с неопределенностью выигрыша и в уравнениях движения а также дифференциальные игры с неопределенностью выигрыша и уравнений движения. Диссертация сосредоточена на методах построения некооперативных стратегий с использованием динамического и непрерывного обновления представлений, а также разработке процедур для нахождения соответствующих решений равновесия Нэша. Наиболее важным является исследование точной формы динамического и непрерывного обновления представлений для неопределенностей в уравнениях движения и функциях выигрыша, что позволяет игрокам обновлять свои представления по мере поступления новой информации. Кроме того, целью является доказательство сходимости этих процессов обновления представлений и соответствующих оптимальных стратегий. Также целью является разработка приложения для реализации подходов непрерывного байесовского обновления и динамического байесовского обновления с акцентом на их различия в управлении неопределенностью и предоставление конкретных результатов моделирования.
Указанная цель достигается решением следующих задач диссертации:
1. Разработать новые классы моделей управления конфликтами, включая динамические игры с неопределенностью в движении и структуре, динамические игры с неопределенностью в выигрышах и в уравнениях движения а также дифференциальные игры с неопределенностью в выигрышах и в уравнениях движения.
2. Разработать методы построения некооперативных стратегий с использованием динамического и непрерывного обновления представлений, а также методы определения соответствующих решений равновесия Нэша.
3. Исследовать формы динамического и непрерывного обновления представлений для неопределенностей в уравнениях движения и функциях выигрыша при условии, что игроки могут пересматривать свои представления по мере поступления новой информации.
4. Доказать сходимость процессов обновления представлений и соответству-
ющих оптимальных стратегий при динамическом и непрерывном обновлении.
5. Сравнить подходы непрерывного байесовского обновления и динамического байесовского обновления, концентрируясь на их различиях в управлении неопределенностью.
6. Предоставить конкретные результаты моделирования, демонстрирующие применение непрерывного байесовского обновления и динамического байесовского обновления в реальных сценариях.
Научная новизна
Данная диссертация вводит понятие динамического и непрерывного байесовского обновления в рамках теории игр, рассматривая неопределенности как в движении и структуре, так и в выигрышах и уравнениях движения. Она расширяет традиционную теорию игр, формализуя методы управления реальными неопределенностями в динамических системах.
Первый аспект новизны заключается в адаптации байесовского обновления на динамическую структуру, что превращает его из одноэтапного процесса в многоэтапный. Это позволяет игрокам обновлять свои представления на разных стадиях, динамически корректируя стратегии в условиях неопределенности, которая сохраняется во времени.
Второй аспект новизны — разработка теорем о сильной сходимости представлений для игр с неопределенностями как в уравнениях движения, так и в структурах выигрыша. Эти теоремы расширяют область применения байесовского обновления к более сложным динамическим играм, обеспечивая строгую основу для принятия решений в условиях неопределенности.
Дополнительным вкладом является применение непрерывного байесовского обновления в дифференциальных играх. Данная работа расширяет метод динамического обновления для модели с непрерывным временем. Мы являемся первыми, кто предлагает интеграцию представлений в дифференциальные уравнения, что способствует улучшению принятия решений в реальном времени в быстро изменяющихся системах.
Методы исследования
В диссертации используются методы исследования динамических и дифференциальных игр (конструирование динамических и дифференциальных игр и
подыгр), теорию некооперативных игр (профиль стратегий Нэша, соответствующая траектория), теорию оптимального управления (динамическое программирование, принцип максимума Понтрягина), математического анализа (сходимость представлений и соответствующая дисперсия), теорию оптимизации и теорию вероятностеи (распределения случайных величин, Теорема о сходимости Колмогорова, Эргодическая теорема, Байесовский вывод).
Теоретическая и практическая значимость
Теоретическое значение данной диссертации заключается в развитии теории динамических игр путем построения байесовского обновления для учета неопределенности в движении и структуре и неопределенности в функциях выигрыша. В отличие от традиционных моделей, которые предполагают полную информацию или детерминированные структуры, данное исследование формализует процесс динамического обновления представлений и стратегий игроков в ответ на новую информацию. Разработка теорем о сходимости представлений и интеграция непрерывного байесовского обновления в дифференциальные игры являются важными теоретическими достижениями, расширяющими текущее знание в данной области.
В главе 1 разрабатываются модели динамического байесовского обновления для учета неопределенности в структуре и движении в динамических играх, где точные правила эволюции системы и расчета выигрышей полностью не определены, а также неизвестны конкретные параметры в уравнениях движения. Практическое значимость модели заключается в контроле загрязнения, где политики корректируют стратегии в соответствии с изменяющимися экологическими условиями, что способствует улучшению устойчивости и точности.
В главе 2 исследуются неопределенности как в уравнениях движения, так и в функциях выигрышей, уделяется внимание случаям, в которых правила эволюции системы и расчета выигрышей известны, но некоторые параметры остаются неопределенными. Формулируются теоремы о сильной сходимости представлений, которые обеспечивают строгую основу для байесовского обновления. Практическое приложение можно наблюдать в добыче ресурсов, например, в игре «рыбные войны», где эволюция факторов влияет на оптимальные стратегии добычи.
В главе 3 непрерывное Байесовское обновление интегрируется в модель дифференциальных игр, что значительно улучшает решение задач неопределен-
ности в системах с непрерывным временем. Этот подход особенно полезен в реальных сценариях, таких как управление загрязнением в непрерывном времени, где динамическое обновление помогает разработать более адаптивные и устойчивые стратегии.
Исследования, проведенные в диссертации, поддерживаются стипендией китайского правительства (CSC) No. 202208010092 (2022-2025).
Краткое описание работы
Диссертация состоит из введения, трех основных глав, заключения и списка литературы. Каждая глава начинается с изложения модели, представления основных определений и формулировки задачи. Результаты представлены через сочетание теоретических утверждений и числовых примеров для разъяснения ключевых понятий. Объем диссертации составляет 113 страниц (в русской версии 124 страницы), включает 1 таблицу и 22 рисунка для поддержки анализа. Список литературы содержит 108 источников, упорядоченных в алфавитном порядке.
Первая глава вводит понятие неопределённости в движении и структуре в дискретных играх, что подразумевает ситуации, когда правила, определяющие эволюцию системы и расчёт выигрышей, не полностью заданы, а конкретные параметры в уравнениях движения остаются неизвестными. В разделе 1.1 представляются три различных информационных сценария для игроков, начиная с полного знания распределения случайной величины в уравнении движения и структуры игры и заканчивая постепенным приобретением этой информации через процессы обучения. В разделе 1.2 проводятся глубокий анализ байесовского обновления в контексте нормальных распределений и сравнение статистических и динамических моделей. В этом разделе также определяются теоремы о слабой сходимости представлений. В разделе 1.3 демонстрируется применение динамического байесовского обновления к задаче управления загрязнением, где для учета динамических обновлений представлений игроков выводится равновесие Нэша с использованием уравнения Гамильтона-Якоби-Беллмана (ГЯБ). Наконец, раздел 1.4 представляет собой краткое изложение основных выводов и вкладов исследования.
Вторая глава строится на концепциях, введенных в первой главе, в ней рассматривается неопределенность в выигрыше. В разделе 2.1 определяется математическая основа, необходимая для исследования, что закладывает базу для
последующего анализа. В разделе 2.2 вводится методология обновления представлений в условиях неопределенности как в уравнениях движения, так и в функциях выигрыша. Этот раздел также включает в себя доказательства теорем о сильной сходимости представлений при неопределенности в уравнениях движения и неопределенности в функциях выигрыша. В разделе 2.3 мы применяем эти методы к практическим задачам, рассматривая игру по борьбе за рыболовные ресурсы на бесконечном интервале времени и задачу контроля загрязнения на конечном интервале времени. Обе эти задачи связаны с неопределенностью в выигрышах и движении. Наконец, раздел 2.4 представляет собой краткое изложение основных выводов и вклада исследования.
В главе 3 данной диссертации, состоящей из нескольких разделов, рассматриваются сложности дифференциальных игр при неопределенности в выигрыше и движении. В разделе 3.1 вводится модель дифференциальной игры, учитывая неопределенности как в уравнениях движения, так и в функциях выигрыша. В разделе 3.2 исследуется использование непрерывного обновления Байеса для управления этими неопределенностями. Основные достижения здесь — метод непрерывного обновления Байеса и доказательство теорем о сильной сходимости представлений как для неопределенности в уравнениях движения так и для неопределенности в функциях выигрыша. В разделе 3.3 эти модели применяются к реальной задаче — контролю загрязнения в случае непрерывного времени, где неопределенность количественно оценивается, и строится равновесие Нэша с использованием непрерывного обновления Байеса. Наконец, раздел 3.4 завершает главу, подводя итог теоретическим вкладам и практическим приложениям полученных результатов.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Теоретико-игровые методы анализа устойчивости в задачах управления загрязнением окружающей среды2024 год, кандидат наук Су Шимай
Теоретико-игровые задачи со случайной продолжительностью2016 год, кандидат наук Громова, Екатерина Викторовна
Декомпозиционные алгоритмы построения равновесных решений в динамических играх2015 год, кандидат наук Красовский, Николай Андреевич
Кооперация в дискретных линейно-квадратичных играх2015 год, кандидат наук Тур, Анна Викторовна
Динамические сетевые игры2020 год, доктор наук Седаков Артем Александрович
Список литературы диссертационного исследования кандидат наук Чжоу Цзянцзин, 2025 год
Литература
[1] Barry, E. J., Kemerer, C. F. & Slaughter, S. A. Environmental volatility, development decisions, and software volatility: a longitudinal analysis // Management Science 2006. Vol. 52. N. 3. P. 448-464.
[2] Basar, T. & Olsder, G. J. Dynamic Noncooperative Game Theory. Academic Press, London (1995).
[3] Belkaoui, A. The impact of the disclosure of the environmental effects of organizational behavior on the market // Financial Management. 1976. P. 2631.
[4] Berkovitz, L. D. A variational approach to differential games //In Advances in Game Theory 2016. P. 127-174. Princeton University Press.
[5] Bettiol, P., Cardaliaguet, P., & Quincampoix, M. Zero-sum state constrained differential games: Existence of value for Bolza problem // International Journal of Game Theory 2006. Vol. 34. N. 4. P. 495-527.
[6] Bingham, N. H. The work of an Komogorov on strong limit theorems // Theory of Probability & Its Applications. 1990. Vol. 34. N. 1. P. 129-139.
[7] Bloembergen, D., Tuyls, K., Hennes, D., Kaisers, M. Evolutionary dynamics of multi-agent learning: A survey // Journal of Artificial Intelligence Research 2015. Vol. 53. P. 659-697.
[8] Borel, E. Les probabilites denombrables et leurs applications arithmetiques // Rendiconti del Circolo Matematico di Palermo 1909. Vol. 27. Series 2. P. 247271.
[9] Breakwell, J. V. Zero-sum differential games with terminal payoff // In: Hagedorn, P., Knobloch, H. W., & Olsder, G. H. (eds) Differential Game and
Applications. Lecture Notes in Control and Information Sciences. 1977. Vol. 3. Springer, Berlin.
[10] Breton, Michele & Keoula, Michel Yevenunye. A great fish war model with asymmetric players // Ecological Economics 2014. Vol. 97. P. 209-223. Elsevier.
[11] Breton, M., Zaccour, G., Zahaf, M.: A differential game of joint implementation of environmental projects// Automatica 2005. Vol.41(10), P.1737-1749.
[12] Candy, J. V. Bayesian Signal Processing: Classical, Modern, and Particle Filtering Methods. John Wiley & Sons, New Jersey (2016).
[13] Cantelli, F. P. Sulla probability come limite della frequenza // Atti della Accademia Nazionale dei Lincei 1917. Vol. 26. N. 1. P. 39-45.
[14] Chistyakov, S. V. On non-cooperative differential games // Reports of the USSR Academy of Sciences 1981. Vol. 259. N. 5. P. 1052-1055.
[15] Dellink, R. & Finus, M. Uncertainty and climate treaties: Does ignorance pay? // Resour. Energy Econ. 2012. Vol. 34. P. 565-584.
[16] Djuric, P. M. Sequential estimation of signals under model uncertainty // In: Sequential Monte Carlo Methods in Practice. New York, NY: Springer New York, 2001. P. 381-400.
[17] Dockner, E. J. & Van Long, N. International Pollution Control: Cooperative versus Noncooperative Strategies // Journal of Environmental Economics and Management 1993. Vol. 25. N. 1. P. 13-29.
[18] Elsawah, S., Pierce, S. A., Hamilton, S. H., Van Delden, H., Haase, D., Elmahdi, A., Jakeman, A. J. An overview of the system dynamics process for integrated modelling of socio-ecological systems: Lessons on good modelling practice from five case studies // Environmental Modelling & Software 2017. Vol. 93. P. 127145.
[19] Feller, W. An Introduction to Probability Theory and Its Applications. Vol. 1. Wiley, New York (1968). P. 227.
[20] Fischer, Ronald D. & Mirman, Leonard J. Strategic dynamic interaction: fish wars // Journal of Economic Dynamics and Control 1992. Vol. 16. N. 2. P. 267-287. Elsevier.
[21] Fleming, W. H. The convergence problem for differential games II // Advances in Game Theory 1964. Vol. 52. P. 195-210.
[22] Fubini, G. Sugli integrali multipli // Rom. Acc. L. Rend. 1907. Vol. 16. N. 1. P. 608-614. Series 5. JFM 38.0343.02.
[23] Fudenberg, D. & Tirole, J. Game Theory. MIT Press (1991).
[24] Ghavamzadeh, M., Mannor, S., Pineau, J., & Tamar, A. Bayesian reinforcement learning: A survey // Foundations and Trends in Machine Learning 2015. Vol. 8. N. 5-6. P. 359-483.
[25] Gintis, H. Game Theory Evolving: A Problem-Centered Introduction to Modeling Strategic Interaction. Princeton University Press (2000).
[26] Gromova, E. & Petrosian, O. Control of information horizon for cooperative differential game of pollution control // In: 2016 International Conference Stability and Oscillations of Nonlinear Control Systems (Pyatnitskiy's Conference), 2016.
[27] Harrison, P. J. & Stevens, C. F. Bayesian forecasting // Journal of the Royal Statistical Society 1978. Vol. 38. N. 3. P. 205-247.
[28] Haurie, A., Krawczyk, J. B., & Zaccour, G. Games and Dynamic Games, volume 1. World Scientific Publishing Company, Singapore (2012).
[29] Horner, J., Takahashi, S. & Vieille, N. Truthful equilibria in dynamic Bayesian games // Econometrica 2015. Vol. 83. N. 5. P. 1795-1848.
[30] Huang, L. & Zhu, Q. Analysis and computation of adaptive defense strategies against advanced persistent threats for cyber-physical systems // In: Decision and Game Theory for Security: 9th International Conference, GameSec 2018, Seattle, WA, USA, October 29-31, 2018, Proceedings 2018. P. 205-226. Springer.
[31] Ieong, S. & Shoham, Y. Bayesian coalitional games // In: AAAI 2008. P. 95100.
[32] Isaacs, R. Differential Games: A Mathematical Theory with Applications to Warfare and Pursuit, Control and Optimization. John Wiley and Sons, New York (1965).
[33] Jonidi Jafari, A., Charkhloo, E., & Pasalari, H. Urban air pollution control policies and strategies: a systematic review // Journal of Environmental Health Science and Engineering, 2021. Vol. 19. P. 1911-1940.
[34] Kelly, D. L., & Kolstad, C. D. Bayesian learning, growth, and pollution // Journal of Economic Dynamics and Control, 1999. Vol. 23. N. 4. P. 491-518.
[35] Kolstad, C. Systematic uncertainty in self-enforcing international environmental agreements // J. Environ. Econ. Manag. 2007. Vol. 53. P. 68-79.
[36] Kolstad, C. & Ulph, A. Learning and international environmental agreements // Clim. Chang. 2008. Vol. 89. P. 125-141.
[37] Koulovatianos, C., Mirman, L. J. & Santugini, M. Optimal growth and uncertainty: Learning // Journal of Economic Theory 2009. Vol. 144. N. 1. P. 280-295.
[38] Krasovsky, N. N. Control of Dynamical System: Problem of Minimum Guaranteed Result. Science, Moscow (1985).
[39] Kuchkarov, I. & Petrosian, O. On class of linear quadratic non-cooperative differential games with continuous updating //In International Conference on Mathematical Optimization Theory and Operations Research, 2019. P. 635-650. (Springer).
[40] Kuchkarov, I. & Petrosian, O. Open-loop based strategies for autonomous linear quadratic game models with continuous updating // In International Conference on Mathematical Optimization Theory and Operations Research, 2020. P. 212-230. (Springer).
[41] Kumar, P. & Van Schuppen, J. On Nash equilibrium solutions in stochastic dynamic games // IEEE Transactions on Automatic Control 1980. Vol. 25. N. 6. P. 1146-1149.
[42] Levhari, D. & Mirman, L. J. The great fish war: an example using a dynamic Cournot-Nash solution //In Fisheries Economics, Volume II 2020. P. 49-61. Routledge.
[43] Lewis, F. L., Vrabie, D., Syrmos, V. L. Optimal Control. John Wiley & Sons, Hoboken, New Jersey (2012).
[44] L'Hospital, G. F. A., Marquis de. Analyse des Infiniment Petits. 1696. P. 145146.
[45] Long, N. V. A differential game approach // Annals Oper. Res. 1992. Vol. 37. P. 283-296.
[46] Lopes, H. F. & Carvalho, C. M. Online Bayesian learning in dynamic models: an illustrative introduction to particle methods // Hierarchical Models and Markov Chain Monte Carlo 2013.
[47] Lopez, V. G., Wan, Y. & Lewis, F. L. Bayesian graphical games for synchronization in networks of dynamical systems // IEEE Transactions on Control of Network Systems 2019. Vol. 7. N. 2. P. 1028-1039.
[48] Lou, H. H., Kulkarni, M. A., Singh, A., et al. A game theory based approach for emergy analysis of industrial ecosystem under uncertainty // Clean Technologies and Environmental Policy 2004. Vol. 6. P. 156-161.
[49] Luo, Y., Yuan, H., Hu, Z., et al. Optimal scheduling of micro-energy grid based on Pareto frontier under uncertainty and pollutant emissions // IEEE Transactions on Smart Grid, 2023. Vol. 15. N. 1. P. 368-380.
[50] Mas-Colell, A., Whinston, M. D. & Green, J. R. Microeconomic Theory. Oxford University Press (1995).
[51] Masoudi, N., Santugini, M. & Zaccour, G. A dynamic game of emissions pollution with uncertainty and learning // Environmental and Resource Economics 2016. Vol. 64. P. 349-372.
[52] Mathys, C., Daunizeau, J., Friston, K. J., & Stephan, K. E. A Bayesian foundation for individual learning under uncertainty // Frontiers in Human Neuroscience, 2011. Vol. 5. P. 39.
[53] Mazalov, V., Parilina, E. & Zhou, J. Altruistic-like equilibrium in a differential game of renewable resource extraction // In International Conference on Mathematical Optimization Theory and Operations Research, 2021. P. 326-339. Springer.
[54] Mazalov, V. & Zhou, J. Dynamic stability of coalition formation in dynamic games // Operations Research Letters. 2024. Vol. 55. P. 107138.
[55] Meinhold, R. J. & Singpurwalla, N. D. Understanding the Kalman filter // The American Statistician 1983. Vol. 37. N. 2. P. 123-127.
[56] Mirman, L. J. & Santugini, M. Learning and technological progress in dynamic games // Dynamic Games and Applications 2014. Vol. 4. P. 58-72.
[57] Muller, P., Quintana, F. A., & Rosner, G. L. Online learning through Bayesian updating in clinical trials // Biometrics 2012. Vol. 68. N. 4. P. 1149-1159.
[58] Murphy, K. P. Conjugate Bayesian analysis of the Gaussian distribution // def. 2007. Vol. 1. P. 16.
[59] Osborne, M. J. & Rubinstein, A. A Course in Game Theory. MIT Press (1994).
[60] Papoulis, A. & Pillai, S. U. Probability, Random Variables, and Stochastic Processes. McGraw-Hill Europe, New York, NY (2002).
[61] Park, K. I., M. Park & James. Fundamentals of Probability and Stochastic Processes with Applications to Communications. Springer, Holmdel, New Jersey, USA (2018).
[62] Petrosyan, L. A. & Murzov, N. V. Game-theoretic problems in mechanics // Lithuanian Mathematical Collection 1966. Vol. 3. P. 423-433.
[63] Petrosian, O. L. Looking forward approach in cooperative differential games with infinite horizon // Vestnik S.-Petersburg Univ. Ser. 10. Prikl. Mat. Inform. Prots. Upr. 2016. Vol. 4. P. 18-30.
[64] Petrosian, O. L. & Barabanov, A. E. Looking forward approach in cooperative differential games with uncertain-stochastic dynamics // Journal of Optimization Theory and Applications 2017. Vol. 172. P. 328-347.
[65] Petrosian, O., Denis, T., Zhou, J. J. & Gao, H. W. Differential game model of resource extraction with continuous and dynamic updating // J. Oper. Res. Soc. China. 2024. Vol. 12. P. 51-75.
[66] Petrosian, O. L., Nastych, M. A., & Volf, D. A. Differential game of oil market with moving informational horizon and non-transferable utility //In 2017 Constructive Nonsmooth Analysis and Related Topics (dedicated to the memory of V. F. Demyanov), 2017.
[67] Petrosian, O. L., Nastych, M. A., & Volf, D. A. Non-cooperative differential game model of oil market with looking forward approach //In Frontiers of Dynamic Games, Game Theory and Management, St. Petersburg, 2017. Eds. L. A. Petrosyan, V. V. Mazalov, N. Zenkevich. Birkhauser, Basel, 2018.
[68] Petrosian, O., Tur, A. Hamilton-Jacobi-Bellman equations for non-cooperative differential games with continuous updating.// In: Bykadorov, I., Strusevich, V., Tchemisova, T. (eds) Mathematical Optimization Theory and Operations Research. MOTOR 2019. Communications in Computer and Information Science, vol 1090. Springer, Cham, 2019, pp. 256-270.
[69] Petrosian, O., Tur, A., Wang, Z. & Gao, H. Cooperative differential games with continuous updating using Hamilton-Jacobi-Bellman equation // Optim. Methods Softw. 2020. P. 1-29.
[70] Petrosian, O., Tur, A. & Zhou, J. Pontryagin's maximum principle for non-cooperative differential games with continuous updating.// In: Kochetov, Y., Bykadorov, I., Gruzdeva, T. (eds) Mathematical Optimization Theory and Operations Research. MOTOR 2020. Communications in Computer and Information Science, vol 1275. Springer, Cham, 2020.
[71] Pontryagin, L. S. On the theory of differential games // Successes of Mathematical Sciences 1966. Vol. 26. N. 4 (130). P. 219-274.
[72] Prokhorov, Y. V. Convergence of random processes and limit theorems in probability theory // Theory of Probability & Its Applications 1956. Vol. 1. N. 2. P. 157-214.
[73] Qin, M., Sun, M. & Li, J. Impact of environmental regulation policy on ecological efficiency in four major urban agglomerations in eastern China // Ecological Indicators 2021. Vol. 130. P. 108002.
[74] Ruanaidh, J. J. K. O. & Fitzgerald, W. J. Numerical Bayesian Methods Applied to Signal Processing. Springer Science & Business Media, Cambridge (2012).
[75] Russell, S. & Norvig, P. Artificial Intelligence: A Modern Approach. Prentice Hall (2003).
[76] Schofield, N. Instability of simple dynamic games // The Review of Economic Studies 1978. Vol. 45. N. 3. P. 575-594.
[77] Shoham, Y. & Leyton-Brown, K. Multiagent Systems: Algorithmic, Game-Theoretic, and Logical Foundations. Cambridge University Press, Cambridge (2008).
[78] Shokri, R. Privacy games: Optimal user-centric data obfuscation // arXiv preprint arXiv:1402.3426 (2014).
[79] Solla, S. A. & Winther, O. Optimal perceptron learning: an online Bayesian approach // On-line Learning in Neural Networks 1998. P. 1-20.
[80] Stavins, R. N. Transaction costs and tradeable permits // Journal of Environmental Economics and Management 1995. Vol. 29. N. 2. P. 133-148.
[81] Stearns, S. D. Adaptive Signal Processing. Prentice-Hall (1985).
[82] Telser, L. G. Competition, Collusion, and Game Theory. Routledge, 2017.
[83] Ummenhofer, C. C. & Meehl, G. A. Extreme weather and climate events with ecological relevance: a review // Philosophical Transactions of the Royal Society B: Biological Sciences 2017. Vol. 372. N. 1723. Article 20160135.
[84] Vasal, D., Sinha, A. & Anastasopoulos, A. A systematic process for evaluating structured perfect Bayesian equilibria in dynamic games with asymmetric information // IEEE Transactions on Automatic Control 2018. Vol. 64. N. 1. P. 81-96.
[85] von Neumann, J. & Morgenstern, O. Theory of Games and Economic Behavior. Princeton University Press (1944).
[86] Vorobeychik, Y., & Porche III, I. R. Game-theoretic methods for analysis of tactical decision-making using agent-based combat simulations // Military Operations Research, 2009. P. 21-39.
[87] Wainwright, M. J. & Jordan, M. I. Graphical models, exponential families, and variational inference // Foundations and Trends in Machine Learning 2008. Vol. 1. N. 1-2. P. 1-305.
[88] Wang, C., Liu, J., Fan, R. & Xiao, L. Promotion strategies for environmentally friendly packaging: a stochastic differential game perspective // Int. J. Environ. Sci. Technol. 2023. Vol. 20. P. 7559-7568.
[89] Wang, Z. & Petrosian, O. On class of non-transferable utility cooperative differential games with continuous updating // J. Dyn. & Games. 2020. Vol. 7. P. 291-302.
[90] Welch, G., Bishop, G., et al. An introduction to the Kalman filter (1995).
[91] Xu, X., & Yu, H. A game theory approach to fair and efficient resource allocation in cloud computing // Mathematical Problems in Engineering, 2014. Vol. 2014. N. 1. P. 915878.
[92] Yang, X. & Gao, J. Linear-quadratic uncertain differential game with application to resource extraction problem // IEEE Transactions on Fuzzy Systems 2015. Vol. 24. N. 4. P. 819-826.
[93] Yeung, D. W. K. Dynamically consistent solution for a pollution management game in collaborative abatement with uncertain future payoffs // International Game Theory Review, 2008. Vol. 10. N. 4. P. 517-538.
[94] Yeung, D. W. K., & Petrosyan, L. A. Generalized dynamic games with durable strategies under uncertain planning horizon // Journal of Computational and Applied Mathematics, 2021. Vol. 395. P. 113595.
[95] Yeung, D. & Petrosian, O. Cooperative stochastic differential games with information adaptation // In: International Conference on Communication and Electronic Information Engineering (CEIE 2016), 2016. P. 375-381. (Atlantis Press).
[96] Yeung, D. & Petrosian, O. Infinite horizon dynamic games: A new approach via information updating // International Game Theory Review 2017. Vol. 19. P. 1-23.
[97] Yuan, Q., Yan, F., Yin, Z., et al. Decision-Making and Planning Methods for Autonomous Vehicles Based on Multistate Estimations and Game Theory // Advanced Intelligent Systems, 2023. Vol. 5. N. 11. P. 2300177.
[98] Zamir, S. Bayesian Games: Games with Incomplete Information. Springer (2020).
[99] Zhang, C., Gholami, S., Kar, D., Sinha, A., Jain, M., Goyal, R. & Tambe, M. Keeping pace with criminals: An extended study of designing patrol allocation against adaptive opportunistic criminals // Games 2016. Vol. 7. N. 3. Article 15.
[100] Zhou, J., Petrosian, O. & Gao, H. Enhancing ecological uncertainty predictions in pollution control games through dynamic Bayesian updating // Scientific Reports 2024. Vol. 14. N. 1. P. 12594. Nature Publishing Group UK, London.
[101] Zhou, J., Petrosian, O. L. & Gao, H. Dynamic decision-making under uncertainty: Bayesian learning in environmental game theory // Vestnik of St. Petersburg University. Applied Mathematics. Computer Science. Control Processes 2024. Vol. 20. N. 2. P. 289-297.
[102] Zhou, J. & Petrosian, O. Bayesian learning in "Fish Wars": Dynamic assessment of unknown states and private information // Mathematical Game Theory and its Applications 2024. Vol. 16. N. 2. P. 92-112.
[103] Zhou, J., Tur, A., Petrosian, O. & Gao, H. Transferable utility cooperative differential games with continuous updating using Pontryagin's maximum principle // Mathematics 2021. Vol. 9. N. 2. P. 163.
[104] Zhou, J., Mazalov, V. (2024). Dynamic stability of coalition structures in network-based pollution control games // In: Eremeev, A., Khachay, M., Kochetov, Y., Mazalov, V., Pardalos, P. (eds) Mathematical Optimization Theory and Operations Research. MOTOR 2024. Lecture Notes in Computer Science, vol 14766. Cham: Springer, 2024.
[105] Zhou, J., Petrosian, O., Pan, Y., Long, Z. (2024). Investment in Public Goods with Uncertain Depreciation // In: Petrosyan, L.A., Mazalov, V., Zenkevich, N.A. (eds) Frontiers of Dynamic Games. GTA 2022. Trends in Mathematics. Cham: Birkhauser, 2024.
[106] Zhou, J., Petrosian, O., Gao, H. Optimizing Pollution Control Strategies in Uncertain Environments. 2024. (https://archive.org/details/optimizing-pollution-control-strategies-in-uncertain-environments)
[107] Zhou, J., Petrosian, O., Gao, H. Nash Equilibrium and Belief Evolution in Differential Games with Motion-Payoff Uncertainty. 2024. (https://archive.org/details/nash-equilibrium-and-belief-evolution-in-differential-games-with-motion-payoff-uncertainty)
[108] Zhu, J., Wu, S., & Xu, J. Synergy between pollution control and carbon reduction: China's evidence // Energy Economics, 2023. Vol. 119. P. 106541.
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.