Динамическое и непрерывное байесовское обновление в многoагентном моделировании тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Чжоу Цзянцзин

  • Чжоу Цзянцзин
  • кандидат науккандидат наук
  • 2025, ФГБОУ ВО «Санкт-Петербургский государственный университет»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 124
Чжоу Цзянцзин. Динамическое и непрерывное байесовское обновление в многoагентном моделировании: дис. кандидат наук: 00.00.00 - Другие cпециальности. ФГБОУ ВО «Санкт-Петербургский государственный университет». 2025. 124 с.

Оглавление диссертации кандидат наук Чжоу Цзянцзин

Введение

Глава 1 Класс дискретных игр с неопределенностью в движении и структуре на основе динамического байесовского обновления

1.1 Модель дискретной игры с неопределенностью в движении и структуре

1.1.1 Обзор неопределенности в движении и структуре в дискретных играх

1.1.2 Моделирование структурной неопределенности в дискретных играх

1.1.3 Параметрическая неопределенность в уравнениях движения

1.2 Модель дискретной игры с неопределенностью в движении и структуре с использованием динамического байесовского обновления

1.2.1 Предварительная информация для Байесовского обновления

1.2.2 Динамическое обновление Байеса

1.2.3 Связанные теоремы о слабой сходимости представлений

1.3 Дискретная игра по управлению загрязнением с неопределенностью

в движении и структуре

1.3.1 Постановка задачи и полученное некооперативное решение

1.3.2 Числовая симуляция задачи контроля загрязнения с неопределенностью структуры движения

1.4 Заключение

Глава 2 Класс дискретных игр с неопределенностью в движении и выигрыше на основе динамического байесовского обновления

2.1 Дискретные игры с неопределенностью в движении и выигрышах

2.1.1 Обзор неопределенности в движении и выигрышах в дискретных играх

2.1.2 Параметрическая неопределенность в уравнениях движения

2.1.3 Параметрическая неопределенность в функциях выигрыша

2.2 Дискретная модель игры с неопределённостью в движении и выигрышах, учитывающая динамическое байесовское обновление

2.2.1 Динамическое байесовское обновление для неопределенности в выигрышах

2.2.2 Теоремы о сильной сходимости представления при неопределенности уравнения движения

2.2.3 Теоремы о сильной сходимости представлений при неопределенности выигрышей

2.3 Приложения

2.3.1 Игра рыболовства бесконечной продолжительности при неопределенности в выигрышах и движении

2.3.2 Задача контроля загрязнения за конечное время при неопределенности в движении и выигрышах

2.4 Заключения

Глава 3 Класс дифференциальных игр с неопределенностью в движении и выигрышах на основе непрерывного байесовского обновления

3.1 Модель дифференциальной игры с неопределенностью в движении

и выигрышах

3.1.1 Обзор неопределенности в движении и выигрышах в дифференциальных играх

3.1.2 Параметрическая неопределенность в уравнениях движения в дифференциальных играх

3.1.3 Параметрическая неопределенность в функциях выигрыша в дифференциальных играх

3.2 Модель дифференциальной игры с неопределенностью в движении

и выигрышах с использованием непрерывного байесовского обновления87

3.2.1 Непрерывное байесовское обновление

3.2.2 Теоремы о сильной сходимости представлений при неопределенности в уравнении движения

3.2.3 Теоремы о сильной сходимости представлений при неопределенности функции выигрыша

3.3 Контроль загрязнения в непрерывном времени с неопределенностью

в движении и выигрышах

3.3.1 Квантование неопределенности

3.3.2 Построение равновесия Нэша с непрерывным обновлением представлений в контроле загрязнения

3.3.3 Сравнительные симуляции динамического и непрерывного байесовского обновления

3.4 Заключение

Заключение

Благодарности

Список литературы

Введение

Введение диссертации (часть автореферата) на тему «Динамическое и непрерывное байесовское обновление в многoагентном моделировании»

Актуальность темы диссертации

Неопределенность является фундаментальной характеристикой многих реальных систем, особенно в таких областях, как управление окружающей средой, «рыбные войны» и экономика. Внутренняя сложность и непредсказуемость этих систем делают принятие решений крайне сложной задачей для политиков и лидеров отрасли. Традиционные модели, особенно те, что применяются в теории игр, часто основываются на детерминированных предположениях, согласно которым игроки обладают полной информацией о динамике системы и структурах выигрышей. Однако такие предположения редко выполняются на практике. Динамическая природа экологических процессов и экономических рынков состоит в том, что ключевые параметры — такие как скорость поглощения загрязнений, темпы восстановления ресурсов и даже рыночные реакции — часто неизвестны или известны только частично.

Данная диссертация решает эти критические проблемы, вводя динамическое байесовское обновление для игр с дискретным временем и непрерывное байесовское обновление для дифференциальных игр. Эти подходы позволяют игрокам итеративно обновлять свои представления о неизвестных параметрах по мере получения новой информации. Меняя свои стратегии в ответ на эти изменения, игроки могут принимать более обоснованные решения даже в условиях неопределенности. Эта способность особенно актуальна в таких сферах, как контроль загрязнений, где долгосрочные экологические последствия выбросов и меры по их сокращению до конца не изучены, и в «рыбных войнах», где доступность природных ресурсов меняется из-за факторов, находящихся вне человеческого контроля.

Управление окружающей средой является одной из самых актуальных глобальных задач, включая такие вопросы, как изменение климата, контроль загрязнений и истощение ресурсов, которые находятся в центре внимания поли-

тической, научной и промышленной повестки. Неопределенности в этих областях многочисленны и разнообразны. Например, точная взаимосвязь между выбросами углерода и повышением глобальной температуры остается предметом продолжающихся научных исследований. Аналогично, скорости, с которыми океаны и леса поглощают загрязнения, значительно варьируются в зависимости от местных условий, что делает трудным прогнозирование долгосрочных последствий человеческой деятельности для экосистем.

Необходимость адаптивного и гибкого принятия решений в этом контексте критически важна. Статические модели, которые не учитывают неопределенности, часто приводят к субоптимальным решениям, которые либо переоценивают, либо недооценивают необходимые меры. Например, чрезмерно консервативные подходы могут иметь неоправданно высокие экономические расходы на отрасли, тогда как излишне оптимистичные стратегии могут привести к деградации окружающей среды или неспособности выполнить международные обязательства, к примеру, Парижское соглашение.

Интеграция байесовского обновления в динамические игры предоставляет более точный и эффективный подход к принятию решений в области экологии. Это позволяет политикам и промышленности корректировать свои стратегии по мере получения новых данных, улучшая точность прогнозов и эффективность мер. Этот адаптивный процесс особенно полезен в долгосрочном управлении окружающей средой, где последствия сегодняшних действий могут проявиться только через десятилетия. Возможность пересматривать стратегии с течением времени по мере появления новых научных знаний и экологических сигналов является ключевым преимуществом динамического байесовского подхода.

Ресурсоемкие отрасли, такие как рыбное хозяйство, лесное хозяйство и добыча полезных ископаемых, сталкиваются с аналогичными проблемами из-за непредсказуемости экологических факторов и доступности ресурсов. Во многих случаях количество доступных для добычи ресурсов колеблется из-за природных процессов, таких как погодные условия или экологические циклы.

Например, в рыбном хозяйстве скорость восстановления рыбных запасов определяется сложным взаимодействием биологических, экологических и экономических факторов. Рыбаки должны определять объемы вылова, не истощая ресурс, что осложняется неполной информацией о текущем состоянии рыбных популяций. В этом контексте динамическое и непрерывное байесовское обнов-

ление позволяет игрокам (компаниям, правительствам или кооперативам) корректировать свои стратегии на основе новых данных о запасах, рыночных ценах и экологических условиях.

В играх по контролю за загрязнением, где страны или отрасли сталкиваются с неопределенностями относительно своих и чужих затрат на сокращение выбросов, асимметрия информации может приводить к субоптимальным или даже конфликтным стратегиям. Получая сигналы (например, рыночные цены на углеродные квоты или наблюдаемые изменения уровней загрязнения), игроки могут обновлять свои представления о неизвестных параметрах, таких как затраты на сокращение выбросов у других игроков, и корректировать свои политики соответственно. Этот адаптивный подход особенно ценен в международных экологических соглашениях, где страны должны координировать свои усилия для достижения глобальных целей, таких как сокращение выбросов парниковых газов несмотря на недостаток знаний об экологических и экономических последствиях своих действий.

Таким образом, внедрение динамического и непрерывного байесовского обновления в модели теории игр открывает новые возможности для адаптивного и реалистичного подхода к принятию решений в условиях неопределенности и изменяющихся систем.

Степень разработанности проблемы в литературе

Изучение динамических игр, особенно тех, которые связаны с неопределенностями в движении и выигрышах, значительно развивалось за последние несколько десятилетий. Исторически большинство моделей теории игр исходили из предположения о совершенной информации, где игроки полностью осведомлены обо всех параметрах и структуре игры [59, 23, 85, 25, 50]. Структура игры относится к правилам, которые определяют эволюцию игры, включая расчет выигрышей и формулировку уравнений движения [68]. Однако в реальных приложениях это предположение редко выполняется. Разнообразные формы неопределенности, такие как экологическая волатильность [1], неполные данные и непредсказуемое поведение других игроков [48], являются общими проблемами в динамических системах [77, 28, 76]. Эти неопределенности особенно значимы в области управления окружающей средой, где неизвестные параметры могут сильно повлиять на результаты динамических систем [45, 51]. Например, в контроле за загрязнением непредсказуемые факторы, такие как

скорость, с которой загрязнение рассеивается в атмосфере или океанах, представляют собой значительные проблемы для принимающих решения. Это привело к росту исследований, направленных на разработку методов управления этими неопределенностями, при этом байесовское обновление стало ключевым подходом в динамических играх [51, 29, 84].

Ранние модели динамических игр в основном концентрировались на детерминированных системах, где состояние игры развивалось предсказуемо на основе известных уравнений и фиксированных параметров [77, 76, 41]. Эти работы заложили основы теории динамических игр с акцентом на равновесие Нэша и методы оптимизации в многопользовательских сценариях.

Наш метод динамического байесовского обновления тесно связан с онлайн-байесовским обучением [16, 46, 79], где распределения версий по неизвестным параметрам обновляются поочередно с каждым новым сигналом или наблюдением. В области обработки сигналов байесовский подход предоставляет надежную основу для оценки неизвестных параметров [12, 74]. Интегрируя предварительные знания с постоянно поступающими сигналами, байесовские методы позволяют исследователям динамически обновлять свои представления о неизвестных параметрах. Каждое новое поступление уточняет апостериорное распределение, постепенно улучшая точность модели [27, 87, 75]. В нашей модели внимание сосредоточено на поэтапном обновлении ожидаемого распределения неизвестного параметра при получении каждого нового сигнала.

Expected trajectory Real

trajectory

О

t

t+1 t+2

Рис. 1: Реальная траектория и ожидаемая траектория В моделях игр с динамическим байесовским обновлением на рисунке 1 пред-

полагается, что игроки:

1. В текущий момент времени £ = 0,1,..., ж имеют информацию об уравнениях движения, функциях выигрыша и своих представлениях относительно неизвестного параметра на сокращенном временном интервале £,£ + 1,... ,£ + Т, длина которого определяется информационным горизонтом

Т.

2. Непрерывно или в любой момент времени £ = £, £ + 1,..., £ + Т получают обновлённую информацию об уравнениях движения, функциях выигрыша и неизвестном параметре, адаптируясь в реальном времени к обновлённой информации.

Однако в отличие от традиционного байесовского обучения [52, 34], где цель обычно заключается в обновлении полного апостериорного распределения, наш подход отслеживает конкретный итеративный процесс обновления математического ожидания неизвестного среднего нормального распределения. Это непрерывное обновление представлений оказалось особенно эффективным в динамических играх, где неопределенность является ключевой проблемой для предсказания результатов [56, 98]. Интегрируя этот подход, новые модели теории игр были адаптированы для лучшего учета реальных сценариев, что повышает точность и актуальность решений в случаях, когда у игроков нет совершенной информации [70, 39, 40].

Неопределенность в параметрах уравнения движения относится к ситуациям, когда правила эволюции системы известны, но конкретные параметры остаются неизвестными. Точно так же неопределенность в параметрах функции выигрыша означает, что расчет выигрыша известен, но некоторые параметры не определены. Эти неопределенности часто упрощаются как неопределенность в уравнении движения или функции выигрыша. С другой стороны, неопределенность в структуре игры означает, что точные правила, регулирующие эволюцию игры и расчет выигрыша, не полностью известны.

В динамических играх неопределенность структуры и движения обычно имеет два основных источника: параметры уравнения движения [51] и структура самой игры [63, 70]. Неопределённость в структуре и выигрышах возникает из-за неизвестных параметров в уравнениях, описывающих эволюцию системы, в то время как неопределённость в выигрышах в игре связана с неизвестными

вознаграждениями или штрафами за различные действия [98, 63]. Оба вида неопределенности усложняют процесс принятия решений для игроков, вынуждая их непрерывно обновлять свои стратегии на основе неполной или изменяющейся информации [56, 35, 36].

В работе [63] представлен метод динамического обновления, который позволяет игрокам получать непрерывные обновления о неопределённости структуры игры по мере её развития. Этот метод впоследствии был расширен в ряде исследований [63, 64, 66, 67, 96, 26], предлагая комплексный подход для решения вопросов неопределённости в динамических играх.

В этих моделях информация об уравнениях движения и функциях выигрыша обновляется через определённые интервалы времени, при этом временные рамки, в которые игроки могут получать новую информацию, определяются информационным горизонтом. Этот подход позволяет игрокам принимать более рациональные стратегические решения по мере того, как игра развивается и поступает новая информация.

Другим важным вкладом стала работа [64], в которой метод динамического обновления был применён к стохастическим прогнозам в дифференциальных играх. Игроки получали информацию о состоянии системы в реальном времени, что позволяло им непрерывно корректировать свои представления о неизвестных параметрах в уравнениях движения [64, 26]. Это оказалось особенно эффективным в кооперативных играх, где игроки делились информацией для достижения взаимовыгодных результатов [26, 95, 96].

Введение метода непрерывного обновления, исследованного в [70], значительно продвинуло развитие этой области, позволяя игрокам уточнять свои представления о динамике системы в реальном времени. Это оказалось особенно полезным в дифференциальных играх, где состояние системы эволюционирует непрерывно [70, 39]. Сочетание динамического и непрерывного обновления чрезвычайно эффективно для решения проблемы неопределённости в движении и структуре в различных приложениях, включая управление окружающей средой и экономику [35, 36].

В играх по извлечению ресурсов, например, где доступность ресурсов (таких как запасы рыбы или темпы восстановления лесов) колеблется непредсказуемо, динамическое обновление предоставляет устойчивый и адаптируемый подход к управлению неопределённостями [56, 88]. В исследовании [88] байесовское об-

новление применяется к модели стохастической дифференциальной игры, свои стратегии на основе новой информации о доступности ресурсов.

Байесовское обновление также оказалось чрезвычайно эффективным в контексте кооперативных дифференциальных игр, где игроки работают вместе для достижения общих целей. Исследование [26] продемонстрировало, что, делясь информацией и непрерывно обновляя свои представления о динамике системы, игроки могут достигать более эффективных и стабильных результатов в кооперативных играх.

Теория дифференциальных игр была определена в [32] и положила начало созданию формальной математической основы для моделирования принятия решений: в играх п лиц в непрерывном времени. В этом случае стратегии игроков эволюционируют непрерывно, по мере поступления новой информации, что имеет множество приложений в некооперативных играх, связанных с управлением ресурсами [91], экономической конкуренцией [82] и военной тактикой [86]. Равновесие Нэша остается основным понятием для определения оптимальных стратегий в некооперативных дифференциальных играх, важный вклад в которые внесли работы [2, 14].

Таким образом, применение динамического и непрерывного байесовского обновления вышло за рамки теоретических моделей и стало применяться в реальных задачах. Например, в контроле загрязнения воздуха, где уровень загрязнения зависит от непредсказуемых метеорологических факторов, байесовское обновление позволяет непрерывно обновлять стратегии на основе данных в реальном времени, что приводит к более рациональным решениям [51, 70]. Точно так же в играх по добыче ресурсов, таких как рыболовство или лесоводство, доступность ресурсов часто непредсказуемо колеблется. Динамическое обновление позволяет игрокам более эффективно реагировать на эти колебания, обеспечивая устойчивое использование ресурсов с течением времени [56, 88].

В заключение, байесовское обновление является мощным инструментом в теории динамических игр, решая неопределенности в движении, структуре и выигрышах. Непрерывно уточняя стратегии с помощью обновлений в реальном времени, игроки могут принимать более адаптивные решения в сложных условиях. По мере развития исследований динамическое и непрерывное байесовское обновление останется важнейшим инструментом для улучшения принятия решений в неопределенных динамических системах.

Цель и задачи диссертации

Цель диссертации заключается в разработке новых классов моделей управления конфликтами, включая динамические игры с неопределенностью в движении и структуре, динамические игры с неопределенностью выигрыша и в уравнениях движения а также дифференциальные игры с неопределенностью выигрыша и уравнений движения. Диссертация сосредоточена на методах построения некооперативных стратегий с использованием динамического и непрерывного обновления представлений, а также разработке процедур для нахождения соответствующих решений равновесия Нэша. Наиболее важным является исследование точной формы динамического и непрерывного обновления представлений для неопределенностей в уравнениях движения и функциях выигрыша, что позволяет игрокам обновлять свои представления по мере поступления новой информации. Кроме того, целью является доказательство сходимости этих процессов обновления представлений и соответствующих оптимальных стратегий. Также целью является разработка приложения для реализации подходов непрерывного байесовского обновления и динамического байесовского обновления с акцентом на их различия в управлении неопределенностью и предоставление конкретных результатов моделирования.

Указанная цель достигается решением следующих задач диссертации:

1. Разработать новые классы моделей управления конфликтами, включая динамические игры с неопределенностью в движении и структуре, динамические игры с неопределенностью в выигрышах и в уравнениях движения а также дифференциальные игры с неопределенностью в выигрышах и в уравнениях движения.

2. Разработать методы построения некооперативных стратегий с использованием динамического и непрерывного обновления представлений, а также методы определения соответствующих решений равновесия Нэша.

3. Исследовать формы динамического и непрерывного обновления представлений для неопределенностей в уравнениях движения и функциях выигрыша при условии, что игроки могут пересматривать свои представления по мере поступления новой информации.

4. Доказать сходимость процессов обновления представлений и соответству-

ющих оптимальных стратегий при динамическом и непрерывном обновлении.

5. Сравнить подходы непрерывного байесовского обновления и динамического байесовского обновления, концентрируясь на их различиях в управлении неопределенностью.

6. Предоставить конкретные результаты моделирования, демонстрирующие применение непрерывного байесовского обновления и динамического байесовского обновления в реальных сценариях.

Научная новизна

Данная диссертация вводит понятие динамического и непрерывного байесовского обновления в рамках теории игр, рассматривая неопределенности как в движении и структуре, так и в выигрышах и уравнениях движения. Она расширяет традиционную теорию игр, формализуя методы управления реальными неопределенностями в динамических системах.

Первый аспект новизны заключается в адаптации байесовского обновления на динамическую структуру, что превращает его из одноэтапного процесса в многоэтапный. Это позволяет игрокам обновлять свои представления на разных стадиях, динамически корректируя стратегии в условиях неопределенности, которая сохраняется во времени.

Второй аспект новизны — разработка теорем о сильной сходимости представлений для игр с неопределенностями как в уравнениях движения, так и в структурах выигрыша. Эти теоремы расширяют область применения байесовского обновления к более сложным динамическим играм, обеспечивая строгую основу для принятия решений в условиях неопределенности.

Дополнительным вкладом является применение непрерывного байесовского обновления в дифференциальных играх. Данная работа расширяет метод динамического обновления для модели с непрерывным временем. Мы являемся первыми, кто предлагает интеграцию представлений в дифференциальные уравнения, что способствует улучшению принятия решений в реальном времени в быстро изменяющихся системах.

Методы исследования

В диссертации используются методы исследования динамических и дифференциальных игр (конструирование динамических и дифференциальных игр и

подыгр), теорию некооперативных игр (профиль стратегий Нэша, соответствующая траектория), теорию оптимального управления (динамическое программирование, принцип максимума Понтрягина), математического анализа (сходимость представлений и соответствующая дисперсия), теорию оптимизации и теорию вероятностеи (распределения случайных величин, Теорема о сходимости Колмогорова, Эргодическая теорема, Байесовский вывод).

Теоретическая и практическая значимость

Теоретическое значение данной диссертации заключается в развитии теории динамических игр путем построения байесовского обновления для учета неопределенности в движении и структуре и неопределенности в функциях выигрыша. В отличие от традиционных моделей, которые предполагают полную информацию или детерминированные структуры, данное исследование формализует процесс динамического обновления представлений и стратегий игроков в ответ на новую информацию. Разработка теорем о сходимости представлений и интеграция непрерывного байесовского обновления в дифференциальные игры являются важными теоретическими достижениями, расширяющими текущее знание в данной области.

В главе 1 разрабатываются модели динамического байесовского обновления для учета неопределенности в структуре и движении в динамических играх, где точные правила эволюции системы и расчета выигрышей полностью не определены, а также неизвестны конкретные параметры в уравнениях движения. Практическое значимость модели заключается в контроле загрязнения, где политики корректируют стратегии в соответствии с изменяющимися экологическими условиями, что способствует улучшению устойчивости и точности.

В главе 2 исследуются неопределенности как в уравнениях движения, так и в функциях выигрышей, уделяется внимание случаям, в которых правила эволюции системы и расчета выигрышей известны, но некоторые параметры остаются неопределенными. Формулируются теоремы о сильной сходимости представлений, которые обеспечивают строгую основу для байесовского обновления. Практическое приложение можно наблюдать в добыче ресурсов, например, в игре «рыбные войны», где эволюция факторов влияет на оптимальные стратегии добычи.

В главе 3 непрерывное Байесовское обновление интегрируется в модель дифференциальных игр, что значительно улучшает решение задач неопределен-

ности в системах с непрерывным временем. Этот подход особенно полезен в реальных сценариях, таких как управление загрязнением в непрерывном времени, где динамическое обновление помогает разработать более адаптивные и устойчивые стратегии.

Исследования, проведенные в диссертации, поддерживаются стипендией китайского правительства (CSC) No. 202208010092 (2022-2025).

Краткое описание работы

Диссертация состоит из введения, трех основных глав, заключения и списка литературы. Каждая глава начинается с изложения модели, представления основных определений и формулировки задачи. Результаты представлены через сочетание теоретических утверждений и числовых примеров для разъяснения ключевых понятий. Объем диссертации составляет 113 страниц (в русской версии 124 страницы), включает 1 таблицу и 22 рисунка для поддержки анализа. Список литературы содержит 108 источников, упорядоченных в алфавитном порядке.

Первая глава вводит понятие неопределённости в движении и структуре в дискретных играх, что подразумевает ситуации, когда правила, определяющие эволюцию системы и расчёт выигрышей, не полностью заданы, а конкретные параметры в уравнениях движения остаются неизвестными. В разделе 1.1 представляются три различных информационных сценария для игроков, начиная с полного знания распределения случайной величины в уравнении движения и структуры игры и заканчивая постепенным приобретением этой информации через процессы обучения. В разделе 1.2 проводятся глубокий анализ байесовского обновления в контексте нормальных распределений и сравнение статистических и динамических моделей. В этом разделе также определяются теоремы о слабой сходимости представлений. В разделе 1.3 демонстрируется применение динамического байесовского обновления к задаче управления загрязнением, где для учета динамических обновлений представлений игроков выводится равновесие Нэша с использованием уравнения Гамильтона-Якоби-Беллмана (ГЯБ). Наконец, раздел 1.4 представляет собой краткое изложение основных выводов и вкладов исследования.

Вторая глава строится на концепциях, введенных в первой главе, в ней рассматривается неопределенность в выигрыше. В разделе 2.1 определяется математическая основа, необходимая для исследования, что закладывает базу для

последующего анализа. В разделе 2.2 вводится методология обновления представлений в условиях неопределенности как в уравнениях движения, так и в функциях выигрыша. Этот раздел также включает в себя доказательства теорем о сильной сходимости представлений при неопределенности в уравнениях движения и неопределенности в функциях выигрыша. В разделе 2.3 мы применяем эти методы к практическим задачам, рассматривая игру по борьбе за рыболовные ресурсы на бесконечном интервале времени и задачу контроля загрязнения на конечном интервале времени. Обе эти задачи связаны с неопределенностью в выигрышах и движении. Наконец, раздел 2.4 представляет собой краткое изложение основных выводов и вклада исследования.

В главе 3 данной диссертации, состоящей из нескольких разделов, рассматриваются сложности дифференциальных игр при неопределенности в выигрыше и движении. В разделе 3.1 вводится модель дифференциальной игры, учитывая неопределенности как в уравнениях движения, так и в функциях выигрыша. В разделе 3.2 исследуется использование непрерывного обновления Байеса для управления этими неопределенностями. Основные достижения здесь — метод непрерывного обновления Байеса и доказательство теорем о сильной сходимости представлений как для неопределенности в уравнениях движения так и для неопределенности в функциях выигрыша. В разделе 3.3 эти модели применяются к реальной задаче — контролю загрязнения в случае непрерывного времени, где неопределенность количественно оценивается, и строится равновесие Нэша с использованием непрерывного обновления Байеса. Наконец, раздел 3.4 завершает главу, подводя итог теоретическим вкладам и практическим приложениям полученных результатов.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Чжоу Цзянцзин, 2025 год

Литература

[1] Barry, E. J., Kemerer, C. F. & Slaughter, S. A. Environmental volatility, development decisions, and software volatility: a longitudinal analysis // Management Science 2006. Vol. 52. N. 3. P. 448-464.

[2] Basar, T. & Olsder, G. J. Dynamic Noncooperative Game Theory. Academic Press, London (1995).

[3] Belkaoui, A. The impact of the disclosure of the environmental effects of organizational behavior on the market // Financial Management. 1976. P. 2631.

[4] Berkovitz, L. D. A variational approach to differential games //In Advances in Game Theory 2016. P. 127-174. Princeton University Press.

[5] Bettiol, P., Cardaliaguet, P., & Quincampoix, M. Zero-sum state constrained differential games: Existence of value for Bolza problem // International Journal of Game Theory 2006. Vol. 34. N. 4. P. 495-527.

[6] Bingham, N. H. The work of an Komogorov on strong limit theorems // Theory of Probability & Its Applications. 1990. Vol. 34. N. 1. P. 129-139.

[7] Bloembergen, D., Tuyls, K., Hennes, D., Kaisers, M. Evolutionary dynamics of multi-agent learning: A survey // Journal of Artificial Intelligence Research 2015. Vol. 53. P. 659-697.

[8] Borel, E. Les probabilites denombrables et leurs applications arithmetiques // Rendiconti del Circolo Matematico di Palermo 1909. Vol. 27. Series 2. P. 247271.

[9] Breakwell, J. V. Zero-sum differential games with terminal payoff // In: Hagedorn, P., Knobloch, H. W., & Olsder, G. H. (eds) Differential Game and

Applications. Lecture Notes in Control and Information Sciences. 1977. Vol. 3. Springer, Berlin.

[10] Breton, Michele & Keoula, Michel Yevenunye. A great fish war model with asymmetric players // Ecological Economics 2014. Vol. 97. P. 209-223. Elsevier.

[11] Breton, M., Zaccour, G., Zahaf, M.: A differential game of joint implementation of environmental projects// Automatica 2005. Vol.41(10), P.1737-1749.

[12] Candy, J. V. Bayesian Signal Processing: Classical, Modern, and Particle Filtering Methods. John Wiley & Sons, New Jersey (2016).

[13] Cantelli, F. P. Sulla probability come limite della frequenza // Atti della Accademia Nazionale dei Lincei 1917. Vol. 26. N. 1. P. 39-45.

[14] Chistyakov, S. V. On non-cooperative differential games // Reports of the USSR Academy of Sciences 1981. Vol. 259. N. 5. P. 1052-1055.

[15] Dellink, R. & Finus, M. Uncertainty and climate treaties: Does ignorance pay? // Resour. Energy Econ. 2012. Vol. 34. P. 565-584.

[16] Djuric, P. M. Sequential estimation of signals under model uncertainty // In: Sequential Monte Carlo Methods in Practice. New York, NY: Springer New York, 2001. P. 381-400.

[17] Dockner, E. J. & Van Long, N. International Pollution Control: Cooperative versus Noncooperative Strategies // Journal of Environmental Economics and Management 1993. Vol. 25. N. 1. P. 13-29.

[18] Elsawah, S., Pierce, S. A., Hamilton, S. H., Van Delden, H., Haase, D., Elmahdi, A., Jakeman, A. J. An overview of the system dynamics process for integrated modelling of socio-ecological systems: Lessons on good modelling practice from five case studies // Environmental Modelling & Software 2017. Vol. 93. P. 127145.

[19] Feller, W. An Introduction to Probability Theory and Its Applications. Vol. 1. Wiley, New York (1968). P. 227.

[20] Fischer, Ronald D. & Mirman, Leonard J. Strategic dynamic interaction: fish wars // Journal of Economic Dynamics and Control 1992. Vol. 16. N. 2. P. 267-287. Elsevier.

[21] Fleming, W. H. The convergence problem for differential games II // Advances in Game Theory 1964. Vol. 52. P. 195-210.

[22] Fubini, G. Sugli integrali multipli // Rom. Acc. L. Rend. 1907. Vol. 16. N. 1. P. 608-614. Series 5. JFM 38.0343.02.

[23] Fudenberg, D. & Tirole, J. Game Theory. MIT Press (1991).

[24] Ghavamzadeh, M., Mannor, S., Pineau, J., & Tamar, A. Bayesian reinforcement learning: A survey // Foundations and Trends in Machine Learning 2015. Vol. 8. N. 5-6. P. 359-483.

[25] Gintis, H. Game Theory Evolving: A Problem-Centered Introduction to Modeling Strategic Interaction. Princeton University Press (2000).

[26] Gromova, E. & Petrosian, O. Control of information horizon for cooperative differential game of pollution control // In: 2016 International Conference Stability and Oscillations of Nonlinear Control Systems (Pyatnitskiy's Conference), 2016.

[27] Harrison, P. J. & Stevens, C. F. Bayesian forecasting // Journal of the Royal Statistical Society 1978. Vol. 38. N. 3. P. 205-247.

[28] Haurie, A., Krawczyk, J. B., & Zaccour, G. Games and Dynamic Games, volume 1. World Scientific Publishing Company, Singapore (2012).

[29] Horner, J., Takahashi, S. & Vieille, N. Truthful equilibria in dynamic Bayesian games // Econometrica 2015. Vol. 83. N. 5. P. 1795-1848.

[30] Huang, L. & Zhu, Q. Analysis and computation of adaptive defense strategies against advanced persistent threats for cyber-physical systems // In: Decision and Game Theory for Security: 9th International Conference, GameSec 2018, Seattle, WA, USA, October 29-31, 2018, Proceedings 2018. P. 205-226. Springer.

[31] Ieong, S. & Shoham, Y. Bayesian coalitional games // In: AAAI 2008. P. 95100.

[32] Isaacs, R. Differential Games: A Mathematical Theory with Applications to Warfare and Pursuit, Control and Optimization. John Wiley and Sons, New York (1965).

[33] Jonidi Jafari, A., Charkhloo, E., & Pasalari, H. Urban air pollution control policies and strategies: a systematic review // Journal of Environmental Health Science and Engineering, 2021. Vol. 19. P. 1911-1940.

[34] Kelly, D. L., & Kolstad, C. D. Bayesian learning, growth, and pollution // Journal of Economic Dynamics and Control, 1999. Vol. 23. N. 4. P. 491-518.

[35] Kolstad, C. Systematic uncertainty in self-enforcing international environmental agreements // J. Environ. Econ. Manag. 2007. Vol. 53. P. 68-79.

[36] Kolstad, C. & Ulph, A. Learning and international environmental agreements // Clim. Chang. 2008. Vol. 89. P. 125-141.

[37] Koulovatianos, C., Mirman, L. J. & Santugini, M. Optimal growth and uncertainty: Learning // Journal of Economic Theory 2009. Vol. 144. N. 1. P. 280-295.

[38] Krasovsky, N. N. Control of Dynamical System: Problem of Minimum Guaranteed Result. Science, Moscow (1985).

[39] Kuchkarov, I. & Petrosian, O. On class of linear quadratic non-cooperative differential games with continuous updating //In International Conference on Mathematical Optimization Theory and Operations Research, 2019. P. 635-650. (Springer).

[40] Kuchkarov, I. & Petrosian, O. Open-loop based strategies for autonomous linear quadratic game models with continuous updating // In International Conference on Mathematical Optimization Theory and Operations Research, 2020. P. 212-230. (Springer).

[41] Kumar, P. & Van Schuppen, J. On Nash equilibrium solutions in stochastic dynamic games // IEEE Transactions on Automatic Control 1980. Vol. 25. N. 6. P. 1146-1149.

[42] Levhari, D. & Mirman, L. J. The great fish war: an example using a dynamic Cournot-Nash solution //In Fisheries Economics, Volume II 2020. P. 49-61. Routledge.

[43] Lewis, F. L., Vrabie, D., Syrmos, V. L. Optimal Control. John Wiley & Sons, Hoboken, New Jersey (2012).

[44] L'Hospital, G. F. A., Marquis de. Analyse des Infiniment Petits. 1696. P. 145146.

[45] Long, N. V. A differential game approach // Annals Oper. Res. 1992. Vol. 37. P. 283-296.

[46] Lopes, H. F. & Carvalho, C. M. Online Bayesian learning in dynamic models: an illustrative introduction to particle methods // Hierarchical Models and Markov Chain Monte Carlo 2013.

[47] Lopez, V. G., Wan, Y. & Lewis, F. L. Bayesian graphical games for synchronization in networks of dynamical systems // IEEE Transactions on Control of Network Systems 2019. Vol. 7. N. 2. P. 1028-1039.

[48] Lou, H. H., Kulkarni, M. A., Singh, A., et al. A game theory based approach for emergy analysis of industrial ecosystem under uncertainty // Clean Technologies and Environmental Policy 2004. Vol. 6. P. 156-161.

[49] Luo, Y., Yuan, H., Hu, Z., et al. Optimal scheduling of micro-energy grid based on Pareto frontier under uncertainty and pollutant emissions // IEEE Transactions on Smart Grid, 2023. Vol. 15. N. 1. P. 368-380.

[50] Mas-Colell, A., Whinston, M. D. & Green, J. R. Microeconomic Theory. Oxford University Press (1995).

[51] Masoudi, N., Santugini, M. & Zaccour, G. A dynamic game of emissions pollution with uncertainty and learning // Environmental and Resource Economics 2016. Vol. 64. P. 349-372.

[52] Mathys, C., Daunizeau, J., Friston, K. J., & Stephan, K. E. A Bayesian foundation for individual learning under uncertainty // Frontiers in Human Neuroscience, 2011. Vol. 5. P. 39.

[53] Mazalov, V., Parilina, E. & Zhou, J. Altruistic-like equilibrium in a differential game of renewable resource extraction // In International Conference on Mathematical Optimization Theory and Operations Research, 2021. P. 326-339. Springer.

[54] Mazalov, V. & Zhou, J. Dynamic stability of coalition formation in dynamic games // Operations Research Letters. 2024. Vol. 55. P. 107138.

[55] Meinhold, R. J. & Singpurwalla, N. D. Understanding the Kalman filter // The American Statistician 1983. Vol. 37. N. 2. P. 123-127.

[56] Mirman, L. J. & Santugini, M. Learning and technological progress in dynamic games // Dynamic Games and Applications 2014. Vol. 4. P. 58-72.

[57] Muller, P., Quintana, F. A., & Rosner, G. L. Online learning through Bayesian updating in clinical trials // Biometrics 2012. Vol. 68. N. 4. P. 1149-1159.

[58] Murphy, K. P. Conjugate Bayesian analysis of the Gaussian distribution // def. 2007. Vol. 1. P. 16.

[59] Osborne, M. J. & Rubinstein, A. A Course in Game Theory. MIT Press (1994).

[60] Papoulis, A. & Pillai, S. U. Probability, Random Variables, and Stochastic Processes. McGraw-Hill Europe, New York, NY (2002).

[61] Park, K. I., M. Park & James. Fundamentals of Probability and Stochastic Processes with Applications to Communications. Springer, Holmdel, New Jersey, USA (2018).

[62] Petrosyan, L. A. & Murzov, N. V. Game-theoretic problems in mechanics // Lithuanian Mathematical Collection 1966. Vol. 3. P. 423-433.

[63] Petrosian, O. L. Looking forward approach in cooperative differential games with infinite horizon // Vestnik S.-Petersburg Univ. Ser. 10. Prikl. Mat. Inform. Prots. Upr. 2016. Vol. 4. P. 18-30.

[64] Petrosian, O. L. & Barabanov, A. E. Looking forward approach in cooperative differential games with uncertain-stochastic dynamics // Journal of Optimization Theory and Applications 2017. Vol. 172. P. 328-347.

[65] Petrosian, O., Denis, T., Zhou, J. J. & Gao, H. W. Differential game model of resource extraction with continuous and dynamic updating // J. Oper. Res. Soc. China. 2024. Vol. 12. P. 51-75.

[66] Petrosian, O. L., Nastych, M. A., & Volf, D. A. Differential game of oil market with moving informational horizon and non-transferable utility //In 2017 Constructive Nonsmooth Analysis and Related Topics (dedicated to the memory of V. F. Demyanov), 2017.

[67] Petrosian, O. L., Nastych, M. A., & Volf, D. A. Non-cooperative differential game model of oil market with looking forward approach //In Frontiers of Dynamic Games, Game Theory and Management, St. Petersburg, 2017. Eds. L. A. Petrosyan, V. V. Mazalov, N. Zenkevich. Birkhauser, Basel, 2018.

[68] Petrosian, O., Tur, A. Hamilton-Jacobi-Bellman equations for non-cooperative differential games with continuous updating.// In: Bykadorov, I., Strusevich, V., Tchemisova, T. (eds) Mathematical Optimization Theory and Operations Research. MOTOR 2019. Communications in Computer and Information Science, vol 1090. Springer, Cham, 2019, pp. 256-270.

[69] Petrosian, O., Tur, A., Wang, Z. & Gao, H. Cooperative differential games with continuous updating using Hamilton-Jacobi-Bellman equation // Optim. Methods Softw. 2020. P. 1-29.

[70] Petrosian, O., Tur, A. & Zhou, J. Pontryagin's maximum principle for non-cooperative differential games with continuous updating.// In: Kochetov, Y., Bykadorov, I., Gruzdeva, T. (eds) Mathematical Optimization Theory and Operations Research. MOTOR 2020. Communications in Computer and Information Science, vol 1275. Springer, Cham, 2020.

[71] Pontryagin, L. S. On the theory of differential games // Successes of Mathematical Sciences 1966. Vol. 26. N. 4 (130). P. 219-274.

[72] Prokhorov, Y. V. Convergence of random processes and limit theorems in probability theory // Theory of Probability & Its Applications 1956. Vol. 1. N. 2. P. 157-214.

[73] Qin, M., Sun, M. & Li, J. Impact of environmental regulation policy on ecological efficiency in four major urban agglomerations in eastern China // Ecological Indicators 2021. Vol. 130. P. 108002.

[74] Ruanaidh, J. J. K. O. & Fitzgerald, W. J. Numerical Bayesian Methods Applied to Signal Processing. Springer Science & Business Media, Cambridge (2012).

[75] Russell, S. & Norvig, P. Artificial Intelligence: A Modern Approach. Prentice Hall (2003).

[76] Schofield, N. Instability of simple dynamic games // The Review of Economic Studies 1978. Vol. 45. N. 3. P. 575-594.

[77] Shoham, Y. & Leyton-Brown, K. Multiagent Systems: Algorithmic, Game-Theoretic, and Logical Foundations. Cambridge University Press, Cambridge (2008).

[78] Shokri, R. Privacy games: Optimal user-centric data obfuscation // arXiv preprint arXiv:1402.3426 (2014).

[79] Solla, S. A. & Winther, O. Optimal perceptron learning: an online Bayesian approach // On-line Learning in Neural Networks 1998. P. 1-20.

[80] Stavins, R. N. Transaction costs and tradeable permits // Journal of Environmental Economics and Management 1995. Vol. 29. N. 2. P. 133-148.

[81] Stearns, S. D. Adaptive Signal Processing. Prentice-Hall (1985).

[82] Telser, L. G. Competition, Collusion, and Game Theory. Routledge, 2017.

[83] Ummenhofer, C. C. & Meehl, G. A. Extreme weather and climate events with ecological relevance: a review // Philosophical Transactions of the Royal Society B: Biological Sciences 2017. Vol. 372. N. 1723. Article 20160135.

[84] Vasal, D., Sinha, A. & Anastasopoulos, A. A systematic process for evaluating structured perfect Bayesian equilibria in dynamic games with asymmetric information // IEEE Transactions on Automatic Control 2018. Vol. 64. N. 1. P. 81-96.

[85] von Neumann, J. & Morgenstern, O. Theory of Games and Economic Behavior. Princeton University Press (1944).

[86] Vorobeychik, Y., & Porche III, I. R. Game-theoretic methods for analysis of tactical decision-making using agent-based combat simulations // Military Operations Research, 2009. P. 21-39.

[87] Wainwright, M. J. & Jordan, M. I. Graphical models, exponential families, and variational inference // Foundations and Trends in Machine Learning 2008. Vol. 1. N. 1-2. P. 1-305.

[88] Wang, C., Liu, J., Fan, R. & Xiao, L. Promotion strategies for environmentally friendly packaging: a stochastic differential game perspective // Int. J. Environ. Sci. Technol. 2023. Vol. 20. P. 7559-7568.

[89] Wang, Z. & Petrosian, O. On class of non-transferable utility cooperative differential games with continuous updating // J. Dyn. & Games. 2020. Vol. 7. P. 291-302.

[90] Welch, G., Bishop, G., et al. An introduction to the Kalman filter (1995).

[91] Xu, X., & Yu, H. A game theory approach to fair and efficient resource allocation in cloud computing // Mathematical Problems in Engineering, 2014. Vol. 2014. N. 1. P. 915878.

[92] Yang, X. & Gao, J. Linear-quadratic uncertain differential game with application to resource extraction problem // IEEE Transactions on Fuzzy Systems 2015. Vol. 24. N. 4. P. 819-826.

[93] Yeung, D. W. K. Dynamically consistent solution for a pollution management game in collaborative abatement with uncertain future payoffs // International Game Theory Review, 2008. Vol. 10. N. 4. P. 517-538.

[94] Yeung, D. W. K., & Petrosyan, L. A. Generalized dynamic games with durable strategies under uncertain planning horizon // Journal of Computational and Applied Mathematics, 2021. Vol. 395. P. 113595.

[95] Yeung, D. & Petrosian, O. Cooperative stochastic differential games with information adaptation // In: International Conference on Communication and Electronic Information Engineering (CEIE 2016), 2016. P. 375-381. (Atlantis Press).

[96] Yeung, D. & Petrosian, O. Infinite horizon dynamic games: A new approach via information updating // International Game Theory Review 2017. Vol. 19. P. 1-23.

[97] Yuan, Q., Yan, F., Yin, Z., et al. Decision-Making and Planning Methods for Autonomous Vehicles Based on Multistate Estimations and Game Theory // Advanced Intelligent Systems, 2023. Vol. 5. N. 11. P. 2300177.

[98] Zamir, S. Bayesian Games: Games with Incomplete Information. Springer (2020).

[99] Zhang, C., Gholami, S., Kar, D., Sinha, A., Jain, M., Goyal, R. & Tambe, M. Keeping pace with criminals: An extended study of designing patrol allocation against adaptive opportunistic criminals // Games 2016. Vol. 7. N. 3. Article 15.

[100] Zhou, J., Petrosian, O. & Gao, H. Enhancing ecological uncertainty predictions in pollution control games through dynamic Bayesian updating // Scientific Reports 2024. Vol. 14. N. 1. P. 12594. Nature Publishing Group UK, London.

[101] Zhou, J., Petrosian, O. L. & Gao, H. Dynamic decision-making under uncertainty: Bayesian learning in environmental game theory // Vestnik of St. Petersburg University. Applied Mathematics. Computer Science. Control Processes 2024. Vol. 20. N. 2. P. 289-297.

[102] Zhou, J. & Petrosian, O. Bayesian learning in "Fish Wars": Dynamic assessment of unknown states and private information // Mathematical Game Theory and its Applications 2024. Vol. 16. N. 2. P. 92-112.

[103] Zhou, J., Tur, A., Petrosian, O. & Gao, H. Transferable utility cooperative differential games with continuous updating using Pontryagin's maximum principle // Mathematics 2021. Vol. 9. N. 2. P. 163.

[104] Zhou, J., Mazalov, V. (2024). Dynamic stability of coalition structures in network-based pollution control games // In: Eremeev, A., Khachay, M., Kochetov, Y., Mazalov, V., Pardalos, P. (eds) Mathematical Optimization Theory and Operations Research. MOTOR 2024. Lecture Notes in Computer Science, vol 14766. Cham: Springer, 2024.

[105] Zhou, J., Petrosian, O., Pan, Y., Long, Z. (2024). Investment in Public Goods with Uncertain Depreciation // In: Petrosyan, L.A., Mazalov, V., Zenkevich, N.A. (eds) Frontiers of Dynamic Games. GTA 2022. Trends in Mathematics. Cham: Birkhauser, 2024.

[106] Zhou, J., Petrosian, O., Gao, H. Optimizing Pollution Control Strategies in Uncertain Environments. 2024. (https://archive.org/details/optimizing-pollution-control-strategies-in-uncertain-environments)

[107] Zhou, J., Petrosian, O., Gao, H. Nash Equilibrium and Belief Evolution in Differential Games with Motion-Payoff Uncertainty. 2024. (https://archive.org/details/nash-equilibrium-and-belief-evolution-in-differential-games-with-motion-payoff-uncertainty)

[108] Zhu, J., Wu, S., & Xu, J. Synergy between pollution control and carbon reduction: China's evidence // Energy Economics, 2023. Vol. 119. P. 106541.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.