Исследование и разработка алгоритмов генерации вознаграждения в задачах обучения с подкреплением на основе модели мира тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Латышев Артем Константинович

  • Латышев Артем Константинович
  • кандидат науккандидат наук
  • 2025, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 112
Латышев Артем Константинович. Исследование и разработка алгоритмов генерации вознаграждения в задачах обучения с подкреплением на основе модели мира: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2025. 112 с.

Оглавление диссертации кандидат наук Латышев Артем Константинович

Введение

Глава 1. Методы обучения с подкреплением

1.1 Формализация задачи обучения для процессов принятия решений

1.2 Обучение агента

1.2.1 Подходы, основанные на оптимизации полезности

1.2.2 Подходы, основанные на оптимизации стратегии

1.2.3 Подходы актор-критик

1.3 Модельный подход в обучении с подкреплением

1.3.1 Синтетический опыт

1.3.2 Планирование

1.3.3 Преимущества использования модели мира

1.4 Обучение динамики модели мира

1.4.1 Неопределенность

1.4.2 Пространство скрытых представлений

1.4.3 Обучение на локальных правилах

1.5 Выводы по главе

Глава 2. Вознаграждение в обучении с подкреплением

2.1 Проблема разреженности

2.1.1 Дополнительное вознаграждение: сигнал внутренней мотивации

2.1.2 Временная декомпозиция

2.1.3 Целевая декомпозиция

2.1.4 Стратегическая декомпозиция

2.2 Вознаграждение безопасной стратегии

2.2.1 Марковский процесс принятия решений с ограничениями

2.2.2 Метод множителей Лагранжа

2.3 Выводы по главе

Глава 3. Генерация и применение функций вознаграждения для задач исследования

среды

3.1 Анализ метода генерации вознаграждения на основе неопределенности предсказания модели мира

3.2 Анализ метода генерации вознаграждения на основе динамического расстояния

3.3 Разработка метода формирования умений на основе расширения возможностей

3.3.1 Формализация метода

3.3.2 Формирование умений на основе сигнала вознаграждения

3.3.3 Анализ сформированных умений

3.3.4 Применение умений для достижения целей

3.4 Разработка метода формирования целенаправленного и исследовательского вознаграждений

3.4.1 Метод обучения LAQUAXA

3.4.2 Формирование множества целей

3.4.3 Общие параметры экспериментов

3.4.4 Экспериментальная проверка возможностей метода

3.5 Выводы по главе

Глава 4. Разработка метода безопасного обучения: генерация вознаграждений и

штрафов

4.1 Метод безопасного обучения SPOWL

4.1.1 Модель мира для генерации вознаграждения и штрафов

4.1.2 Адаптивный выбор уровня безопасности для текущего уровня возможностей агента

4.1.3 Балансирование между безопасной стратегией и локальным планом

модели мира

4.2 Экспериментальная проверка

4.2.1 Адаптивный порог при безопасном планировании

4.2.2 Использование сигналов вознаграждения и штрафов модулем принятия решений

4.2.3 Абляционное исследование модели мира

4.2.4 Сравнение с существующими методами

4.3 Выводы по главе

Глава 5. Разработка алгоритма генерации вознаграждения в хеббовских моделях

обучения

5.1 Специфика модели динамики на основе HTM

5.2 Методы генерации вознаграждений

5.2.1 Новизна

5.2.2 Любопытство

5.2.3 Сигнал расширения возможностей

5.3 Алгоритм вычисления взаимной информации

5.3.1 Предсказание и сбор статистики

5.3.2 Агрегация статистики по кластерам

5.3.3 Память представлений

5.4 Результаты экспериментов

5.4.1 Исследование среды в задаче четырёх комнат

5.4.2 Сравнение дополнительных вознаграждений

5.5 Выводы по главе

Заключение

Список сокращений и условных обозначений

Список литературы

Список рисунков

Список таблиц

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Исследование и разработка алгоритмов генерации вознаграждения в задачах обучения с подкреплением на основе модели мира»

Введение

Современный этап развития технологий искусственного интеллекта (ИИ) и вычислительной техники характеризуется интенсивным прогрессом в области создания интеллектуальных систем, способных функционировать в сложных динамических условиях. Широкое внедрение автономных решений, таких как роботы-пылесосы, системы беспилотной доставки и автономный транспорт, свидетельствует о возрастающей роли адаптивных алгоритмов в обеспечении эффективности и безопасности подобных технологий. Однако дальнейшее совершенствование интеллектуальных систем требует разработки более сложных механизмов, позволяющих им выполнять разнородные задачи в полностью автономном режиме при сохранении устойчивости, контролируемости и безопасности.

Особый интерес в данном контексте представляет обучение с подкреплением (Reinforcement Learning, RL) — метод машинного обучения [1], доказавший свою эффективность в управлении робототехническими системами [2], манипуляторами, а также в решении задач, традиционно ассоциирующихся с высоким уровнем интеллектуальной деятельности (например, стратегические игры, включая шахматы и го) [3]. Ключевым преимуществом данного подхода является его способность активно формировать стратегии поведения, оптимизированные для достижения долгосрочных целей в условиях неопределенности. Это делает RL перспективной основой для создания универсальных автономных агентов, способных адаптироваться к изменяющейся среде, выполнять широкий спектр задач, при этом соблюдая требования к безопасности получаемого решения [4].

Основу обучения с подкреплением составляет парадигма проб и ошибок, в рамках которой интеллектуальный агент, взаимодействуя со средой, последовательно выполняет действия и получает обратную связь в виде скалярного сигнала вознаграждения. Данный сигнал выполняет роль положительного и отрицательного подкрепления, кодируя желаемое поведение агента: большие положительные значения вознаграждения закрепляют эффективные действия, тогда как отрицательные способствуют подавлению нежелательных стратегий. В результате итеративного процесса взаимодействия со средой агент формирует оптимальную стратегию, максимизирующую суммарное вознаграждение. Однако ключевым ограничением данного подхода выступает проблема корректного определения функции вознаграждения, непосредственно влияющей на эффективность обучения.

Генерация функции вознаграждения представляет собой сложную задачу, требующую установления соответствия между желаемым поведением агента и числовыми оценками, присваиваемыми его действиям. Пример такого соответствия можно рассмотреть для целеориенти-рованного поведения по достижению конкретной цели, здесь стандартом является индикаторное вознаграждение — имеет ненулевое значение только при выполнении действия, непосредственно приводящего к целевому состоянию. А для безопасного поведения, например, вводятся штрафы, имеющие ненулевое значение при выполнении опасных действий или посещении опасных состояний. Однако, некорректно заданная функция вознаграждения может привести к неожиданным эффектам [5], включая: формирование субоптимальных стратегий (попадание в локальные оп-

тимумы), отсутствие сходимости алгоритма из-за недостаточной исследовательской активности (проблема разреженного вознаграждения) [6], взлому функции вознаграждения.

В реальных задачах пространства состояний и действий, как правило, являются многомерными и непрерывными, что делает поиск оптимальной стратегии чрезвычайно сложной вычислительной проблемой. Основная трудность заключается в том, что лишь ограниченное подмножество переходов содержит информативный сигнал вознаграждения, необходимый для обучения. В таких условиях агент, совершая множество попыток, может так и не получить сигнал подкрепления, что приводит к отсутствию прогресса в обучении.

Одним из ключевых подходов к решению данной проблемы является увеличение плотности вознаграждения, то есть дополнительная генерация вознаграждения для всех взаимодействий агента со средой. В этом контексте особую значимость приобретают методы внутренней мотивации [6], основанные на идеях психологии и когнитивных наук [7], а также теории информации [8]. Внутренняя мотивация в обучении с подкреплением направлена на стимулирование исследовательского поведения агента за счет дополнительных (внутренних) сигналов вознаграждения. Эти сигналы не связаны напрямую с основной задачей, но поощряют активность, способствующую изучению среды. Аналогично тому, как у человека внутренняя мотивация (любопытство, стремление к новизне) способствует накоплению опыта и развитию навыков, искусственный агент может получать вознаграждение (быть замотивированным) за:

- исследование новых состояний [9];

- поиск непредсказуемости в среде [10; 11];

- достижение промежуточных целей [12; 13].

Дополнительное вознаграждение позволяет агенту эффективно обучаться даже в условиях крайне разреженного внешнего вознаграждения.

Также одним из направлений упрощения поиска оптимального поведения является иерархическое представление стратегий: факторизация длинных последовательностей действий. В отличие от непосредственного поиска управления на низком уровне (например, генерации команд для отдельных приводов робота), агент может оперировать абстрактными действиями, представляющими собой универсальные стратегии поведения — умения. Умения агрегируют последовательности примитивных действий, могут многократно использоваться в различных задачах и сокращают горизонт планирования, что существенно упрощает процесс обучения [14—16]. Более того, переход к обучению на уровне умений позволяет сконцентрировать вознаграждение на более высоком уровне абстракции, повышая его информативность и способствуя более быстрому формированию оптимальной стратегии.

Фундаментальным направлением развития методов обучения с подкреплением является использование моделей мира. Формирование внутренней модели среды рассматривается как одно из важнейших преимуществ интеллектуального агента, обеспечивающее более эффективное и безопасное обучение [6; 17]. Модель мира представляет собой систематизированное знание о динамике среды и служит основой для прогнозирования последствий действий без необходимости непосредственного взаимодействия со средой. Это открывает возможности для обобщения опыта, что значительно повышает эффективность обучения. Кроме того, неопределённость самой модели может рассматриваться как источник информации, позволяющий формировать дополнительные

сигналы вознаграждения и направлять агента на активное исследование среды [10; 11]. Использование модели мира выполняет ряд ключевых функций. Во-первых, она позволяет выявлять причинно-следственные зависимости и строить абстрактные представления о среде. Во-вторых, наличие модели предоставляет возможность предсказывать потенциально опасные состояния и избегать их ещё до фактического взаимодействия со средой [18—20]. Этот аспект особенно значим в сложных и потенциально опасных сценариях, где цена ошибки может быть чрезвычайно высока.

Однако даже обладание точной моделью мира не снимает другой фундаментальной сложности, характерной для реальных приложений: необходимость учитывать множество факторов, которые могут противоречить друг другу. Если в модельных средах агент сосредоточен преимущественно на достижении единственной цели, то при переходе к реальным практическим задачам поведение агента должно быть сбалансировано с учётом дополнительных ограничений и требований, которые могут конфликтовать между собой [21]. Среди них можно выделить как относительно мягкие ограничения, влияющие лишь на способ достижения основной цели, так и критические требования, связанные с безопасностью и минимизацией рисков. Последние, как правило, формализуются в виде дополнительных сигналов вознаграждения — штрафов, ограничивающих пространство допустимых стратегий. Таким образом, разработка алгоритмов, способных учитывать различные аспекты вознаграждения и обеспечивать безопасность в условиях реального применения (безопасное обучение с подкреплением, Safe RL), становится одной из приоритетных задач прикладного развития методов обучения с подкреплением.

Актуальность данного исследования определяется необходимостью создания подходов, которые одновременно повышают эффективность обучения и обеспечивают безопасность агента в условиях ограниченной и разреженной обратной связи. Совмещение методов генерации вознаграждения с построением моделей мира и методами безопасного обучения формирует перспективное направление, способное существенно расширить возможности обучения с подкреплением в реальных приложениях — от робототехники и автономного управления до систем поддержки принятия решений в критически важных областях.

Целью данной работы является разработка и исследование методов генерации дополнительного сигнала вознаграждения, направляющего исследовательское, безопасное и целевое поведение, использующего обучаемую модель мира.

Для достижения поставленной цели необходимо было решить следующие задачи:

1. Исследовать существующие методы формирования дополнительного вознаграждения в задачах исследования агентом среды.

2. Разработать метод формирования умений агента для факторизации процесса принятия решений в среде, не зависящий от целевого вознаграждения.

3. Разработать метод формирования целевого и исследовательского поведения, определяющий целевое множество через пространство скрытых представлений, формируемое обучаемой моделью мира.

4. Разработать метод одновременного планирования и обучения стратегии на основе модели мира с адаптивной настройки уровня безопасных ограничений, предъявляемого агенту.

5. Адаптировать методы вычисления сигнала дополнительного вознаграждения для применения с моделями мира, использующими локальные правила обучения Хебба.

Научная новизна:

1. Разработан оригинальный метод факторизации процесса принятия решений в форме набора умений, независимых от целевой функции вознаграждения, основанный на вычислении взаимной информации между умениями и состояниями, что позволило выделять инвариантные структуры поведения. Продемонстрирована применимость подхода для задач достижения целей. В отличие от существующих подходов предложенный алгоритм не требует сложных нейросетевых аппроксиматоров.

2. Предложен и реализован оригинальный метод обучения с генерацией целевого множества на основе дискретизации пространства скрытых представлений обучаемой модели мира. Продемонстрированы преимущества подхода в сравнении со стандартным подходом к такому обучению: улучшена эффективность достижения новых целей. Разработанный метод обеспечивает генерацию емкого и конечного множества целей для исследования среды.

3. Разработан метод совместного планирования и обучения стратегии в задачах с ограничениями безопасности, представляемыми через штрафы, обеспечивающий адаптивное правило переключения между двумя вариантами действия. Кроме того, разработанный алгоритм планирования динамически балансирует между риском и полезностью в зависимости от накопленного опыта, решая проблему фиксированного безопасного порога в стандартном кросс-энтропийном методе. Разработанный метод показал лучшие результаты эффективности и безопасности по отношению к только планированию или только использованию стратегии, обходя лучшие алгоритмы безопасного обучения с подкреплением.

4. Адаптированы методы вычисления сигнала дополнительного вознаграждения для использования в моделях мира, обучаемых с помощью локальных хеббовских правил, что показывает совместимость подходов генерации дополнительного вознаграждения на основе модели мира с нейроподобными и распределёнными архитектурами обучения. Разработан алгоритм генерации исследовательского вознаграждения на основе вычисления взаимной информации между состояниями и действиями.

Практическая значимость заключается в возможности применения разработанных методов для обучения интеллектуальных агентов в задачах реального мира, требующих развитых исследовательских возможностей. Предложенные подходы могут быть интегрированы в системы управления роботами, автоматизированными комплексами и другими интеллектуальными системами, где критичны безопасность и устойчивость работы в неопределённых условиях.

Разработанный в диссертационной работе метод формирования умений и факторизации процесса принятия решений способствует переносу поведения на более высокий уровень абстракции. Это позволяет эффективно решать задачи, требующие сложной координации и манипуляции, в частности, в робототехнических системах, таких как домашние сервисные роботы. Повторное использование сформированных умений при решении новых задач значительно снижает потребность в ручной настройке и переобучении, повышая обобщающую способность и снижая вычислительные затраты.

Предложенный алгоритм обучения, обеспечивающий автоматическую генерацию целей (целевого вознаграждения) и одновременное обучение стратегий исследования и достижения, демонстрирует высокую эффективность в задачах, требующих активного освоения среды. Он может быть применён в системах автономной навигации в неизвестных и динамически меняющихся пространствах, в том числе без предварительно заданной карты или структуры среды.

Метод безопасного управления, основанный на балансе между использованием стратегии и планированием с адаптивной настройкой порогов ограничений, позволяет отказаться от ручной и вычислительно затратной процедуры настройки фиксированных параметров. Такой подход особенно актуален для задач, в которых требования безопасности могут изменяться в процессе взаимодействия с окружающей средой.

Разработанный модельный алгоритм безопасного планирования обладает широкой применимостью в прикладных задачах, где требуется надёжное и безопасное поведение агента. Например, он может быть использован при управлении сервисными роботами, взаимодействующими с хрупкими объектами, а также в робототехнических системах, функционирующих в потенциально опасных для оборудования или человека условиях. Применение предлагаемого метода позволяет существенно снизить ущерб, наносимый во время обучения, и обеспечить выполнение целевых задач без нарушения требований безопасности. Это особенно важно в контексте человеко-ориентированных приложений, где безопасность взаимодействия человека и робота является критически значимой.

Представленная адаптация методов генерации вознаграждения для использования с моделями, обучающимися по правилам обучения Хебба, и соответствующий алгоритм вычисления взаимной информации (исследовательского сигнала) подтверждают возможность использования энергоэффективных нейроподобных систем, вдохновленных архитектурами из реального мира живых систем, для реализации сложного поведения искусственных агентов.

Методология и методы исследования. Разработанные алгоритмы опирались на методы машинного обучения. Для формализации рассматриваемых задач и оптимизации стратегий использовался математический аппарат марковских процессов принятия решений. Основными выступали методы обучения функций полезности на основе метода временных различий и оптимизации стратегии на основе актор-критик подхода. Помимо этого, для обучения модели мира, функций вознаграждения и штрафов использовались методы обучения с учителем. Для рассмотрения одного из подходов генерации вознаграждения был применен теоретико-информационный подход. Основой оценки эффективности и качества разных подходов выступал численный эксперимент с использованием вычислительной инфраструктуры, где основной метрикой качества выступало суммарное вознаграждение за эпизод взаимодействия. Программная реализация осуществлялась на языке программирования Python3 с использованием открытого программного обеспечения. Основой для тестирования выступали пакеты Gymnasium, SafetyGymnasium, а также собственные реализации на Brax. Для эффективной оптимизации алгоритмов обучения использовался фреймворк JAX для работы с графическими ускорителями (GPU).

Основные положения, выносимые на защиту:

1. Метод формирования умений на основе вычисления взаимной информации между последовательностью действий и состояниями, позволяющий обучать множество умений для повышения эффективности исследования среды и достижения целей.

2. Метод обучения агента на основе модельного подхода с формированием множества целей согласно дискретизации пространства скрытых представлений. Метод позволяет ускорить исследование и обучение в задачах достижения целей, выделяя значимые области для направленного исследования.

3. Метод безопасного планирования на основе обучаемой модели мира, использующий дополнительно обучаемую стратегию для корректировки предлагаемых планов, где баланс выбора определяется текущей оценкой полезности вознаграждения и штрафов. Использует неявный подход к обучению модели мира, обеспечивает лучшие показатели по достижению целей в условиях ограничений.

4. Алгоритм вычисления исследовательского сигнала расширения возможностей для генерации внутреннего вознаграждения в задачах обучения с подкреплением для моделей, обучающихся по правилу Хебба.

Достоверность полученных результатов обеспечивается применением математического аппарата для постановки задачи и обработки получаемых результатов, использованием широкодоступных симуляторов и наборов данных, признанных в научном сообществе, сравнением с результатами, полученными другими авторами. Достоверность подтверждается также апробацией на конференциях и публикациями в рецензируемых научных изданиях.

Апробация работы. Основные результаты работы докладывались на:

- Семинар Центра Когнитивного Моделирования МФТИ (2022, 2023, 2024).

- XXI Национальная конференция по искусственному интеллекту с международным участием 2023 (КИИ, 2023).

- XXVI Международная конференция «Нейроинформатика-2024».

- 23rd Mexican International Conference on Artificial Intelligence (MICAI, 2024).

Публикации. Основные результаты по теме диссертации изложены в 7 печатных изданиях,

4 [6; 12; 14; 22] из которых изданы в журналах собственного перечня МФТИ категории К1, 7 — в периодических научных журналах, индексируемых Scopus, 1 [19] — в материалах конференции CORE A уровня.

Личный вклад. Автор принимал активное участие в разработке агента HIMA в статье [22], предложил, разработал и реализовал метод вычисления сигнала расширения возможностей, аномалии для генерации исследовательского вознаграждения на основе модели мира, использующей локальные правила обучения. В работе [6] автор провел обзор существующих методов генерации вознаграждения, опирающихся на обучение модели мира, предложил систематизацию рассмотренных методов. В статье [14] автор разработал, реализовал и протестировал метод формирования умений на основе вычисления сигнала расширения возможностей. В статье на международную конференцию MICAI [12] автор разработал, реализовал и протестировал метод формирования множества целей, а также и полную архитектуру агента LAQUAXA; реализовал одну из тестовых сред. В работах [10; 23] участвовал в постановке тестовых экспериментов и

анализе получаемых результатов работы алгоритмов генерации вознаграждения. В работе на конференцию ECAI (CORE A) [19], посвященной безопасному обучению, разработал и реализовал алгоритм планирования и интеграцию его в общую архитектуру агента SPOWL, провел тестовый набор экспериментов. Во всех работах автор принимал активное участие в обсуждении получаемых результатов и их интерпретации.

Содержание диссертации соответствует специальности 1.2.1. Искусственный интеллект и машинное обучение, в частности, пунктам паспорта специальности:

6. Формализация и постановка задач управления и (поддержки) принятия решений на основе систем искусственного интеллекта и машинного обучения. Разработка систем управления с использованием систем искусственного интеллекта и методов машинного обучения в том числе — управления роботами, автомобилями, БПЛА и т.п.

7. Разработка специализированного математического, алгоритмического и программного обеспечения систем искусственного интеллекта и машинного обучения. Методы и средства взаимодействия систем искусственного интеллекта с другими системами и человеком-оператором.

12. Исследования в области «доверенных» систем класса ИИ, включая проблемы формирования тестовых выборок прецедентов, надежности, устойчивости, переобучения и т.д.

Объем и структура работы. Диссертация состоит из введения, 5 глав и заключения. Полный объём диссертации составляет 112 страниц, включая 30 рисунков и 4 таблицы. Список литературы содержит 134 наименования.

Глава 1. Методы обучения с подкреплением

Обучение с подкреплением представляет собой обширный класс методов машинного обучения, которые рассматривают процесс взаимодействия интеллектуального агента с внешней средой и предлагают подходы к обучению посредством максимизации некоторой количественной меры успеха [1; 24]. В основе парадигмы RL лежит идея последовательного принятия решений: взаимодействие агента разбивается на временные шаги, на каждом таком шаге агент наблюдает состояние среды, принимает решение о выполнении действия и получает обратную связь в виде нового наблюдения.

Ключевая особенность данного подхода заключается в скалярной мере эффективности поведения, определяемой на основе истории наблюдений и действий агента. Эта мера задает «правильность» действий выполняемых агентом, определяя его интеллектуальную составляющую [24, с. 40]. Мера эффективности поведения проверяет насколько совпадают действия агента с тем, что ожидается, выдавая метрику сходства с желаемым поведением. Как правило, она отражает суммарную полезность всех принятых агентом решений. Формализация меры эффективности позволяет сравнивать различные стратегии и служит фундаментом для построения алгоритмов оптимизации поведения агента [25].

В рамках обучения с подкреплением [1] центральную роль играет понятие функции вознаграждения — правила, которое задает скалярный сигнал, характеризующий каждое взаимодействие агента со средой. Эта функции формирует обратную связь для агента как локальную (на основе текущего действия, наблюдения), так и глобальную, связывая поведение агента с целью всего обучения — максимизацией ожидаемого суммарного вознаграждение за все время взаимодействия со средой. Таким образом, функция вознаграждения служит своего рода промежуточным звеном для определения меры эффективности агента (ожидаемого суммарного вознаграждения).

Данная глава посвящена формализации вышеописанных концепций, а также обзору существующих методов обучения с подкреплением, служащих фундаментом диссертации. Глава начинается с формализации задачи в терминах марковского процесса принятия решений в разделе 1.1. Далее рассматриваются основные методы для получения оптимальной стратегии поведения в разделе 1.2. Особое внимание уделяется подходу Model-based RL, в котором дополнительно к стратегии обучается модель мира (см. раздел 1.3), и отдельно рассматриваются вопросы обучения функции динамики переходов в разделе 1.4. Помимо обучения модели мира рассматриваются и вопросы использования её для обучения агента в подразделе 1.3.1 и принятия решений в подразделе 1.3.2. Вопросам определения функции вознаграждения посвящена отдельная глава 2.

1.1 Формализация задачи обучения для процессов принятия решений

Обучение с подкреплением рассматривает процесс взаимодействия агента А со средой Е. Агент — активная сторона, принимающая решения на основе предыдущей истории наблюдений Ь>г = (о0^ а0,..., а—1, ) какое действие должно быть выполнено а% ^ А(Нг). История наблюдений состоит из последовательного набора наблюдений ог, полученных агентом, и действий аг, исполненных средой на временном шаге Среда — система, описывающая динамику взаимодействия, определяет какое наблюдение должно быть следующим о+ ^ Е а). На Рисунке 1.1 отображена схема взаимодействия агента со средой.

Рисунок 1.1 — Взаимодействие агента со средой. Агент выполняет действия на основе наблюдений. Вознаграждение определяет предпочтительное поведение. Память прецедентов сохраняет историю взаимодействий. Модель мира позволяет реализовать дополнительный процесс взаимодействия.

Для принятия решений агент получает необходимую информацию из текущей истории взаимодействия ht, которую далее будем рассматривать как текущее состояние системы st. Здесь состояние не обязано в точности соответствовать истории, но оно должно содержать достаточно информации, чтобы определить следующее наблюдение на основании предпринятого агентом действия at: ot+1 ^ E (st, at). Отличительная особенность наблюдений от состояний заключается в том, что наблюдение может содержать недостаточно данных: невозможно определить функциональную зависимость вида ot+1 = f (ot,at). Далее будем считать, что наблюдения, выдаваемые средой, ot соответствуют состояниям st, то есть агент получает сразу состояние системы. В отдельных случаях (частично-наблюдаемого процесса) это не будет выполняться, что будет явно обозначено.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Латышев Артем Константинович, 2025 год

Список литературы

1. Sutton R. S., BartoA. G. Reinforcement learning: An introduction. — 2nd ed. — Cambridge, MA, USA : The MIT Press, 2018. — XXII, 526.

2. Staroverov A., Panov A. I. Hierarchical Landmark Policy Optimization for Visual Indoor Navigation // IEEE Access. — 2022. — Vol. 10. — P. 70447—70455.

3. Mnih V., Kavukcuoglu K., Silver D., Rusu A. A., Veness J., Bellemare M. G., Graves A., Ried-millerM., FidjelandA. K., Ostrovski G., [et al.]. Human-level control through deep reinforcement learning//Nature. -2015. — Vol. 518, no. 7540. —P. 529—533.

4. Gu S., Yang L., Du Y, Chen G., Walter F., Wang J., Knoll A. A Review of Safe Reinforcement Learning: Methods, Theory and Applications // Preprint arXiv:2205.10330. — 05/2024. — URL: https://arxiv.org/abs/2205.10330 (дата обращения 11.11.2024).

5. AmodeiD., Olah C., Steinhardt J., Christiano P., Schulman J., Mané D. Concrete problems in AI safety // Preprint arXiv:1606.06565. — 06/2016. — URL: https://arxiv.org/abs/1606.06565 (дата обращения 11.11.2024).

6. Latyshev A. K., Panov A. I. Intrinsic Motivation in Model-Based Reinforcement Learning: A Brief Review // Scientific and Technical Information Processing. — 2024. — Vol. 51, no. 5. — P. 460—470.

7. Ryan R. M., DeciE. L. Intrinsic and extrinsic motivations: Classic definitions and new directions // Contemporary educational psychology. — 2000. — Vol. 25, no. 1. — P. 54—67.

8. Aubret A., Matignon L., Hassas S. An information-theoretic perspective on intrinsic motivation in reinforcement learning: A survey // Entropy. — 2023. — Vol. 25, no. 2. — P. 327.

9. Bellemare M., Srinivasan S., Ostrovski G., Schaul T., Saxton D., Munos R. Unifying count-based exploration and intrinsic motivation // Proceedings of the 30th International Conference on Neural Information Processing Systems. — Red Hook, NY, USA : Curran Associates Inc., 2016. — P. 1479—1487.

10. Shiman N., Latyshev A., Kuderov P, Panov A. Exploring Ensemble Error Exploration for Un-supervised Reinforcement Learning // Advances in Neural Computation, Machine Learning, and Cognitive Research VIII. — Springer Nature Switzerland, 2025. — P. 199—209.

11. PathakD., GandhiD., GuptaA. Self-supervised exploration via disagreement//Proceedings of the 36th International Conference on Machine Learning. Vol. 97. — PMLR, 2019. — P. 5062—5071.

12. Latyshev A., Panov A. I. Latent State Space Quantization for Learning and Exploring Goals // Advances in Computational Intelligence. — Springer Nature Switzerland, 2025. — P. 28—39.

13. Hu E. S., Chang R., Rybkin O., Jayaraman D. Planning goals for exploration // Preprint arXiv:2303.13002. — 03/2023. — URL: https://arxiv.org/abs/2303.13002 (дата обращения 11.11.2024).

14. Latyshev A. K., Panov A. I. Skill Learning with Empowerment in Reinforcement Learning // Pattern Recognition and Image Analysis. — 2024. — Vol. 34. — P. 535—542.

15. Hafner D., Lee K.-H., Fischer I., Abbeel P. Deep hierarchical planning from pixels // Proceedings of the 36th International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2022. — P. 26091—26104.

16. Eysenbach B., Gupta A., Ibarz J., Levine S. Diversity is all you need: Learning skills without a reward function//Preprint arXiv:1802.06070. —11/2018. —URL: https://arxiv.org/abs/1802.06070 (дата обращения 11.11.2024).

17. Moerland T.M., BroekensJ., PlaatA., Jonker C.M., [et al.]. Model-based reinforcement learning: A survey//Foundations and Trends® in Machine Learning. — 2023.—Vol. 16, no. 1.—P. 1—118.

18. WenM., Topcu ^.Constrained cross-entropy method for safe reinforcement learning // Proceedings of the 32nd International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2018. — P. 7461—7471.

19. Latyshev A., Gorbov G., Panov A. I. Safe Planning and Policy Optimization via World Model Learning // Preprint arXiv:2506.04828. — 06/2025. — URL: https://arxiv.org/abs/2506.04828 (дата обращения 10.06.2025).

20. Huang W., JiJ., ZhangB., XiaC., YangY. SafeDreamer: Safe Reinforcement Learning with World Models // The Twelfth International Conference on Learning Representations. — 2024. — URL: https://openreview.net/forum?id=tsE5HLYtYg (дата обращения 11.11.2024).

21. Vamplew P, Smith B. J., Kdllstrom J., Ramos G., Radulescu R., Roijers D. M., Hayes C. F., Heintz F., Mannion P, Libin P. J., [et al.]. Scalar reward is not enough: A response to Silver, Singh, Precup and Sutton (2021) // Autonomous Agents and Multi-Agent Systems. — 2022. — Vol. 36, no. 2. — P. 41.

22. Dzhivelikian E., Latyshev A., Kuderov P., Panov A. I. Hierarchical intrinsically motivated agent planning behavior with dreaming in grid environments // Brain Informatics. — 2022. — Vol. 9. — P. 8.

23. Vasilev D. V, Latyshev A., Kuderov P, Shiman N., Panov A. I. Dynamical Distance Adaptation in Goal-Conditioned Model-Based Reinforcement Learning // Advances in Neural Computation, Machine Learning, and Cognitive Research VIII. — Springer Nature Switzerland, 2025. — P. 185—198.

24. Russell S. J., Norvig P. Artificial intelligence: a modern approach. — 4th ed. — Hoboken, USA : Pearson, 2021. — XVII, 1067.

25. Puterman M. L. Markov decision processes: discrete stochastic dynamic programming. — New York, NY, USA : Wiley, 1994. - XVII, 649.

26. BellmanR. Dynamic Programming// Science. — 1966. — Vol. 153, no. 3731. —P. 34—37.

27. Watkins C. J.C. H., Dayan P. Q-learning // Machine learning. — 1992. — Vol. 8. — P. 279—292.

28. HesselM, Modayil J., Van Hasselt H., Schaul T, Ostrovski G., Dabney W., Horgan DPiot B., AzarM.., Silver D. Rainbow: Combining improvements in deep reinforcement learning//Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence and Thirtieth Innovative Applications of Artificial Intelligence Conference and Eighth AAAI Symposium on Educational Advances in Artificial Intelligence. Vol. 32. — AAAI Press, 2018. — P. 3215—3222.

29. Lillicrap T. P, Hunt J. J., Pritzel A., Heess N., Erez T., Tassa Y, Silver D., Wierstra D. Continuous control with deep reinforcement learning // Preprint arXiv:1509.02971. — 07/2019. — URL: https://arxiv.org/abs/1509.02971 (дата обращения 11.11.2024).

30. Williams R. J.Simple statistical gradient-following algorithms for connectionist reinforcement learning // Machine Learning. — 1992. — Vol. 8. — P. 229—256.

31. Konda V., Tsitsiklis J.Actor-critic algorithms // Proceedings of the 13th International Conference on Neural Information Processing Systems. — MIT Press, 1999. — P. 1008—1014.

32. Schulman J., Wolski F., Dhariwal P, Radford A., Klimov O. Proximal policy optimization algorithms // Preprint arXiv:1707.06347. — 08/2017. — URL: https://arxiv.org/abs/1707.06347 (дата обращения 11.11.2024).

33. Haarnoja T., Zhou A., Abbeel P., Levine S. Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor // Preprint arXiv:1801.01290. — 08/2018. — URL: https://arxiv.org/abs/1801.01290 (дата обращения 11.11.2024).

34. Ha D, Schmidhuber J.World Models // Preprint arXiv:1803.10122. — 05/2018. — URL: https://arxiv.org/abs/1803.10122 (дата обращения 11.11.2024).

35. Sutton R Dyna, an integrated architecture for learning, planning, and reacting // ACM Sigart Bulletin. — 1991. — Vol. 2, no. 4. — P. 160—163.

36. Janner M., Fu J., Zhang M., Levine S. When to Trust Your Model: Model-Based Policy Optimization // Proceedings of the 33rd International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2019. — P. 12519—12530.

37. Hansen N., Su H., Wang X. TD-MPC2: Scalable, Robust World Models for Continuous Control // The Twelfth International Conference on Learning Representations. — 2024. — URL: https://openreview.net/forum?id=Oxh5CstDJU (дата обращения 11.11.2024).

38. Hafner D., Lillicrap T., Norouzi M., Ba J. Mastering atari with discrete world models // Preprint arXiv:2010.02193. — 02/2022. — URL: https://arxiv.org/abs/2010.02193 (дата обращения 11.11.2024).

39. Hafner D., Pasukonis J., Ba J., Lillicrap T. Mastering Diverse Domains through World Models // Preprint arXiv:2301.04104. — 04/2024. — URL: https://arxiv.org/abs/2301.04104 (дата обращения 11.11.2024).

40. NegenbornR. R., De Schutter B., WieringM. A., Hellendoorn H. Learning-based model predictive control for Markov decision processes // IF AC Proceedings Volumes. — 2005. — Vol. 38, no. 1. — P. 354—359.

41. Rubinstein R. The cross-entropy method for combinatorial and continuous optimization // Methodology and computing in applied probability. — 1999. — Vol. 1. — P. 127—190.

42. Williams G., Wagener N., Goldfain B., Drews P., Rehg J. M., Boots B., Theodorou E. A. Information theoretic MPC for model-based reinforcement learning // 2017 IEEE international conference on robotics and automation (ICRA). — IEEE, 2017. — P. 1714—1721.

43. Silver D., Huang A., Maddison C. J., Guez A., Sifre L., Van Den Driessche G., Schrittwieser J., AntonoglouI., Panneershelvam V, LanctotM., [et al.]. Mastering the game of Go with deep neural networks and tree search // Nature. — 2016. — Vol. 529, no. 7587. — P. 484—489.

44. Silver D., Hubert T., Schrittwieser J., Antonoglou I., Lai M., Guez A., Lanctot M., Sifre L., Ku-maran D., Graepel T., [et al.]. A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play // Science. — 2018. — Vol. 362, no. 6419. — P. 1140—1144.

45. Schrittwieser J., Antonoglou I., Hubert T., Simonyan K., Sifre L., Schmitt S., Guez A., Lockhart E., Hassabis D., Graepel T., [et al.]. Mastering atari, go, chess and shogi by planning with a learned model // Nature. — 2020. — Vol. 588, no. 7839. — P. 604—609.

46. Gesser R. S., Lima D. M., Normey-Rico J. E. Robust Model Predictive Control: Implementation Issues with Comparative Analysis // IFAC-PapersOnLine. — 2018. — Vol. 51, no. 25. — P. 478—483. — 9th IFAC Symposium on Robust Control Design ROCOND 2018.

47. Liu Z., Zhou H., Chen B., Zhong S., Hebert M., Zhao D. Constrained model-based reinforcement learning with robust cross-entropy method // Preprint arXiv:2010.07968. — 03/2021. — URL: https://arxiv.org/abs/2010.07968 (дата обращения 11.11.2024).

48. Chua K., Calandra R., McAllister R., Levine S. Deep reinforcement learning in a handful of trials using probabilistic dynamics models // Proceedings of the 32nd International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2018. — P. 4759—4770.

49. Oudeyer P. -Y, Kaplan F. What is intrinsic motivation? A typology of computational approaches // Frontiers in neurorobotics. — 2007. — Vol. 1. — P. 108.

50. Sekar R., Rybkin O., Daniilidis K., Abbeel P, Hafner D., Pathak D. Planning to explore via self-supervised world models // Proceedings of the 37th International Conference on Machine Learning. Vol. 119. — PMLR, 2020. — P. 8583—8592.

51. Castanet N., Lamprier S., Sigaud O. Stein variational goal generation for adaptive exploration in multi-goal reinforcement learning // Preprint arXiv:2206.06719. — 05/2023. — URL: https://arxiv.org/abs/2206.06719 (дата обращения 11.11.2024).

52. Pathak D. , Agrawal P. , Efros A. A. , Darrell T. Curiosity-driven exploration by self-supervised prediction // Proceedings of the 34th International Conference on Machine Learning. Vol. 70. — PMLR, 2017. — P. 2778—2787.

53. Mendonca R., Rybkin O., Daniilidis K., Hafner D., Pathak D. Discovering and achieving goals via world models // Proceedings of the 35th International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2021. — P. 24379—24391.

54. Zadaianchuk A., Seitzer M., Martius G. Self-supervised visual reinforcement learning with object-centric representations // Preprint arXiv:2011.14381. — 11/2020. — URL: https://arxiv.org/abs/2011.14381 (дата обращения 11.11.2024).

55. Sancaktar C., Blaes S., Martius G. Curious Exploration via Structured World Models Yields Zero-Shot Object Manipulation // Proceedings of the 36th International Conference on Neural Information Processing Systems. — Curran Associates, Inc., 2022. — P. 24170—24183.

56. KlyubinA. S., PolaniD., NehanivC.L. All else being equal be empowered//European Conference on Artificial Life. — Springer, 2005. — P. 744—753.

57. Stooke A., Achiam J., Abbeel P. Responsive safety in reinforcement learning by pid lagrangian methods // Proceedings of the 37th International Conference on Machine Learning. Vol. 119. — PMLR, 2020. — P. 9133—9143.

58. As Y, Usmanova I., Curi S., Krause A. Constrained Policy Optimization via Bayesian World Models // International Conference on Learning Representations. — 2022. — URL: https://openreview.net/forum?id=PRZoSmCinhf (дата обращения 11.11.2024).

59. Nagabandi A., Kahn G., Fearing R. S., Levine S. Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning // 2018 IEEE international conference on robotics and automation (ICRA). — IEEE, 2018. — P. 7559—7566.

60. Hafner D., Lillicrap T., Fischer I., Villegas R., Ha D., Lee H., Davidson J.Learning Latent Dynamics for Planning from Pixels // Proceedings of the 36th International Conference on Machine Learning. Vol. 97. — PMLR, 2019. — P. 2555—2565.

61. Wei R., Lambert N., McDonald A., Garcia A., Calandra R A unified view on solving objective mismatch in model-based reinforcement learning // Preprint arXiv:2310.06253. — 04/2024. — URL: https://arxiv.org/abs/2310.06253 (дата обращения 11.11.2024).

62. Xu T., Li Z., YuY. Error bounds of imitating policies and environments // Proceedings of the 34th International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2020. — P. 15737—15749.

63. LambertN., PisterK., CalandraR. Investigating compounding prediction errors in learned dynamics models // Preprint arXiv:2203.09637. — 03/2022. — URL: https://arxiv.org/abs/2203.09637 (дата обращения 11.11.2024).

64. Asadi K., Cater E., Misra D., Littman M. L. Towards a simple approach to multi-step model-based reinforcement learning // Preprint arXiv:1811.00128. — 10/2018. — URL: https://arxiv.org/abs/1811.00128 (дата обращения 11.11.2024).

65. Luo Y, Xu H., Li Y, Tian Y., Darrell T., Ma T. Algorithmic framework for model-based deep reinforcement learning with theoretical guarantees // Preprint arXiv:1807.03858. — 02/2021. — URL: https://arxiv.org/abs/1807.03858 (дата обращения 11.11.2024).

66. Kiureghian A. D., Ditlevsen O. Aleatory or epistemic? Does it matter? // Structural Safety. — 2009. — Vol. 31, no. 2. — P. 105—112. — Risk Acceptance and Risk Communication.

67

68

69

70

71

72

73

74

75

76

77

78

79

80

Ghavamzadeh M., Mannor S., Pineau J., Tamar A., [et al.]. Bayesian reinforcement learning: A survey//Foundations and Trends® in Machine Learning.—2015. — Vol. 8,no. 5/6.—P. 359—483.

Gal Y, Ghahramani Z. Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning // Proceedings of The 33rd International Conference on Machine Learning. Vol. 48. — PMLR, 2016. — P. 1050—1059.

Kurutach T., Clavera I., Duan Y, Tamar A., Abbeel P. Model-ensemble trust-region policy optimization // Preprint arXiv:1802.10592. — 10/2018. — URL: https://arxiv.org/abs/1802.10592 (дата обращения 11.11.2024).

Williams C. K., Rasmussen C. E. Gaussian processes for machine learning. — Cambridge, MA, USA : The MIT press, 2006. — XVIII, 248.

Deisenroth M., Rasmussen C. E. PILCO: A model-based and data-efficient approach to policy search // Proceedings of the 28th International Conference on International Conference on Machine Learning. — Omnipress, 2011. —P. 465—472.

Watter M., Springenberg J., Boedecker J., RiedmillerM.Embed to control: A locally linear latent dynamics model for control from raw images // Proceedings of the 29th International Conference on Neural Information Processing Systems - Volume 2. — MIT Press, 2015. — P. 2746—2754.

Ghosh D., Gupta A., Levine S. Learning actionable representations with goal-conditioned policies // Preprint arXiv:1811.07819. — 01/2019. — URL: https://arxiv.org/abs/1811.07819 (дата обращения 11.11.2024).

Thomas V, Bengio E., Fedus W., Pondard J., Beaudoin P., Larochelle H., Pineau J., Precup D., Bengio Y Disentangling the independently controllable factors of variation by interacting with the world // Preprint arXiv:1802.09484. — 02/2018. — URL: https://arxiv.org/abs/1802.09484 (дата обращения 11.11.2024).

Hafner D., Lillicrap T., BaJ., NorouziM. Dream to control: Learning behaviors by latent imagination // Preprint arXiv:1912.01603. — 03/2020. — URL: https://arxiv.org/abs/1912.01603 (дата обращения 11.11.2024).

Lambert N., Amos B., Yadan O., Calandra R. Objective mismatch in model-based reinforcement learning//PreprintarXiv:2002.04523. —04/2021. —URL: https://arxiv.org/abs/2002.04523 (дата обращения 11.11.2024).

Oh J., Singh S., Lee H. Value prediction network // Proceedings of the 31st International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2017. — P. 6120—6130.

Marblestone A. H., Wayne G., Kording K. P. Toward an integration of deep learning and neuroscience // Frontiers in computational neuroscience. — 2016. — Vol. 10. — P. 215943.

Hebb D. O. The organization of behavior: A neuropsychological theory. — 1st ed. — New York, NY, USA : Psychology press, 2002. — 279 p.

Krotov D. Hierarchical associative memory // Preprint arXiv:2107.06446. — 07/2021. — URL: https://arxiv.org/abs/2107.06446 (дата обращения 11.11.2024).

81. Hopfield J.J.Neural networks and physical systems with emergent collective computational abilities. //Proceedings of the national academy of sciences. — 1982. — Vol. 79, no. 8. —P. 2554—2558.

82. BennaM. K., Fusi S. Computational principles of synaptic memory consolidation // Nature neuroscience. — 2016. — Vol. 19, no. 12. — P. 1697—1706.

83. Schmidhuber J.Learning complex, extended sequences using the principle of history compression // Neural computation. — 1992. — Vol. 4, no. 2. — P. 234—242.

84. Hawkins J., AhmadS. Why neurons have thousands of synapses, a theory of sequence memory in neocortex // Frontiers in neural circuits. — 2016. — Vol. 10. — P. 23.

85. Hawkins J. A thousand brains: a new theory of intelligence. — 1st ed. — New York, NY, USA : Basic Books, 2021. —288 p.

86. DaviesM., WildA., OrchardG., SandamirskayaY., GuerraG.A.F., JoshiP.,PlankP.,RisbudS. R. Advancing neuromorphic computing with loihi: A survey of results and outlook // Proceedings of the IEEE. — 2021. — Vol. 109, no. 5. — P. 911—934.

87. Miconi T., Stanley K., CluneJ. Differentiable plasticity: training plastic neural networks with back-propagation // Proceedings of the 35th International Conference on Machine Learning. Vol. 80. — PMLR, 2018. — P. 3559—3568.

88. Burda Y., Edwards H., Storkey A., Klimov O. Exploration by random network distillation // International Conference on Learning Representations. — 2019. — URL: https://openreview.net/forum?id=H1lJJnR5Ym (дата обращения 11.11.2024).

89. Andrychowicz M., Wolski F., Ray A., Schneider J., Fong R., Welinder P, McGrew B., Tobin J., Pieter Abbeel O., Zaremba W. Hindsight experience replay // Proceedings of the 31st International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2017. — P. 5055—5065.

90. Amin S., Gomrokchi M., Satija H., Van Hoof H., Precup D. A survey of exploration methods in reinforcement learning // Preprint arXiv:2109.00157. — 09/2021. — URL: https://arxiv.org/abs/2109.00157 (дата обращения 11.11.2024).

91. Altman E. Constrained Markov Decision Processes. — 1st ed. — New York, NY, USA : Routledge, 2021. —256 p.

92. Arora S., Doshi P. A survey of inverse reinforcement learning: Challenges, methods and progress // Artificial Intelligence. — 2021. — Vol. 297. — P. 103500.

93. Adams S., Cody T., BelingP. A. A survey of inverse reinforcement learning// Artificial Intelligence Review. — 2022. — Vol. 55, no. 6. — P. 4307—4346.

94. TorabiF., WarnellG., StoneP. Behavioral cloningfromobservation//PreprintarXiv:1805.01954.— 05/2018. — URL: https://arxiv.org/abs/1805.01954 (дата обращения 11.11.2024).

95. Laskin M., Yarats D., Liu H., Lee K., Zhan A., Lu K., Cang C., Pinto L., Abbeel P. Urlb: Unsupervised reinforcement learning benchmark // Preprint arXiv:2110.15191. — 10/2021. — URL: https://arxiv.org/abs/2110.15191 (дата обращения 11.11.2024).

96. Schmidhuber J. A possibility for implementing curiosity and boredom in model-building neural controllers // Proc. of the international conference on simulation of adaptive behavior: From animals to animats. — 1991. — P. 222—227.

97. GregorK., Rezende D. J., WierstraD. Variational intrinsic control//Preprint arXiv:1611.07507.— 11/2016. —URL: https://arxiv.org/abs/1611.07507 (дата обращения 11.11.2024).

98. Sharma A., Gu S., Levine S., Kumar V., Hausman K. Dynamics-aware unsupervised discovery of skills // Preprint arXiv:1907.01657. — 02/2020. — URL: https://arxiv.org/abs/1907.01657 (дата обращения 11.11.2024).

99. Strehl A. L., Littman M. L. An analysis of model-based interval estimation for Markov decision processes// Journal of Computer and System Sciences. —2008. — Vol. 74, no. 8. —P. 1309—1331.

100. Groth O., Wulfmeier M., Vezzani G., Dasagi V., Hertweck T., Hafner R., Heess N., Riedmiller M. Is curiosity all you need? on the utility of emergent behaviours from curious exploration // Preprint arXiv:2109.08603. — 09/2021. — URL: https://arxiv.org/abs/2109.08603 (дата обращения 11.11.2024).

101. Kim H., Kim J., Jeong Y, Levine S., SongH. O. EMI: Exploration with Mutual Information // Proceedings of the 36th International Conference on Machine Learning. Vol. 97. — PMLR, 2019. — P. 3360—3369.

102. Burda Y, Edwards H., Pathak D., Storkey A., Darrell T., Efros A. A. Large-scale study of curiosity-driven learning // Preprint arXiv:1808.04355. — 08/2018. — URL: https://arxiv.org/abs/1808.04355 (дата обращения 11.11.2024).

103. Hafez M. B., Weber C., Kerzel M., Wermter S. Deep intrinsically motivated continuous actor-critic for efficient robotic visuomotor skill learning // Paladyn, Journal of Behavioral Robotics. — 2019. — Vol. 10, no. 1. — P. 14—29.

104. Kim K., SanoM., De Freitas J., Haber N., Yamins D. Active world model learning with progress curiosity // Proceedings of the 37th International Conference on Machine Learning. Vol. 119. — PMLR, 2020. — P. 5306—5315.

105. Achiam J., Sastry S. Surprise-based intrinsic motivation for deep reinforcement learning // Preprint arXiv:1703.01732. — 03/2017. — URL: https://arxiv.org/abs/1703.01732 (дата обращения 11.11.2024).

106. Yao Y, Xiao L., An Z., Zhang W., Luo D. Sample efficient reinforcement learning via modelensemble exploration and exploitation // 2021 IEEE International Conference on Robotics and Automation (ICRA). — IEEE, 2021. — P. 4202—4208.

107. Shyam P, Jaskowski W., Gomez F. Model-based active exploration // Proceedings of the 36th International Conference on Machine Learning. Vol. 97. — PMLR, 2019. — P. 5779—5788.

108. HouthooftR., ChenX., Duan Y., SchulmanJ.,De TurckF., AbbeelP. Vime: Variational information maximizing exploration // Proceedings of the 30th International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2016. — P. 1117—1125.

109

110

111

112

113

114

115

116

117

118

119

120

121

122

Shi L. X., Lim J. J., Lee Y. Skill-based model-based reinforcement learning // Preprint arXiv:2207.07560. — 12/2022. —URL: https://arxiv.org/abs/2207.07560 (датаобращения 11.11.2024).

Sutton R S., Precup D., Singh S. Between MDPs and semi-MDPs: A framework for temporal abstraction in reinforcement learning // Artificial intelligence. — 1999. — Vol. 112, no. 1/2. — P. 181—211.

Bacon P.-L., Harb J., Precup D. The option-critic architecture // Proceedings of the Thirty-First AAAI Conference on Artificial Intelligence. — AAAI Press, 2017. — P. 1726—1734.

Achiam J., Edwards H., Amodei D., Abbeel P. Variational option discovery algorithms // Preprint arXiv:1807.10299. — 07/2018. — URL: https://arxiv.org/abs/1807.10299 (дата обращения 11.11.2024).

Liu M., Zhu M., Zhang W. Goal-conditioned reinforcement learning: Problems and solutions // Preprint arXiv:2201.08299. — 09/2022. — URL: https://arxiv.org/abs/2201.08299 (дата обращения 11.11.2024).

Hartikainen K., Geng X., Haarnoja T., Levine S. Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery // International Conference on Learning Representations. — 2020. — URL: https://openreview.net/forum?id=H1lmhaVtvr (дата обращения 11.11.2024).

Pong V., DalalM., Lin S., Nair A., Bahl S., Levine S. Skew-Fit: State-Covering Self-Supervised Reinforcement Learning // Proceedings of the 37th International Conference on Machine Learning. Vol. 119. — PMLR, 2020. — P. 7783—7792.

Ecoffet A., Huizinga J., Lehman J., Stanley K. O., Clune J.First return, then explore // Nature. — 2021. — Vol. 590, no. 7847. — P. 580—586.

Выготский Л. С. Мышление и речь. — 5, испр. — М. : Издательство «Лабиринт», 1999. — С. 352.

Hayes C. F., Radulescu R, Bargiacchi E., Küllstrom J., Macfarlane M., Reymond M., Verstraeten T., Zintgraf L. M., Dazeley R, Heintz F., [et al.]. A practical guide to multi-objective reinforcement learning and planning // Autonomous Agents and Multi-Agent Systems. — 2022. — Vol. 36, no. 1. — P. 26.

Brunke L., Greeff M., Hall A. W., Yuan Z., Zhou S., Panerati J., Schoellig A. P. Safe Learning in Robotics: From Learning-Based Control to Safe Reinforcement Learning // Annual Review of Control, Robotics, and Autonomous Systems. — 2022. — Vol. 5. — P. 411—444.

Garcia J., Fernández F. A comprehensive survey on safe reinforcement learning // Journal of Machine Learning Research. — 2015. — Vol. 16, no. 1. — P. 1437—1480.

Nocedal J., Wright S. J.Numerical Optimization. — 2nd ed. — New York, NY, USA : Springer, 2006. — XXII, 664.

Eysenbach B., Salakhutdinov R. R, Levine S. Search on the Replay Buffer: Bridging Planning and Reinforcement Learning // Proceedings of the 33rd International Conference on Neural Information Processing Systems. — Curran Associates, Inc., 2019.

123. Jung T., Polani D., Stone P. Empowerment for continuous agent—environment systems // Adaptive Behavior. — 2011. — Vol. 19, no. 1. — P. 16—39.

124. Salge C., Glackin C., Polani D. Empowerment-an introduction // Guided Self-Organization: Inception. — 2014. — P. 67—114.

125. Brockman G., Cheung V., Pettersson L., Schneider J., Schulman J., Tang J., Zaremba W. Openai gym // Preprint arXiv:1606.01540. — 06/2016. — URL: https://arxiv.org/abs/1606.01540 (дата обращения 11.11.2024).

126. TodorovE., Erez T., Tassa Y. Mujoco: A physics engine for model-based control // 2012IEEE/RSJ international conference on intelligent robots and systems. — IEEE, 2012. — P. 5026—5033.

127. Raffin A., Hill A., Gleave A., Kanervisto A., Ernestus M., Dormann N.Stable-baselines3: Reliable reinforcement learning implementations // Journal of machine learning research. — 2021. — Vol. 22, no. 268. — P. 1—8.

128. Nikulin A., Kurenkov V., Zisman I., Agarkov A., Sinii V., Kolesnikov S. XLand-minigrid: Scalable meta-reinforcement learning environments in JAX // Proceedings of the 38th International Conference on Neural Information Processing Systems. — Curran Associates Inc., 2024. — P. 43809—43835.

129. Freeman C. D., Frey E., Raichuk A., Girgin S., Mordatch I., Bachem O. Brax-a differentiable physics engine for large scale rigid body simulation // Preprint arXiv:2106.13281. — 06/2021. — URL: https://arxiv.org/abs/2106.13281 (дата обращения 11.11.2024).

130. Bradbury J., Frostig R., Hawkins P., Johnson M. J., Leary C., Maclaurin D., Necula G., Paszke A., VanderPlas J., Wanderman-Milne S., [et al.]. JAX: composable transformations of Python+ NumPy programs. — 2018. — URL: http://github.com/jax-ml/jax (дата обращения 27.01.2025).

131. Lavoie S., Tsirigotis C., Schwarzer M., Vani A., Noukhovitch M., Kawaguchi K., Courville A. Simplicial Embeddings in Self-Supervised Learning and Downstream Classification // The Eleventh International Conference on Learning Representations. — 2023. — URL: https://openreview.net/forum?id=RWtGreRpovS (дата обращения 11.11.2024).

132. ChenX., WangC., ZhouZ., RossK. Randomized ensembled double q-learning: Learning fast without a model // Preprint arXiv:2101.05982. — 03/2021. — URL: https://arxiv.org/abs/2101.05982 (дата обращения 11.11.2024).

133. Ji J., Zhang B., Zhou J., Pan X., Huang W., Sun R., Geng Y, Zhong Y., Dai J., Yang Y Safety Gymnasium: A Unified Safe Reinforcement Learning Benchmark // Proceedings of the 37th International Conference on Neural Information Processing Systems. — Curran Associates, Inc., 2023. — P. 18964—18993.

134. Liu Z.., Cen Z.., Isenbaev V., Liu W., Wu S., Li B., Zhao D. Constrained variational policy optimization for safe reinforcement learning // Proceedings of the 39th International Conference on Machine Learning. Vol. 162. — PMLR, 2022. — P. 13644—13668.

Список рисунков

1.1 Взаимодействие агента со средой ............................................................13

2.1 Конвертация данных агентом..................................................................30

3.1 Среды для тестирования исследовательского вознаграждения ............................44

3.2 Тепловые карты обучаемых расстояний до цели............................................47

3.3 Процесс формирования умений ..............................................................50

3.4 Траектории сформированных умений........................................................53

3.5 Эффективность достижения целей с использованием обученных умений................54

3.6 Схема обучения LAQUAXA ..................................................................56

3.7 Примеры сред для тестирования исследования и достижения целей......................58

3.8 Тестирование квантизации для формирования целей........................................59

3.9 Эффективность комбинирования стратегий..................................................60

3.10 Абляционное исследование LAQUAXA......................................................61

4.1 Схема архитектуры модели мира SPOWL....................................................66

4.2 Схема адаптивного безопасного планирования ..............................................68

4.3 Среды Safety Gymnasium......................................................................71

4.4 Сравнение фиксированных порогов безопасности для глобальной и локальной оценки 73

4.5 Зависимость эффективности CCE от глобальной оценки ..................................73

4.6 Исследование баланса между планом и стратегией..........................................75

4.7 Сравнение методов агрегации оценок ожидаемых нарушений для целевой функции потерь SPOWL ..................................................................................76

4.8 Абляционное исследование ансамблей штрафов ............................................77

4.9 Абляционное исследование влияния вспомогательного декодировщика при

различных весах функции потерь ............................................................78

4.10 Кривые обучения безопасных алгоритмов ....................................................80

5.1 Схема оценки статистики посещений состояний............................................88

5.2 Схема процесса обновления памяти представлений ........................................90

5.3 Поля идеальных значений взаимной информации..........................................91

5.4 Кластеры в задаче четырёх комнат............................................................92

5.5 Поля точного и оценочного исследовательского вознаграждения на основе взаимной информации ....................................................................................93

5.6 Уровни в среде четыре комнаты для задачи достижения целей............................93

5.7 Сравнение итоговой эффективности агента с разными сигналами внутреннего вознаграждения ................................................................................95

5.8 Сравнение агентов с различными сигналами внутреннего вознаграждения в задаче достижения целей ..............................................................................96

Список таблиц

1 Результаты оценки исследовательского поведения в различных средах....................45

2 Гиперпараметры алгоритма формирования умений ........................................52

3 Сравнение SPOWL с другими методами со строгим порогом..............................79

4 Сравнение SPOWL с другими методами со стандартным порогом........................81

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.