Систематизация и улучшение алгоритмов офлайн-обучения с подкреплением тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Никулин Александр Павлович

  • Никулин Александр Павлович
  • кандидат науккандидат наук
  • 2026, «Московский физико-технический институт (национальный исследовательский университет)»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 111
Никулин Александр Павлович. Систематизация и улучшение алгоритмов офлайн-обучения с подкреплением: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Московский физико-технический институт (национальный исследовательский университет)». 2026. 111 с.

Оглавление диссертации кандидат наук Никулин Александр Павлович

Введение

Глава 1. Обзор офлайн-обучения с подкреплением

1.1 Основы обучения с подкреплением

1.1.1 Формализация через MDP

1.1.2 Различие между онлайн и офлайн обучением с подкреплением

1.2 Особенности офлайн-обучения с подкреплением

1.2.1 Распределительный сдвиг и ошибка экстраполяции

1.2.2 Ограничения отсутствия исследования среды

1.2.3 Сравнение с имитационным обучением

1.3 Ключевые направления развития офлайн-обучения с подкреплением

1.3.1 Поведенческое клонирование

1.3.2 Штрафующие подходы

1.3.3 Консервативные подходы

1.3.4 Decision Transformer и использование последовательностных моделей

1.3.5 Ансамблевые методы

1.4 Наборы данных для сравнения алгоритмов

1.4.1 D4RL и V-D4RL как стандартная платформа

1.4.2 Представленные среды

1.5 Мотивация к минимализму и воспроизводимости

1.6 Выводы

Глава 2. CORL: открытая библиотека для офлайн-обучения

с подкреплением

2.1 Мотивация

2.1.1 Контекст

2.1.2 Отличия от предыдущих решений

2.2 Архитектура CORL

Стр.

2.2.1 Один файл на один алгоритм

2.2.2 YAML-конфигурации: хранение параметров среды и алгоритма

2.2.3 Интеграция с системами логирования

2.3 Эксперименты и результаты

2.3.1 Экспериментальный протокол

2.3.2 Результаты офлайн-обучения на D4RL

2.3.3 Наблюдения

2.3.4 Результаты до-обучения в онлайне

2.3.5 Наблюдения

2.4 Выводы

Глава 3. ReBRAC: минималистичный алгоритм для

офлайн-обучения с подкреплением

3.1 Мотивация

3.2 Штрафующие методы

3.2.1 BRAC и производные алгоритмы

3.2.2 Ограничения и чувствительность к гиперпараметрам

3.3 Основные нововведения в ReBRAC

3.3.1 Более глубокие сети

3.3.2 Нормализация слоев

3.3.3 Увеличенные мини-батчи

3.3.4 Раздельное штрафование актора и критика

3.3.5 Изменение коэффициента дисконтирования

3.4 Эксперименты и результаты

3.4.1 Результаты на D4RL

3.4.2 Результаты на V-D4RL

3.5 Анализ и абляции

3.5.1 Оценка эффекта предложенных улучшений

3.5.2 Оценка влияния глубины сетей

3.5.3 Чувствительность к гиперпараметрам

3.6 Выводы

Стр.

Глава 4. SAC-RND: ускорение оценки неопределенности без

использования ансамблей критиков

4.1 Мотивация

4.2 Вводные сведения

4.2.1 Офлайн-обучение с подкреплением как анти-исследование

4.2.2 Дистилляция случайных сетей

4.2.3 Мультипликативные взаимодействия

4.3 Проблема дискриминативности

4.4 Ограничения простой конкатенации

4.5 Метод SAC-RND

4.5.1 Дистилляция случайных сетей

4.5.2 Анти-исследовательский бонус

4.5.3 Функции потерь

4.6 Эксперименты и результаты

4.6.1 Эксперименты на Gym средах

4.6.2 Эксперименты на AntMaze средах

4.7 Анализ

4.7.1 Почему FiLM-обусловливание полезно

4.7.2 Сравнение вариантов обусловливания в RND

4.7.3 Анализ времени обучения

4.8 Выводы

Заключение

Список литературы

Список рисунков

Список таблиц

Приложение А. Полные таблицы

А.1 Таблицы CORL

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Систематизация и улучшение алгоритмов офлайн-обучения с подкреплением»

Введение

Актуальность темы. В последние годы обучение с подкреплением (Reinforcement Learning, RL) стало одной из ключевых парадигм искусственного интеллекта, демонстрируя значительные успехи в таких областях, как дообучение больших языковых моделей, робототехника, автономное управление и рекомендательные системы. Однако классический подход, основанный на интерактивном взаимодействии агента со средой, часто оказывается непрактичным в реальных условиях из-за высокой стоимости, ограничений по безопасности или невозможности проведения масштабных экспериментов. В этой связи офлайн-обучение с подкреплением (Offline RL) выдвигается на первый план как перспективное направление, позволяющее обучать стратегии на фиксированных датасетах без дополнительного взаимодействия со средой.

Несмотря на активное развитие области офлайн-обучения с подкреплением, исследователи сталкиваются с целым рядом фундаментальных проблем. Среди них — проблема распределительного сдвига, ошибка экстраполяции и отсутствие механизма исследования среды. Существующие алгоритмические подходы стремятся ограничить поведение агента рамками имеющихся данных, однако они существенно различаются по уровню консерватизма, вычислительной сложности и устойчивости к гиперпараметрам. В результате в литературе сформировался широкий спектр решений: от поведенческого клонирования и регуляризационных методов до ансамблей критиков и трансформерных моделей. Вместе с тем, несмотря на большое число публикаций, остается проблема воспроизводимости результатов и отсутствие единых инструментов, позволяющих исследователям напрямую сопоставлять алгоритмы, не теряя в прозрачности реализации.

В совокупности это затрудняет как практическое применение методов офлайн-обучения с подкреплением, так и воспроизводимость научных результатов. На фоне этих вызовов большое значение приобретают минима-листичные алгоритмы и открытые библиотеки, которые, с одной стороны, обеспечивают конкурентоспособные результаты, а с другой — способствуют прозрачности, воспроизводимости и удобству прототипирования. Таким образом, актуальность настоящей работы определяется необходимостью си-

стематизировать современные методы офлайн-обучения с подкреплением, выявить общие принципы их построения и предложить улучшения, направленные на повышение эффективности и воспроизводимости алгоритмов.

Степень разработанности темы. Классические обзорные работы [1; 2] формализовали задачу офлайн-обучения с подкреплением как частный случай марковского процесса принятия решений с ограничением на распределение данных и выделили ключевые проблемы — ошибку экстраполяции и распределительный сдвиг между политикой данных и целевой политикой. Для их решения предложено несколько классов подходов: консервативное обучение [3], имитационно-регуляризованные методы [4], а также алгоритмы с явной оценкой неопределённости и ансамблями критиков [5; 6]. Методы CQL [3], TD3+BC [4], ^ [7] и AWAC [8] стали стандартом, обеспечивающим стабильное обучение при ограниченной поддержке данных. Параллельно развивается направление офлайн с дообучением в онлайне [9; 10], объединяющее преимущества предварительного обучения по статическому датасету и последующего онлайн дообучения в среде.

Существенный вклад в развитие экспериментальной и методологической базы внесли открытые библиотеки: D4RL [11], [12], d3rlpy [13], CleanRL [14]. Тем не менее, несмотря на активное развитие, офлайн-обучение с подкреплением остаётся областью с рядом нерешённых вопросов, включая высокую чувствительность гиперпараметров, ограниченную переносимость между фреймворками (РуТогсЬ, JAX) и отсутствие единых минималистичных имплементаицй алгоритмов. Эти ограничения определяют актуальность и необходимость дальнейших исследований, направленных на систематизацию и упрощение существующих методов.

Целью данной работы является систематизация и улучшение алгоритмов офлайн-обучения с подкреплением, что включает в себя создание новой открытой библиотеки, с проверенными имплементациями всех популярных алгоритмов, а также предрасчитанными результатами на популярных датасетах; выявление наименьшего набора наиболее эффективных способов улучшения работы алгоритмов; значительное ускорение методов офлайн-обучения с подкреплением на основе ансамблирования. В совокупности, целью является повысить воспроизводимость исследований и эффективность алгоритмов.

Для достижения поставленной цели необходимо решить следующие задачи:

1. Проанализировать существующие подходы и экспериментальные результаты в области офлайн-обучения с подкреплением, выявив их сильные и слабые стороны, а также ограничения в части воспроизводимости и прозрачности имплементаций;

2. Систематизировать существующие результаты, разработав библиотеку для исследователей с минималистичной архитектурой, поддерживающей базовые и современные методы офлайн обучения с подкреплением. Полностью опубликовать в открытый доступ все результаты вычислений для научного сообщества;

3. На основе анализа результатов текущих алгоритмов предложить новый, чтобы добиться максимальных результатов минимальными изменениями алгоритма, сохранив простоту и надежность;

4. Значительно ускорить оценку неопределенности, традиционно выполняемую ансамблевыми методам;

5. Провести масштабные эксперименты на стандартных наборах данных D4RL и V-D4RL, и сравнить эффективность предложенных решений с существующими подходами.

Научная новизна:

1. Предложена новая открытая библиотека CORL (Clean Offline RL), основанная на принципе один алгоритм - один файл и прозрачной конфигурации, что обеспечивает воспроизводимость и простоту модификаций алгоритмов. Вместе с алгоритмами библиотека предоставляет предрасчитанные метрики для наиболее популярных датасетов, значительно экономя ресурсы для воспроизведении и сравнительного анализа;

2. Разработан алгоритм ReBRAC, в котором систематически интегрированы дизайнерские решения из современных исследований, ранее фрагментарно используемые в различных работах.

3. Эмпирически проверена и обоснована возможность применения дистилляции случайных сетей (RND) в качестве механизма оценки неопределенности в офлайн-обучении с подкреплением. Предложен метод SAC-RND, устраняющий недостатки наивного использования RND и позволяющий отказаться от ансамблей без потери качества.

Практическая значимость работы заключается в создании инструментов, которые позволяют исследователям и практикам в области офлайн обучения с подкреплением эффективно прототипировать алгоритмы, проводить воспроизводимые эксперименты и использовать более простые, но при этом конкурентоспособные методы. CORL обеспечивает удобную платформу для обучения и исследований, ReBRAC демонстрирует, как минималистичный подход может быть усилен современными практиками, а SAC-RND снижает вычислительные затраты без ухудшения качества решений, что критично для реальных приложений.

Методология и методы исследования. Работа включают анализ существующих публикаций по офлайн-обучению с подкреплением, систематизацию дизайнерских решений, разработку программных средств и проведение масштабных вычислительных экспериментов. В качестве эмпирической базы использованы стандартные наборы данных D4RL и V-D4RL. Для обеспечения объективности применялись множественные независимые запуски, унифицированный протокол подбора гиперпараметров, абляционные исследования ключевых дизайнерских решений, а также статистические методы оценки устойчивости (performance profiles, вероятность улучшения), обеспечивающие объективное сравнение алгоритмов.

Основные положения, выносимые на защиту:

1. Разработана и опубликована библиотека CORL [15] как результат анализа и систематизации результатов в области офлайн-обучения с подкреплением. Библиотека предоставляет имплементации 13 алгоритмов, предрассчитанные метрики на 30 наборах данных, включая дообучение в онлайне. На основе анализа результатов выделены лидирующие методы в каждом домене, а также их сильные и слабые стороны. В отличие от существующих решений, CORL реализует алгоритмы в простом и прозрачном формате, предоставляет YAML-конфигурации всех гиперпараметров и встроенную систему логирования. Итоговые метрики выложены в открытый доступ, что является беспрецедентным. В совокупности CORL позволяет исследователям сэкономить более пяти тысяч GPU-часов вычислений.

2. Предложен алгоритм ReBRAC [16] как улучшение минималистич-ного алгоритма TD3+BC за счёт интеграции современных дизайн-

решений, выявленных в ходе работы над CORL: более глубокие сети, увеличенный размер мини-батча, нормализация (LayerNorm), раздельное штрафование актёра и критика, модифицированный коэффициент дисконтирования. Эмпирически показано, что ReBRAC достигает передовых результатов среди методов без ансамблей на наборах данных D4RL и V-D4RL, значительно превосходя существующие алгоритмы по средним показателям в задачах Gym-MuJoCo, AntMaze и Adroit. Во время онлайн-дообучения ReBRAC демонстрирует результаты, сопоставимые со специализированными под этот сценарий методами.

3. Разработан метод SAC-RND [17], использующий штраф на основе дистилляции случайных сетей (Random Network Distillation) с FiLM-обусловливанием. Показано, что SAC-RND обеспечивает производительность, сопоставимую с ансамблевыми методами (SAC-N, EDAC), при существенно меньших вычислительных затратах, ускоряя обучение до 20 раз. Метод является первым конкурентоспособным алгоритмом без ансамблей, эффективно ограничивающим оценки вознаграждения для внераспределительных действий и демонстрирующим высокие результаты на наборе данных D4RL.

Достоверность полученных результатов обеспечивается: использованием открытых и признанных в сообществе наборов данных (D4RL, V-D4RL), воспроизводимостью экспериментов за счет публикации кода и конфигураций, многократными запусками с различными случайными инициализациями, а также сопоставлением с результатами, представленными в предшествующих исследованиях. Исходный код методов опубликован в соответствующих репозиториях.

— https://github.com/tinkoff-ai/CORL

— https://github.com/corl-team/CORL

— https://github.com/tinkoff-ai/ReBRAC

— https://github.com/tinkoff-ai/sac-rnd

Апробация работы. Статьи представлены на конференциях уровня CORE A*. CORL и ReBRAC на Neural Information Processing Systems (NeurIPS). SAC-RND на International Conference on Machine Learning (ICML). За работу SAC-RND автор данной диссертационной работы был

удостоен премии Yandex ML Prize (Научная премия Яндекса им. Ильи Се-галовича) в 2023 году, в номинации «Первая публикация».

Международные конференции:

— «Neural Information Processing Systems» (2023, Новый Орлеан, США)

— «International Conference on Machine Learning» (2023, Гонолулу, США)

Публикации автора по теме диссертации. Основные научные результаты были опубликованы в четырех рецензируемых изданиях: три работы опубликованы на конференциях уровня CORE A*, одна опубликована в журнале категории К2 по классификации Перечня ВАК РФ, которые также входят в собственный перечень журналов МФТИ:

1. Никулин А.П. Обзор методов оценки неопределенности в офлайн обучении с подкреплением // Труды МФТИ. 2025 Т. 17, № 3 С. 53-63. [18]

2. Nikulin, A., Kurenkov, V., Tarasov, D., Kolesnikov, S. Anti-exploration by random network distillation // Proceedings of the 40th International Conference on Machine Learning. - 2023. - С. 26228-26244.

3. Tarasov, D., Nikulin, A., Akimov, D., Kurenkov, V., Kolesnikov, S. CORL: research-oriented deep offline reinforcement learning library // Proceedings of the 37th International Conference on Neural Information Processing Systems. - 2023. - С. 30997-31020.

4. Tarasov, D., Kurenkov, V., Nikulin, A., Kolesnikov, S. Revisiting the minimalist approach to offline reinforcement learning // Proceedings of the 37th International Conference on Neural Information Processing Systems. - 2023. - С. 11592-11620.

Личный вклад. Личное участие автора в представленных исследованиях заключается в следующем. Автор является одним из основных разработчиков библиотеки CORL [15], написал значительную часть кода (половина представленных методов) и текста статьи, а также выполнил основную часть экспериментов. После выпуска статьи, активно и единолично участвовал в поддержании библиотеки, разработке публичной документации, исправлении недочетов и расширении на новые методы. В работе SAC-RND [17] вся работа выполнена автором, включая изначальную идею. В работе ReBRAC [16] автору принадлежит изначальная идея,

первоначальный список улучшений. Далее принимал активное участие вторым автором в постановке и анализе экспериментов, написании статьи. В работе [18] вся работа выполнена автором.

Объем и структура работы. Диссертация состоит из введения, 4 глав, заключения и 1 приложения. Полный объём диссертации составляет 111 страниц, включая 16 рисунков и 21 таблицу. Список литературы содержит 75 наименований.

Глава 1. Обзор офлайн-обучения с подкреплением

1.1 Основы обучения с подкреплением

Обучение с подкреплением (Reinforcement Learning, RL) представляет собой направление машинного обучения, в котором агент взаимодействует с окружающей средой, обучаясь принимать последовательность решений, максимизирующих накопленное вознаграждение. В отличие от классических парадигм обучения с учителем и без учителя, в RL ключевым элементом является процесс взаимодействия, в котором агент получает информацию о последствиях своих действий и постепенно улучшает стратегию поведения [19].

1.1.1 Формализация через MDP

Стандартной математической моделью для формализации задачи RL является марковский процесс принятия решений (Markov Decision Process, MDP). MDP описывается множеством

{S, A, P, R,у},

где S — множество состояний среды, A — множество возможных действий агента, P(s'|s,a) — функция переходов, определяющая вероятность перехода в состояние s' при выполнении действия a в состоянии s, R(s,a) — функция вознаграждений, задающая числовую оценку полезности действия в конкретном состоянии, и у Е (0,1] — коэффициент дисконтирования, определяющий значимость будущих вознаграждений.

Цель агента заключается в построении стратегии n(a|s), которая максимизирует математическое ожидание суммарного дисконтированного вознаграждения по всему горизонту планирования, который может быть

как конечным так и бесконечным:

N

J(п) = En ^Y'Rist^at) .

Для анализа эффективности стратегий в ИЬ используются функции ценности. Они играют центральную роль в построении алгоритмов, так как позволяют количественно описывать качество тех или иных действий в разных состояниях.

Функция ценности состояния определяется как математическое ожидание суммарного дисконтированного вознаграждения, если агент начинает из состояния в и далее действует по стратегии п:

Функция ценности действия учитывает не только состояние, но и конкретный выбор действия:

Таким образом, Vn(s) описывает ценность нахождения в состоянии s при дальнейшем следовании политике п, а Qn(s,a) — ожидаемое вознаграждение, если в состоянии s выбрать действие а, а затем следовать п.

Дополнительной важной величиной является функция преимущества (advantage function):

Она измеряет, насколько конкретное действие а в состоянии в лучше или хуже в сравнении со средним ожидаемым результатом от нахождения в этом состоянии.

Функции Уп и Qп удовлетворяют рекурсивным соотношениям Беллма-на, которые лежат в основе большинства алгоритмов ИЬ. Для Уп(в) имеем:

N

Vn(s) = En Y,YtR(st,at) so = s .

N

An(s,a) = Qn(s,a) - Vn(s).

Vn(s) = Y^n(a\s) R(s,a) + y^P(s'\s,a)Vn(s') .

aeA

Аналогично, для Qn(s,a):

s' €S

Qп(s,a) = Я(в,а) + у ^ Р(в'\в,а)^ ^¿¡¿^(в',а').

я'^Б а'еЛ

Эти уравнения подчеркивают, что ценность состояния или действия зависит не только от непосредственного вознаграждения, но и от будущих вознаграждений, достигаемых при следовании политике. Они также определяют фундаментальную динамику задачи ИЬ: агенту необходимо находить такие стратегии, при которых Vп и Qп максимизируются.

Функции ценности позволяют не только анализировать поведение фиксированной стратегии, но и формулировать задачу нахождения оптимальной политики. Оптимальной называется стратегия п*, которая максимизирует суммарное дисконтированное вознаграждение для любого состояния. Оптимальная функция ценности состояния определяется как

V*(s) = maxVn(s), Vs Е S,

п

а оптимальная функция ценности действия — как

Q*(s,a) = maxQn(s,a), Vs Е S,a Е A.

Эти функции также удовлетворяют уравнениям оптимальности Беллмана. Для V*(в):

V*(s) = max

aGÄ

R(s,a)+ P(s'\s,a)V*(s')

s'GS

а для Q*(s,a):

Q*(s,a) = R(s,a) + у V^ P(s'\s,a) maxQ*(s',a')•

—' a'G Ä

s'eS

Оптимальная стратегия п* может быть получена напрямую из оптимальной Q-функции:

n*(s) = arg max Q*(s,a).

V У aGÄ V У

Таким образом, решение задачи обучения с подкреплением сводится к нахождению аппроксимации Q*(s,a) или V*(s), из которых затем восстанавливается оптимальная политика. Эта постановка лежит в основе как классических методов динамического программирования (value iteration, policy iteration) [20], так и современных алгоритмов обучения с функциями аппроксимации — от табличных Q-learning до глубоких нейронных сетей (Deep Q-Networks, Actor-Critic и их модификаций).

1.1.2 Различие между онлайн и офлайн обучением с

подкреплением

Традиционное (online) обучение с подкреплением предполагает, что агент имеет возможность активно взаимодействовать со средой, получать новые данные и адаптировать стратегию в процессе обучения. Такой подход позволяет корректировать ошибки на основе дополнительных экспериментов и собирать репрезентативные траектории. Однако он сопряжен с высокой стоимостью генерации данных, а в ряде приложений — с невозможностью безопасного проведения экспериментов (например, в медицине, робототехнике или автономном вождении).

В офлайн-обучении с подкреплением (офлайн RL) агенту доступен

1 О О О о о

фиксированный набор данных взаимодействий, собранный заранее одной или несколькими политиками. Новые данные во время обучения не генерируются (см. Рисунок 1.1). Это значительно усложняет задачу, поскольку алгоритму необходимо обобщать знания, избегая действий, которые выходят за пределы распределения имеющихся данных. В отличие от онлайн RL, где процесс обучения тесно связан с исследованием среды, в офлайн RL ключевой проблемой становится борьба с распределительным сдвигом и экстраполяционной ошибкой при работе с состояниями и действиями, редко или вовсе не представленными в обучающем наборе [1].

Агент т

Rt

Среда ©

Среда Q -► Датасет 1

(suaurust+i)£L0 i

Агент т

а) Онлайн б) Офлайн

Рисунок 1.1 — Схематичное изображение цикла обучения для онлайн и офлайн обучения с подкреплением. Во время онлайн-обучения агенту позволяется взаимодействовать со средой напрямую, в то время как во время офлайн-обучения агент обучается по статическому, заранее собранному набору данных из среды.

Таким образом, офлайн ИЬ можно рассматривать как более сложную, но практически важную вариацию классического обучения с подкреплением, где на первый план выходят вопросы устойчивости алгоритмов, работы с ограниченными данными и обеспечения воспроизводимости результатов.

1.2 Особенности офлайн-обучения с подкреплением

Как было пояснено ранее, офлайн-обучение с подкреплением (офлайн ИЬ) выделяется среди других формулировок ИЬ тем, что агент лишён возможности взаимодействовать со средой в процессе обучения. Алгоритм получает фиксированный набор данных, собранный заранее одной или несколькими политиками, и должен построить стратегию, максимально эффективную в исходной среде. Однако именно это свойство приводит к ряду фундаментальных проблем, которые существенно усложняют задачу в сравнении с классическим онлайн ИЬ [1]. Далее кратко рассмотрим возникающие проблемы.

1.2.1 Распределительный сдвиг и ошибка экстраполяции

Главной проблемой в офлайн ИЬ является распределительный сдвиг. Данные формируют ограниченное множество траекторий, характерное для поведения исходной политики (или их смеси). Когда обучаемая стратегия п начинает выбирать действия, которые редко или вовсе не встречались в датасете, оценки функции ценности Qп(s,a) оказываются ненадёжными.

Эта проблема известна как ошибка экстраполяции. Она возникает в момент, когда аппроксиматор (например, нейронная сеть) пытается обобщить значения Q(s,a) на пары (в,а), находящиеся вне области, покрытой данными. Поскольку реальные вознаграждения и переходы для таких пар отсутствуют, ошибка может накапливаться, приводя к переоценке ценности «внераспределительных» действий [21].

Формально, если распределение данных обозначить как dp(s,a), где в — поведение (behavior policy), с помощью которого собирался датасет, то при обучении новой политики п возникает несоответствие:

dn(s,a) = dp(s,a).

Это несоответствие и приводит к ошибкам в обновлении Q-функции. Именно поэтому большинство алгоритмов офлайн RL стремятся ограничить стратегию п областями, хорошо покрытыми dp, или добавляют штрафы за выход за пределы распределения данных.

1.2.2 Ограничения отсутствия исследования среды

Во многих практических сценариях исследовательский компонент является ключевой частью онлайн RL: агент пробует новые действия, тем самым уточняя оценки ценности и открывая новые стратегии. В офлайн RL этот механизм отсутствует: агент работает с фиксированными данными и не может проверить свои гипотезы о среде.

Отсутствие исследования означает, что если оптимальные действия или состояния не представлены в датасете, то политика п, обученная офлайн, не сможет их восстановить. В частности, даже если в среде существует траектория с высокой наградой, но она не была собрана в данных, агент не имеет возможности её открыть.

Это фундаментальное ограничение офлайн RL: агент всегда ограничен поддержкой распределения исходных данных. В отличие от онлайн RL, где стратегия постепенно приближается к оптимальной за счёт генерации новых траекторий, в офлайн RL приходится искать баланс между максимизацией награды и безопасным удержанием политики в области, где оценки Q надёжны [1].

1.2.3 Сравнение с имитационным обучением

По своей постановке офлайн RL близко к имитационному обучению (imitation learning), однако между ними существуют принципиальные различия.

В имитационном обучении цель состоит в том, чтобы воспроизвести поведение, демонстрируемое в данных. Наиболее простой метод — поведенческое клонирование (Behavioral Cloning, BC), при котором политика обучается аппроксимировать распределение действий, выбранных исходной политикой:

rc(a|s) « e(als)-

Такой подход игнорирует функцию вознаграждения и не пытается улучшить стратегию по сравнению с исходными данными. В офлайн RL, напротив, ставится задача максимизации накопленного вознаграждения, а не воспроизведения поведения. Агент должен использовать данные для построения политики, которая может превзойти исходную. Однако именно это и приводит к рискам ошибок экстраполяции: любая попытка отойти от поведения в связана с обращением к областям состояния-действия, плохо представленным в датасете.

Таким образом, офлайн RL можно рассматривать как обобщение имитационного обучения. В то время как BC является частным случаем, где агент строго повторяет данные, офлайн RL использует вознаграждение для поиска улучшенной стратегии, но вынужден учитывать риски, возникающие из-за распределительного сдвига [22].

1.3 Ключевые направления развития офлайн-обучения с

подкреплением

Развитие офлайн RL сопровождалось появлением целого ряда методологических подходов, направленных на преодоление распределительного сдвига и ошибок экстраполяции. Эти подходы можно условно разделить на несколько основных направлений: поведенческое клонирование, методы

основанные на штрафах (penalization-based), консервативные алгоритмы, модели на основе последовательностей, а также ансамблевые методы.

1.3.1 Поведенческое клонирование

Поведенческое клонирование (BC) является базовым и самым простым методом работы с офлайн-данными. Идея заключается в обучении политики напрямую аппроксимировать действия исходной политики в:

n(a|s) « p(a|s).

Обучение проводится как задача супервизии с функцией потерь

Lbc(п) = - logn(a|s^ ,

где D — фиксированный датасет взаимодействий. Достоинством BC является простота и устойчивость: метод не страдает от ошибок экстраполяции, так как политика не выходит за пределы исходного распределения данных. Однако BC полностью игнорирует сигналы вознаграждения и поэтому ограничен по эффективности: он способен воспроизвести, но не превзойти поведение исходной политики [23; 24].

1.3.2 Штрафующие подходы

В штрафующих (penalization-based) методах минимизация ошибки экстраполяции достигается добавлением штрафа за отклонение политики п от поведения p. В BRAC [25] используется KL-дивергенция:

J(п) = Em~d[Q(s,a)j - adkl(4|s)|P(-|s)).

В TD3+BC [4] политика обучается как компромисс между максимизацией Q-значений и имитацией поведения через BC-компонент. Функция потерь для актора имеет вид:

Сп = -Es^d[Q(s^(s))] + ЛEm~d [Ks) - af],

где Л управляет балансом между следованием данным и улучшением политики.

1.3.3 Консервативные подходы

Консервативные алгоритмы модифицируют процесс обучения Q-функции, чтобы занижать оценки для внераспределительных действий. В CQL (Conservative Q-Learning) [3] вводится дополнительный член:

lcql (Q) = Es_D

log^exp(Q(s,a)) - Ea„P(.|s)[Q(s,a)]

который гарантирует, что Q для действий вне данных будет уменьшаться.

IQL (Implicit Q-Learning) [7] использует advantage-функцию и делает обновления более стабильными без явного регуляризатора. Алгоритм применяет экспектильную-регрессию для аппроксимации V(s):

Су = Es^d Px(Q(s,a) - V(s)) , a ~ p(-|s),

где pT — expectile loss, а параметр т £ (0,1) контролирует степень «консерватизма». Определим expectile-loss как

рт(и) = |т - I{u < 0}| и2,

Если и ^ 0 (переоценка), то вес ошибки равен т, если и < 0 (недооценка), то вес равен (1 - т).

Затем стратегия обновляется через взвешенную регрессию (advantage-weighted regression):

Сп = - exp(A(s,a)^) logrc(a|s)],

где A(s,a) = Q(s,a) - V(s).

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Список литературы диссертационного исследования кандидат наук Никулин Александр Павлович, 2026 год

/ I - -

/ i / / / ////"-"- ^ '

I / t ///////'' "

/ j /// / / / ^ ^ "

/ i / / / s s ^^ " -

\ i i t / ///^^^^- -

1***/ / / ^ --

0.0 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0

1 V \ \ \ \ \ \ \ * 4 \ \ \ \ \ \ \ > N N \\X H

a0

/ / f \ \ / i! м ///it, / / / t \ \ . . . ///MWWv

/ / i M W\NN

/ / t t \ Ч ч x ^ x. i f t I i \ \ >, >*.

\ \ \

\ \ \ N

0.0 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0

0.0 0.5 1.0 1.5 2.0 2.5 3.0 3.5 4.0

30

a0

а) Состояние 0

0.1 0.2 0.3 0.4 0.5 0.6

б) Состояние 1

0.05 0.10 0.15 0.20 0.25 0.30 0.35 0.40

в) Состояние 2

0.05 0.10 0.15 0.20 0.25 0.30 0.35 0.40

г) Состояние 3

00 со

Рисунок 4.6 — Поле антиградиентов действий для анти-исследовательского бонуса, обусловленного на четыре категориальных состояния в каждом углу для игрушечной задачи, представленной на Рисунке 4.5. Верхний ряд соответствует RND с конкатенационным обусловливанием в prior, нижний — с FiLM-обусловливанием. Получающиеся антиградиенты для конкатенации оказываются шумными, тогда как направления для FiLM

остаются гладкими по всему доступному пространству действий.

4.7.2 Сравнение вариантов обусловливания в RND

Возникает естественный вопрос: (1) как различные типы обусловливания для prior и predictor взаимодействуют друг с другом и (2) на каком уровне глубины сети введение обусловливания оказывается наиболее полезным.

Для ответа на эти вопросы был воспроизведён эксперимент из секции 4.4, но с расширенным числом вариаций. Рассматривались три схемы обусловливания: на первом слое, на последнем слое и на всех слоях сети. Для билинейного слоя тестировались две реализации: полная, описанная в [72], и упрощённая, которая используется по умолчанию в PyTorch. На рисунке 4.7 приведены значения финальной ошибки MSE между результирующей политикой и поведенческой политикой на обучающем датасете.

Анализ полученных данных позволяет сделать два вывода. Во-первых, FiLM не является единственной архитектурой с подходящими условиями для prior. Оба варианта билинейного слоя при обусловливании на всех слоях также демонстрируют результаты, сопоставимые с FiLM. Однако следует учитывать, что внутренние билинейные слои значительно более ресурсоёмки: их использование требует как минимум одного тензора весов ранга 3 и двух дополнительных матриц весов, причём скрытые размерности существенно превышают размерности входа.

Во-вторых, наибольшую пользу для predictor даёт обусловливание на последнем слое, в то время как для prior оптимальным оказывается использование обусловливания на всех слоях. При этом обобщать данные результаты на широкий класс задач затруднительно: разные типы обусловливания могут давать преимущества в зависимости от постановки и используемого домена.

4.7.3 Анализ времени обучения

Дополнительно были проведены замеры времени обучения для различных алгоритмов: TD3+BC как пример алгоритма без ансамблей, SAC-N

>-

о о

В

Он

gated concatfirst concatlast concatfiill bilinearfirst bilinearlast bilinearfiill torch_bilinear_first torchbilinearlast torchbilinearfiill film full filmfirst film last

ao

«a.

о Й о о

г

nj

О й о о

хл я, хл <а *~н I %

а1 о й о а1 1) .Й ё' си .й а <D .й

о £ IS IS

и хл <а 1 сл хл

а1 1) .Й а и .Й и <D .й i в б' 1С м в

is,

-С о t-о -С о t- В -С о t- В

1.2

- 1.0

-0.8

0.6

0.4

0.2

рпог

Рисунок 4.7 — Среднеквадратичная ошибка между действиями актора, обученного с различными вариантами обусловливания predictor и prior, и действиями поведенческой политики. Используются датасеты halfcheetah, walker2d и hopper medium, по 3 запуска для каждого. Видно, что обусловливание на каждом слое полезно для prior-сетей, тогда как для предикторов лучше использовать обусловливание на последнем слое. Следует отметить, что данный эксперимент выполнен в условиях без критика.

с размером ансабля от 10 до 500 (в соответствии с параметрами необходимыми для лучших результатов), а также предложенный SAC-RND. Замеры проводились на GPU V100 для стандартных 1M обновлений с размером бат-ча 256 и одинаковыми размерами сетей. Для SAC-N [5] приведены времена для всех конфигураций размеров ансамбля из оригинальной публикации. Следует отметить, что все алгоритмы были реализованы на Jax [74], кото-

рый, как правило, значительно быстрее для небольших сетей по сравнению с альтернативами на РуТогсЬ [75]. Результаты приведены в Таблице 12. SAC-RND лишь незначительно медленее TD3+BC, и значительно быстрее SAC-N, ускоряя обучения в 20 раз в худшем случае. Таким образом, SAC-RND занимает золотую середину, между результатов SAC-N и скоростью обучения TD3+BC.

Таблица 12 — Сравнение времени обучения различных алгоритмов на да-тасете halfcheetah-medium-v2.

Алгоритм Обновлений / с ^ Время (мин) ^

TD3+BC 1485 11.2

SAC-2 1285 12.9

SAC-RND 850 19.6

SAC-10 809 20.5

SAC-20 559 29.7

SAC-100 171 97.3

SAC-200 93 178.3

SAC-500 39 424.0

4.8 Выводы

Связь с общими целями диссертации. Разработка SAC-RND соответствует общей цели работы — систематизации и улучшению алгоритмов офлайн RL с акцентом на простоту, воспроизводимость и снижение вычислительных издержек. Алгоритм демонстрирует, что отказ от ансамблей возможен без значительной потери качества, а при правильных архитектурных решениях — даже с выходом на уровень лучших современных методов. Это подтверждает, что достижение баланса между вычислительной эффективностью и качеством обучения возможно за счёт переосмысления известных идей, таких как RND, в контексте офлайн RL.

Направления для будущих исследований. Дальнейшая работа может быть связана с изучением других форм обусловливания и их влияния на оптимизацию анти-исследовательского бонуса в более сложных средах. Перспективным направлением является исследование масштабируемости SAC-RND к задачам с визуальными наблюдениями, где дискриминатив-ность RND может быть ещё более важна. Кроме того, интерес представляет комбинирование SAC-RND с методами генеративного моделирования для уточнения структуры бонуса и интеграция с трансформерными архитектурами, способными обрабатывать долгосрочные зависимости. Важной задачей остаётся и автоматический подбор коэффициента а, контролирующего уровень консерватизма, что снизит чувствительность алгоритма к гиперпараметрам.

Вывод. Было продемонстрировано, что SAC-RND является вычислительно лёгким, но при этом конкурентоспособным методом офлайн RL. С помощью переосмысленной идеи RND и архитектурных модификаций ^^М-обусловливание, билинейные взаимодействия) удалось достичь результатов, сопоставимых с ансамблевыми методами, сохраняя простоту реализации. Таким образом, SAC-RND закрывает важный разрыв между теоретически эффективными, но тяжёлыми ансамблевыми подходами и практической необходимостью в лёгких и воспроизводимых алгоритмах, применимых в реальных сценариях офлайн RL.

Заключение

В диссертации представлены три ключевых результата, каждый из которых вносит вклад в развитие офлайн обучения с подкреплением:

— CORL — минималистичная библиотека для офлайн и offline-to-online RL, ориентированная на воспроизводимость. Она исключает избыточные абстракции, облегчает исследование и позволяет выявлять скрытые проблемы алгоритмов (например, чувствительность CQL к гиперпараметрам и трудности переноса между фреймвор-ками). CORL закрепилась как удобный стартовый инструмент для разработки и анализа методов.

— ReBRAC — расширение TD3+BC, демонстрирующее значимость дизайнерских решений, ранее считавшихся второстепенными. Увеличение глубины сетей, применение LayerNorm, использование больших батчей, раздельное штрафование актора и критика, а также настройка коэффициента дисконтирования позволили достичь state-of-the-art среди ансамбле-свободных методов на D4RL и V-D4RL. ReBRAC стал новым сильным базлайном для сравнения.

— SAC-RND — алгоритм, использующий RND как антиисследовательский бонус. Показано, что при корректных архитектурных предпосылках (например, FiLM-кондиционирование в prior) RND способен соперничать с ансамблями по качеству, не требуя их вычислительных ресурсов. SAC-RND дополнил инструментарий офлайн RL простым и эффективным методом.

Рекомендации по практическому применению. CORL может использоваться как исследовательская платформа для тестирования и сравнения алгоритмов офлайн RL в академических и индустриальных проектах, где важны прозрачность и воспроизводимость. ReBRAC рекомендуется применять в практических сценариях, где требуется надёжный и стабильный метод без ансамблей, например, в робототехнике или системах рекомендаций. SAC-RND может найти применение в условиях ограниченных вычислительных ресурсов, обеспечивая качество, сопоставимое с ансамблевыми методами, но при существенно меньшей стоимости обучения.

Перспективы дальнейшей разработки темы. Дальнейшие исследования могут быть направлены на расширение библиотеки CORL за счёт интеграции новых датасетов и задач; адаптацию ReBRAC для мультиагент-ных и частично наблюдаемых сред; развитие SAC-RND с использованием более сложных схем кондиционирования и проверку применимости к визуальным наблюдениям. Перспективным направлением также является выработка единого протокола оценки офлайн RL, включающего стандартные метрики и прикладные сценарии.

Общий вывод. Прогресс в офлайн RL обеспечивается не только разработкой новых алгоритмов, но и инфраструктурными решениями, а также вниманием к деталям реализации. Полученные результаты формируют основу для будущих методов, которые будут более универсальными, воспроизводимыми и эффективными при работе с ограниченными данными.

Список литературы

1. Offline reinforcement learning: Tutorial, review, and perspectives on open problems/Levine, S., Kumar, A., Tucker, G., Fu, J.//arXiv preprint arXiv:2005.01643. — 2020. URL: https://arxiv.org/abs/2005.01643 (visited on September 9 2025).

2. A survey on offline reinforcement learning: Taxonomy, review, and open problems/Prudencio, R. F., Maximo, M. R., Colombini, E. L.//arXiv preprint arXiv:2203.01387. — 2022. URL: https://arxiv.org/abs/2203. 01387 (visited on September 9 2025).

3. Conservative q-learning for offline reinforcement learning/Kumar, A., Zhou, A., Tucker, G., Levine, S.//Advances in neural information processing systems. — 2020. — Vol. 33. — P. 1179—1191.

4. A minimalist approach to offline reinforcement learning/Fujimoto, S., Gu, S. S.//Proceedings of the 35th International Conference on Neural Information Processing Systems. — 2021. — P. 20132—20145.

5. Uncertainty-based offline reinforcement learning with diversified q-ensemble/An, G., Moon, S., Kim, J.-H., Song, H. O.//Advances in neural information processing systems. — 2021. — Vol. 34. — P. 7436—7447.

6. Why so pessimistic? estimating uncertainties for offline rl through ensembles, and why their independence matters/Ghasemipour, K., Gu, S. S., Nachum, O.//Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 18267—18281.

7. Offline Reinforcement Learning with Implicit Q-Learning/Kostrikov, I., Nair, A., Levine, S.//International Conference on Learning Representations. — 2022. URL: https://openreview.net/forum?id = 68n2s9ZJWF8 (visited on September 15 2025).

8. Awac: Accelerating online reinforcement learning with offline datasets/ Nair, A., Gupta, A., Dalal, M., Levine, S. // arXiv preprint arXiv:2006.09359. — 2020. URL: https : / / arxiv . org / abs / 2006 . 09359 (visited on September 10 2025).

9. Accelerating online reinforcement learning with offline datasets/Nair, A., Dalal, M., Gupta, A., Levine, S.//arXiv preprint arXiv:2006.09359. — 2020. URL: https://arxiv.org/abs/2006.09359 (visited on September 9 2025).

10. Supported policy optimization for offline reinforcement learning/Wu, J., Wu, H., Qiu, Z., Wang, J., Long, M.//arXiv preprint arXiv:2202.06239. — 2022. URL: https://arxiv.org/abs/2202.06239 (visited on September 9 2025).

11. D4rl: Datasets for deep data-driven reinforcement learning / Fu, J., Kumar, A., Nachum, O., Tucker, G., Levine, S.//arXiv preprint arXiv:2004.07219. — 2020. URL: https : / / arxiv . org / abs / 2004 . 07219 (visited on September 9 2025).

12. Challenges and opportunities in offline reinforcement learning from visual observations/Lu, C., Ball, P. J., Rudner, T. G., Parker-Holder, J., Osborne, M. A., Teh, Y. W.//arXiv preprint arXiv:2206.04779. — 2022. URL: https://arxiv.org/abs/2206.04779 (visited on September 9 2025).

13. d3rlpy: An offline deep reinforcement learning library/Seno, T., Imai, M.// Journal of Machine Learning Research. — 2022. — Vol. 23. — P. 1—20.

14. CleanRL: High-quality Single-file Implementations of Deep Reinforcement Learning Algorithms/Huang, S., Dossa, R. F. J., Ye, C., Braga, J.//arXiv preprint arXiv:2111.08819. — 2021. URL: https://arxiv.org/abs/2111. 08819 (visited on September 9 2025).

15. CORL: research-oriented deep offline reinforcement learning library / Tarasov, D., Nikulin, A., Akimov, D., Kurenkov, V., Kolesnikov, S.// Proceedings of the 37th International Conference on Neural Information Processing Systems. — 2023. — P. 30997—31020.

16. Revisiting the minimalist approach to offline reinforcement learning/ Tarasov, D., Kurenkov, V., Nikulin, A., Kolesnikov, S.//Proceedings of the 37th International Conference on Neural Information Processing Systems. — 2023. — P. 11592—11620.

17. Anti-exploration by random network distillation / Nikulin, A., Kurenkov, V., Tarasov, D., Kolesnikov, S.//Proceedings of the 40th International Conference on Machine Learning. — 2023. — P. 26228—26244.

18. Обзор методов оценки неопределенности в офлайн обучении с подкреплением/Никулин, А. П.//Труды МФТИ. — 2025. — Vol. 17. — P. 53-63.

19. Reinforcement Learning: An Introduction/Sutton, R. S., Barto, A. G. — 2018. URL: http://incompleteideas.net/book/the-book-2nd.html (visited on September 9 2025).

20. Markov Decision Processes: Discrete Stochastic Dynamic Programming/ Puterman, M. L. — 1994. URL: https://personalpages.manchester.ac.uk/ staff/mingfei.sun/books/mdp.pdf (visited on September 9 2025).

21. Off-Policy Deep Reinforcement Learning without Exploration / Fuji-moto, S., Meger, D., Precup, D.//Proceedings of the 36th International Conference on Machine Learning. — 2019. — Vol. 97. — P. 2052—2062. URL: https://proceedings.mlr.press/v97/fujimoto19a.html (visited on September 9 2025).

22. Imitation Learning: A Survey of Learning Methods / Hussein, A., Gaber, M. M., Elyan, E., Jayne, C.//ACM Comput. Surv. — 2017. — Vol. 50. URL: https://doi.org/10.1145/3054912 (visited on September 9 2025).

23. Efficient Training of Artificial Neural Networks for Autonomous Navigation /Pomerleau, D. A.//Neural Computation. — 1991. — Vol. 3. — P. 88—97. URL: https : / / api. semanticscholar. org / CorpusID : 7813587 (visited on September 9 2025).

24. Behavioral Cloning from Observation/Torabi, F., Warnell, G., Stone, P. //Proceedings of the Twenty-Seventh International Joint Conference on Artificial Intelligence. — 2018. — P. 4950—4957.

25. Behavior regularized offline reinforcement learning/Wu, Y., Tucker, G., Nachum, O.//arXiv preprint arXiv:1911.11361. — 2019. URL: https:// arxiv.org/abs/1911.11361 (visited on September 9 2025).

26. Decision transformer: Reinforcement learning via sequence modeling/ Chen, L., Lu, K., Rajeswaran, A., Lee, K., Grover, A., Laskin, M., Abbeel, P., Srinivas, A., Mordatch, I.//Advances in neural information processing systems. — 2021. — Vol. 34. — P. 15084—15097.

27. Human-Level Control through Deep Reinforcement Learning/Mnih, V., Kavukcuoglu, K., Silver, D., Rusu, A. A., Veness, J., Bellemare, M. G., Graves, A., Riedmiller, M., Fidjeland, A. K., Ostrovski, G., Petersen, S., Beattie, C., Sadik, A., Antonoglou, I., King, H., Kumaran, D., Wierstra, D., Legg, S., Hassabis, D.//Nature. — 2015. — Vol. 518. — P. 529-533.

28. OpenAI Baselines/Dhariwal, P., Hesse, C., Klimov, O., Nichol, A., Plappert, M., Radford, A., Schulman, J., Sidor, S., Wu, Y., Zhokhov, P.// GitHub repository. — 2017. URL: https://github.com/openai/baselines (visited on September 9 2025).

29. Stable Baselines/Hill, A., Raffin, A., Ernestus, M., Gleave, A., Kan-ervisto, A., Traore, R., Dhariwal, P., Hesse, C., Klimov, O., Nichol, A., Plappert, M., Radford, A., Schulman, J., Sidor, S., Wu, Y.//GitHub repository. — 2018. URL: https://github.com/hill-a/stable-baselines (visited on September 9 2025).

30. Dopamine: A research framework for deep reinforcement learning/Castro, P. S., Moitra, S., Gelada, C., Kumar, S., Bellemare, M. G.//arXiv preprint arXiv:1812.06110. — 2018. URL: https://arxiv.org/abs/1812. 06110 (visited on September 9 2025).

31. Horizon: Facebook's Open Source Applied Reinforcement Learning Plat-form/Gauci, J., Conti, E., Liang, Y., Virochsiri, K., Chen, Z., He, Y., Kaden, Z., Narayanan, V., Ye, X.//arXiv preprint arXiv:1811.00260. — 2018. URL: https://arxiv.org/abs/1811.00260 (visited on September 9 2025).

32. SLM Lab/Keng, W. L., Graesser, L.//GitHub repository. — 2017. URL: https://github.com/kengz/SLM-Lab (visited on September 9 2025).

33. Garage: A toolkit for reproducible reinforcement learning research/The-GarageContributors//GitHub repository. — 2019. URL: https: //github. com/rlworkgroup/garage (visited on September 9 2025).

34. Benchmarking Deep Reinforcement Learning for Continuous Control/ Duan, Y., Chen, X., Houthooft, R., Schulman, J., Abbeel, P.//Proceed-ings of the 33rd International Conference on International Conference on Machine Learning - Volume 48. — 2016. — P. 1329—1338.

35. Catalyst.RL: A Distributed Framework for Reproducible RL Research/ Kolesnikov, S., Hrinchuk, O. — 2019. URL: https://arxiv.org/abs/1903. 00027 (visited on September 9 2025).

36. ChainerRL: A Deep Reinforcement Learning Library/Fujita, Y., Nagara-jan, P., Kataoka, T., Ishikawa, T.//Journal of Machine Learning Research.

— 2021. — Vol. 22. — P. 1—14. URL: http://jmlr.org/papers/v22/20-376.html (visited on September 9 2025).

37. RLlib: Abstractions for distributed reinforcement learning // International conference on machine learning (2018), p. 3053—3062.

38. ElegantRL: Massively Parallel Framework for Cloud-native Deep Reinforcement Learning/Liu, X.-Y., Li, Z., Wang, Z., Zheng, J.//GitHub repository. — 2021. URL: https://github.com/AI4Finance-Foundation/ ElegantRL (visited on September 9 2025).

39. Tianshou: A Highly Modularized Deep Reinforcement Learning Library/ Weng, J., Chen, H., Yan, D., You, K., Duburcq, A., Zhang, M., Su, Y., Su, H., Zhu, J.//arXiv preprint arXiv:2107.14171. — 2021. URL: https: //arxiv.org/abs/2107.14171 (visited on September 9 2025).

40. rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch/ Stooke, A., Abbeel, P. — 2019. URL: https://arxiv.org/abs/1909.01500 (visited on September 9 2025).

41. Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning/ Nakamoto, M., Zhai, Y., Singh, A., Mark, M. S., Ma, Y., Finn, C., Kumar, A., Levine, S.//arXiv preprint arXiv:2303.05479. — 2023. URL: https: //arxiv.org/abs/2303.05479 (visited on September 9 2025).

42. EnvPool: A Highly Parallel Reinforcement Learning Environment Execution Engine/Weng, J., Lin, M., Huang, S., Liu, B., Makoviichuk, D., Makoviychuk, V., Liu, Z., Song, Y., Luo, T., Jiang, Y., Xu, Z., Yan, S.// Advances in Neural Information Processing Systems. — 2022. — Vol. 35.

— P. 22409—22421. URL: https://proceedings.neurips.cc/paper_files/ paper / 2022 / file / 8caaf08e49ddbad6694fae067442ee21 - Paper - Datasets _ and_Benchmarks.pdf (visited on September 9 2025).

43. Deep reinforcement learning at the edge of the statistical precipice/Agar-wal, R., Schwarzer, M., Castro, P. S., Courville, A. C., Bellemare, M.// Advances in neural information processing systems. — 2021. — Vol. 34. — P. 29304—29320.

44. Implementation matters in deep policy gradients: A case study on ppo and trpo/Engstrom, L., Ilyas, A., Santurkar, S., Tsipras, D., Janoos, F., Rudolph, L., Madry, A.//arXiv preprint arXiv:2005.12729. — 2020. URL: https://arxiv.org/abs/2005.12729 (visited on September 9 2025).

45. Deep reinforcement learning that matters/Henderson, P., Islam, R., Bachman, P., Pineau, J., Precup, D., Meger, D.//Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence and Thirtieth Innovative Applications of Artificial Intelligence Conference and Eighth AAAI Symposium on Educational Advances in Artificial Intelligence. — 2018. — P. 3207—3214.

46. Addressing function approximation error in actor-critic methods/Fuji-moto, S., Hoof, H., Meger, D.//International conference on machine learning. — 2018. — P. 1587—1596.

47. Let Offline RL Flow: Training Conservative Agents in the Latent Space of Normalizing Flows/Akimov, D., Kurenkov, V., Nikulin, A., Tarasov, D., Kolesnikov, S.//arXiv preprint arXiv:2211.11096. — 2022. URL: https: //arxiv.org/abs/2211.11096 (visited on September 9 2025).

48. LAPO: Latent-Variable Advantage-Weighted Policy Optimization for Offline Reinforcement Learning/Chen, X., Ghadirzadeh, A., Yu, T., Wang, J., Gao, A. Y., Li, W., Bin, L., Finn, C., Zhang, C.//Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 36902—36913.

49. Scaling laws for neural language models/Kaplan, J., McCandlish, S., Henighan, T., Brown, T. B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., Amodei, D.//arXiv preprint arXiv:2001.08361. — 2020. URL: https://arxiv.org/abs/2001.08361 (visited on September 9 2025).

50. Scaling laws for a multi-agent reinforcement learning model/Neumann, O., Gros, C.//arXiv preprint arXiv:2210.00849. — 2022. URL: https://arxiv. org/abs/2210.00849 (visited on September 9 2025).

51. D2rl: Deep dense architectures in reinforcement learning / Sinha, S., Bharadhwaj, H., Srinivas, A., Garg, A.//arXiv preprint arXiv:2010.09163. — 2020. URL: https://arxiv.org/abs/2010.09163 (visited on September 9 2025).

52. Multi-game decision transformers / Lee, K.-H., Nachum, O., Yang, M., Lee, L., Freeman, D., Xu, W., Guadarrama, S., Fischer, I., Jang, E., Michalewski, H., [et al.]//arXiv preprint arXiv:2205.15241. — 2022. URL: https://arxiv.org/abs/2205.15241 (visited on September 9 2025).

53. Offline Q-Learning on Diverse Multi-Task Data Both Scales And Generalizes/Kumar, A., Agarwal, R., Geng, X., Tucker, G., Levine, S.//arXiv preprint arXiv:2211.15144. — 2022. URL: https://arxiv.org/abs/2211. 15144 (visited on September 9 2025).

54. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor/Haarnoja, T., Zhou, A., Abbeel, P., Levine, S.// International conference on machine learning. — 2018. — P. 1861—1870.

55. RORL: Robust Offline Reinforcement Learning via Conservative Smoothing/Yang, R., Bai, C., Ma, X., Wang, Z., Zhang, C., Han, L.//Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 23851-23866.

56. Behavior Proximal Policy Optimization/Zhuang, Z., LEI, K., Liu, J., Wang, D., Guo, Y.//International Conference on Learning Representations. — 2023. URL: https: / / openreview. net /forum?id = 3c13LptpIph (visited on September 9 2025).

57. Layer normalization/Ba, J. L., Kiros, J. R., Hinton, G. E.//arXiv preprint arXiv:1607.06450. — 2016. URL: https://arxiv.org/abs/1607.06450 (visited on September 9 2025).

58. Dropout q-functions for doubly efficient reinforcement learning / Hi-raoka, T., Imagawa, T., Hashimoto, T., Onishi, T., Tsuruoka, Y. // arXiv preprint arXiv:2110.02034. — 2021. URL: https://arxiv.org/abs/ 2110.02034 (visited on September 9 2025).

59. A walk in the park: Learning to walk in 20 minutes with model-free reinforcement learning/Smith, L., Kostrikov, I., Levine, S.//arXiv preprint arXiv:2208.07860. — 2022. URL: https://arxiv.org/abs/2208.07860 (visited on September 9 2025).

60. CrossQ: Batch Normalization in Deep Reinforcement Learning for Greater Sample Efficiency and Simplicity/Bhatt, A., Palenicek, D., Belousov, B., Argus, M., Amiranashvili, A., Brox, T., Peters, J.//The Twelfth International Conference on Learning Representations. — 2024. URL: https: //openreview.net/forum?id=PczQtTsTIX (visited on September 9 2025).

61. Q-Ensemble for Offline RL: Don't Scale the Ensemble, Scale the Batch Size/Nikulin, A., Kurenkov, V., Tarasov, D., Akimov, D., Kolesnikov, S.// arXiv preprint arXiv:2211.11092. — 2022. URL: https://arxiv.org/abs/ 2211.11092 (visited on September 9 2025).

62. Efficient online reinforcement learning with offline data/Ball, P. J., Smith, L., Kostrikov, I., Levine, S.//International Conference on Machine Learning. — 2023. — P. 1577—1594.

63. Large batch training of convolutional networks/You, Y., Gitman, I., Ginsburg, B.//arXiv preprint arXiv:1708.03888. — 2017. URL: https://arxiv. org/abs/1708.03888 (visited on September 9 2025).

64. Large Batch Optimization for Deep Learning: Training BERT in 76 minutes/You, Y., Li, J., Reddi, S., Hseu, J., Kumar, S., Bhojanapalli, S., Song, X., Demmel, J., Keutzer, K., Hsieh, C.-J.//International Conference on Learning Representations. — 2020. URL: https://openreview.net/ forum?id=Syx4wnEtvH (visited on September 9 2025).

65. The dependence of effective planning horizon on model accuracy/Jiang, N., Kulesza, A., Singh, S., Lewis, R.//Proceedings of the 2015 International Conference on Autonomous Agents and Multiagent Systems. — 2015. — P. 1181—1189.

66. On the role of discount factor in offline reinforcement learning/Hu, H., Yang, Y., Zhao, Q., Zhang, C.//International Conference on Machine Learning. — 2022. — P. 9072—9098.

67. Showing Your Offline Reinforcement Learning Work: Online Evaluation Budget Matters/Kurenkov, V., Kolesnikov, S.//Proceedings of the 39th International Conference on Machine Learning. — 2022. — Vol. 162. — P. 11729—11752.

68. Offline reinforcement learning as anti-exploration / Rezaeifar, S., Dadashi, R., Vieillard, N., Hussenot, L., Bachem, O., Pietquin, O., Geist, M.//Proceedings of the AAAI Conference on Artificial Intelligence. — 2022. — Vol. 36. — P. 8106—8114.

69. Exploration by random network distillation/ Burda, Y., Edwards, H., Storkey, A., Klimov, O.//arXiv preprint arXiv:1810.12894. — 2018. URL: https://arxiv.org/abs/1810.12894 (visited on September 9 2025).

70. Conservative Uncertainty Estimation By Fitting Prior Networks / Ciosek, K., Fortuin, V., Tomioka, R., Hofmann, K., Turner, R.//In-ternational Conference on Learning Representations. — 2020. URL: https://openreview.net/forum?id=BJlahxHYDS (visited on September 9 2025).

71. Feature-wise transformations / Dumoulin, V., Perez, E., Schucher, N., Strub, F., Vries, H. d., Courville, A., Bengio, Y.//Distill. — 2018. URL: https://distill.pub/2018/feature-wise-transformations (visited on September 9 2025).

72. Multiplicative Interactions and Where to Find Them/Jayakumar, S. M., Czarnecki, W. M., Menick, J., Schwarz, J., Rae, J., Osindero, S., Teh, Y. W., Harley, T., Pascanu, R.//International Conference on Learning Representations. — 2020. URL: https://openreview.net/forum?id= rylnK6VtDH (visited on September 9 2025).

73. FiLM: visual reasoning with a general conditioning layer/Perez, E., Strub, F., Vries, H. de, Dumoulin, V., Courville, A.//Proceedings of the Thirty-Second AAAI Conference on Artificial Intelligence and Thirtieth Innovative Applications of Artificial Intelligence Conference and Eighth AAAI Symposium on Educational Advances in Artificial Intelligence. — 2018. — P. 3942—3951.

74. JAX: composable transformations of Python+NumPy programs / Bradbury, J., Frostig, R., Hawkins, P., Johnson, M. J., Leary, C., Maclaurin, D., Necula, G., Paszke, A., VanderPlas, J., Wanderman-Milne, S., Zhang, Q. — 2018. URL: http://github.com/google/jax (visited on September 9 2025).

75. PyTorch: An Imperative Style, High-Performance Deep Learning Library/ Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., Desmaison, A., Kopf, A., Yang, E., DeVito, Z., Raison, M., Tejani, A., Chilamkurthy, S., Steiner, B., Fang, L., Bai, J., Chintala, S.//Advances in Neural Information Processing Systems. — 2019. — Vol. 32. — P. 8026-8037.

Список рисунков

1. Рисунок 1.1. — Схематичное изображение цикла обучения для

онлайн и офлайн обучения с подкреплением. Во время онлайн-обучения агенту позволяется взаимодействовать со средой напрямую, в то время как во время офлайн-обучения агент обучается по статическому, заранее собранному

набору данных из среды................ 15

2. Рисунок 1.2. — Визуализация MuJoCo и Adroit-сред

представленных в наборе данных D4RL........ 24

3. Рисунок 1.3. — Визуализация Maze-сред представленных в наборе

данных D4RL....................... 25

4. Рисунок 2.1. — Основные дизайнерские решения CORL. Рисунок

взят из статьи CORL [15]................ 29

5. Рисунок 2.2. — Профили эффективности (performance profiles) и

вероятность превосходства для агрегированной

оценки по всем задачам из D4RL. Данные метрики

были предложены в статье [43] и предоставляются

библиотекой RLiable. Подобные метрики

позволяют с большей статистической

уверенностью судить об эффективности

алгоритмов, нежели чем простое усреднение.

Рисунок взят из статьи CORL [15].......... 35

6. Рисунок 2.3. — Профили эффективности (performance profiles) и

вероятность превосходства для агрегированной оценки по всем задачам из D4RL в сценарии онлайн дообучения. Рисунок взят из статьи CORL [15]............................. 39

7. Рисунок 3.1. — Схема предложенных изменений в ReBRAC

относительно базового алгоритма TD3+BC...... 43

8. Рисунок 3.2. — Профили эффективности (performance profiles) и

вероятность превосходства для агрегированной оценки по всем задачам из D4RL, включая Gym-MuJoCo, AntMaze, and Adroit. Рисунок взят из статьи ReBRAC [16].................. 51

9. Рисунок 3.3. — Влияние глубины сетей на финальную суммарную

награду на задачах AntMaze из D4RL......... 60

10. Рисунок 4.1. — Анти-исследовательский бонус [68] на датасете

walker2d-medium для обученного SAC-N [5], Q-ансамбля (N = 25) и RND.............. 69

11. Рисунок 4.2. —Эффект различных способов обусловливания

состояние-действие в prior сети RND на обучение актора........................... 72

12. Рисунок 4.3. —Визуализация финальной архитектуры RND в

SAC-RND. В predictor используется билинейное обусловливание [72] на первом слое. В prior применяется FiLM-обусловливание [73] на предпоследнем слое перед функцией нелинейности. 73

13. Рисунок 4.4. —Средняя награда вариантов SAC-RND на

датасетах walker и hopper medium-*. Показаны результаты для наивной версии, использующей конкатенационное обусловливание, и для финальной версии. Финальная версия значительно превосходит наивную, достигая

производительности, сопоставимой с ансамблями. . 78

14. Рисунок 4.5. —Визуализация игрушечного датасета. Этот датасет

состоит из четырёх категориальных состояний, соответствующих каждому углу ограниченной сетки двумерных действий. Для каждого состояния равномерно выбираются 4096 двумерных действий внутри ограниченного квадрата. Во время обучения RND состояния кодируются с помощью one-hot представления . . . 82

15. Рисунок 4.6. — Поле антиградиентов действий для

анти-исследовательского бонуса, обусловленного на четыре категориальных состояния в каждом углу для игрушечной задачи, представленной на Рисунке 4.5. Верхний ряд соответствует RND с конкатенационным обусловливанием в prior, нижний — с FiLM-обусловливанием. Получающиеся антиградиенты для конкатенации оказываются шумными, тогда как направления для FiLM остаются гладкими по всему доступному пространству действий................. 83

16. Рисунок 4.7. —Среднеквадратичная ошибка между действиями

актора, обученного с различными вариантами обусловливания predictor и prior, и действиями поведенческой политики. Используются датасеты halfcheetah, walker2d и hopper medium, по 3 запуска для каждого. Видно, что обусловливание на каждом слое полезно для prior-сетей, тогда как для предикторов лучше использовать обусловливание на последнем слое. Следует отметить, что данный эксперимент выполнен в условиях без критика.................. 85

Список таблиц

1. Таблица 1.

2. Таблица 2.

3. Таблица 3.

4. Таблица 4.

5. Таблица 5.

6. Таблица 6.

Метрика emulative regret для онлайн дообучения. . 38

Решения по реализации и выбору архитектуры, выходящих за рамки основных алгоритмических усовершенствований, в некоторых недавно

предложенных алгоритмах................ 46

Средняя нормализовання награда для финальной политики, усредненная по 10 независимым запускам на задачах MuJoCO из D4RL. Значения для BC и CQL были взяты из статьи SAC-N [5]. Для честого сравнения, дополнительно был произведен масштабный поиск гиперпараметров

для IQL и TD3+BC.................... 52

Средняя нормализовання награда для финальной политики, усредненная по 10 независимым запускам на задачах AntMaze из D4RL. Значения для BC и CQL были взяты из статьи RORL [55]. Для честого сравнения, дополнительно был произведен масштабный поиск гиперпараметров

для IQL и TD3+BC.................... 53

Средняя нормализовання награда для финальной политики, усредненная по 10 независимым запускам на задачах Adroit из D4RL. Значения для BC и CQL были взяты из статьи MSG [6]. Для честого сравнения, дополнительно был произведен масштабный поиск гиперпараметров для IQL и

TD3+BC.......................... 54

Средняя нормализованная награда финальной политики, усредненная по 5 независимым запускам на задачах V-D4RL. Значения масштабируются из [0,1000] в [0,100] для удобства.............. 56

7. Таблица 7. — Абляции улучшений в ReBRAC: каждая

модификация была отключена по очереди, при сохранении остальных.................. 57

8. Таблица 8. — Метрика Expected Online Performance [67]

усредненная по D4RL доменам и 4 независимым запускам. Данная метрика демонстрирует чувствительность к выбору гиперпараметров, учитывая определенный бюджет на онлайн-оценку политик........................... 62

9. Таблица 9. — Сравнение различных предикторов RND. В prior

используется FiLM-обусловливание. Задачи halfcheetah опущены, так как они оказались нерепрезентативными для оценки итоговой производительности на более сложных задачах. . . 74

10. Таблица 10. —Нормализованная награда SAC-RND на домене

Gym из D4RL....................... 77

11. Таблица 11. —Оценка SAC-RND на домене AntMaze......... 80

12. Таблица 12. — Сравнение времени обучения различных

алгоритмов на датасете halfcheetah-medium-v2. ... 86

13. Таблица 13. —Нормализованная награда. Домен Gym-MuJoCo,

последняя политика....................106

14. Таблица 14. —Нормализованная награда. Домен Maze2d, v1

версия датасета, последняя политика.......... 107

15. Таблица 15. —Нормализованная награда. Домен AntMaze, v2

версия датасета, последняя политика.......... 107

16. Таблица 16. —Нормализованная награда. Домен Adroit, v1 версия

датасета, последняя политика..............108

17. Таблица 17. —Нормализованная награда. Домен Gym-MuJoCo, v2

версия датасета, лучшая политика...........109

18. Таблица 18. —Нормализованная награда. Домен Maze2d, v1

версия датасета, лучшая политика...........109

19. Таблица 19. —Нормализованная награда. Домен AntMaze, v2

версия датасета, лучшая политика...........110

20. Таблица 20. —Нормализованная награда. Домен Adroit, v1 версия

датасета, лучшая политика................110

21. Таблица 21. —Нормализованная награда алгоритмов после

офлайн обучения и онлайн дообучения.

Использованы датасеты версии v2 для AntMaze и

v1 для Adroit........................111

Приложение А Полные таблицы

А.1 Таблицы ТОИХ

Таблица 13 — Нормализованная награда. Домен Gym-MuJoCo, последняя политика.

Датасет BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-Ж EDAC DT

42.5 ± 0.7 48.1 ± 0.2 50.0 ± 0.3 47.0 ± 0.2 48.3 ± 0.2 64.0 ± 0.7 68.2 ± 1.3 67.7 ± 1.0 42.2 ± 0.3

23.6 ± 7.0 44.8 ± 0.6 45.1 ± 0.9 45.0 ± 0.3 44.5 ± 0.2 51.2 ± 0.3 60.7 ± 1.0 62.1 ± 1.1 38.9 ± 0.5

90.1 ± 2.5 90.8 ± 6.0 95.0 ± 0.6 95.6 ± 0.4 94.7 ± 0.5 103.8 ± 3.0 99.0 ± 9.3 104.8 ± 0.6 91.6 ± 1.0

55.5 ± 7.3 60.4 ± 3.5 63.0 ± 4.6 59.1 ± 3.8 67.5 ± 3.8 102.3 ± 0.2 40.8 ± 9.9 101.7 ± 0.3 65.1 ± 1.6

Ь-тг^2 70.4 ± 8.7 64.4 ± 21.5 98.9 ± 2.1 95.1 ± 5.3 97.4 ± 6.4 95.0 ± 6.5 100.3 ± 0.8 99.7 ± 0.8 81.8 ± 6.9

Ь-те^2 111.2 ± 1.0 101.2 ± 9.1 101.9 ± 6.2 99.3 ± 10.9 107.4 ± 7.8 109.5 ± 2.3 101.3 ± 11.6 105.2 ± 10.1 110.4 ± 0.3

w-m-v2 67.3 ± 5.2 82.7 ± 4.8 68.5 ± 27.2 80.8 ± 3.3 80.9 ± 3.2 85.8 ± 0.8 87.5 ± 0.7 93.4 ± 1.4 67.6 ± 2.5

w-mr-v2 54.4 ± 6.3 85.6 ± 4.0 80.6 ± 3.6 73.1 ± 13.2 82.2 ± 3.0 84.3 ± 2.3 79.0 ± 0.5 87.1 ± 2.8 59.9 ± 2.7

w-me-v2 108.7 ± 0.3 110.0 ± 0.4 111.4 ± 1.6 109.6 ± 0.4 111.7 ± 0.9 111.9 ± 0.4 114.9 ± 0.4 114.8 ± 0.7 107.1 ± 1.0

Среднее

69.3 76.5 79.4 78.3 81.6 89.7 83.5

92.9

73.8

Таблица 14 — Нормализованная награда. Домен Maze2d, VI версия датасета, последняя политика.

Датасет BC-10% TD3+BC

AWAC

CQL

IQL ReBRAC

SAC-N

EDAC

DT

umaze

medium

large

12.2 ± 4.3 29.4 ± 12.3 65.7 ± 5.3 -8.9 ± 6.1 42.1 ± 0.6 106.9 ± 22.2 130.6 ± 16.5 95.3 ± 6.4 18.1 ± 25.4

14.3 ± 2.3 59.5 ± 36.3 84.6 ± 35.5 86.1 ± 9.7 34.9 ± 2.7 105.1 ± 31.7 88.6 ± 18.7 57.0 ± 3.5 31.7 ± 26.3 11.3 ± 5.1 97.1 ± 25.4 215.5 ± 3.1 23.8 ± 36.7 61.7 ± 3.5 78.3 ± 61.8 204.8 ± 1.2 95.6 ± 22.9 35.7 ± 28.2

Среднее

12.6

62.0

121.9

33.7

46.2

96.8

141.3

82.6

28.5

о

Таблица 15 — Нормализованная награда. Домен AntMaze, v2 версия датасета, последняя политика.

Датасет BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-N EDAC DT

antmaze-umaze 65.8 ± 5.3 70.8 ± 39.2 56.8 ± 9.1 92.8 ± 1.9 77.0 ± 5.5 97.8 ± 1.5 0.0 ± 0.0 0.0 ± 0.0 57.0 ± 9.8

antmaze-umaze-diverse 44.0 ± 1.0 44.8 ± 11.6 54.8 ± 8.0 37.3 ± 3.7 54.3 ± 5.5 83.5 ± 7.0 0.0 ± 0.0 0.0 ± 0.0 51.8 ± 0.4

antmaze-medium-play 2.0 ± 0.7 0.3 ± 0.4 0.0 ± 0.0 65.8 ± 11.6 65.8 ± 11.7 89.5 ± 3.4 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0

antmaze-medium-diverse 5.8 ± 9.4 0.3 ± 0.4 0.0 ± 0.0 67.3 ± 3.6 73.8 ± 5.5 83.5 ± 8.2 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0

antmaze-large-play 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0 20.8 ± 7.3 42.0 ± 4.5 52.3 ± 29.0 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0

antmaze-large-diverse 0.8 ± 0.8 0.0 ± 0.0 0.0 ± 0.0 20.5 ± 13.2 30.3 ± 3.6 64.0 ± 5.4 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0

Среднее 19.7 19.3 18.6 50.7 57.2 78.4 0.0 0.0 18.1

Таблица 16 — Нормализованная награда. Домен Adroit, v1 версия датасета, последняя политика.

^aTaceT BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-N EDAC DT

pen-human 27.0 ± 9.6 -3.9 ± 0.2 76.7 ± 11.7 13.7 ± 17.0 78.5 ± 8.2 103.2 ± 8.5 6.9 ± 5.9 5.1 ± 6.2 67.7 ± 5.5

pen-cloned 46.7 ± 14.3 5.1 ± 5.3 85.7 ± 16.9 1.0 ± 6.6 83.4 ± 8.2 102.8 ± 7.8 31.4 ± 2.1 12.0 ± 1.8 64.4 ± 1.4

pen-expert 115.0 ± 3.0 122.5 ± 21.3 159.9 ± 1.9 -1.4 ± 2.3 128.1 ± 9.2 152.2 ± 6.3 87.1 ± 49.0 -1.6 ± 0.8 116.4 ± 1.3

door-human -0.1 ± 0.1 -0.3 ± 0.0 2.4 ± 2.3 5.5 ± 1.3 3.3 ± 1.8 -0.1 ± 0.0 -0.4 ± 0.0 -0.1 ± 0.1 4.4 ± 0.9

door-cloned 0.3 ± 0.6 -0.3 ± 0.0 0.0 ± 0.0 -0.3 ± 0.0 3.1 ± 1.8 0.1 ± 0.1 -0.3 ± 0.0 2.7 ± 2.3 7.6 ± 3.3

door-expert 104.0 ± 1.5 -0.3 ± 0.0 104.6 ± 0.3 -0.3 ± 0.0 106.7 ± 0.3 106.4 ± 0.3 -0.3 ± 0.0 106.3 ± 1.7 104.9 ± 0.4

hammer-human -0.2 ± 0.0 1.0 ± 0.2 1.0 ± 0.5 0.1 ± 0.1 1.8 ± 0.8 0.2 ± 0.2 0.2 ± 0.0 0.3 ± 0.2 1.3 ± 0.2

hammer-cloned 0.1 ± 0.1 0.3 ± 0.0 1.3 ± 2.1 0.3 ± 0.0 1.5 ± 0.7 5.0 ± 3.8 0.1 ± 0.1 0.2 ± 0.1 1.8 ± 0.6

hammer-expert 121.8 ± 7.7 3.1 ± 0.0 127.1 ± 0.1 0.3 ± 0.0 128.7 ± 0.3 133.6 ± 0.3 25.1 ± 43.3 28.5 ± 49.0 117.5 ± 6.7

relocate-human -0.1 ± 0.1 -0.3 ± 0.0 0.5 ± 0.5 0.1 ± 0.0 0.1 ± 0.0 0.2 ± 0.3 -0.3 ± 0.0 -0.2 ± 0.2 0.1 ± 0.0

relocate-cloned 0.0 ± 0.0 -0.3 ± 0.0 0.0 ± 0.0 -0.3 ± 0.0 0.0 ± 0.0 1.7 ± 2.6 0.0 ± 0.1 0.2 ± 0.4 0.2 ± 0.1

relocate-expert 97.9 ± 5.2 -1.7 ± 1.0 109.5 ± 0.5 -0.3 ± 0.0 106.1 ± 4.0 107.5 ± 2.3 -0.4 ± 0.0 71.9 ± 18.4 104.3 ± 0.4

Среднее

42.7 10.4 55.7 1.5 53.4

59.4

12.4 18.8 49.2

Таблица 17 — Нормализованная награда. Домен Gym-MuJoCo, v2 версия датасета, лучшая политика.

Датасет BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-N EDAC DT

hf-m hf-mr hf-me 43.9 ± 0.1 42.3 ± 0.5 94.1 ± 0.2 48.9 ± 0.1 45.8 ± 0.3 96.6 ± 0.9 50.8 ± 0.2 46.5 ± 0.3 96.8 ± 0.2 47.6 ± 0.0 46.4 ± 0.2 97.0 ± 0.2 48.8 ± 0.1 45.4 ± 0.1 95.4 ± 0.2 65.6 ± 0.5 52.2 ± 0.3 108.9 ± 1.2 72.2 ± 0.3 67.3 ± 0.3 111.7 ± 0.5 69.7 ± 0.9 66.6 ± 1.1 110.6 ± 1.0 42.7 ± 0.1 40.3 ± 0.3 93.4 ± 0.2

h-m h-mr h-me 73.8 ± 0.4 90.6 ± 2.1 113.1 ± 0.2 70.4 ± 1.2 98.1 ± 1.2 113.2 ± 0.4 95.4 ± 3.7 101.5 ± 0.2 113.3 ± 0.5 70.8 ± 2.0 101.6 ± 0.6 112.8 ± 0.7 80.5 ± 3.1 102.7 ± 1.0 113.2 ± 0.4 103.2 ± 0.2 102.6 ± 0.5 113.2 ± 0.4 101.8 ± 0.2 103.8 ± 0.5 111.2 ± 0.2 103.3 ± 0.1 103.3 ± 0.5 111.8 ± 0.1 69.4 ± 3.6 88.7 ± 3.0 111.2 ± 0.2

w-m w-mr w-me 82.1 ± 0.9 76.1 ± 0.4 109.9 ± 0.1 86.9 ± 0.3 91.2 ± 0.7 112.2 ± 0.1 85.9 ± 3.8 86.7 ± 0.9 113.4 ± 2.2 84.8 ± 0.2 89.4 ± 0.9 111.6 ± 0.4 87.6 ± 0.5 89.9 ± 0.9 113.1 ± 0.5 87.8 ± 0.2 91.1 ± 0.6 112.5 ± 0.2 90.2 ± 0.5 85.2 ± 1.6 116.9 ± 0.4 95.8 ± 1.1 89.7 ± 1.4 116.5 ± 0.8 74.7 ± 0.6 68.2 ± 1.2 108.7 ± 0.3

Среднее 80.65 84.83 87.80 84.68 86.28 93.00 95.60 96.36 77.49

Таблица 18 — Нормализованная награда. Домен Maze2d, vi версия датасета, лучшая политика.

Датасет BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-N EDAC DT

maze2d-umaze-v1 22.5 ± 1.5 99.3 ± 16.2 137.0 ± 10.9 92.1 ± 13.7 50.9 ± 4.2 162.3 ± 1.8 153.1 ± 6.5 149.9 ± 2.0 63.8 ± 17.4

maze2d-medium-v1 27.6 ± 1.9 150.9 ± 3.9 152.7 ± 20.8 128.7 ± 5.4 122.7 ± 30.0 150.1 ± 4.5 93.8 ± 14.7 154.4 ± 1.6 68.1 ± 12.3

maze2d-large-v1 41.8 ± 3.6 197.6 ± 5.3 227.3 ± 1.5 157.5 ± 7.3 162.3 ± 44.2 197.6 ± 5.8 207.5 ± 1.0 182.5 ± 2.7 50.3 ± 19.3

Среднее 30.65 149.30 172.33 126.07 111.95 169.98 151.48 162.27 60.74

Таблица 19 — Нормализованная награда. Домен AntMaze, v2 версия датасета, лучшая политика.

Датасет BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-N EDAC DT

antmaze-umaze 77.5 ± 1.5 98.5 ± 0.9 70.8 ± 8.8 94.8 ± 0.8 84.0 ± 4.1 100.0 ± 0.0 0.0 ± 0.0 42.5 ± 28.6 64.5 ± 2.1

antmaze-umaze-diverse 63.5 ± 2.2 71.3 ± 5.8 81.5 ± 4.3 53.8 ± 2.1 79.5 ± 3.4 96.8 ± 2.3 0.0 ± 0.0 0.0 ± 0.0 60.5 ± 2.3

antmaze-medium-play 6.3 ± 2.4 3.8 ± 1.3 25.0 ± 10.7 80.5 ± 3.4 78.5 ± 3.8 93.5 ± 2.6 0.0 ± 0.0 0.0 ± 0.0 0.8 ± 0.4

antmaze-medium-diverse 16.5 ± 5.6 5.5 ± 1.5 10.8 ± 5.3 71.0 ± 4.5 83.5 ± 1.8 91.8 ± 2.1 0.0 ± 0.0 0.0 ± 0.0 0.5 ± 0.5

antmaze-large-play 13.5 ± 9.8 1.3 ± 0.4 0.5 ± 0.5 34.8 ± 5.9 53.5 ± 2.5 68.8 ± 13.9 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0

antmaze-large-diverse 6.3 ± 1.8 0.3 ± 0.4 0.0 ± 0.0 36.3 ± 3.3 53.0 ± 3.0 69.5 ± 7.3 0.0 ± 0.0 0.0 ± 0.0 0.0 ± 0.0

Среднее 30.58 30.08 31.42 61.83 72.00 86.71 0.00 7.08 21.04

Таблица 20 — Нормализованная награда. Домен Adroit, v1 версия датасета, лучшая политика.

Датасет BC-10% TD3+BC AWAC CQL IQL ReBRAC SAC-N EDAC DT

pen-human-v1 pen-cloned-v1 pen-expert-v1 59.9 ± 8.0 83.6 ± 11.8 134.4 ± 3.2 10.0 ± 8.2 52.7 ± 6.3 142.8 ± 7.7 119.0 ± 6.6 125.8 ± 3.3 162.5 ± 0.3 58.9 ± 1.8 14.7 ± 2.3 14.9 ± 4.1 106.2 ± 10.3 114.0 ± 4.8 140.0 ± 6.4 127.3 ± 3.2 128.6 ± 7.2 157.6 ± 0.3 56.5 ± 7.2 52.7 ± 5.3 116.4 ± 40.3 35.8 ± 10.6 26.9 ± 7.9 36.0 ± 4.6 77.8 ± 2.3 71.2 ± 2.7 119.5 ± 2.3

door-human-v1 door-cloned-v1 door-expert-v1 7.0 ± 6.8 10.4 ± 4.1 105.9 ± 0.2 -0.1 ± 0.1 -0.2 ± 0.1 4.5 ± 7.4 17.7 ± 2.6 10.5 ± 2.8 106.6 ± 0.3 13.3 ± 2.8 -0.1 ± 0.1 59.5 ± 25.0 13.5 ± 1.2 9.0 ± 1.5 107.3 ± 0.4 0.3 ± 0.4 7.7 ± 6.8 106.8 ± 0.0 -0.1 ± 0.1 -0.2 ± 0.1 0.1 ± 0.0 2.5 ± 2.3 20.4 ± 1.1 109.2 ± 0.2 7.4 ± 1.2 11.2 ± 1.0 105.5 ± 0.1

hammer-human-v1 hammer-cloned-v1 hammer-expert-v1 6.2 ± 4.8 8.7 ± 3.3 128.2 ± 0.7 2.4 ± 0.1 1.0 ± 0.3 33.3 ± 47.7 17.0 ± 3.6 10.7 ± 5.5 129.1 ± 0.3 0.3 ± 0.1 0.3 ± 0.0 0.9 ± 1.1 6.9 ± 2.4 11.6 ± 1.7 129.8 ± 0.4 1.2 ± 0.2 48.2 ± 6.2 134.7 ± 0.3 0.3 ± 0.0 12.7 ± 15.0 91.7 ± 47.8 3.5 ± 2.2 0.3 ± 0.0 69.4 ± 47.0 1.7 ± 0.1 2.7 ± 0.2 127.4 ± 0.1

relocate-human-v1 relocate-cloned-v1 relocate-expert-v1 0.2 ± 0.1 0.7 ± 0.5 109.8 ± 0.6 -0.3 ± 0.0 0.0 ± 0.0 0.2 ± 0.3 1.8 ± 0.8 0.4 ± 0.1 111.2 ± 0.3 1.0 ± 0.2 -0.1 ± 0.0 0.0 ± 0.1 1.2 ± 0.3 1.8 ± 0.7 110.1 ± 0.8 3.7 ± 2.3 9.3 ± 2.6 111.1 ± 0.2 -0.2 ± 0.1 0.1 ± 0.0 -0.1 ± 0.1 0.1 ± 0.0 4.1 ± 1.4 98.3 ± 3.8 0.1 ± 0.0 0.3 ± 0.1 106.5 ± 0.3

Среднее 54.6 20.5 67.7 13.6 62.6 69.7 27.5 33.9 52.6

Таблица 21 — Нормализованная награда алгоритмов после офлайн обучения и онлайн дообучения. Использованы датасеты версии v2 для AntMaze и v1 для Adroit.

Датасет AWAC CQL IQL SPOT Cal-QL ReBRAC

antmaze-umaze 52.8 ^ 98.8 94.0 ^ 99.5 77.0 ^ 96.5 91.0 ^ 99.5 76.8 ^ 99.8 98.0 ^ 74.8

antmaze-umaze-diverse 56.0 ^ 0.0 9.5 ^ 99.0 59.5 ^ 63.8 36.3 ^ 95.0 32.0 ^ 98.5 73.8 ^ 98.0

antmaze-medium-play 0.0 ^ 0.0 59.0 ^ 97.8 71.8 ^ 89.8 67.3 ^ 97.3 71.8 ^ 98.8 87.5 ^ 98.0

antmaze-medium-diverse 0.0 ^ 0.0 63.5 ^ 97.3 64.3 ^ 92.3 73.8 ^ 94.5 62.0 ^ 98.3 85.3 ^ 98.8

antmaze-large-play 0.0 ^ 0.0 28.8 ^ 88.3 38.5 ^ 64.5 31.5 ^ 87.0 31.8 ^ 97.3 68.5 ^ 31.5

antmaze-large-diverse 0.0 ^ 0.0 35.5 ^ 91.8 26.8 ^ 64.3 17.5 ^ 81.0 44.0 ^ 91.5 67.0 ^ 72.3

Среднее AntMaze 18.1 ^ 16.5 (-1.7) 48.4 ^ 95.6 (+47.2) 56.3 ^ 78.5 (+22.2) 52.9 ^ 92.4 (+39.5) 53.0 ^ 97.3 (+24.3) 80.0 ^ 78.9 (-1.1)

pen-cloned-v1 88.7 ^ 86.8 -2.8 ^ -1.3 84.2 ^ 102.0 6.2 ^ 43.6 -2.7 ^ -2.7 74.0 ^ 138.2

door-cloned-v1 0.9 ^ 0.0 -0.3 ^ -0.3 1.2 ^ 20.3 -0.2 ^ 0.0 -0.3 ^ -0.3 0.1 ^ 102.4

hammer-cloned-v1 1.8 ^ 0.2 0.6 ^ 2.9 1.4 ^ 57.3 4.0 ^ 3.7 0.3 ^ 0.2 6.5 ^ 124.7

relocate-cloned-v1 -0.0 ^ -0.0 -0.3 ^ -0.3 0.0 ^ 0.3 -0.2 ^ -0.2 -0.3 ^ -0.3 0.7 ^ 7.0

Среднее Adroit 22.8 ^ 21.8 (-1.1) -0.7 ^ 0.2 (+0.9) 21.7 ^ 45.0 (+23.3) 2.4 ^ 11.8 (+9.4) -0.8 ^ -0.8 (-0.0) 20.3 ^ 93.0 (+72.7)

Среднее

20.0 ^ 18.6 (-1.4) 28.7 ^ 57.4 (+28.7) 42.5 ^ 65.1 (+22.7) 32.7 ^ 60.2 (+27.5) 31.5 ^ 58.1 (+26.6) 56.1 ^ 84.5 (+28.4)

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.