Разработка методов и алгоритмов байесовской иерархической временной памяти для задач обучения с подкреплением тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Дживеликян Евгений Александрович
- Специальность ВАК РФ00.00.00
- Количество страниц 155
Оглавление диссертации кандидат наук Дживеликян Евгений Александрович
Введение
Глава 1. Постановка задачи и методы
1.1 Непрерывное обучение с подкреплением
1.2 Нейрофизиологические ограничения
1.3 Биологически интерпретируемые когнитивные модели агентов
1.4 Иерархическая временная память
1.5 Временная память как модель мира
1.6 Выводы по главе
Глава 2. Биологически интерпретируемый агент на основе
иерархической временной памяти
2.1 Иерархическое обучение с подкреплением
2.2 Иерархический внутренне-мотивированный агент
2.3 Алгоритм моделирования иерархии
2.3.1 Иерархическая модель мира
2.3.2 Модификация временной памяти
2.4 Эксперименты и результаты
2.4.1 Клеточная среда с нестационарной целью
2.4.2 Формирование умений в задаче поиска исчерпаемого ресурса
2.5 Выводы по главе
Глава 3. Вероятностная интерпретация иерархической
временной памяти
3.1 Дендритный сегмент как наивный байесовский детектор
3.2 Эксперименты и результаты
3.2.1 Предсказание последовательностей символов в марковской грамматике
3.2.2 Предсказание распределённых представлений в стохастичной среде
3.3 Выводы по главе
Стр.
Глава 4. Модель временной памяти на основе фактор-графов
4.1 Распределённая хеббовская временная память
4.1.1 Факторная графовая модель
4.1.2 Нейронная реализация
4.2 Архитектура агента
4.3 Временная память как модель эпизодической памяти
4.4 Эксперименты и результаты
4.4.1 Клеточная среда с нестационарной функцией перехода
4.4.2 Распределённое кодирование в Ашта1А1
4.5 Выводы по главе
Глава 5. Структурирование памяти эпизодов с помощью
последовательных представлений
5.1 Дискретная частично наблюдаемая среда как граф переходов
5.2 Кластеризация на основе последовательных представлений признаков
5.3 Модель памяти и её нейронная реализация
5.4 Эксперименты и результаты
5.5 Выводы по главе
Заключение
Список сокращений и условных обозначений
Список литературы
Список рисунков
Список таблиц
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Разработка методов и алгоритмов представления информации в обучении с подкреплением с использованием биологических принципов2024 год, кандидат наук Кудеров Петр Викторович
Исследование рабочей памяти и механизмов быстрой адаптации в обучении с подкреплением2022 год, кандидат наук Сорокин Артём Юрьевич
Исследование и разработка методов обучения с подкреплением для задач навигации в визуальных и клеточных средах2023 год, кандидат наук Скрынник Алексей Александрович
Методы мультиагентного обучения с подкреплением в условиях частичной наблюдаемости и динамических сред2025 год, кандидат наук Малышева Александра Ивановна
Исследование и разработка алгоритмов генерации вознаграждения в задачах обучения с подкреплением на основе модели мира2025 год, кандидат наук Латышев Артем Константинович
Введение диссертации (часть автореферата) на тему «Разработка методов и алгоритмов байесовской иерархической временной памяти для задач обучения с подкреплением»
Введение
Актуальность темы. Одной из наиболее важных характеристик интеллектуального агента является способность адаптироваться к изменяющимся условиям среды, которую условимся называть способностью к обучению в реальном времени. В области искусственного интеллекта, методы обучения с подкреплением зарекомендовали себя как наиболее перспективные для создания искусственных интеллектуальных агентов, способных взаимодействовать со средой, управляя робототехническими устройствами. Подавляющее большинство таких методов основаны на универсальных аппроксиматорах сложных функций в виде глубоких нейронных сетей (далее, глубокое обучение с подкреплением), обучаемых с помощью обратного распространения ошибки. Однако, глубокие нейронные сети, несмотря на успех их применения во многих областях науки и техники, обладают рядом недостатков, которые, на сегодняшний день, не позволяют создать полностью автономных искусственных агентов, сравнимых, по адаптивности, с человеком.
Существует множество работ, демонстрирующих превосходство над человеком искусственных агентов, являющихся результатом обучения с подкреплением на множестве узконаправленных задач и виртуальных сред [1; 2]. Однако даже небольшие изменения среды, которые не были учтены на этапе обучения и проектирования агента, как правило, приводят к краху интеллектуальной системы или существенному ухудшению её производительности [3; 4]. Хрупкость и неадаптивность подобных систем можно сравнить со свойствами организмов, которые тщательно отбирались в ходе миллионов лет эволюции, подстраиваясь к относительно стабильной окружающей среде без необходимости выработать общий механизм приспособления [5]. Самый прямой способ решения этой проблемы это увеличение разнообразия набора тренировочных данных, качества и глубины виртуальных сред, на которых обучается агент [6]. К примеру, успех увеличения размера обучающей выборки для глубокого обучения можно наблюдать в области моделирования языка и рассуждений с помощью больших языковых моделей, который определяется тем, что человечество уже накопило огромное количество текстовых данных [7]. Однако, учесть все возможные сценарии на этапе обучения практически невозможно, а
моделирование окружающей среды максимально приближённое к физической реальности, вероятно, не будет доступно в обозримом будущем. Поэтому, на сегодняшний день, очень важно, чтобы система имела возможность быстро адаптироваться к изменяющимся условиям, обучаясь в реальном времени на ограниченном наборе данных из окружающей среды. Одной из ключевых проблем в задаче обучения в реальном времени с помощью глубоких нейронных сетей, является так называемое катастрофическое забывание. Явление заключается в том, что когда новая порция обучающих данных достаточно сильно отличается от той, на которой искусственная нейронная сеть обучалась изначально, уже полученные знания теряются или вызывают конфликты, ухудшающие производительность интеллектуальной системы. В силу того, что глубокое обучение широко применяется в обучении с подкреплением, наиболее эффективные методы в этой области так же подвержены проблеме катастрофического забывания. Данная проблема влечёт за собой неспособность агента к обобщению и выделению наиболее общей структуры окружающего мира, которую можно переиспользовать в других задачах в случае непрерывного обучения. Обобщающая способность искусственных нейронных сетей напрямую зависит от размера и разнообразия начального набора данных. Один класс существующих методов борьбы с катастрофическим забыванием основан на хранении данных, на которых модель уже была обучена и повторном обучении на них с добавлением новых данных [8]. Другие методы основаны на расширении нейронной сети с добавлением новых нейронов [9], сохранении наиболее важных связей [10] и других методах контроля пластичности [11]. Примечательно, что все эти методы либо имеют аналоги в живых нейронных сетях, либо напрямую были вдохновлены нейрофизиологическими или психологическими исследованиями
[12]. К примеру, известно, что одна из функций сна —воспроизведение эпизодического опыта, которая приводит к улучшению перехода эпизодической памяти в семантическую, что аналогично методу улучшения обобщения в искусственных нейронных сетях через повторное обучение на старых примерах
[13].
Вероятно, в условиях часто меняющейся окружающей среды и неустойчивых экологических ниш возникли предпосылки к более успешному отбору тех видов, которые способны вырабатывать стратегию выживания на основе индивидуального опыта [14; 15]. У млекопитающих, в том
числе и у человека, это свойство обеспечиваются наличием памяти и механизмов выделения закономерностей наблюдаемых процессов [16; 17], субстратом которых общепринято считается головной мозг. В отличие от искусственных нейронных сетей, нервная система млекопитающих более устойчива к изменениям в среде и способна к обучению в реальном времени [18], проявляя гибкую специализацию. В связи с этим, особый интерес представляет понимание принципиальных различий механизмов обучения мозга и глубоких аппроксиматоров функций с помощью обратного распространения ошибки, которые могут быть причиной недостижимости адаптивности животных искусственными агентами, построенных на глубоком обучении с подкреплением. Ряд исследователей отмечает, что реализация механизма обратного распространения ошибки в мозге затруднительна, т.к. требует симметрии афферентных и эфферентных весов и высокой синхронности передачи информации между отдаленными областями мозга. В то время как считается, что биологически правдоподобные правила синаптической пластичности необходимо локальны [19; 20]. Тем не менее искусственные нейронные сети, обученные только локальными правилами, существенно проигрывают обученным с помощью обратного распространения ошибки в подавляющем большинстве задач. Это позволяет сделать вывод, что помимо синаптической пластичности, принципиально важны и другие процессы, для обеспечения мозгом обобщения индивидуального опыта.
Таким образом, с одной стороны, понимание принципов обеспечения мозгом наблюдаемых психических функций может помочь в создании более адаптивных искусственных агентов. С другой — решение задач искусственного интеллекта, ограничиваясь биологически правдоподобными правилами обучения, стимулирует создание принципиально новых алгоритмов обучения агентов, которые могли бы объяснить адаптивность живых систем. Данная работа является результатом разработки последнего направления, а именно: решения задач обучения с подкреплением с использованием биологически правдоподобных локальных правил обучения.
Степень разработанности темы. Наиболее близкими данному направлению являются работы Хокинса Дж. и Джорджа Д. [21; 22], которые ставят своей целью создание принципиально новых, более адаптивных и энергоэффективных архитектур искусственного интеллекта, основанных на нейрофизиологических исследованиях мозга млекопитающих. Предложенные
модели были успешно использованы для выявления аномалий временных рядов [23] и выделения объектов на изображениях [24], однако до сих пор не были адаптированы для построения искусственных агентов, способных решать задачи области обучения с подкреплением.
Отдельно нужно выделить область исследований, связанную со спайковыми нейронными сетями, которые основаны на упрощённой нейрофизиологической модели нейрона. Обычно такие сети специально создают под каждую конкретную задачу и они не обучаются в реальном времени. Основная задача таких архитектур — это увеличение энергоэффективности искусственных нейронных сетей с использованием специальных нейроморфных вычислительных устройств. Однако, исследования биологически правдоподобных правил обучения может позволить создание более адаптивных моделей данного типа.
Другие связанные работы ставят своей целью именно нейрофизиологическое моделирование, а не решение задач ИИ, как например, в тех, что используют вычислительную модель нейрона, предложенную нейрофизиологом О'Рейли Р. [25]. Однако нейрофизиологические модели, как правило, используются для относительно простых задач, которые не представляют интереса для области ИИ. Это обусловлено как тем, что такие модели вычислительно сложны и плохо масштабируются, так и тем, что сложность задач, на которых можно провести эксперименты с животными для сравнения с моделями также сильно ограничена.
Классические методы ИИ и глубокое обучение также используются для нейрофизиологического моделирования, как, к примеру, в работах Уиттингтона Дж. и Джорджа Д. Основная их цель это показать, что несмотря на отличия в методах обучения, результирующие свойства искусственных нейронных сетей и мозга могут быть принципиально похожими при определённых условиях. Так, например, в работе [26] было показано, что в искусственной модели, основанной на скрытых марковских цепях, из общих принципов возникают состояния, аналогичные состояниям гиппокампальных клеток места, границы, объекта и другим специфичным для задач навигации нейронам у мышей. А в работе [27], исследуются условия возникновения искусственных нейронов функционально аналогичных нейронам решётки в энторинальной коре.
Целью данной работы является разработка модели временной памяти, обучающейся с помощью локальных правил и полностью онлайн, которую
можно использовать в качестве модели мира агента в обучении с подкреплением в условиях нестационарности, стохастичности и частичной наблюдаемости среды.
Для этого нужно было решить следующие задачи:
1. Адаптировать существующую нейрофизиологическую модель временной памяти для решения задач обучения с подкреплением и выявить её ограничения.
2. Формализовать нейрофизиологическую модель временной памяти как модель мира агента в рамках байесовского подхода.
3. На основе данной формализации разработать новую модель временной памяти, преодолевающую ограничения исходной модели с сохранением основных нейрофизиологических принципов, таких как дендритное строение нейрона, локальность и несимметричность обратной связи.
4. Реализовать программный код предложенной модели как часть биологически интерпретируемой архитектуры агента.
5. Провести эксперименты для сравнения этой модели с существующими методами обучения с подкреплением в условиях нестационарности, стохастичности и частичной наблюдаемости среды.
Научная новизна:
1. Предложен алгоритм формирования иерархических представлений временной памяти для кодирования наблюдений и действий в частично наблюдаемой среде. Полученная модель памяти способна к обучению в реальном времени, в отличие от методов на основе обратного распространения ошибки.
2. Реализована архитектура агента, использующая алгоритм иерархической временной памяти для формирования иерархической стратегии, которая позволяет более эффективно переиспользовать накопленный опыт в задаче обучения с подкреплением в условиях нестационарности функции вознаграждения по сравнению с агентами, использующими алгоритм обратного распространения ошибки.
3. Предложен и реализован алгоритм временной памяти на основе байесовского подхода для её адаптации к стохастическим средам и многошаговым предсказаниям. Предложено использовать данную модель памяти для формирования последовательных представлений для эффективной стратегии агента в частично наблюдаемой
среде с нестационарными функциями вознаграждения и переходов состояний. Экспериментально показана более высокая эффективность предложенной архитектуры агента с биологически инспирированной временной памятью по сравнению с моделями памяти на основе глубокого обучения в нестационарных средах.
4. Предложен алгоритм итеративной структуризации временной памяти для улучшения её обобщающей способности. Показано, что данный алгоритм может быть реализован на основе локальных правил обучения и поэтому может рассматриваться как нейрофизиологическая модель возникновения обобщающих представлений в коре головного мозга.
Теоретическая значимость. Было показано, что модель иерархической временной памяти необходимо должна иметь разные типы сегментов для формирования иерархии действий.
Предложена двухуровневая модель сэмплирования в вероятностной модели временной памяти для устранения затухания предсказаний на основе простой модели дендритных сегментов как детекторов совпадений. Затем была разработана оригинальная вычислительная модель дендритного сегмента на основе модификации алгоритма распространения доверия в фактор-графах, позволяющая учитывать зависимость предсинаптических нейронов без необходимости двухуровнего семплирования. Учёт данной зависимости решает проблему затухания многошаговых предсказаний в многофакторной графической модели без использования циклических графов.
Предложены локальные правила обновления весов модели на основе ЕМ-алгоритма для марковских цепей и Монте-Карло семплирования, похожие на правило Хебба.
Приведён алгоритм, устанавливающий соответствие между эпизодической памятью и иерархической временной памятью. Было показано, что скрытое состояние иерархической временной памяти обладает низкой обобщающей способностью. Также произведена теоретическая оценка ёмкости предложенной модели памяти в зависимости от количества нейронов.
Предложен алгоритм обобщения представлений в виде второго уровня иерархии временной памяти на основе последовательных представлений признаков (БЕ-представлений), что позволяет моделировать формирование
когнитивных карт агентом с использованием биологически правдоподобных правил обучения.
Практическая значимость. Экспериментально было показано, что искусственный агент, стратегия которого строится с использованием предложенной биологически правдоподобной временной памяти обеспечивает более быстрое обучение, что ускоряет адаптацию к изменениям в среде по сравнению с моделями глубокого обучения. Потенциально это может быть использовано в мобильных робототехнических устройствах, требующих обучения в условиях реального времени. В силу локальности используемых правил обучения, в отличие от моделей глубокого обучения, обучение данной модели памяти может также быть реализовано на энергоэффективных нейроморфных вычислительных устройствах.
Методология и методы исследования. В качестве основы модели временной памяти использовался алгоритм временной иерархической памяти, разработанный Хокинсом Дж. и его коллегами с опорой на нейрофизиологические исследования коры головного мозга. А именно, при создании алгоритма широко использовались идеи колончатой и слоистой организации нейронов, а также локального ингибирования групп нейронов посредством интернейронов. Для вероятностной интерпретации временной памяти Хокинса использовалась теория байесовских графических моделей, в частности, алгоритм распространения доверия и представление распределений с помощью фактор-графов. Для вывода локальных правил обучения весов модели памяти использовался вариант EM-алгоритма для марковских цепей с Монте-Карло семплированием. Алгоритм обобщения представлений временной памяти опирается на психологическую теорию когнитивных карт и идею связи последовательных представлений с клетками места в гиппокампе.
Вычислительные эксперименты проводились посредством реализации алгоритмов на языке Python и библиотеки NumPy для быстрых операций с векторами. Использовались также готовые реализации части алгоритмов иерархической временной памяти на языке C++, взятых из свободной библиотеки htm.core.
Основные положения, выносимые на защиту:
1. Алгоритм онлайн формирования иерархических представлений на основе нейрофизиологической модели иерархической временной памяти с использованием локальных правил обучения.
2. Архитектура агента, использующая иерархическую временную память как модель мира и для формирования иерархической стратегии, которая улучшает эффективность переиспользования полученного опыта и исследования среды агентом в задаче непрерывного обучения с подкреплением по сравнению с алгоритмами на основе глубокого обучения с обратным распространением ошибки.
3. Модель хеббовской распределённой временной памяти и алгоритм её обучения на основе вероятностной интерпретации иерархической временной памяти. Показана эффективность предложенной модели памяти для формирования стратегии агента в нестационарной среде по сравнению с моделями глубокого обучения на основе обратного распространения ошибки.
4. Алгоритм итеративной структуризации представлений временной памяти на основе БЕ-представлений, улучшающий её обобщающую способность и позволяющий моделировать формирование когнитивных карт в искусственных нейронных сетях, обучающихся с использованием локальных правил.
Достоверность Все численные эксперименты проводились для нескольких различных начальных значений генератора псевдослучайных чисел и оценивались эмпирические среднее и дисперсия, а также приведены доверительные интервалы полученных значений. Достоверность результатов также обеспечивается сравнением с другими похожими методами, опубликованными в рецензируемых научных журналах. Для всех сравниваемых методов подбирались параметры для достижения наилучшего результата в одинаковых условиях эксперимента. Для наиболее важных компонент предложенных моделей были проведены абляционные исследования, подтверждающие их существенное влияние на результат экспериментов. Компьютерный код с подробными инструкциями, позволяющий в точности воспроизвести результаты экспериментов, находится в открытом доступе.
Апробация работы. Основные результаты по теме диссертации изложены в 5 печатных изданиях, 3 из которых изданы в журналах уровня К1 собственного перечня журналов МФТИ [28—30], 4 —в сборниках трудов конференций [28; 30—32], 1—в сборнике трудов конференции уровня А* [32].
Основные результаты работы докладывались на:
— 64-я Всероссийская научная конференция МФТИ (2021, Долгопрудный, Россия)
— «14th International Conference on Brain Informatics» (2021, Падуя, Италия)
— Семинар Центра когнитивного моделирования МФТИ (2022, 2023, Долгопрудный, Россия)
— Конференция «Kaspersky Neuromorphic AI» (2023, Москва, Россия)
— International Conference on Brain-Inspired Cognitive Architectures for Artificial Intelligence (2023, Нинбо, Китай)
— X Международная конференция по когнитивной науке (2024, Пятигорск, Россия)
— «19th International Conference on Hybrid Artificial Intelligence Systems» (2024, Сантьяго-де-Компостела, Испания)
— «The Thirteenth International Conference on Learning Representations» (2025, Сингапур)
Личный вклад. В работах [28; 29] предложена и реализована идея использования иерархической временной памяти для формирования абстрактных действий искусственного агента и реализованы соответствующие модификации алгоритма с добавлением новых типов дендритных сегментов. В работе [31] предложен вариант вероятностной интерпретации иерархической временной памяти и протестирован на задаче предсказания распределения наблюдений на несколько шагов в клеточной среде. В работах [30; 32] предложена и протестирована распределённая хеббовская временная память (РХВП) на основе вероятностной байесовской интерпретации иерархической памяти с новой вычислительной моделью дендритных сегментов. В работе [32] также была предложена и протестирована архитектура агента, использующая РХВП для формирования последовательных представлений.
Содержание диссертации соответствует паспорту специальности 5.12.4. Когнитивное моделирование, в частности, пунктам:
1. Математическое и компьютерное моделирование когнитивных процессов у человека, животных и искусственных агентов. Подходы к решению классических проблем: фрейма, обыденной («наивной») модели мира, генерации нового знания, принятия медицинских и социально значимых решений.
8. Искусственные нейронные сети (включая конволюционные и импульсные сети) при моделировании базовых когнитивных функций обучения, распознавания, запоминания фигуративной (образной), процедурной и декларативной информации.
Объем и структура работы. Диссертация состоит из введения, 5 глав и заключения. Полный объём диссертации составляет 155 страниц, включая 52 рисунка и 1 таблицу. Список литературы содержит 129 наименований.
Глава 1. Постановка задачи и методы
1.1 Непрерывное обучение с подкреплением
В данной работе, задача когнитивного моделирования адаптивного агента формализуется как задача непрерывного обучения с подкреплением (НОП):
Определение 1.1.1 (Задача непрерывного обучения с подкреплением). Даны пространство состояний пространство действий А, пространство наблюдений О, функция вознаграждения Я^г^) = Рг(г | з^), функция перехода Р^в^в,^ = Рг(й'| ,з,а,Ь), функция наблюдения или эмиссии Хг(о,з) = Рг(о | в^) и коэффициент дисконтирования у Е (0,1), тогда задача непрерывного обучения с подкреплением может быть описана кортежем вида:
где й Е 3,а Е А, о Е О, г Е К, индекс £ Е N означает, что компонент может также зависеть и от времени, которое везде полагаем дискретной величиной, а Рг—означает вероятностное распределение.
Задача Мсжъ задаёт частично наблюдаемую среду, если не существует однозначного отображения пространства наблюдений в пространство состояний. В этом случае, агент должен иметь внутренние представления о текущем состоянии среды, пространство которых обозначим как Н. Стоить отметить, что, в общем случае, Н = Б и не существует биективного отображения Н в Б. Мы рассматриваем именно такой случай, как наиболее реалистичную модель когнитивного агента.
Таким образом, в отличие от классической постановки задачи обучения с подкреплением, необходимо рассматривать стратегию, которая зависит от внутреннего представления агента.
Определение 1.1.2 (Стратегия). Стратегией называется вероятность выбрать действие а Е А в текущем представлении агента об окружающей среде Н Е Н:
Мокь = (8,А,0,КиРиХи у),
(1.1)
п(а, Н) = Рг(а | Н)
(1.2)
Механизм, который позволяет агенту формировать последовательности внутренних представлений, для объяснения причин последовательности наблюдений, условимся называть моделью мира агента:
Определение 1.1.3 (Модель мира). Моделью мира называется совокупность пространства внутренних или скрытых состояний Н, пространства действий А, пространства наблюдений О, функции перехода Т(к', к, а) = Рг(к'| к, а), функции кодирования Е(о, к) = Рг(о | к) и функции начального состояния В (к) = Рг(к):
= (Н,А,0,Т,Е,В), (1.3)
где к е н, а е А, о е О.
Такая формулировка модели мира соответствует скрытой марковской модели (СММ). Для процесса длиной Т временных шагов со значениями случайных величин о1:т = (о1,...,от), к1:т = (к1,...,кт) и действиями = (а1,а2, ...,ат) марковское свойство даёт следующую факторизацию генеративной модели:
тт Рг(01:т, к1:т | ^1:т) = В ^ Т (кт, кт-1, 0^) П Е (°т, кт). (1.4)
т=2 т=1
Модель мира агента должна хорошо предсказывать результат взаимодействия со средой. Модель тем лучше описывает Мсиь, чем меньше неожиданность последовательности наблюдений для любой произвольной последовательности действий. Тогда качество модели мира агента можно оценить по матожиданию неожиданности наблюдений, получаемых агентом при взаимодействии со средой:
8иг(Мскь,М№) = Е,
01:Т,в1;Т
10^^Рг(01:т, к1:т | Й1:т)
1:Т
(1.5)
где последовательность наблюдений о1:т распределена по Мскь, начиная с произвольного момента времени £, имеющего равномерное распределение, следуя последовательности действий а1:т = (а1, а2,..., ат): от ~
~ Рг+т(;, St+т-1 ,ат-1) и е Б, кт е Н, ат е А, от е О для всех т = 1..Т, где т—это относительное время внутри эпизода взаимодействия со средой.
Как следует из определения 1.1.1, в случае непрерывного обучения мы полагаем, что, в частности, вероятность переходов и наблюдений может
задаваться нестационарным распределением. Нужно отметить, что, формально, мы всегда можем сделать фактор времени частью пространства состояний среды. Однако, здесь он рассматривается отдельно, чтобы подчеркнуть, что не требуется от агента способности выявления закономерности в нестационарности, которая, в реальности, может быть очень сложной или не иметь структуры, поддающейся обобщению. По этой причине, при рассмотрении модели мира с точки зрения агента, зависимость распределений от времени опускается.
Для задачи непрерывного обучения с подкреплением удобно также ввести понятие правила обучения агента.
Определение 1.1.4 (Правило обучения). Правило обучения это правило обновления стратегии и модели мира на основе опыта взаимодействия со средой:
(п*,М*) ^ Ф((о,а,г), n,Mw), (1.6)
где о е О, а е А, г е R.
Тогда решением задачи Mqrl являются такие начальные стратегия и модель (п°, М°) и правило обучения агента Ф, которые максимизируют отдачу:
G(n°,М00, Ф, Mqrl) = E
L T-
ЕЁ Y(T-1VErJiT+т|п0,М», 9,MCRL
_j=1 T=1
где L это время жизни агента в числе эпизодов, Т^—длина ¿-го эпизода взаимодействия со средой, ^—вознаграждение в момент времени t, которое семплируется из распределения, зависящего от Rt, а коэффициент дисконтирования у определяет степень важности сиюминутных вознаграждений по сравнению с отложенными внутри эпизода. С помощью функции вознаграждения Rt задаётся цель агента в среде. По аналогии с экспериментами на животных, вознаграждение может представлять собой питательный ресурс, а эпизоды — отдельные эксперименты. Таким образом, выражение (1.7) соответствует среднему успеху популяции агентов с одинаковым набором (п°,М|°, Ф), в некотором наборе экспериментов. Здесь L, T1, T2..., Tl также являются значениями случайных величин, распределение которых зависит от динамики взаимодействия агента и среды.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Обучение спайковых нейронных сетей на основе минимизации их энтропийных характеристик в задачах анализа, запоминания и адаптивной обработки пространственно-временной информации2011 год, кандидат технических наук Синявский, Олег Юрьевич
Интеграция иерархических ансамблей и трансформерных архитектур в алгоритмы обучения с подкреплением2024 год, кандидат наук Козлов Даниил Александрович
Методология коллективного взаимодействия агентов интеллектуальных иерархических систем в процессе обучения с подкреплением при исследовании окружающего пространства2024 год, доктор наук Дубенко Юрий Владимирович
Нейроморфные методы оптимизации систем искусственного интеллекта для задач обучения с подкреплением2025 год, кандидат наук Иванов Дмитрий Александрович
Алгоритмы интерпретируемого искусственного интеллекта на основе значений Шепли в задачах высокой размерности2025 год, кандидат наук Цзоу Цзиньин
Список литературы диссертационного исследования кандидат наук Дживеликян Евгений Александрович, 2025 год
Список литературы
1. Silver D. [et al.]. Mastering the game of Go with deep neural networks and tree search // Nature. — 2016. — Vol. 529, no. 7587. — P. 484—489. — URL: https://doi.org/10.1038/nature16961.
2. OpenAI [et al.]. Dota 2 with Large Scale Deep Reinforcement Learning. — 2019. — URL: https://arxiv.org/abs/1912.06680 (visited on 10/11/2025).
3. Ilyas A., Santurkar S., Tsipras D., Engstrom L., Tran B., Madry A. Adversarial Examples Are Not Bugs, They Are Features. — 2019. — URL: https://arxiv.org/abs/1905.02175 (visited on 10/11/2025).
4. Zhang C, Bengio S., Hardt M, Recht B., Vinyals O. Understanding deep learning requires rethinking generalization. — 2017. — URL: https://arxiv. org/abs/1611.03530 (visited on 10/11/2025).
5. Barnosky A. D. [et al.]. Has the Earth's sixth mass extinction already arrived? // Nature. — 2011. — Vol. 471, no. 7336. — P. 51—57. — URL: https://www.nature.com/articles/nature09678.
6. Parker-Holder J. [et al.]. Genie 2: A Large-Scale Foundation World Model. — 2024. —URL: https://deepmind.google/discover/blog/genie-2-a-large-scale-foundation-world-model/ (visited on 10/11/2025).
7. OpenAI [et al.]. GPT-4 Technical Report. — 2024. — URL: https://arxiv. org/abs/2303.08774 (visited on 10/11/2025).
8. Kessler S., Ostaszewski M., Bortkiewicz M., Zarski M., Wolczyk M., Parker-Holder J., Roberts S. J., Mi\los P. The Effectiveness of World Models for Continual Reinforcement Learning // Proceedings of The 2nd Conference on Lifelong Learning Agents. — PMLR, 2023. — P. 184—204. — URL: https://proceedings.mlr.press/v232/kessler23a.html.
9. Rusu A. A., Rabinowitz N. C., Desjardins G., Soyer H., Kirkpatrick J., Kavukcuoglu K., Pascanu R., Hadsell R. Progressive Neural Networks. — 2022. — URL: https://arxiv.org/abs/1606.04671 (visited on 10/11/2025).
10. Kirkpatrick J. [et al.]. Overcoming catastrophic forgetting in neural networks // Proceedings of the National Academy of Sciences. — 2017. — Vol. 114, no. 13. — P. 3521—3526. — URL: https://www.pnas.org/doi/ abs/10.1073/pnas.1611835114.
11. Zenke F., Poole B., Ganguli S. Continual Learning Through Synaptic Intelligence // Proceedings of the 34th International Conference on Machine Learning. Vol. 70 / ed. by D. Precup, Y. W. Teh. — PMLR, 2017. — P. 3987—3995. — (Proceedings of Machine Learning Research). — URL: https://proceedings.mlr.press/v70/zenke17a.html.
12. Kudithipudi D. [et al.]. Biological underpinnings for lifelong learning machines // Nature Machine Intelligence. — 2022. — Vol. 4, no. 3. — P. 196—210. — URL: https://www.nature.com/articles/s42256-022-00452-0.
13. Ven G. M. van de, Siegelmann H. T., Tolias A. S. Brain-inspired replay for continual learning with artificial neural networks // Nature Communications. — 2020. — Vol. 11, no. 1. — P. 4069. — URL: https://www.nature.com/articles/s41467-020-17866-2.
14. Sol D., Duncan R. P., Blackburn T. M., Cassey P., Lefebvre L. Big brains, enhanced cognition, and response of birds to novel environments // Proceedings of the National Academy of Sciences. — 2005. — Vol. 102, no. 15. —P. 5460—5465. —URL: https://www.pnas.org/doi/abs/10.1073/ pnas.0408145102.
15. Snell-Rood E. C., Wick N. Anthropogenic environments exert variable selection on cranial capacity in mammals // Proceedings of the Royal Society B: Biological Sciences. — 2013. — Vol. 280, no. 1769. — P. 20131384. — URL: https://royalsocietypublishing.org/doi/10.1098/rspb.2013.1384.
16. Tolman E. C. Cognitive maps in rats and men. // Psychological Review. — 1948. — Vol. 55, no. 4. — P. 189—208. — URL: http://doi.apa.org/getdoi. cfm?doi=10.1037/h0061626.
17. Eichenbaum H. Memory: Organization and Control // Annual Review of Psychology. — 2017. — Vol. 68, Volume 68, 2017. — P. 19—45. — URL: https: / / www. annualreviews. org/content / journals/10. 1146/ annurev- psych-010416-044131.
18. Hassabis D., Kumaran D., Summerfield C., Botvinick M. Neuroscience-Inspired Artificial Intelligence // Neuron. — 2017. — Vol. 95, no. 2. — P. 245—258. — URL: https://www.cell.com/neuron/abstract/S0896-6273(17)30509-3.
19. Bengio Y., Lee D.-H., Bornschein J., Mesnard T., Lin Z. Towards Biologically Plausible Deep Learning. — 2016. — URL: https:/ /arxiv. org/abs/1502.04156 (visited on 10/11/2025).
20. Lillicrap T. P., Santoro A, Marris L., Akerman C. J., Hinton G. Backpropagation and the brain // Nature Reviews Neuroscience. — 2020. — Vol. 21, no. 6. — P. 335—346. — URL: http://www.nature.com/articles/ s41583-020-0277-3.
21. Hawkins J, George D., Niemasik J. Sequence memory for prediction, inference and behaviour // Philosophical Transactions of the Royal Society B: Biological Sciences. — 2009. — Vol. 364, no. 1521. — P. 1203—1209. — URL: https://royalsocietypublishing.org/doi/10.1098/rstb.2008.0322.
22. George D., Hawkins J. Towards a Mathematical Theory of Cortical Micro-circuits // PLoS Computational Biology / ed. by K. J. Friston. — 2009. — Vol. 5, no. 10. — e1000532. — URL: https://dx.plos.org/10.1371/ journal.pcbi.1000532 (visited on 10/14/2025).
23. Bamaqa A., Sedky M., Bosakowski T., Bastaki B. B. Anomaly Detection Using Hierarchical Temporal Memory (HTM) in Crowd Management // Proceedings of the 2020 4th International Conference on Cloud and Big Data Computing. — Virtual, United Kingdom : Association for Computing Machinery, 2020. — P. 37—42. — (ICCBDC '20). — URL: https://doi.org/ 10.1145/3416921.3416940.
24. George D. [et al.]. A generative vision model that trains with high data efficiency and breaks text-based CAPTCHAs // Science. — 2017. —Vol. 358, no. 6368. —eaag2612. —URL: https://www.science.org/doi/10.1126/ science.aag2612 (visited on 10/14/2025).
25. O'Reilly R. C, Hazy T. E., Herd S. A. The Leabra cognitive architecture: How to play 20 principles with nature and win! // The Oxford handbook of cognitive science. — New York, NY, US : Oxford University Press, 2017. — P. 91—115.
26. George D., Rikhye R. V., Gothoskar N., Guntupalli J. S., Dedieu A., Lazaro-Gredilla M. Clone-structured graph representations enable flexible learning and vicarious evaluation of cognitive maps // Nature Communications. — 2021. — Vol. 12, no. 1. — P. 2392. — URL: https://www.nature.com/articles/s41467-021-22559-5.
27. Whittington J. C., Muller T. H., Mark S., Chen G., Barry C., Burgess N., Behrens T. E. The Tolman-Eichenbaum Machine: Unifying Space and Relational Memory through Generalization in the Hippocampal Formation // Cell. — 2020. — Vol. 183, no. 5. — 1249—1263.e23. — URL: https: //www.sciencedirect.com/science/article/pii/S009286742031388X.
28. Dzhivelikian E., Latyshev A., Kuderov P., Panov A. I. Intrinsic Motivation to Learn Action-State Representation with Hierarchical Temporal Memory // Brain Informatics / ed. by M. Mahmud, M. S. Kaiser, S. Vassanelli, Q. Dai, N. Zhong. — Cham : Springer International Publishing, 2021. — P. 13—24. — URL: https://doi.org/10.1007/978-3-030-86993-9_2.
29. Dzhivelikian E., Latyshev A., Kuderov P., Panov A. I. Hierarchical intrinsically motivated agent planning behavior with dreaming in grid environments // Brain Informatics. — 2022. — Vol. 9, no. 1. — P. 8. — URL: https://doi.org/10.1186/s40708-022-00156-6.
30. Prokhorenko A., Dzhivelikian E., Kuderov P., Panov A. Soft Adaptive Segments for Bio-Inspired Temporal Memory // Hybrid Artificial Intelligent Systems / ed. by H. Quintian [et al.]. — Cham : Springer Nature Switzerland, 2025. — P. 202—213.
31. Dzhivelikian E, Kuderov P., Panov A. I. Learning Hidden Markov Model of Stochastic Environment with Bio-inspired Probabilistic Temporal Memory // Biologically Inspired Cognitive Architectures 2023 / ed. by A. V. Samsonovich, T. Liu. — Cham : Springer Nature Switzerland, 2024. — P. 330—339.
32. Dzhivelikian E. A., Kuderov P., Panov A. Learning Successor Features with Distributed Hebbian Temporal Memory // The Thirteenth International Conference on Learning Representations. — 2025. — URL: https : / / openreview.net/forum?id=wYJII5BRYU (visited on 10/11/2025).
33. Markram H., Gerstner W, Sjostrom P. J. Spike-timing-dependent plasticity: a comprehensive overview // Frontiers in Synaptic Neuroscience. — 2012. — Vol. 4. — P. 2.
34. Schultz W. Dopamine reward prediction-error signalling: a two-component response // Nature Reviews Neuroscience. — 2016. — Vol. 17, no. 3. — P. 183—195. — URL: https://doi.org/10.1038/nrn.2015.26.
35. Douglas R. J., Martin K. A. C. Neuronal circuits of the neocortex // Annual Review of Neuroscience. — 2004. — Vol. 27. — P. 419—451.
36. Case J. F. The Physiology of Nerve Cells // BioScience. — 1957. — Vol. 7, no. 3. — P. 38—38. — URL: https://doi.org/10.2307/1292338.
37. Hnasko T. S., Edwards R. H. Neurotransmitter corelease: mechanism and physiological role // Annual Review of Physiology. — 2012. — Vol. 74. — P. 225—243.
38. London M, Hausser M. Dendritic computation // Annual Review of Neuroscience. — 2005. — Vol. 28. — P. 503—532.
39. Rao R. P. N., Ballard D. H. Predictive coding in the visual cortex: a functional interpretation of some extra-classical receptive-field effects // Nature Neuroscience. — 1999. — Vol. 2, no. 1. — P. 79—87. — URL: https://doi.org/10.1038/4580.
40. Wenliang L. K., Seitz A. R. Deep Neural Networks for Modeling Visual Perceptual Learning // The Journal of Neuroscience: The Official Journal of the Society for Neuroscience. — 2018. — Vol. 38, no. 27. — P. 6028—6044.
41. Lillicrap T. P., Cownden D., Tweed D. B., Akerman C. J. Random feedback weights support learning in deep neural networks. — 2014. — URL: http: //arxiv.org/abs/1411.0247 (visited on 08/09/2025).
42. Liao Q., Leibo J. Z., Poggio T. How Important is Weight Symmetry in Backpropagation? —2016. — URL: http://arxiv.org/abs/1510.05067 (visited on 08/16/2025).
43. Bengio Y., Lee D.-H., Bornschein J., Mesnard T., Lin Z. Towards Biologically Plausible Deep Learning. — 2016. — URL: http://arxiv. org/abs/1502.04156 (visited on 06/04/2025).
44. O'Reilly R. C. Biologically Plausible Error-Driven Learning Using Local Activation Differences: The Generalized Recirculation Algorithm // Neural Computation. — 1996. — Vol. 8, no. 5. — P. 895—938. — URL: https: //direct.mit.edu/neco/article/8/5/895-938/5991.
45. Hinton G. E, Dayan P., Frey B. J., Neal R. M. The "Wake-Sleep" Algorithm for Unsupervised Neural Networks // Science. — 1995. — Vol. 268, no. 5214. — P. 1158—1161. —URL: https://www.science.org/doi/10. 1126/science.7761831.
46. Journe A., Rodriguez H. G., Guo Q., Moraitis T. Hebbian Deep Learning Without Feedback. — 2023. — URL: http://arxiv.org/abs/2209.11883 (visited on 10/21/2024).
47. Moraitis T., Toichkin D., Journe A., Chua Y., Guo Q. SoftHebb: Bayesian inference in unsupervised Hebbian soft winner-take-all networks // Neuromorphic Computing and Engineering. — 2022. — Vol. 2, no. 4. — P. 044017. — URL: https: / / iopscience. iop. org/ article / 10. 1088 / 2634-4386/aca710.
48. Launay J., Poli I., Boniface F., Krzakala F. Direct Feedback Alignment Scales to Modern Deep Learning Tasks and Architectures // Advances in Neural Information Processing Systems. Vol. 33. — Curran Associates, Inc., 2020. —P. 9346—9360. —URL: https://proceedings.neurips.cc/paper_ files/paper/2020/hash/69d1fc78dbda242c43ad6590368912d4-Abstract.html.
49. Rumelhart D. E., McClelland J. L. Learning Internal Representations by Error Propagation // Parallel Distributed Processing: Explorations in the Microstructure of Cognition: Foundations. — 1987. — P. 318—362.
50. Murray J. M. Local online learning in recurrent networks with random feedback // eLife / ed. by P. Latham, M. J. Frank, B. DePasquale. — 2019. — Vol. 8. — e43299. — URL: https://doi.org/10.7554/eLife.43299 (visited on 10/14/2025).
51. Bellec G., Scherr F., Subramoney A., Hajek E., Salaj D., Legenstein R., Maass W. A solution to the learning dilemma for recurrent networks of spiking neurons //Nature Communications. —2020. —Vol. 11, no. 1. —P. 3625. — URL: https://doi.org/10.1038/s41467-020-17236-y.
52. Huh M., Cheung B., Wang T., Isola P. The Platonic Representation Hypothesis. — 2024. — URL: http://arxiv.org/abs/2405.07987 (visited on 09/11/2024).
53. Bolado-Gomez R., Gurney K. A biologically plausible embodied model of action discovery // Frontiers in Neurorobotics. — 2013. — Vol. Volume 7 —2013. — URL: https : / / www. frontiersin. org / journals / neurorobotics / articles/10.3389/fnbot.2013.00004 (visited on 10/14/2025).
54. Stetter M., Lang E. W. Learning Intuitive Physics and One-Shot Imitation Using State-Action-Prediction Self-Organizing Maps // Computational Intelligence and Neuroscience / ed. by J. Liu. — 2021. — Vol. 2021. — P. 1—15. —URL: https://www.hindawi.com/journals/cin/2021/5590445/.
55. Kim T., Hamade K. C., Todorov D., Barnett W. H., Capps R. A., Latash E. M., Markin S. N., Rybak I. A., Molkov Y. I. Reward Based Motor Adaptation Mediated by Basal Ganglia // Frontiers in Computational Neuroscience. —2017. —Vol. 11. —URL: http://journal.frontiersin.org/ article/10.3389/fncom.2017.00019/full (visited on 10/14/2025).
56. Granato G., Cartoni E., Rold F. D., Mattera A., Baldassarre G. Integrating unsupervised and reinforcement learning in human categorical perception: A computational model // PLOS ONE. — 2022. — Vol. 17, no. 5. — e0267838. — URL: https://journals.plos.org/plosone/article?id=10.1371/ journal.pone.0267838 (visited on 10/14/2025).
57. Vértes E., Sahani M. A neurally plausible model learns successor representations in partially observable environments // Advances in Neural Information Processing Systems. Vol. 32. — Curran Associates, Inc., 2019. — URL: https : / / proceedings . neurips . cc / paper / 2019 / hash / dea184826614d3f4c608731389ed0c74-Abstract.html (visited on 10/14/2025).
58. Fang C., Aronov D., Abbott L., Mackevicius E. L. Neural learning rules for generating flexible predictions and computing the successor representation // eLife / ed. by S. Ostojic, T. E. Behrens, S. Recanatesi, A. Juliani. — 2023. — Vol. 12. — e80680. — URL: https://doi.org/10.7554/eLife.80680 (visited on 10/14/2025).
59. Anwar H. [et al.]. Training a spiking neuronal network model of visual-motor cortex to play a virtual racket-ball game using reinforcement learning // PLOS ONE / ed. by G. S. Cymbalyuk. — 2022. — Vol. 17, no. 5. — e0265808. — URL: https://dx.plos.org/10.1371/journal.pone.0265808 (visited on 10/14/2025).
60. Capone C, Paolucci P. S. Towards biologically plausible model-based reinforcement learning in recurrent spiking networks by dreaming new experiences // Scientific Reports. — 2024. — Vol. 14, no. 1. — P. 14656. — URL: https://www.nature.com/articles/s41598-024-65631-y.
61. Kappel D., Nessler B., Maass W. STDP Installs in Winner-Take-All Circuits an Online Approximation to Hidden Markov Model Learning // PLOS Computational Biology. — 2014. — Vol. 10, no. 3. — e1003511. — URL: https: / /journals.plos.org/ploscompbiol / article ? id = 10.1371 / journal. pcbi. 1003511 (visited on 10/14/2025).
62. Friston K., Schwartenbeck P., Fitzgerald T., Moutoussis M., Behrens T., Dolan R. The anatomy of choice: active inference and agency // Frontiers in Human Neuroscience. —2013. —Vol. 7. —URL: https://www.frontiersin. org/article/10.3389/fnhum.2013.00598 (visited on 10/14/2025).
63. Schwobel S., Kiebel S., Markovic D. Active Inference, Belief Propagation, and the Bethe Approximation // Neural Computation. — 2018. — Vol. 30, no. 9. — P. 2530—2567. — URL: https://doi.org/10.1162/neco_a_01108.
64. Fountas Z, Sajid N., Mediano P. A. M, Friston K. Deep active inference agents using Monte-Carlo methods. — 2020. — URL: https://arxiv.org/ abs/2006.04176 (visited on 10/16/2025).
65. Hawkins J., Ahmad S. Why Neurons Have Thousands of Synapses, a Theory of Sequence Memory in Neocortex // Frontiers in Neural Circuits. — 2016. — Vol. 10. —P. 23. —URL: https://www.frontiersin.org/article/10.3389/ fncir.2016.00023.
66. Cui Y, Ahmad S., Hawkins J. The HTM Spatial Pooler—A Neocortical Algorithm for Online Sparse Distributed Coding // Frontiers in Computational Neuroscience. — 2017. — Vol. 11. — P. 111.
67. Cui Y., Ahmad S., Hawkins J. Continuous Online Sequence Learning with an Unsupervised Neural Network Model // Neural Computation. — 2016. — Vol. 28, no. 11. — P. 2474—2504. — URL: https://doi.org/10.1162/NECO% 5C_a%5C_00893.
68. Ahmad S., Hawkins J. Properties of Sparse Distributed Representations and their Application to Hierarchical Temporal Memory. —2015. —URL: https: //arxiv.org/abs/1503.07469 (visited on 10/11/2025).
69. Kanerva P. Sparse Distributed Memory. — Cambridge, MA, USA : MIT Press, 1988. — 180 p.
70. Haxby J. V., Gobbini M. I., Furey M. L., Ishai A., Schouten J. L., Pietrini P. Distributed and overlapping representations of faces and objects in ventral temporal cortex // Science. — 2001. — Vol. 293, no. 5539. — P. 2425—2430.
71. Weliky M, Fiser J., Hunt R. H, Wagner D. N. Coding of natural scenes in primary visual cortex // Neuron. — 2003. — Vol. 37, no. 4. — P. 703—718.
72. Daylidyonok I., Frolenkova A., Panov A. Extended Hierarchical Temporal Memory for Motion Anomaly Detection // Advances in Intelligent Systems and Computing. — 2019. — Vol. 848. — P. 69—81.
73. Wang X., Yang K., Liu T. Stock Price Prediction Based on Morphological Similarity Clustering and Hierarchical Temporal Memory // IEEE Access. — 2021. — Vol. 9. — P. 67241—67248.
74. Sousa R., Lima T, Abelha A., Machado J. Hierarchical Temporal Memory Theory Approach to Stock Market Time Series Forecasting // Electronics. — 2021. — Vol. 10, no. 14. — URL: https://www.mdpi.com/2079-9292/10/ 14/1630 (visited on 10/14/2025).
75. Zeng H., Zhao X., Wang L. Multivariate Time Series Anomaly Detection on Improved HTM Model //. — 2021. — P. 759—763.
76. Hunter K. L, Spracklen L, Ahmad S. Two Sparsities Are Better Than One: Unlocking the Performance Benefits of Sparse-Sparse Networks. — 2021. — URL: https://arxiv.org/abs/2112.13896 (visited on 10/16/2025).
77. Iyer A., Grewal K., Velu A., Souza L. O., Forest J., Ahmad S. Avoiding Catastrophe: Active Dendrites Enable Multi-Task Learning in Dynamic Environments // Frontiers in Neurorobotics. — 2022. — Vol. 16. — URL: https: //www.frontiersin.org/article/10.3389/fnbot.2022.846219 (visited on 10/14/2025).
78. Struye J., Latre S. Hierarchical temporal memory and recurrent neural networks for time series prediction: An empirical validation and reduction to multilayer perceptrons // Neurocomputing. — 2020. — Vol. 396. — P. 291—301. — URL: https : / / linkinghub . elsevier . com / retrieve / pii / S0925231219304369.
79. Struye J., Mets K., Latre S. HTMRL: Biologically Plausible Reinforcement Learning with Hierarchical Temporal Memory. — 2020. — URL: https: //arxiv.org/abs/2009.08880 (visited on 10/14/2025).
80. Nugamanov E., Panov A. I. Hierarchical Temporal Memory with Reinforcement Learning // Procedia Computer Science. — 2020. — Vol. 169. — P. 123—131. — URL: https://linkinghub.elsevier.com/ retrieve/pii/S1877050920302465.
81. Kuderov P., Panov A. Planning with Hierarchical Temporal Memory for Deterministic Markov Decision Problem // Proceedings of the 13th International Conference on Agents and Artificial Intelligence - Volume 2: ICAART, — INSTICC. SciTePress, 2021. — P. 1073—1081.
82. Rawlinson D., Kowadlo G. Generating Adaptive Behaviour within a Memory-Prediction Framework // PLoS ONE / ed. by E. Vasilaki. — 2012. — Vol. 7, no. 1. — e29264. — URL: https://dx.plos.org/10.1371/ journal.pone.0029264 (visited on 10/14/2025).
83. Hawkins J., Ahmad S., Cui Y. A Theory of How Columns in the Neocortex Enable Learning the Structure of the World // Frontiers in Neural Circuits. — 2017. — Vol. 11. — P. 81.
84. Khetarpal K., Riemer M, Rish I., Precup D. Towards Continual Reinforcement Learning: A Review and Perspectives // Journal of Artificial Intelligence Research. — 2022. — Vol. 75. — P. 1401—1476. — URL: https://www.jair.org/index.php/jair/article/view/13673.
85. Sutton R., Precup D., Singh S. Between MDPs and semi-MDPs: A framework for temporal abstraction in reinforcement learning // Artificial Intelligence. — 1999. — Vol. 112, no. 1. — P. 181—211.
86. Dzhivelikian E., Latyshev A., Kuderov P., Panov A. I. Hierarchical intrinsically motivated agent planning behavior with dreaming in grid environments // Brain Informatics. — 2022. — Vol. 9, no. 1. — P. 8. — URL: https://doi.org/10.1186/s40708-022-00156-6.
87. Staay F. J. van der, Gieling E. T., Pinzon N. E., Nordquist R. E., Ohl F. The appetitively motivated "cognitive" holeboard: a family of complex spatial discrimination tasks for assessing learning and memory // Neuroscience and Biobehavioral Reviews. — 2012. — Vol. 36, no. 1. — P. 379—403.
88. Tolman E. C. Purposive behavior in animals and men. — London, England : Century/Random House UK, 1932. — P. xiv, 463—xiv, 463. — (Purposive behavior in animals and men.)
89. Oades R. D., Isaacson R. L. The development of food search behavior by rats: the effects of hippocampal damage and haloperidol // Behavioral biology. — 1978. — Vol. 24, no. 3. — P. 327—337.
90. Olton D. S., Samuelson R. J. Remembrance of places passed: spatial memory in rats. // Journal of experimental psychology: Animal behavior processes. — 1976. — Vol. 2, no. 2. — P. 97.
91. Bouger P. C, Staay F. J. van der. Rats with scopolamine-or MK-801-induced spatial discrimination deficits in the cone field task: animal models for impaired spatial orientation performance // European neuropsychopharmacology. — 2005. — Vol. 15, no. 3. — P. 331—346.
92. Crosby M., Beyret B., Shanahan M., Hernandez-Orallo J., Cheke L., Halina M. The animal-AI testbed and competition // NeurIPS 2019 competition and demonstration track. — PMLR. 2020. — P. 164—176.
93. Chevalier-Boisvert M, Willems L, Pal S. Minimalistic Gridworld Environment for OpenAI Gym. — 2018. — (Visited on 10/14/2025). https://github.com/maximecb/gym-minigrid.
94. Beattie C. [et al.]. DeepMind Lab. —2016. —URL: https://arxiv.org/abs/ 1612.03801 (visited on 10/14/2025).
95. Chevalier-Boisvert M., Bahdanau D., Lahlou S., Willems L., Saharia C., Nguyen T. H, Bengio Y. BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning. — 2019. — URL: https://arxiv.org/abs/ 1810.08272 (visited on 10/14/2025).
96. Platanios E. A., Saparov A., Mitchell T. Jelly Bean World: A Testbed for Never-Ending Learning. — 2020. —URL: https://arxiv.org/abs/2002.06306 (visited on 10/14/2025).
97. Goodfellow I., Bengio Y, Courville A. Deep learning. — MIT Press, 2016. — URL: http://www.deeplearningbook.org (visited on 10/16/2025).
98. Dzhivelikian E., Latyshev A., Kuderov P., Panov A. I. The Hierarchical Intrinsically Motivated Agent (HIMA). — 2022. — (Visited on 10/14/2025). https://github.com/AIRI-Institute/him-agent.
99. Kuderov P., Dzhivelikyan E., Latyshev A., Panov A. I. cog-isa/htm-rl: Hierarchical Intrinsically Motivated Agent Planning Behavior with Dreaming in Grid Environments. — Version v3.1-hima. — 2021. — URL: https: //doi.org/10.5281/zenodo.5638830 (visited on 10/14/2025).
100. Bayesian Brain: Probabilistic Approaches to Neural Coding / ed. by K. Doya, S. Ishii, A. Pouget, R. P. Rao. — The MIT Press, 2006. — URL: https: / / direct.mit.edu/books/book / 2884/bayesian-brainprobabilistic-approaches-to-neural.
101. Pearl J. The seven tools of causal inference, with reflections on machine learning // Communications of the ACM. — 2019. — Vol. 62, no. 3. — P. 54—60.
102. Paszke A. [et al.]. PyTorch: An Imperative Style, High-Performance Deep Learning Library // Advances in Neural Information Processing Systems 32. — Curran Associates, Inc., 2019. — P. 8024—8035. — URL: http: / / papers . neurips . cc / paper / 9015 - pytorch - an - imperative - style - high -performance-deep-learning-library.pdf.
103. Beeching E., Debangoye J., Simonin O, Wolf C. Godot Reinforcement Learning Agents. — 2021. —URL: https://arxiv.org/abs/2112.03636 (visited on 10/14/2025).
104. Baum L. E, Petrie T., Soules G, Weiss N. A maximization technique occurring in the statistical analysis of probabilistic functions of Markov chains // The annals of mathematical statistics. — 1970. — Vol. 41, no. 1. — P. 164—171.
105. Kschischang F ., Frey B., Loeliger H.-A. Factor graphs and the sum-product algorithm // IEEE Transactions on Information Theory. — 2001. — Vol. 47, no. 2. — P. 498—519.
106. Loeliger H.-A. An introduction to factor graphs // IEEE Signal Processing Magazine. — 2004. — Vol. 21, no. 1. — P. 28—41.
107. Ghahramani Z, Jordan M. Factorial Hidden Markov Models // Machine Learning. — 1997. — Vol. 29, no. 2/3. — P. 245—273.
108. Mountcastle V. The columnar organization of the neocortex // Brain. — 1997. — Vol. 120, no. 4. — P. 701—722. — URL: https://academic.oup. com/brain/article-lookup/doi/10.1093/brain/120.4.701.
109. George D., Rikhye R. V., Gothoskar N., Guntupalli J. S., Dedieu A., Lazaro-Gredilla M. Clone-structured graph representations enable flexible learning and vicarious evaluation of cognitive maps // Nature Communications. — 2021. — Vol. 12, no. 11. — P. 2392.
110. Stuart G. J., Spruston N. Dendritic integration: 60 years of progress // Nature Neuroscience. — 2015. — Vol. 18, no. 12. — P. 1713—1721. — URL: https://doi.org/10.1038/nn.4157.
111. Barreto A., Dabney W, Munos R., Hunt J. J., Schaul T., Hasselt H. van, Silver D. Successor Features for Transfer in Reinforcement Learning. — 2018. — URL: https://arxiv.org/abs/1606.05312 (visited on 10/14/2025).
112. Dayan P. Improving generalization for temporal difference learning: The successor representation // Neural computation. — 1993. —Vol. 5, no. 4. — P. 613—624.
113. Weiss G. <i>Dynamic Programming and Markov Processes</i>. Ronald A. Howard. Technology Press and Wiley, New York, 1960. viii + 136 pp. Illus. $5.75. // Science. — 1960. — Vol. 132, no. 3428. — P. 667—667. — URL: https://www.science.org/doi/abs/10.1126/science.132.3428.667.a.
114. Organization of memory / ed. by E. Tulving, W. Donaldson, G. H. Bower, United States. — New York, US : Academic Press, 1972. — 423 p.
115. Hochreiter S., Schmidhuber J. Long Short-term Memory // Neural computation. — 1997. — Vol. 9. — P. 1735—80.
116. Peng B. [et al.]. RWKV: Reinventing RNNs for the Transformer Era. — 2023. — URL: https://arxiv.org/abs/2305.13048 (visited on 10/14/2025).
117. Dedieu A., Gothoskar N., Swingle S., Lehrach W, Lázaro-Gredilla M., George D. Learning higher-order sequential structure with cloned HMMs. — 2019. — URL: http://arxiv.org/abs/1905.00507 (visited on 10/15/2025).
118. Paszke A. [et al.]. PyTorch: An Imperative Style, High-Performance Deep Learning Library // Advances in Neural Information Processing Systems 32. — Curran Associates, Inc., 2019. — P. 8024—8035.
119. Bo P. BlinkDL/RWKV-LM: 0.01. — Version 0.01. — 2021. — URL: https: //doi.org/10.5281/zenodo.5196577 (visited on 10/14/2025).
120. Hafner D., Pasukonis J., Ba J., Lillicrap T. Mastering Diverse Domains through World Models. — 2024. — URL: https://arxiv.org/abs/2301.04104 (visited on 10/14/2025).
121. Crosby M., Beyret B., Shanahan M., Hernández-Orallo J., Cheke L., Halina M. The Animal-AI Testbed and Competition // Proceedings of the NeurIPS 2019 Competition and Demonstration Track. Vol. 123 / ed. by H. J. Escalante, R. Hadsell. — PMLR, 2020. — P. 164—176. — (Proceedings of Machine Learning Research).
122. Jang E., Gu S., Poole B. Categorical Reparameterization with Gumbel-Softmax. —2017. — URL: https://arxiv.org/abs/1611.01144 (visited on 10/11/2025).
123. Subramanian A. PyTorch-VAE. — 2020. — (Visited on 10/14/2025). https: //github.com/AntixK/PyTorch-VAE.
124. Dzhivelikian E. A., Panov A. I. A Biologically Interpretable Cognitive Architecture for Online Structuring of Episodic Memories into Cognitive Maps. — 2025. — URL: https://arxiv.org/abs/2510.03286 (visited on 10/11/2025).
125. Stolcke A., Omohundro S. M. Best-first Model Merging for Hidden Markov Model Induction. — 1994. —URL: http://arxiv.org/abs/cmp-lg/9405017 (visited on 11/12/2024).
126. Staiger J. F., Petersen C. C. H. Neuronal Circuits in Barrel Cortex for Whisker Sensory Perception // Physiological Reviews. — 2021. — Vol. 101, no. 1. —P. 353—415. —URL: https://journals.physiology.org/doi/full/10. 1152/physrev.00019.2019.
127. Samuel J. Gershman. The Successor Representation: Its Computational Logic and Neural Substrates // The Journal of Neuroscience. — 2018. — Vol. 38, no. 33. — P. 7193. — URL: http://www.jneurosci.org/content/38/ 33/7193.abstract.
128. Hawkins J. A Thousand Brains: A New Theory of Intelligence. — New York, NY, US : Basic Books, 2021. — 288 p.
129. Edelman G. M. Neural Darwinism: The theory of neuronal group selection. — New York, NY, US : Basic Books, 1987. — 371 p. — (Neural Darwinism: The theory of neuronal group selection).
Список рисунков
1. Рисунок 1.1 — Структура иерархической временной памяти. А. Нейрон. Б. Нейроны, организованные в миниколонки, имеют общее рецептивное поле. В. Группа миниколонок составляет слой. Миниколонки одного слоя имеют один и тот же вход, но могут иметь разные рецептивные поля.......................28
2. Рисунок 1.2 — Марковский процесс, генерирующий последовательности символов или наблюдения о^ для рассматриваемой ВП, начиная из состояния 0 и заканчивая состоянием 7....................................................33
3. Рисунок 1.3 — Схема деполяризации нейронов по базальным сегментам. Базальные сегменты детектируют паттерны активации предсинаптических клеток Н для текущего шага £ и деполяризуют нейроны предсказывая активации на шаге £ +1. Н можно сопоставить состоянию марковского процесса вг е 5..........................................................................34
4. Рисунок 2.1 — ИВМА с иерархией из двух уровней, а также блоками воображения (Воображение) и внутренней мотивации (Влияние)............41
5. Рисунок 2.2 — Иерархическая нейроморфная модель кортекса, построенная с помощью алгоритмов теории ИВП. Является частью архитектуры ИВМА. 43
6. Рисунок 2.3 — Формирование стратегии верхнего уровня................46
7. Рисунок 2.4 — Формирование стратегии нижнего уровня.................46
8. Рисунок 2.5 — Сравнение моделей нейронов исходной и модифицированной версий временной памяти. / — бинарный паттерн активации нейронов обратной связи, сГ1,се — активации внутренних и внешних нейронов ВП, Н — входной паттерн активации............................................................48
9. Рисунок 2.6 — Пример наблюдения и его бинарного представления. Наблюдение состоит из нескольких каналов. Каждый канал кодирует положения соответствующих объектов в окне наблюдения...................50
10. Рисунок 2.7 — Примеры конфигураций клеточной среды. Жёлтый — множество начальных позиций. Зелёный — начальное положение цели. Тёмно синий — препятствия. Оттенки голубого — цвета пола.......................51
11. Рисунок 2.8 — Сравнение агентов, использующих и не использующих абстрактные действия, на задаче с четырьмя коридорами. Число шагов (действий) агента до достижения цели за эпизод.............................52
12. Рисунок 2.9 — Сравнение агентов, использующих и не использующих абстрактные действия, на задаче в лабиринте из четырёх комнат с
ограниченным множеством начальных положений агента. Число шагов (действий) агента до достижения цели за эпизод.............................53
13. Рисунок 2.10 — Сравнение агентов, использующих и не использующих абстрактные действия, на задаче в лабиринте из четырёх комнат с неограниченным множеством начальных положений агента. Число шагов (действий) агента до достижения цели за эпизод.............................54
14. Рисунок 2.11 — Примеры задач для разных уровней. Жёлтый — начальное положение агента. Зелёный начальное положение цели. Тёмно синий — препятствия. Оттенки голубого — цвета пола.................................56
15. Рисунок 2.12 — Сравнение агентов, использующих и не использующих абстрактные действия, в эксперименте с исчерпаемым ресурсом. Полное число шагов за задание в логарифмическом масштабе..............................57
16. Рисунок 2.13 — Сравнение агентов, использующих и не использующих абстрактные действия, в эксперименте с исчерпаемым ресурсом на конфликтных заданиях. Полное число шагов за задание.....................58
17. Рисунок 2.14 — Примеры четырёх сформированных абстрактных действий в эксперименте с исчерпаемым ресурсом. Тепловая карта для каждого абстрактного действия показывает с какой частотой переход в положение, соответствующее клетке относительно агента, который изначально находится в центре, был предсказан во время выполнения соответствующего абстрактного действия. Две маленькие тепловые карты слева: I — вероятности инициации данного умения в соответствующем положении на исходной карте, в — вероятности прекращения выполнения данного абстрактного действия...... 59
18. Рисунок 2.15 — Сравнение базового агента (элементарные действия) и агента с умениями (абстрактные действия) с DQN (dqn) и Option-Critic (o-c) в эксперименте с исчерпаемым ресурсом. На графике представлено полное число шагов, потребовавшихся для достижения ресурса 100 раз для каждого задания, усреднённое по 9-ти экспериментам........................................... 60
19. Рисунок 3.1 — Сравнение предложенной модели prob_tm с CHMM, обученной алгоритмом Баума-Велча bw и его итеративной версией bw_iter, и LSTM. График показывает изменение удивления, оценённого для одношагового предсказания, в зависимости от эпизода обучения............................ 68
20. Рисунок 3.2 — Сравнение предложенной модели prob_tm с CHMM, обученной алгоритмом Баума-Велча bw и его итеративной версией bw_iter, и LSTM в задаче n-шагового предсказания. График показывает зависимость
расстояния Кульбака-Лейблера (в логарифмическом масштабе) между предсказанными и истинными распределениями от шага предсказания......69
21. Рисунок 3.3 — Примеры наблюдений среды Пинбол. A. Визуальное представление среды. Круги визуализируют рассеивающие и аттракторные силовые поля, стрелка представляет начальный импульс шара. B. Наблюдение размером 36x50 после обработки. C. Закодированное наблюдение размером 12x12..........................................................................70
22. Рисунок 3.4 — Схематическое представление двух экспериментальных условий. R —рассеивающие силовое поле, A — аттракторное поле, s — возможные начальные позиции шара, стрелка — направление начального импульса шара в соответствующей позиции...................................71
23. Рисунок 3.5 — Сравнение вероятностной ВП (prob_tm), КСММ, обученной итеративным алгоритмом Баума-Велша (chmm), LSTM (lstm) и классической СММ с алгоритмом Баума-Велша (hmm). График показывает изменение неожиданности, оценённой от одношагового до четырёхшагового предсказаний. Для КСММ и ВП также варьируется количество клеток на ансамбль.......73
24. Рисунок 3.6 — Примеры прогнозов на пять шагов вперёд упорядочены слева направо. Текущее наблюдение изображено на крайнем левом рисунке. Оттенки синего цвета представляют вероятность прогноза, при этом самый тёмный синий соответствует 1.0. Легенда: prob_tm — вероятностная ВП, chmm_iter — КСММ с итеративным АБВ, htm — оригинальная ВП...........74
25. Рисунок 3.7 — Примеры прогнозов на пять шагов вперёд упорядочены слева направо. Текущее наблюдение изображено на крайнем левом рисунке. Оттенки синего цвета представляют вероятность прогноза, при этом самый тёмный синий соответствует 1.0. Сравниваются модели с разным размером ансамбля/столбцов............................................................75
26. Рисунок 3.8 — Сравнение прогнозов вероятностной ВП (справа) и LSTM (слева). Примеры прогнозов на пять шагов вперёд упорядочены слева направо. Текущее наблюдение изображено на крайнем левом рисунке. Оттенки синего цвета представляют вероятность прогноза, при этом самый тёмный синий соответствует 1.0..............................................................76
27. Рисунок 4.1 — Пример факторного графа для РХВП. Входом в модель является последовательность наблюдений Ot. Блок энкодера формирует категориальные признаки Ф^. Каждый признак Ф имеет свою объясняющую скрытую переменную, которая может зависеть от скрытых переменных других
признаков и от себя самой на предыдущем временном шаге. ^ и ^ — контекстные и эмиссионные факторы для соответствующих переменных. Унарные факторы 1, называемые сообщениями, представляют накопленную информацию о предыдущих временных шагах................................ 79
28. Рисунок 4.2 — Нейронная реализация. Случайные величины представлены кластерами клеток (белые круги), где каждая клетка соответствует состоянию, а частота ее спайков — вероятности состояния ). Дендритные сегменты клетки соответствуют значениям контекстного фактора // для данной комбинации состояний (активные предсинаптические клетки). Возбуждения сегментов Е/ агрегируются для определения частоты спайков клетки р(Ы[). Веса синапсов сегментов отражают специфичность комбинации предсинаптических клеток для сегмента. Факторы эмиссии ^ фиксированы и изображены как колонки внутри переменной................................................... 81
29. Рисунок 4.3 — Биологический взгляд на нейронную реализацию РХВП. Переменные Щ_ 1 соответствуют популяциям нейронов, имеющим общий сенсорный вход и латеральное конкурентное торможение. Дендритные сегменты соответствуют значениям факторов //. Частота спайков нейрона отражает вероятность состояния ) переменной...........................82
30. Рисунок 4.4 — Пример фактор-графа для наблюдений, кодируемых одной категориальной переменной. Цвета рёбер показывают, что рёбра соответствуют отдельным фактор-графам с копируемыми значениями общих переменных. Все контекстные факторы также соединены с переменной действия Значение переменной-признака копируется для трёх скрытых переменных, чтобы увеличить пространство скрытых состояний и избежать коллизий памяти.........................................................................93
31. Рисунок 4.5 — Схематическое представление конфигураций клеточной среды. Левое изображение показывает начальную конфигурацию среды, где целевая позиция обозначена светло-серым квадратом (число 4). Правое изображение представляет среду после того, как целевая позиция заблокирована препятствиями (красные квадраты или отрицательные числа). Буква А обозначает начальную позицию агента, а буква С — цель..........94
32. Рисунок 4.6 — Динамика числа шагов, необходимых агенту для достижения цели в частично наблюдаемой клеточной среде размера 5x5. На 300-м эпизоде цель блокируется стеной, поэтому агенту нужно найти новую оптимальную траекторию..................................................... 96
33. Рисунок 4.7 — Общее количество шагов за 1000 эпизодов в частично наблюдаемой клеточной среде размера 5x5...................................97
34. Рисунок 4.8 — Схематическое представление конфигураций клеточной среды для экспериментов с масштабированием. Слева направо: 5x5, 7x7, 10x10. Буква A обозначает начальную позицию агента, а буква G — цель..........98
35. Рисунок 4.9 — Динамика количества шагов, необходимых агенту для достижения цели в задаче сбора ресурса в частично наблюдаемой клеточной среде разных размеров: 5x5, 7x7 и 10x10......................................98
36. Рисунок 4.10 — Количество выросших сегментов (или записей в словаре для агента ЭК) после 300 эпизодов в зависимости от размера пространства состояний...................................................................... 99
37. Рисунок 4.11 — Сравнение количества сегментов РХВП с размером словаря агента ЭК в зависимости от длины эпизода в клеточной среде 10 на 10 после равномерного исследования в течение ста эпизодов...................100
38. Рисунок 4.12 — Пример вида от первого лица агента в используемой конфигурации среды AnimalAI. Зелёный шар представляет цель — съедобный ресурс, которого агент должен коснуться....................................102
39. Рисунок 4.13 — Динамика числа шагов, необходимых агенту для достижения цели в комнате 10 на 10 метров в среде AnimalAI..............103
40. Рисунок 4.14 — Результат Dreamer V3 (18M) в эксперименте AnimalAI, описанном в данной работе..................................................104
41. Рисунок 4.15 — Общее количество шагов за 1000 эпизодов агентом с РХВП с кодировщиком к-средних и категориальный VAE. Для последнего варьируется размер контекстного фактора РХВП (т.е. сколько скрытых переменных предыдущего временного шага учитывается для предсказания).105
42. Рисунок 4.16 — Фактор-граф для распределённого кодирования категориального VAE, пример для фактора размера 3 (т.е. учитывает три скрытые переменные с предыдущего временного шага). Цвета рёбер обозначают отдельные фактор-графы, а значения общих переменных копируются между ними.......................................................................... 106
43. Рисунок 4.17 — Количество шагов действий, которое требуется агенту для достижения цели в комнате 10 на 10 метров в среде AnimalAI, с использованием моделей РХВП и ЭК с распределённым категориальным энкодером VAE, включающим одну дополнительную шумовую переменную
(всего шесть переменных). Размер фактора РХВП варьируется, определяя количество переменных, выбираемых для каждого фактора................108
44. Рисунок 5.1 — Зависимость близости SF эпизодической памяти к истинным SF от размера и чистоты кластера состояний первого уровня. Результаты усреднены по пяти разбиениям состояний и трём клеточным средам 10 на 10 с 10-ю цветами и случайной раскраской. Цветная тень соответствует 95%-му доверительному интервалу...................................................114
45. Рисунок 5.2 — Зависимость точности слияния кластеров на основе SF от их размера и однородности. Результаты усреднены по пяти разбиениям состояний и трём клеточным средам 10 на 10 с 10-ю цветами и случайной раскраской. Цветная тень соответствует 95%-му доверительному интервалу............. 115
46. Рисунок 5.3 — Средняя точность слияния (обозначена цветом) на основе SF представлений в зависимости от истинной позиции в клеточной среде размера 10 на 10 для трёх различных карт с десятью состояниями наблюдения, которые обозначены цифрами в каждой позиции. Для каждой карты и размера кластера результаты усреднены по пяти различным разбиениям кластеров...........116
47. Рисунок 5.4 — Распределение чистоты случайно сформированных кластеров (случайных разбиений) состояний первого уровня в зависимости от размера кластера и числа клонов. Результаты приведены для 1000 случайных разбиений....................................................................117
48. Рисунок 5.5 — Фактор граф модели памяти со слияниями и возможная нейронная реализация процесса слияния....................................121
49. Рисунок 5.6 — Средняя точность предсказаний наблюдений в зависимости от эпизода для клеточной среды 10 на 10 с 10-ю цветами. Первая группа (random) это точность для памяти со случайными слияниями кластеров, вторая (sf) — слияния на основе SF представлений и третья (no merge) — совсем без слияний......................................................................123
50. Рисунок 5.7 — Взвешенная чистота кластеров в зависимости от эпизода для клеточной среды 10 на 10 с 10-ю цветами. Первая группа (random) — память со случайными слияниями кластеров, вторая (sf) — слияния на основе SF представлений и третья (no merge) — совсем без слияний................124
51. Рисунок 5.8 — Число кластеров (состояний на втором уроне) в зависимости от эпизода для клеточной среды 10 на 10 с 10-ю цветами. Первая группа (random) — память со случайными слияниями кластеров, вторая (sf) — слияния на основе SF представлений и третья (no merge) — совсем без слияний.....125
52. Рисунок 5.9 — Матрицы переходов между положениями в среде (усреднённые по действиям) сформированные на основе второго уровня памяти при разных режимах обучения: no merges — без слияния кластеров, random merges — случайные слияния, sf merges — слияния на основе близости SF-представлений, ground true — истинная матрица переходов. Результаты усреднены по трём случайным раскраскам среды 10 на 10 с 10-ю цветами.. 127
Список таблиц
1. Таблица 1 — Формулы обновления параметров распределений...........66
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.