Нейросетевой метод управления на основе подкрепляемого обучения тема диссертации и автореферата по ВАК РФ 05.13.01, кандидат технических наук Вичугов, Владимир Николаевич
- Специальность ВАК РФ05.13.01
- Количество страниц 148
Оглавление диссертации кандидат технических наук Вичугов, Владимир Николаевич
СПИСОК СОКРАЩЕНИЙ.
ВВЕДЕНИЕ.
1 МЕТОД ПОДКРЕПЛЯЕМОГО ОБУЧЕНИЯ.
1.1 Постановка задачи подкрепляемого обучения.
1.2 Суммарная величина подкрепления.
1.3 Стратегия управления.
1.4 Исследование среды и использование знаний.
1.5 Свойства сигналов состояния внешней среды и подкрепления.
1.6 Функции оценки.
1.7 Оптимальная стратегия управления.
1.8 Оптимальные функции оценки.
1.9 Алгоритмы обучения.
1.9.1 Алгоритм временных разностей.
1.9.2 Алгоритм Q-обучения.
1.9.3 Алгоритм SARS А.
1.9.4 Алгоритм TD (А.).
1.9.5 Анализ алгоритмов обучения.
Рекомендованный список диссертаций по специальности «Системный анализ, управление и обработка информации (по отраслям)», 05.13.01 шифр ВАК
Методы повышения качества управления судном на основе использования нейросетевых технологий2008 год, доктор технических наук Глушков, Сергей Витальевич
Алгоритмический синтез нейросетевых систем управления нелинейными динамическими объектами в условиях неопределенности2001 год, кандидат технических наук Тюкин, Иван Юрьевич
Оптимизация управления слабоформализуемыми объектами в социально-экономических системах на основе нейросетевого моделирования2004 год, кандидат технических наук Исаков, Павел Николаевич
Разработка и исследование двухуровневых адаптивно-нейронных систем управления динамическими объектами2000 год, кандидат технических наук Тимчук, Наталья Алексеевна
Разработка и исследование нейросетевых алгоритмов управления2006 год, кандидат технических наук Хоанг Куанг Тинь
Введение диссертации (часть автореферата) на тему «Нейросетевой метод управления на основе подкрепляемого обучения»
Постоянное усложнение технических объектов управления (ОУ) и расширение областей их применения приводит к необходимости развития средств и методов интеллектуального управления в условиях неопределенности и при изменяющихся условиях функционирования. Применение методов классической теории автоматического управления для управления сложными динамическими ОУ затруднено рядом факторов. Прежде всего, это сложность получения достаточно точного формализованного описания ОУ. Кроме того, параметры ОУ могут изменяться в широких пределах в процессе функционирования системы, либо иметь большой разброс значений от образца к образцу. В таких случаях регуляторы с постоянными настройками не всегда могут обеспечить требуемое качество работы системы. Также следует учесть, что практически все реальные ОУ являются нелинейными, и их представление в виде линейных математических моделей является лишь приблизительным. Многообразие видов нелинейностей, несмотря на большое количество публикаций по этой теме, не позволяет создать единую теорию идентификации нелинейных ОУ. Чаще всего применяется классический подход, основанный на аппроксимации нелинейностей рядами Гаммерштейна, Винера, Вольтера, полиномами Колмогорова-Габора и др. [25]. Однако область применения таких моделей ограничена. Кроме того, наличие в реальных сигналах помех вносит дополнительные трудности в процесс получения адекватного математического описания ОУ. Преодоление указанных трудностей связывают с развитием интеллектуальных систем управления, основанных, в частности, на применении аппарата искусственных нейронных сетей.
Начиная с 1990-х гг. активно развивается метод подкрепляемого обучения (англ. reinforcement learning), относящийся к группе методов машинного обучения [81]. В основе этого метода лежат те основополагающие принципы адаптивного поведения, которые позволяют живым организмам приспосабливаться к изменяющимся или неизвестным условиям обитания. В этом методе рассматривается система, которая в процессе взаимодействия с внешней средой получает сигнал подкрепления, характеризующий, насколько хорошо функционирует система в текущий момент времени. Алгоритмы, относящиеся к методу подкрепляемого обучения, определяют порядок изменения состояния системы таким образом, чтобы формируемые воздействия системы на внешнюю среду обеспечивали максимальное значение суммарного сигнала подкрепления, накопленного за длительный период времени. Одной из отличительных особенностей метода подкрепляемого обучения является тот факт, что в начале функционирования система не обладает практически никакой информацией о внешней среде, и обучение системы происходит в процессе взаимодействия с ней. Второй особенностью метода подкрепляемого обучения является формирование воздействий с учетом сигналов подкрепления, которые будут получены в отдаленном будущем.
В исходном виде метод подкрепляемого обучения предполагает конечное количество возможных состояний внешней среды и сигналов воздействия, что затрудняет его применение в задачах управления, в которых сигналы обычно являются непрерывными. Тем не менее, в зарубежной литературе рассматривается несколько успешных применений метода подкрепляемого обучения для управления моделями таких объектов, как тележка с шестом [65], перевернутый маятник и «Акробот» [53], а также для управления движением роботов [52, 55, 60, 67, 71]. Однако, указанные системы управления были разработаны под конкретные задачи, что не позволяет говорить о едином методе управления, основанном на подкрепляемом обучении.
Цель работы и задачи исследования. Целью работы является разработка нейросетевого метода адаптивного управления, основанного на принципах подкрепляемого обучения и обеспечивающего формирование управляющих воздействий на основе взаимодействия с объектом управления.
Для достижения поставленной цели были решены следующие задачи:
1. Разработка модифицированного градиентного алгоритма обучения радиально-бизисных нейронных сетей (РБНС), обеспечивающего динамическое изменение структуры нейронной сети в процессе обучения.
2. Разработка обобщенной структурной схемы нейросетевой RL-САУ и алгоритмов работы структурных блоков.
3. Разработка программного средства для моделирования нейросетевой RL-САУ.
4. Определение рекомендаций по настройке параметров УУ в процессе работы RL-САУ.
5. Апробация разработанного метода управления в задачах управления линейными и нелинейными ОУ.
Методы исследований. В работе использованы методы теории управления, теории оптимизации, системного анализа, математического моделирования, прикладной математики и теории нейронных сетей.
Апробация работы. Основные положения и результаты диссертационной работы докладывались, обсуждались и вошли в сборники трудов IX Русско-Корейского международного симпозиума по науке и технологии KORUS-2005 (г. Новосибирск, 2005 г.), V и VI Всероссийских научно-практических конференций студентов, аспирантов и молодых ученых «Молодежь и современные информационные технологии» (г. Томск, 2007 и 2008 гг.), XI, XII и XIII Международных научно-практических конференций студентов, аспирантов и молодых ученых «Современная техника и технологии» (г. Томск, 2005-2007 гг.), IX Всероссийской научно-технической конференции «Нейроинформатика-2007» (г. Москва, 2007 г.), Международных научно-технических конференций «Интеллектуальные системы» (IEEE AIS-06) и «Интеллектуальные САПР» (CAD-2006) (г. Дивноморское, 2006 г.), IV международной научно-практической конференции «Исследование, разработка и применение высоких технологий в промышленности» (г. Санкт-Петербург, 2007 г.), III Всероссийской научно-практической конференции «Имитационное моделирование. Теория и практика» (ИММОД-2007) (г. Санкт-Петербург,
2007 г.), II Российско-Коррейского научно-технического семинара «Мехатроника: устройства и управление» (г. Томск, 2008 г.).
Публикации. По результатам исследований опубликовано 14 работ, из них одна работа в издании, рекомендуемом списком ВАК.
Научную новизну работы определяют:
1. Модифицированный градиентный алгоритм обучения РБНС, отличающийся от классического градиентного алгоритма возможностью динамического изменения структуры РБНС.
2. Нейросетевой метод адаптивного управления, основанный на разработанной обобщенной структурной схеме нейросетевой ИЬ-САУ и алгоритмах функционирования структурных блоков и обеспечивающий формирование управляющих воздействий на основе взаимодействия с ОУ.
3. Алгоритм адаптивного изменения значения параметра обучения в процессе функционирования нейросетевой ЯЬ-САУ, обеспечивающий устойчивость процесса обучения при использовании РБНС для представления функции оценки воздействия.
Практическая значимость и реализация результатов работы.
Разработанный метод управления может быть использован при разработке адаптивных систем управления, когда отсутствует априорная - - -информация о- математической модели ОУ. Разработанное программное средство моделирования нейросетевой ЯЬ-САУ может быть использовано для определения последовательности управляющих воздействий, переводящих ОУ из начального состояния в требуемое.
Разработанное программное средство моделирования нейросетевой ИЬ-САУ используется в ОАО «Информационные спутниковые системы» имени академика М.Ф. Решетнева». Результат внедрения подтвержден соответствующим актом.
Результаты диссертационной работы используются в учебном процессе при приведении лекционных занятий по курсу «Современные проблемы автоматизации и управления».
Основные положения, выносимые на защиту:
1. Разработанный модифицированный градиентный алгоритм обучения РБНС обеспечивает автоматическое формирование структуры нейронной сети в процессе обучения.
2. Нейросетевая ЯЬ-САУ позволяет формировать управляющие воздействия на ОУ в соответствии с выбранным критерием функционирования системы при неизвестных или изменяющихся свойствах ОУ.
3. Разработанный алгоритм адаптивного изменения значения параметра обучения позволяет обеспечить устойчивость процесса обучения при использовании РБНС для представления функции оценки воздействия.
Личный вклад автора. Автором непосредственно получены все основные результаты работы: разработан модифицированный алгоритм обучения РБНС, разработана обобщенная структурная схема нейросетевой КЬ-САУ и алгоритмы работы структурных блоков, разработаны и написаны программы «Исследование ЯЬ-САУ» и «Исследование МЯЬ-САУ».
Структура и объем работы. Диссертационная работа состоит из введения, трех глав, заключения, двух приложений. Основной текст изложен на 140 страницах, общий объем работы - 148 страниц. Диссертация включает 64 рисунка, 5 таблиц. Список использованных источников содержит 92 наименования.
Похожие диссертационные работы по специальности «Системный анализ, управление и обработка информации (по отраслям)», 05.13.01 шифр ВАК
Робастная стабилизация динамических систем с использованием нейросетевых моделей и модулярных регуляторов2009 год, кандидат технических наук Рудакова, Татьяна Анатольевна
Методы и алгоритмы адаптивной реконструкции моделей сложных систем2005 год, доктор технических наук Булдакова, Татьяна Ивановна
Суперпозиционное линейно-нелинейное нейроструктурное моделирование2011 год, доктор технических наук Сараев, Павел Викторович
Синтез робастных систем управления с использованием каскадно-связанных модифицированных нелинейных, нечетких и нейросетевых регуляторов2011 год, кандидат технических наук Масютина, Галина Владимировна
Автоматизация технологического процесса испытаний дизелей на базе нечеткого нейросетевого метода2011 год, кандидат технических наук Галиуллин, Ленар Айратович
Заключение диссертации по теме «Системный анализ, управление и обработка информации (по отраслям)», Вичугов, Владимир Николаевич
Основные результаты и выводы по главе 3
1. Представлен обзор основных типов ИНС и алгоритмов обучения.
2. Описан модифицированный градиентный алгоритм обучения РБНС.
3. Приведено описание разработанной обобщенной структурной схемы нейросетевой ЯЬ-САУ, в которой функция оценки воздействия представлена с помощью РБНС.
4. Приведены результаты экспериментальных исследований систем управления различными ОУ.
129
ЗАКЛЮЧЕНИЕ
Представленная диссертационная работа описывает результаты исследований, направленных на разработку метода управления, в основе которого лежит метод подкрепляемого обучения. В результате выполнения диссертационной работы получены следующие основные научные и практические результаты и сделаны следующие выводы.
1. Разработан модифицированный градиентный алгоритм обучения РБНС, в котором введено понятие коэффициента взаимного пересечения элементов. Основная особенность алгоритма заключаются в динамическом определении структуры РБНС в процессе обучения. Проведенные эксперименты показали, что РБНС, обученная модифицированным градиентным алгоритмом, характеризуется меньшей ошибкой обучения, чем РБНС, обученная классическим градиентным алгоритмом при одинаковом количестве элементов.
2. Разработана обобщенная структурная схема нейросетевой ЯЬ-САУ, функционирующей на основе метода подкрепляемого обучения с применением РБНС для представления функции оценки воздействия. Определены алгоритмы работы структурных блоков.
3. Разработано программное средство «Исследование МЯЬ-САУ», предназначенное для моделирования и исследования нейросетевых КЬ-САУ. Программное средство позволяет задавать математическую модель ОУ в виде системы дифференциальных уравнений, определять вид и параметры задающего воздействия, задавать параметры настройки УУ, управлять процессом моделирования, отображать на экране значения всех моделируемых сигналов и их графики, определять значения показателей качества управления, сохранять результаты моделирования в файлы.
4. Предложены рекомендации по настройке параметров УУ в процессе функционирования 11Ь-САУ.
5. Результаты экспериментальных исследований нейросетевой КЬ-САУ с линейными и нелинейными объектами показали приемлемое качество управления и способность ЯЬ-САУ адаптироваться к изменяющимся параметрам ОУ. Для нейросетевой ЯЬ-САУ актуальной является проблема большого времени обучения и переобучения УУ при изменении параметров ОУ, поэтому в настоящий момент практическое применение ЯЬ-САУ может заключаться в определении последовательности управляющих воздействий для перевода ОУ из исходного состояния в требуемое при известной математической модели ОУ.
Список литературы диссертационного исследования кандидат технических наук Вичугов, Владимир Николаевич, 2008 год
1. Антонов, В. Н. Адаптивное управление в технических системах: Учеб. Пособие / В. Н. Антонов, В. А. Терехов, И. Ю. Тюкин. Спб.: Издательство С.-Петербургского университета, 2001. - 244 с.
2. Анхимюк, В. Л. Теория автоматического управления / В. JI. Анхимюк, О.Ф. Опейко, Н.Н. Михеев. Мн.: Дизайн ПРО, 2000. - 352 с.
3. Барский, А. Б. Нейронные сети: распознавание, управление, принятие решений. М.: Финансы и статистика, 2004. - 176 с.
4. Ван-Кампсн, Н. Г. Стохастические процессы в физике и химии. М.: Высшая школа, 1990. 376 с.
5. Вичугов, В. Н. Метод подкрепляемого обучения в задачах автоматического управления / В.Н. Вичугов, Г. П. Цапко // Известия Таганрогского государственного радиотехнического университета, 2007. -№ 3. С. 171-174.
6. Вичугов, В. Н. Нейросетевой метод подкрепляемого обучения в задачах автоматического управления // Известия Томского политехнического университета, 2006. т.309, № 7. - С. 92-96.
7. Вичугов, В. Н. Нейросетевые системы управления с применением генетических алгоритмов / В. Н. Вичугов, А. А. Вичугова // Молодежь и современные информационные технологии: Сборник трудов V
8. Всероссийской научно-практической конференции студентов, аспирантов и молодых ученых Томск, 27 февр. - 1 марта 2007. - Томск: Изд. ТПУ, 2007.-С. 365-367.
9. Вороновский, Г. К. Генетические алгоритмы, искусственные нейронные сети и проблемы виртуальной реальности / Г. К. Вороновский, К. В. Махотило, С. Н. Петрашев, С. А. Сергеев. Харьков: Основа, 1997.
10. Горбань, А. Н. Нейронные сети на персональном компьютере / А. Н. Горбань, Д. А. Россиев. Новосибирск: Наука, Сиб. отделение, 1996. -276 с.
11. Горбань, А. Н. Обобщенная аппроксимационная теорема и вычислительные возможности нейронных сетей / А. Н. Горбань // Сибирский журнал вычислительной математики— 1998. Т. 1, № 1. — С.12-24.
12. Джейн, А. К. Введение в искусственные нейронные сети / А. К. Джейн, Ж. Мао, К. М. Моиуддин. Открытые системы. - 1997. - №4. - С. 16-24.
13. Епанешников, А. М. Программирование в среде Turbo Pascal 7.0 / A. M. Епанешников, В. А. Епанешников. 3-е изд. - М.: «ДИАЛОГ-МИФИ», 1996.-288 с.
14. Ермаков, С. М. Статистическое моделирование / С. М. Ермаков, Г. А. Михайлов. М., 1982. - 290 с.
15. Зайцев, А. П. Основы теории автоматического управления: Учебное пособие. Томск: Изд. ТПУ, 2000. 152 с.
16. Каллан Р. Основные концепции нейронных сетей. : Пер. с англ. М.: Издательский дом «Вильяме», 2001. - 290 с.
17. Комарцова, JI. Г. Нейрокомпьютеры / JI. Г. Комарцова, А. В. Максимов. -М.: МГТУ им. Баумана, 2002. 320 с.
18. Комарцова, JI. Г. Исследование алгоритмов обучения многослойного персептрона / Л. Г. Комарцова // Нейрокомпьютеры: Разработка и применение. 2002. - № 12.
19. Комашинский, В. И. Нейронные сети и их применение в системах управления и связи / В. И. Комашинский, Д. А. Смирнов. М.: Горячая линия-Телеком, 2003. - 94 с.
20. Круглов, В. В. Искусственные нейронные сети: Теория и практика / В. В. Круглов, В. В. Борисов. М.: Горячая линия-Телеком, 2001. - 382 с.
21. Омату, С. Нейроуправление и его приложения. Кн. 2 : пер. с англ. / С. Омату, М. Халид, Р. Юсоф. М.: ИПРЖР, 2000. - 272 с.
22. Осовский, С. Нейронные сети для обработки информации : пер. с польск. / С. Осовский. М.: Финансы и статистика, 2002. — 344 с.
23. Редько, В. Г. Эволюция, нейронные сети, интеллект: Модели и концепции эволюционной кибернетики 3-е изд. / В.Г. Редько. - М.: Ком-Книга, 2005.
24. Редько, В.Г. Самообучающиеся агенты на основе нейросетевых адаптивных критиков / Мосалов О. П., Прохоров Д. В., Редько В. Г. // Искусственный интеллект 2004 - Т. 3 - С. 550-560.
25. Редько, В.Г. Нейросетевые адаптивые критики / В.Г. Редько, Д. В. Прохоров // Научная сессия МИФИ-2004. VI Всероссийская научно-техническая конференция "Нейроинформатика-2004". Сборник научных трудов. Часть 2. М.: МИФИ, 2004. С.77-84.
26. Редько, В. Г. Модели адаптивного поведения естественнонаучный подход к развитию информационных технологий // Информационные технологии и вычислительные системы. 2004. Вып.1. - С. 19-43.
27. Розенблат, Ф. Принципы нейродинамики. Перцептроны и теория механизмов мозга / Ф. Розенблат. М.: Мир, 1965.
28. Тархов, Д. А. Нейронные сети. Модели и алгоритмы. Кн. 18. М.: Радиотехника, 2005. - 256 с.
29. Терехов, В. А. Нейросетевые системы управления : учебное пособие / В. А. Терехов, Д. В. Ефимов, И. Ю. Тюкин. М.: Высшая школа, 2002. - 184 с.
30. Терехов, С. А. Нейродинамическое программирование автономных агентов // Лекция для Школы-семинара «Современные проблемы нейроинформатики». М.: МИФИ, 2004. Часть 2. - С. 111-139.
31. Уоссерман, Ф. Нейрокомпьютерная техника: Теория и практика: Пер. с англ. М.: Мир, 1992. - 240 с.
32. Усков, А. А. Интеллектуальные технологии управления. Искусственные нейронные сети и нечеткая логика / А. А. Усков, А. В. Кузьмин. М.: Горячая линия-Телеком, 2004. - 143 с.
33. Хайкин, С. Нейронные сети: полный курс 2-е издание / С. Хайкин; под ред. Н.Н. Куссуль. - М.: Издательский дом «Вильяме», 2006. - 1104 с.
34. Anderson, С. W. Learning to control an inverted pendulum using neural networks // IEEE Control Systems Magazine. 1989. - N9. - P. 31-37.
35. Anderson, C. W. Restricted Gradient-Descent Algorithm for Value-Function Approximation in Reinforcement Learning / A. da Motta Salles Barreto, C.W. Anderson // Artificial Intelligence. 2008. - N172. - P. 454-482.
36. Barreto, A. Restricted gradient-descent algorithm for value-function approximation in reinforcement learning / A. Barreto, C. W. Anderson // Artificial Intelligence. 2008. - Vol. 172, N4/5. - P. 454-482.
37. Baxter, J. Direct gradient-based reinforcement learning: I. Gradient estimation algorithms, Technical report / J. Baxter, P. Bartlett. Research School of Information Sciences and Engineering, Australian National University, July 1999.
38. Bellman, R. E. Dynamic Programming. Princeton University Press, 1957. -255 p.
39. Bellman, R. E. A Markov decision process // Journal of Mathematical Mechanics. 1957.-N6.-P. 679-684.
40. Bertsekas, D. P. Neuro-Dynamic Programming / D.P. Bertsekas, J.N. Tsitsilclis.- Belmont: MA: Athena Scientific, 1996.
41. Bhatnagara, S. Actor-critic algorithms for hierarchical Markov decision processes / S. Bhatnagara, J. R. Panigrahi // Automatica. 2006. - N42. - P. 637-644.
42. Boone, G. Minimum-time control of the Acrobot // International Conference on Robotics and Automation. Albuquerque, NM: IEEE Robotics and Automation Society, 1997.-Vol. l.-P. 3281-3287.
43. Boone, G. Efficient reinforcement learning: Model-based Acrobot control // International Conference on Robotics and Automation. Albuquerque, NM: IEEE Robotics and Automation Society, 1997. - Vol. l.-P. 229-234.
44. Brown, S. C. Intelligent control for an Acrobot / S. C. Brown, K. M. Passino // Intelligent Robotics Systems. 1997. - N3. - P. 209-248.
45. Chuan-Kai Lin. A reinforcement learning adaptive fuzzy controller for robots // Fuzzy Sets and Systems. 2003. - Vol. 137, N3. - P. 339-352.
46. Coulom, R. Reinforcement Learning Using Neural Networks, with Applications to Motor Control: Unpublished PhD thesis. Institut National Polytechnique de Grenoble, 2002. // http://sciencedirect.com
47. Dayan, P. TD(A.) converges with probability 1 / P. Dayan, T. Sejnowski // Machine Learning. 1994. - N14. - P. 295-301.
48. Duan, Y. Application of reinforcement learning in robot soccer / Yong Duan, Qiang Liu, XinHe Xu // Engineering Applications of Artificial Intelligence. -2007. Vol. 20, N7. - P. 936-950
49. Farrel, J. On the effects of the training sample density in passive learning control / J. Farrel, T. Berger // American Control Conference. 1995. - P. 872876.
50. Girosi, F. Networks and the best approximation property, Technical Report AIM-1164. Massachusetts Institute of Technology, Artificial Intelligence Laboratory and Center for Biological Information Processing Whitaker College, 1989.
51. Jianyu, L. Numerical solution of elliptic partial differential equation using radial basis function neural networks / Li Jianyu, Luo Siwei, Qi Yingjiana, Huang Yapinga // Neural Networks. 2003. - N5/6. - P. 729-734.
52. Jilin, Tu. Continuous reinforcement learning for feedback control systems : Unpublished M.S. Thesis. Department of Computer Science, Colorado State University, Fort Collins, CO, 2001. // http://sciencedirect.com
53. Hafner, R. Reinforcement Learning on an omnidirectional mobile robot / Roland Hafner, Martin Riedmiller // Proceedings of the 2003 IEEE/RSJ International Conference on Intelligent Robots and Systems. 2003. - Vol. 1. -P. 418-423.
54. Hauser, J. Nonlinear controllers for non-integrable systems: The acrobot example / J. Hauser, M. R. Murray // Proceedings of the 1990 American Control Conference. San Diego, CA, 1990. - Vol. 1. - P. 669-671.
55. Hornik, K. M. Approximation capabilities of mulilayer feedforward network // Neural Networks. 1991N4. - P. 251-257.
56. Hornik, K. M. Multilayer feedforward networks are universal approximators / K.M. Hornik, M. Stinchcombe, H. White // Neural Networks. 1989. - Vol. 2. -P. 359-366.
57. Igel, C. Neuroevolution for reinforcement learning using evolution strategies // Congress on Evolutionary Computation. IEEE Press, 2003. - Vol. 4. -P. 2588-2595.
58. Kaelbling, L. P. Reinforcement learning: A survey / Leslie Pack Kaelbling, Michael L. Littman, Andrew W. Moore. // Journal of Artificial Intelligence Research. 1996. - N4. - P. 237-285.
59. Kohonen, T. Self-organizing maps / T. Kohonen. Berlin Heidelberg: SpringerVerlag, 1995.
60. Kondo, T. A reinforcement learning with evolutionary state recruitment strategy for autonomous mobile robots control / Toshiyuki Kondo, Koji Ito // Robotics and Autonomous Systems. 2004. - Vol. 46, N2.-P. 111-124.
61. McCuIloch, W. S. A logical calculus of ideas immanent in nervous activity / W.S. McCuIloch, W.H. Pitts // Bulletin of Mathematical Biophysics. 1943. -Vol.5.-P. 115-133.
62. Minsky, M. L. Perceptrons / M.L. Minsky, S.A. Papert Cambridge, MA: MIT Press, 1969.
63. Pal, S. Multilayer Perceptron, Fuzzy Sets, and Classification / Sankar K. Pal, Sushmita Mitra // IEEE Transactions on Neural Networks. 1992. - Vol. 3, N 5. -P. 683-696.
64. Peters, J. Reinforcement learning of motor skills with policy gradients / Jan Peters, Stefan Schaal // Neural Networks. 2008. - Vol. 21, N4. - P. 682-697.
65. Rumelhart, D. E. Learning representations of back-propagation errors / D. E. Rumelhart, G. E. Hinton, R. J. Williams // Nature (London). 1986. - Vol. 323. -P. 533-536.
66. Rust, J. Using randomization to break the curse of dimensionality // Econometrica. 1997.-N3.-P. 487-516.
67. Puterman, M. L. Markov Decision Processes: Discrete Stochastic Dynamic Programming. New York: John Wiley & Sons, 1994. - 672 p.
68. Red'ko, V. G. A Model of Evolution and Learning / Red'lco V.G., Mosalov O.P., Prokhorov D.V. // Neural Networks 2005 - Vol. 18, N 5-6 - P. 738-745.
69. Sabes, P. N. Approximating Q-values with basis function representations // 1993 Connectionist Models Summer School. Hillsdale, NJ: Lawrence Erlbaum Assoc. Inc., 1993.
70. Singh, S. P. An upper bound on the loss from approximate optimal-value functions / S. P. Singh, R.C. Yee // Machine Learning. 1994. - N3. - P. 227233.
71. Singh, S. P. Reinforcement learning with replacing eligibility traces / S. P. Singh, R. S. Sutton//Machine Learning. 1996.-N1/3.-P. 123-158.
72. Singh, S. P. Convergence results for single-step on-policy reinforcement-learning algorithms / S. P. Singh, T. Jaakkola, M. L. Littman, C. Szepesvari // Machine Learning. 2000. - N3. - P. 287-308.
73. Spong, M. W. The swing up control problem for the Acrobot // IEEE Control Systems Magazine. 1995. - N15. - P. 49-5 5.
74. Sutton, R. S. Reinforcement learning: An introduction / R. S. Sutton, A. G. Barto. Cambridge: MIT Press, 1998. - 322 p.
75. Sutton, R. S. Policy gradient methods for reinforcement learning with function approximation / R. S. Sutton, D. McAllester, S. Singh, Y. Mansour // Advances in Neural Information Processing Systems, 2000. P. 1057-1063.
76. Sutton, R. S. Generalization in reinforcement learning: Successful examples using sparse coarse coding // Advances in Neural Information Processing Systems. Cambridge, MA: MIT Press, 1996. - Vol. 8. - P. 1038-1044.
77. Sutton, R. S. Learning to predict by the methods of temporal differences // Machine Learning. 1988. -N3. P. 9-44.
78. Tsitsiklis, J. N. Feature-based methods for large scale dynamic programming / J. N. Tsitsiklis, B. Van Roy // Machine Learning. 1996. - N22. - P. 59-94.
79. Wai-Tat, F. From Recurrent Choice to Skill Learning: A Reinforcement-Learning Model / F. Wai-Tat, J.R. Anderson // Journal of Experimental Psychology: General. 2006. - N2. - P. 184-206.
80. Watkins, C. Learning from Delayed Rewards: Unpublished PhD Thesis. -University of Cambridge, England, 1989. // http://sciencedirect.com
81. Watkins, C. Q-learning / C. Watkins, P.D. Dayan // Machine Learning. 1992. -N8.-P. 279-292.
82. Weaver, S. E. Preventing unlearning during on-line training of feedforward networks / S. E. Weaver, L. C. Baird, M. M. Polycarpou // International Symposium of Intelligent Control, Gaithersburg, 1998. P. 359-364.
83. Whitley, D. Genetic reinforcement learning for neurocontrol problems / D. Whitley, S. Dominic, R. Das, C.W. Anderson // Machine Learning. 1993. -N2/3.-P. 259-284.
84. Zhao, D. Z. GA-based control to swing up an Acrobot with limited torque / D. Z. Zhao, J. Yi // Transactions of the Institute of Measurement and Control. -2006.-N1.-P. 3-13.
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.