Информационно-аналитическая система прогнозирования социально-экономических показателей России тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Савинова Виктория Михайловна
- Специальность ВАК РФ00.00.00
- Количество страниц 203
Оглавление диссертации кандидат наук Савинова Виктория Михайловна
Введение
Глава 1 Особенности краткосрочного прогнозирования социально-экономических показателей России
1.1 Структура показателей социально-экономической сферы России
1.2 Особенности краткосрочного эконометрического прогнозирования социально-экономических показателей
1.3 Описание существующих информационно-аналитических систем краткосрочного прогнозирования социально-экономических показателей
Глава 2 Методика разработки ансамбля математических моделей прогнозирования социально-экономических показателей
2.1 Формирование структуры моделей информационно-аналитической системы прогнозирования социально-экономических показателей России
2.2 Ранжирование моделей информационно-аналитической системы прогнозирования социально-экономических показателей России
2.3 Обоснование системы показателей точности и качества моделей краткосрочного прогнозирования социально-экономических показателей
2.4 Методика построения системы моделей краткосрочного прогнозирования социально-экономических показателей
Глава 3 Разработка информационно-аналитической системы прогнозирования социально-экономических показателей России
3.1 Разработка гибкой архитектуры информационно-аналитической системы краткосрочного прогнозирования
3.2 Описание программных средств реализации информационно-аналитической системы прогнозирования социально-экономических показателей России
3.3 Построение моделей временных рядов в рамках разработанной системы краткосрочного прогнозирования социально-экономических показателей
3.4 Построение моделей множественной линейной регрессии в рамках разработанной системы краткосрочного прогнозирования социально-экономических показателей
3.5 Построение моделей регрессионных деревьев решений в рамках разработанной системы краткосрочного прогнозирования социально-экономических показателей
3.6 Построение моделей случайного леса в рамках разработанной системы краткосрочного прогнозирования социально-экономических показателей
3.7 Построение моделей градиентного бустинга в рамках разработанной системы краткосрочного прогнозирования социально-экономических показателей
3.8 Построение моделей нейронных сетей в рамках разработанной системы краткосрочного прогнозирования социально-экономических показателей
Заключение
Список литературы
Приложение А (обязательное) Параметры моделей АММЛ
Приложение Б (обязательное) Поквартальное сравнение результатов построения моделей случайного леса
Приложение В (обязательное) Поквартальное сравнение результатов построения моделей градиентного бустинга
Приложение Г (обязательное) Поквартальное сравнение результатов построения моделей нейронных сетей
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Модели и алгоритмы краткосрочного прогнозирования электропотребления на основе деревьев решений и искусственных нейронных сетей2025 год, кандидат наук Горшенин Алексей Юрьевич
Повышение эффективности краткосрочного прогнозирования генерации ветроэлектрических станций2025 год, кандидат наук Снегирев Денис Алексеевич
Вероятностно-статистические методы и модели оценки и прогнозирования занятости в регионах Российской Федерации2026 год, кандидат наук Гавриленко Юлия Евгеньевна
Прогнозирование инфляции на основе методов машинного обучения2026 год, кандидат наук Джункеев Урмат Кубанович
Адаптивные стратегии обучения градиентного бустинга2024 год, кандидат наук Ибрагимов Булат Ленарович
Введение диссертации (часть автореферата) на тему «Информационно-аналитическая система прогнозирования социально-экономических показателей России»
Введение
Актуальность темы исследования. Управление развитием страны в текущем периоде, предполагает использование результатов краткосрочного прогнозирования социально-экономических процессов в качестве ключевых индикаторов принятия решений. Такие индикаторы применяют при решении следующих задач:
- ориентации информационно-аналитических систем краткосрочного прогнозирования на уровни исследуемых социально-экономических показателей;
- наполнения процессов управления и планирования ограниченным объемом данных, обусловленным тем, что при разработке краткосрочных прогнозов социально-экономических процессов используется, как правило, информация об их значениях, а также о внешних и внутренних воздействующих на них условиях только за последние временные интервалы. Это связано с тем, что учет информации за более ранние периоды может существенно исказить вновь формирующиеся тенденции в развитии рассматриваемых процессов и их прогнозы;
- раннего выявления и прогнозирования неблагоприятных тенденций, а также разработки методов и подходов к их коррекции.
Краткосрочное прогнозирование социально-экономических показателей характеризуется наличием множества возможных подходов и моделей. Одним из наиболее известных подходов к разработке краткосрочных прогнозов социально-экономических индикаторов является построение моделей, формализующих тенденции рассматриваемых процессов на основе временных рядов их показателей. Реализация этого подхода осложняется такими особенностями изучаемых процессов, как высокая волатильность их тенденций, а также наличие комплексных взаимосвязей между исследуемыми факторами, обусловленными нестабильностью внешних условий. Кроме того, различные классы моделей краткосрочного прогнозирования различаются сложностью алгоритмов определения оценок параметров таких моделей, интерпретируемостью полученных результатов с точки
зрения влияния факторов на исследуемый процесс, системой критериев оценки точности и качества построенных моделей для определения их адекватности исследуемым процессам.
В современных научных публикациях достаточно полно представлены различные подходы к построению различных классов моделей краткосрочного прогнозирования социально-экономических показателей, однако недостаточно внимания уделено процессу подбора адекватной исследуемому процессу модели, обладающей приемлемыми уровнями значений критериев точности и качества, учитывающего как специфику краткосрочного прогнозирования социально-экономических показателей, так и вычислительные особенности и сложности алгоритмов построения таких моделей.
Подбор релевантных моделей для краткосрочного прогнозирования целесообразно проводить на базе информационно-аналитических систем. Информационно-аналитические системы, которые позволяют автоматизированно решать задачу подбора моделей, адекватных исследуемому процессу, должны учитывать как специфику исследуемых процессов, так и особенности алгоритмов построения моделей их краткосрочного прогнозирования с целью получения наиболее достоверных прогнозов исследуемых индикаторов, которым, однако, в публикациях по данной тематике уделено мало внимания.
Однако в научной литературе вопросы построения таких систем практически не рассматривались, что определяет актуальность тематики представленного исследования.
Степень разработанности темы исследования. В научной литературе имеется достаточно обширный спектр публикаций, посвященных проблемам разработки моделей краткосрочного прогнозирования. Проблема разработки моделей экономического прогнозирования с использованием эконометрических моделей рассматривалась в работах ученых С.А.Айвазяна, В.И.Антипова, Е.Астафьевой, С.В.Борисовой, Б.Е.Борисовой, В.М.Гусарова, В.Б.Гусева, Т.А.Дубровой, И.И.Елисеевой, И.Б.Колмакова, Э.А.Лакалина, И.М.Лебедевой, В.В.Леонтьева, В.С.Лисина, Ю.П.Лукашина, В.Л.Макарова, Н.А.Моисеева,
B.И.Моторина, В.С.Мхитаряна, Н.П.Тихомирова, И.В.Трегуб, М.Ю.Турунцевой, А.Ю.Федоровой, Ю.А.Чижова, Дж.Бокса, А.С.Голдбергера, Г.Дженкинса, Л.Р.Клейна, К.Р.Рао.
Вопросы прогнозирования с использованием регрессионных деревьев решений были представлены в работах авторов О.С.Голубевой, Л.Бреймана, Н.Р.Свенсона, Дж.Х.Фридмана.
Возможность применения моделей случайного леса и градиентного бустинга в задачах прогнозирования экономических показателей были рассмотрены авторами В.И.Орешкова, Н.Б.Паклина, М.Пилиньского, Л.Рутковского, Д.Рутковской,
Использование моделей нейронных сетей для построения прогнозов было рассмотрено в работах авторов Й.Бенжио, В.С.Маккалоха, У.Х.Питтса, Ф.Розенблатта, П.Симар, С.Хайкина, Д.Д.Хебба, Х.Чена, Дж.-Ш.Р.Янга.
Применение алгоритмов подбора релевантной модели прогнозирования из их отобранного множества рассматривалось в работах авторов А.Н.Аверкина, Е.В.Заровой, Л.А.Демидовой, А.Н.Пылькина, С.В.Скворцова, Т.С.Скворцовой,
C.А.Ярушева.
Работы приведенных авторов позволили оценить степень развития существующих методов прогнозирования, оценить алгоритмы отбора модели прогнозирования и степень автоматизации данных процессов. Вместе с тем данные разработки подвергаются критике ряда аналитиков в связи с их недостаточной эффективностью в условиях динамично изменяющихся тенденций. Авторы Ajit Kambil, Patricia Brown, Dean Hobbs, Mark Horn, Eric Merrill, Matt Soderberg отметили в своей работе «Dynamic Planning and Forecasting for Better Insights» несостоятельность современных методов краткосрочного прогнозирования ввиду недостаточной адаптивности к изменению внешних условий. На основании публикаций, посвященных проблемам краткосрочного прогнозирования, можно выделить основные недостатки существующих подходов к подбору релевантных моделей краткосрочного прогнозирования:
- недостаточное внимание к особенностям исследуемых процессов, включая
их высокую волатильность ввиду часто изменяющихся воздействующих внешних условий;
- неполнота учета специфики разрабатываемых моделей краткосрочного прогнозирования исследуемых процессов, таких как вычислительная сложность алгоритмов их построения, интерпретируемость и система критериев определения точности и качества таких моделей.
В диссертационной работе предложены подходы к решению перечисленных проблем краткосрочного прогнозирования на основе разработанной информационно-аналитической системы, в рамках которой осуществляется обоснование адекватных особенностям рассматриваемого процесса моделей, в результате чего обеспечивается упрощение процедуры их подбора с учетом специфики краткосрочного прогнозирования.
Цель и задачи исследования. Целью исследования является разработка информационно-аналитической системы краткосрочного прогнозирования социально-экономических показателей России в условиях изменчивости их тенденций, неполноты информации и наличия взаимосвязей между моделируемыми процессами.
В соответствии с данной целью в работе поставлены и решены следующие задачи:
- Выявлены особенности подходов к разработке краткосрочных прогнозов социально-экономических показателей России.
- Систематизированы особенности информационно-аналитических систем краткосрочного прогнозирования социально-экономических показателей и обоснованы направления их совершенствования.
- Обоснована система показателей качества построенных моделей краткосрочного прогнозирования, используемых для отбора моделей, наиболее адекватных тенденциям рассматриваемых показателей.
- Разработана методика построения системы моделей краткосрочного прогнозирования социально-экономических показателей, в рамках которой на основе оценок их качества осуществляется отбор релевантной модели для
рассматриваемого процесса.
- Разработана архитектура информационно-аналитической системы краткосрочного прогнозирования социально-экономических показателей.
- Разработана серверная и клиентская части информационно-аналитической системы краткосрочного прогнозирования социально-экономических показателей.
Объектом исследования является система важнейших показателей социально-экономической сферы России за рассматриваемый временной период, включающих в себя поквартальные уровни доходов, расходов населения, безработицы.
Предметом исследования являются методы краткосрочного прогнозирования социально-экономических показателей России.
Область исследования. Диссертационное исследование соответствует паспорту научных специальностей Высшей аттестационной комиссии при Министерстве науки и высшего образования Российской Федерации по специальности 5.2.2 «Математические, статистические и инструментальные методы в экономике». Пункты паспорта специальности, в рамках которых было проведено диссертационное исследование:
1. Разработка и развитие математических и эконометрических моделей анализа экономических процессов (в том числе в исторической перспективе) и их прогнозирования.
2. Развитие и применение инструментария разработки систем поддержки принятия решений в сфере экономической политики и обеспечения национальных интересов.
Теоретическую и методологическую основу исследования составили работы отечественных и зарубежных авторов в сфере макроэкономического краткосрочного прогнозирования с использованием эконометрических моделей и методов машинного обучения.
При реализации данного исследования использовались модели временных рядов, множественной линейной регрессии, деревьев решений, случайного леса,
градиентного бустинга и искусственных нейронных сетей. При разработке системы использовались методы системного анализа и программной инженерии.
Информационную базу исследования составили публикации и открытые данные Федеральной службы государственной статистики в социально-экономической сфере России, данные из Единой межведомственной информационно-статистической системы (ЕМИСС), официальные публикации и открытые данные Банка России.
Методология и методы исследования. Методологическую основу проведенного исследования составили совокупность методов и принципов системного и структурного анализа, методы эконометрического и экономико-математического моделирования, машинного обучения. В качестве инструментария для разработки информационно-аналитической системы применялись следующие технологии разработки:
1. Язык программирования Python, фреймворк Django и библиотеки Pandas, NumPy, SciPy, statsmodels, Scikit-Learn, Keras, TensorFlow.
2. Язык программирования JavaScript, фреймворк React.
3. СУБД PostgreSQL.
Научная новизна результатов диссертационного исследования.
Разработана гибкая информационно-аналитическая система краткосрочного прогнозирования социально-экономических показателей России, осуществляющая последовательный отбор релевантной модели из исходного множества сформированных классов моделей временных рядов, множественной линейной регрессии, регрессионных деревьев решений, случайного леса, градиентного бустинга и нейронных сетей с учетом рассматриваемых критериев точности и достоверности альтернативных моделей.
Наиболее существенные результаты исследования, выносимые на защиту и полученные лично автором, заключаются в следующем:
- Выявлены особенности краткосрочного эконометрического прогнозирования социально-экономических показателей в условиях небольших объемов данных и сложных взаимосвязей между показателями, предопределенных
нестабильностью внешних условий.
- Предложена структура моделей информационно-аналитической системы прогнозирования социально-экономических показателей России, включающая модели временных рядов, факторные модели множественной линейной регрессии, модели деревьев решений, модели случайного леса, модели градиентного бустинга и модели искусственных нейронных сетей.
- Разработан подход к выбору рационального варианта релевантной модели краткосрочного прогнозирования социально-экономических показателей России, базирующийся на последовательном их применении в порядке увеличения вычислительной сложности с учетом критериев их качества. Процесс подбора моделей прекращается, когда последний вариант удовлетворяет этим критериям. Система критериев оценки точности и качества включает в себя три группы показателей: группу показателей качества, отражающих степень соответствия построенной модели фактическим тенденциям; группу показателей точности, характеризующих степень аппроксимации полученными моделями исходного временного ряда; критерий эмпирической оценки точности прогнозирования по ретроспективным прогнозам.
- Разработана архитектура информационно-аналитической системы краткосрочного прогнозирования социально-экономических показателей России, особенностью которой является возможность добавления новых информационных модулей в короткие временные интервалы, позволяющая производить эффективную адаптацию моделей краткосрочного прогнозирования к изменяющимся условиям внутренней и внешней среды.
- Произведена адаптация системы моделей краткосрочного прогнозирования социально-экономических показателей России на основе сопоставления полученных результатов и фактических данных.
Теоретическая значимость диссертационного исследования состоит в совершенствовании теории и методологии краткосрочного прогнозирования социально-экономических показателей России на базе моделей эконометрики и машинного обучения в условиях недостатка информации и смещенности оценок с
использованием процедуры подбора наиболее релевантной модели прогнозирования из комплекса построенных моделей.
Практическая ценность результатов исследования состоит в возможности использования полученных краткосрочных прогнозов социально-экономических показателей России в управлении социально-экономическими процессами государства; в обеспечении информацией и инструментами для принятия решений для достижения стабильного экономического развития; в минимизации вероятности неблагоприятных явлений за счет своевременного выявления негативных тенденций в краткосрочном периоде.
Данное исследование выполнено в рамках государственного задания в сфере научной деятельности Министерства науки и высшего образования Российской Федерации на тему «Модели, методы и алгоритмы искусственного интеллекта в задачах экономики для анализа и стилизации многомерных данных, прогнозирования временных рядов и проектирования рекомендательных систем», номер проекта FSSW-2023-0004.
Апробация работы и внедрение результатов исследования.
Основные результаты данного исследования были изложены в рамках докладов на международных и всероссийских научных конференциях:
- XXVII Международная научная конференция «Инжиниринг предприятий и управление знаниями» (2024);
- XXIV Международная научная конференция «Инжиниринг предприятий и управление знаниями» (2021);
- Х Международная научная конференция «Абалкинские чтения» (2021);
- XXIII Международная научная конференция «Инжиниринг предприятий и управление знаниями» (2020);
- IV Международная научно-практическая конференция имени А.И. Китова «Математические методы и информационные технологии в экономике и управлении» (2014);
- Х Международная научно-практическая конференция им. А. И. Китова «Математические методы и информационные технологии в экономике
и управлении» (2020);
- II Международная научно-практическая конференция «Программная инженерия: методы и технологии разработки информационно-вычислительных систем» (ПИИВС-2018);
- XXI Международная конференция по мягким вычислениям и измерениям (SCM'2018);
Разработанная в рамках диссертационного исследования методика была апробирована в следующих научных проектах:
- Проект РФФИ № 13-07-00858 А «Методология и система гибридных интеллектуально-экономических моделей и инструментальных средств для анализа и вариантного прогнозирования показателей социально-экономического развития на федеральном и региональном уровнях» 2013-2015 гг. под руководством Китовой О.В.
- Проект РФФИ № 17-07-01558 А «Гибридные когнитивные системы поддержки принятия решений» 2017-2019 гг. под руководством Аверкина А.Н.
- Международный проект РФФИ № 20-57-00024 Бел_а «Разработка моделей и технологий оценки состояния компонентов крупномасштабных социально-экономических и организационно-технических систем на основе методов искусственного интеллекта» 2020-2021 гг. под руководством Китовой О.В.
Публикации. В рамках исследования было опубликовано 18 научных работ общим объемом 10,5 печатных листов (авторских 4,05 печатных листа), из них 7 работ объемом 4,98 печатных листа (авторских 2,25 печатных листа) опубликованы в журналах из перечня ВАК рецензируемых научных изданий, в которых должны быть опубликованы основные научные результаты диссертации на соискание ученой степени кандидата наук, 6 работ общим объемом 4 печатных листа (авторских 1,3 печатных листа) в изданиях, зарегистрированных в базе данных Scopus, 1 работа объемом 0,9 печатных листа в издании, зарегистрированном в базе данных Web of Science.
Структура, объем и краткое содержание работы. Данное диссертационное
исследование состоит из введения, трех глав, заключения и списка литературы (100 источников, в том числе 40 интернет-источников). Общий объем работы - 204 м. пл. Основной текст включает 36 таблиц, 39 рисунков, 79 формул.
В главе 1 «Теоретические вопросы применения математических и инструментальных методов в социально-экономическом прогнозировании» рассмотрены основные направления разработки моделей краткосрочного экономического прогнозирования. Проанализированы работы ученых в данном направлении, приведены описания методов и моделей эконометрики и машинного обучения, применяемых в задачах прогнозирования.
В главе 2 «Методика разработки ансамбля математических моделей прогнозирования социально-экономических показателей» предложен компьютерный метод сценарного прогнозирования социально-экономических показателей Российской Федерации, который позволяет повысить точность и качество прогнозов за счет объединения преимуществ, используемых в ансамбле математических моделей. Разработана и обоснована методика подготовки данных и представления прогнозов на основе ансамбля математических моделей краткосрочного прогнозирования социально-экономических показателей Российской Федерации с использованием моделей временных рядов, множественной линейной регрессии, регрессионных деревьев решений, случайного леса, градиентного бустинга и нейронных сетей. Приведена информационно-логическая схема, описывающая данную методику. В главе 3 «Разработка информационно-аналитической системы краткосрочного прогнозирования» описана разработанная архитектура информационно-аналитической системы, описаны разработанные в рамках системы модули, приведены результаты моделирования и верификации полученных результатов.
Глава 1 Особенности краткосрочного прогнозирования социально-экономических показателей России
1.1 Структура показателей социально-экономической сферы России
Социально-экономическая сфера - это комплексная система, которая представляет собой целостную совокупность взаимосвязанных и взаимодействующих социальных и экономических институтов (субъектов) и отношений в части распределения и потребления материальных и нематериальных ресурсов, производства, обмена и потребления товаров и услуг [48].
Социально-экономическая сфера является неотъемлемой частью государства и включает в себя экономические процессы страны, социальные отношения в обществе, а также процессы регулирования социально-экономической сферы. Структура социально-экономической сферы представлена на рисунке 1.
Рисунок 1 — Структура социально-экономической сферы государства
Источник: разработано автором на основе материалов [48]
Для эффективного управления социально-экономическими процессами, входящими в состав рассматриваемой сферы, необходима грамотно сформированная методика расчета показателей, которые обеспечивают качество
информации на всех уровнях управления. Структура и методологии расчета рассматриваемых показателей регламентируется системой национальных счетов (СНС). СНС - система взаимосвязанных статистических показателей, построенных в виде определенного набора счетов и таблиц, характеризующая результаты отдельных экономических процессов и экономическую деятельность в целом [8]. В рамках СНС рассматриваются три основных направления, которые позволяют эффективно оценивать экономическое положение страны [57]:
- экономическое производство, которое предполагает учет всех видов производства товаров и услуг;
- доход, который представляет собой наибольшую денежную сумму, потратив которую рассматриваемые субъекты не становятся беднее;
- экономические субъекты, которые сгруппированы в пять однородных групп - нефинансовые корпорации, финансовые корпорации, государственное управление, домашние хозяйства, некоммерческие организации, обслуживающие домашние хозяйства.
Счета, входящие в СНС, позволяют выполнять макроэкономические расчеты, которые способны оценить текущее положение страны и тенденции экономики в целом, а также по отдельным отраслям и субъектам.
Макроэкономические показатели. Центральное место в макроэкономических расчетах занимает такой показатель, как валовой внутренний продукт (ВВП). Он характеризует поток конечных товаров и услуг (вновь созданную стоимость), произведенных резидентами страны за тот или иной период, и исчисляется в рыночных ценах конечного потребления [8].
Статистический показатель внутреннего валового продукта позволяет оценивать: экономическую активность, т. е. общий объем производства товаров и услуг за определенное время; экономический рост в стране; эффективность принятых решений на уровне государства. [40]
Основная задача, решаемая при исследовании ВВП, - количественное описание основных целевых ориентиров развития экономики. Оценка данного показателя может быть произведена на основе одного из трех методов:
- производство ВВП, т. е. измерение добавленной стоимости;
- использование ВВП как распределение между субъектами конечного потребления;
- формирование ВВП по источникам доходов как сумма доходов.
Для более информативной оценки ВВП также рассматриваются показатели доходов и использования ВВП. [51] Источники доходов ВВП России представлены следующими показателями: оплата труда наемных работников, чистые налоги на производство и импорт, валовая прибыль экономики и валовые смешанные доходы. Структура элементов использования ВВП может быть оценена на основе показателей расходов на конечное потребление, валового накопления, экспортно-импортного сальдо.
Помимо показателей, характеризующих ВВП, важно рассматривать дефицит (профицит) консолидированного бюджета как основной показатель финансовой сферы государства. Данный показатель позволяет оценить эффективность финансовой политики и устойчивость государственных финансов.
Важными для исследования социально-экономических процессов также являются показатели просроченной задолженности по заработной плате и просроченной кредиторской задолженности, которые позволяют более детально оценить экономические предпосылки изменения структуры и тенденций рынка труда и занятости, а также доходов и расходов домашних хозяйств.
Для оценки социально-экономического положения государства также важно учитывать показатели уровня жизни населения и показатели рынка труда и занятости.
Показатели уровня жизни населения. В настоящий момент не существует однозначного определения понятия «уровень жизни населения» и единой системы показателей, характеризующих его. Это в первую очередь обусловлено тем, что при решении различных научных и прикладных задач используются различные интерпретации этого понятия, акцентирующие внимание на его отдельных сторонах [24].
Основной задачей исследования показателей уровня жизни населения является определение на перспективный период потребностей населения и возможностей их удовлетворения в продуктах питания, промышленных товарах, бытовых услугах, жилье, образовании, услугах здравоохранения, культуры, искусства.
Уровень жизни населения в конечном счете определяется совокупностью и взаимовлиянием большого количества факторов, обусловленных культурными, геополитическими, историческими и прочими особенностями государства. Поэтому для исследования уровня жизни населения логично применить показатели, охватывающие не все, а только некоторые наиболее существенные процессы.
В настоящей работе выбраны следующие показатели жизни населения, обусловленные методологией по расчету показателей денежных доходов и расходов населения Федеральной службы государственной статистики [1]:
а) Величина денежных доходов населения - сумма денежных средств и материальных благ, полученных или произведенных домашними хозяйствами за определенный промежуток времени (в миллиардах рублей). Показатель дифференцирован по источникам возникновения на оплату труда (включая скрытую заработную плату), на доходы от собственности, доходы от предпринимательской деятельности, социальные выплаты, прочие доходы.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Моделирование покупательского спроса на предприятиях розничной торговли на основе методов машинного обучения2018 год, кандидат наук Пивкин Кирилл Сергеевич
Инвестиционная привлекательность и экологическая безопасность в Китае и Юго-Восточной Азии: эмпирические модели и анализ данных2024 год, кандидат наук Ци Дунфан
Разработка методических рекомендаций по прогнозированию развития угольной отрасли в системе государственного информационного ресурса2007 год, кандидат экономических наук Тимкова, Нина Федоровна
Наукастинг и краткосрочное прогнозирование развивающейся экономики в условиях неопределённости2026 год, кандидат наук Макеева Наталья Михайловна
Статистическое моделирование основных макроэкономических показателей развития России в период реформ1998 год, кандидат экономических наук Мешимбаева, Анар Ертулевна
Список литературы диссертационного исследования кандидат наук Савинова Виктория Михайловна, 2026 год
Источник [6]
Следующим этапом при построении регрессионной модели выполняется отбор факторов в модель. С этой целью необходимо произвести расчет парного коэффициента корреляции Пирсона между результирующей переменной и всеми потенциальными факторами, который вычисляется по формуле:
Я=1 х(Ух - пхУ
гху
^2=1 *2 - пх2 у2 - пу2
(15)
где гху - коэффициент корреляции Пирсона; Х1 и Уь - элементы выборки;
х и у - выборочные средние параметров х и у соответственно. [24] В результате в модель отбираются факторы, для которых значение коэффициента корреляции по отношению к результирующей переменной по модулю больше 0.6 (|гху| > 0.6).
Третьим этапом построения модели регрессии является выбор метода оценки ее параметров, в основе которого лежит метод наименьших квадратов (МНК).
Оценкой наименьших квадратов является такой вектор параметров (а1) а2,..., ат), который минимизирует сумму квадратов отклонений наблюдаемых значений от отчетных:
S = - («Л1 + «2*i2 + «3*i3 + ^ + amxim)) ^ min. (16)
Для удобства решения данной задачи возможно перейти к матричной форме уравнения регрессии (16):
Y = XA+U,
(17)
где:
X =
/У1
= У 2
\Ур
х12
х22
\Xpi Хр2
(18)
х1т х2т
(19)
х
Рт/
A =
(а 1 «2
(20)
U =
/^i щ
(21)
Тогда оценка МНК будет выглядеть следующим образом:
5 = UTU = (Y — XA)T(Y — ХА).
тt
(22)
Для того, чтобы найти минимум данного выражения необходимо найти производную S от А и приравнять ее к нулю.
Предварительно производятся преобразование выражения (22). Учитывая, что при транспонировании произведения матриц получается произведение матриц в обратном порядке:
S = YTY -ATXTY -YTXA + ATXTXA. (23)
Величина YTXA является скалярной, следовательно, она не меняется при транспонировании. Тогда
S = YyY- 2AtXtY + АТХТХА. (24)
Далее необходимо минимизировать функцию S. С этой целью необходимо найти частные производные по всем (а1,а2,... ,ат), то есть необходимо найти
dS , dS dS dS ч
вектор — = (—,—, ...,-—).
оА даг да2 дат
В результате преобразований выражения (22) получится следующее выражение:
dS Т Т
— = -2XTY + 2ХТХА = 0. (25)
дА
Из выражения (25) получим вектор коэффициентов линейной регрессии, который будет равен:
А = (XTX)-1XTY. (26)
Однако, оценка А является эффективной и несмещенной только в случае, если выполняются следующие условия [61]:
- математическое ожидание ошибки для всех моментов времени равно нулю или:
M(£t) = 0, (27)
где st - ошибка в момент t (t = 1,2,3, ...,Т);
- значение дисперсии ошибки является постоянной величиной для всех моментов t (t = 1,2,3, ...,Т):
а2 = const; (28)
- отсутствует корреляционная связь ошибок между собой, то есть их ковариация равна нулю или:
соу(£1,£1+5) = 0, (29)
где s = 1, 2, ..., Т-1;
- значения независимых факторов модели и ошибки, рассматриваемые в одни и те же моменты времени, являются независимыми, т. е. их ковариации равны нулю:
С0У(Х11,£1+3) = 0 (30)
для I = 1,2,..., п;
- матрица (ХТХ) невырожденной, то есть все факторные признаки независимы между собой (отсутствие мультиколлинеарности), что означает, что парные коэффициенты корреляции факторных признаков г^ не превосходит некоторого порога р
Ы < р. (31)
Если одно или несколько условий не выполняется, то необходимо использовать специальные методы оценки параметров моделей.
Так в случае нарушения условия наличия корреляционных связей ошибок модели между собой или наличия их гетероскедастичности применяется обобщенный метод наименьших квадратов. При данном методе оценки коэффициентов модели будут определяться следующим образом:
А = (ХтП-1Х)-1ХтП-1У, (32)
где П - ковариационная матрица ошибок модели, выраженная следующим уравнением:
П = СОР(£) = (33)
где £ - матрица коэффициентов автокорреляции модели, отличная от единичной.
При наличии корреляционных связей остатков матрица £ имеет вид:
1 Р1 Р2 . Т- 1
Р1 1 Р1 .. р[ 2
Р2 Р1 1. .. р[ 3
^Г1 Р1 т—з р1 3 . 1 )
где рг - коэффициент автокорреляции рядов ошибки £ первого порядка и рассчитывается исходя из предположения о наличии автокорреляционной зависимости первого порядка в ряду ошибок:
Ч = Р1Ч-1 + (35)
где (( - ошибка авторегрессионной модели, которая характеризуется нулевым
•у
значением среднего и конечной дисперсией о^ . [61]
При наличии гетероскедастичности остатков модели матрица 2 имеет вид:
.. с\
2 = Л"2 0 0 а2 0 0 0 0
.0 0 . а2
/I
¿1
0 —
V
0
0 1
я~2
0
0 1
17/
(36)
где о"2 Ф Ф ••• Ф а2, то есть присутствует гетероскедастичность ошибок
(дисперсии ошибок не постоянны);
- постоянный множитель;
Яс - переменные коэффициенты.
В случае, если факторы характеризуются наличием связи со значениями ошибки, то применяется метод инструментальных переменных. При использовании данного метода предполагается, что существуют такие инструментальные переменные , число которых в общем случае совпадает с числом независимых факторов модели х;, I = 1, 2,..., п. Причем инструментальные переменные не имеют взаимосвязи с ошибкой эконометрической модели, то есть коэффициент корреляции между ними равен нулю. При заданном Т матрица значений инструментальных переменных Ъ имеет такой же размер, как матрица Х. [61]
Тогда оценки моделей регрессии могут быть получены по следующей формуле:
А = (7ТХ)-17ТГ. (37)
В случае наличия зависимости факторных признаков между собой (мультиколлинеарность) может быть применен метод коррекции Рао (метод наименьших квадратов Рао). Метод наименьших квадратов Рао является методом оценки параметров в линейной регрессионной модели. Этот метод был разработан индийским статистиком C. Radhakrishna Rao и представляет собой обобщение классического метода наименьших квадратов. [91]
В рамках метода наименьших квадратов Рао оценки параметров моделей вычисляется по следующей формуле: [91]
Á = (XTR-1X)-XTR-Y, (38)
где Á - скорректированные оценки модели множественной линейной регрессии,
R- - обобщенная обратная матрица R.
Матрица R вычисляется следующим образом:
R = ñ+XUXT, (39)
где U является положительно определенной матрицей, такой, что ^(П) с ^(R) и Я(Х) с #(R).
Чаще всего значение U выбирают равным Ь21, где b - любая константа, / -единичная матрица размером р Хр .
В случае, если методом наименьших квадратов Рао не удалось получить эффективные и несмещенные оценки уравнения линейной регрессии, можно использовать метод главных компонент. Метод главных компонент — это статистический метод, используемый для уменьшения размерности данных путем проецирования их на новое пространство с меньшим количеством переменных, называемых главными компонентами. Главные компоненты являются линейными комбинациями исходных центрированных переменных и ортогональны друг другу. Основная цель метода главных компонент заключается в том, чтобы сохранить как можно больше информации из исходных данных, удаляя при этом недостатки, вызванные корреляционной зависимостью в исходных данных.
Для применения метода главных необходимо выполнить центрирование исходных данных:
хи= 1 ^ Х]=, (40)
(41)
где X] - среднее значение j-го фактора;
у - среднее значение результирующего фактора.
Главные компоненты представляются как линейная комбинация центрированных исходных факторов . В матричной форме это можно записать следующим образом:
г1 = (42)
где - вектор-столбец значений первой компоненты в моменты V,
Ь1 - вектор-столбец коэффициентов линейной зависимости, выражающей связь первой компоненты со значениями центрированных переменных в момент времени V,
X - матрица центрированных переменных. [61]
Неизвестный вектор Ь1 должен быть выбран таким образом, чтобы первая компонента вобрала в себя наибольшую возможную долю изменчивости, характеризующей матрицу X ТХ, но при условии, что сами значения коэффициентов не будут влиять на эту характеристику. Это можно сделать, введя нормирующее ограничение на элементы вектора Ь1, которое выражается следующим соотношением:
(ьЛ) = Ь121 + ¿22 + - + Ь2п = 1. (43)
Решая задачу максимизации величины изменчивости первой главной компоненты с использованием метода множителей Лагранжа получено следующее выражение:
(Я Т)()Ь1 = ^1Ь1, (44)
где Д"- максимальное собственное число (перронов корень), положительно определенной матрицы (X 7Х);
Ь" - соответствующий ему собственный вектор.
Последующие компоненты должны также описывать максимальную долю изменчивости матрицы (X 7Х), оставшуюся после предыдущей компоненты, а также должны быть ортогональны друг другу и удовлетворять условию (43). На примере второй главной компоненты получено следующее выражение:
(;Гх)Ь2 = дЛ, (44)
где д2 - второй по величине собственный корень матрицы (X 7Х);
Ь2 - соответствующий ему собственный вектор.
Таким образом проведя аналогичные вычисления для вычисления всех главных компонент, будет получено множество нормированных собственных векторов Ь",Ь2, ...,ЬП матрицы (ХТХ), которым будут соответствовать собственные числа Д",Д2, ...,Дп, которые будут отсортированы по убыванию, то есть Д" > Д2 > > ••• > Дп. Тогда, объединив собственные вектора в матрицу Б, получим уравнение
7 = ХБ. (45)
Далее происходит отбор наиболее значимых компонентов, то есть тех, которые описывают наибольшую долю изменчивости исходных данных.
На основе отобранных компонент выполняется построение модели множественной линейной регрессии, оценки которого можно вычислить с использованием классического метода наименьших квадратов:
С = ^^-"^Г, (46)
где С - вектор оценок модели линейной регрессии, построенной на основе выявленных главных компонент.
Далее возможно выполнить обратное преобразование полученной модели к исходным отобранным факторам для лучшей интерпретации полученной эконометрической модели.
Существует множество других методов нахождения или коррекции оценок параметров моделей множественной линейной регрессии, но в рамках данного исследования они не рассматривались.
После нахождения оценок параметров модели множественной линейной регрессии производится проверка точности и качества моделей множественной линейной регрессии с использованием системы критериев верификации. Предложенная автором система критериев верификации для оценки качества моделей будет описана в диссертационной работе в рамках параграфа 2.3.
Обобщенно процесс построения модели множественной линейной регрессии представлен на рисунке 11.
Впервые модели множественной линейной регрессии были успешно применены в прогнозировании социально-экономических показателей Лоуренсом Робертом Клейном [83, 84]. Им была разработана модель, которая представляла собой сложную систему уравнений, описывающих взаимосвязь различных экономических факторов.
Модель Клейна была разработана для прогнозирования и анализа макроэкономических явлений, таких как инфляция, безработица, ВВП и другие. Данная модель широко используется в экономической науке, так как позволяет повышать качество принимаемых решений. Разработанный Клейном подход был в дальнейшем рассмотрен в различных исследованиях по прогнозированию на основании эконометрических моделей.
В Работе «Модель экономики» рассмотрены концепции и основные примеры применения эконометрических моделей. Также приведены результаты расчета различных моделей (качество прогноза). [67]
В России эконометрические методы и регрессионные модели исследовались и применялись в работах Айвазяна С.А., Елисеевой И. И, Калихмана И.Л., Колмакова И.Б., Макарова В.Л, Моторина В.И., Мхитаряна В. С., Тихомирова Н.П.
Рисунок 11 - Укрупненная схема процесса построения модели множественной линейной регрессии
Источник: составлено автором на основе [19-26, 61-60, 91].
Одной из первых публикаций, описывающих модели краткосрочного прогнозирования социально-экономических показателей Российской Федерации в условиях рыночной экономики, была работа Лисина В.С. и др. «Проблемы моделирования воспроизводства ВВП России», базирующиеся на уравнениях множественной линейной регрессии. [38] Системы уравнений линейной регрессии для прогнозирования макроэкономики также рассматривались в работе [11].
Использование моделей множественной линейной регрессии широко применяется в рамках информационно-аналитических систем краткосрочного прогнозирования социально-экономических процессов, что было показано ранее в главе 1.
Широкое распространение моделей множественной линейной регрессии в краткосрочном прогнозировании социально-экономических показателей вызвано их достоинствами, сформулированными автором на основе [28]:
- простота, гибкость и прозрачность моделирования, обусловленные обширным и обоснованным математическим аппаратом и небольшим количеством требующих оценки параметров модели;
- возможность находить наилучшее решение из возможных за счет большого количества методов оценки параметров модели;
- высокая интерпретируемость влияния факторов модели на результирующий признак.
Однако у моделей множественной линейной регрессии существует и ряд недостатков:
- сложность определения наиболее адекватной формы регрессионной функции;
- трудоемкость нахождения эффективных и несмещенных оценок параметров регрессии;
отсутствие возможности моделирования нелинейных процессов.
Рассмотренные недостатки выявлены автором на основании работ [61] и [28]. Наличие таких недостатков приводит к невозможности построения достаточно точных прогнозов по всему множеству рассматриваемых социально-
экономических показателей, которые могут характеризоваться сложными взаимосвязями между ними.
В связи с этим имеет смысл рассмотреть модели, которые компенсируют недостатки рассмотренных ранее моделей. Одной из таких моделей является регрессионное дерево решение.
Модели регрессионных деревьев решений. Данная модель представляет собой иерархический набор правил для разбиения исходного набора данных на группы с минимальным значением вариации и минимальным отклонением среднего в группе от эталонного значения.
Изначально деревья решений были созданы, как модели машинного обучения для классификации объектов. [47] В настоящее время разработаны специальные алгоритмы, которые позволяют создавать регрессионные деревья решений, которые возможно использовать в задачах краткосрочного прогнозирования социально-экономических показателей. Регрессионное дерево решений состоит из двух типов объектов, а именно узлы и листья. Узлы содержат в себе правила вида «если..., то...», которые регламентируют разбиение исходных данных на подмножества. Листья содержат прогнозируемое значение целевой переменной. [47]
В качестве алгоритма построения регрессионного дерева решений используется CART (Classification and Regression Tree) — популярный алгоритм построения деревьев решений, предложенный в 1984 г. в работе [73] за авторством Breiman L., Friedman J., Olshen R. и Stone Ch. Построение регрессионного дерева решений включает в себя несколько этапов.
На первом этапе производится разбиение на обучающую и тестовые выборки. Обучающая выборка используется для настройки правил разбиения дерева решений, поэтому она должна значительно превышать по объему тестовую, применяемую для тестирования полученной модели.
На следующем этапе выбираются параметры алгоритма построения, которые включают в себя:
- глубину дерева — это количество уровней разбиения данных на подгруппы. Слишком глубокое дерево может привести к переобучению модели, тогда как в противном случае может привести к недостаточной точности прогноза. В рамках данной работы из-за малого объема выборки глубина дерева рассматривалась в диапазоне 5-7 уровней. Данные значения были получены путем проведения кросс-валидации различных конфигураций деревьев решений.
- Критерий разбиения — это мера качества, используемая для выбора наилучшего разбиения данных на подгруппы на каждом уровне дерева. Для построения моделей регрессионных деревьев решений для краткосрочного прогнозирования исследуемых показателей использовалась среднеквадратическая ошибка (MSE), которая наиболее часто применяется при решении задач прогнозирования.
- Минимальное количество объектов в листе (узле) — это минимальное количество объектов, которые должны оставаться в каждом листе дерева. Это позволяет управлять сложностью модели и избежать переобучения. В рамках данной работы это значение было выбрано равным 5 и подобрано на основании результатов кросс-валидации при различных конфигурациях дерева решений.
Далее производится обучение регрессионного дерева решений, которое заключается в построении правил разбиения исходного набора данных. Обучение дерева заключается в следующем: пусть дана обучающая выборка исходных данных (*!, ■■■ > хп ) и желаемые отклики (У1,У2, -,Уп). Предположим, что а -алгоритм разбиения регрессионного дерева решений. Тогда отклонение рассчитанных с помощью дерева решений значений от желаемых можно вычислить с использованием квадратичной ошибки: [94]
Тогда для определения наилучшего разбиения найдем минимум квадратичной ошибки между значениями (у1,у2, ■ ,Ут), попавших в соответствующий узел в текущем разбиении (т - количество примеров, попавших
(47)
в узел) и средним значением искомого признака в узле. Среднее значение будет определяться, как среднее арифметическое и обозначается уг, где 1 - номер узла. Тогда значение критерия разбиения в узле 1 будет рассчитано по формуле: [94]
Следовательно, при построении дерева решений на каждом этапе выбирают ту переменную с таким пороговым значением, при котором величина Q будет минимальной.
На последнем этапе производится верификация построенных моделей и принимается решение о ее применении при краткосрочном прогнозировании исследуемых показателей. Обобщенная схема построения регрессионного дерева решений представлена на рисунке 12.
Модель регрессионных решений применяется в ряде работ, современных исследованиях, посвященных краткосрочному прогнозированию социально-экономических показателей. Например, работа [33] посвящена прогнозированию показателей инвестиций в России в зависимости от макроэкономических показателей. Использование модели регрессионных деревьев решений позволило получить достаточно точные прогнозы некоторых рассматриваемых в рамках работы показателей, о чем свидетельствует значение средней относительной ошибки, равное в среднем 5%.
Статья [88] также демонстрирует успешное применение регрессионных деревьев решений в сфере краткосрочного прогнозирования социально-экономических показателей на примере показателей цен на уголь, на нефть, природный газ и бумагу. В результате применения модели регрессионного дерева решений удалось получить прогнозы высокой точности, подтвержденной значением средней относительной ошибки, меньшей 5%.
(48)
Рисунок 12 - Укрупненная схема процесса построения модели регрессионного дерева решений
Источник: составлено автором на основе [94].
Еще одним примером статьи, подтверждающей эффективность использования регрессионных деревьев решений в краткосрочном прогнозировании, является работа [77], которая также посвящена краткосрочному прогнозированию цен на сырьевые продукты. Регрессионные деревья решений позволили получить точные прогнозы исследуемых процессов, что обосновано значением средней относительной ошибки, равной менее 5%.
Использование регрессионных деревьев решений в задачах социально-экономического прогнозирования может быть обусловлено достоинствами этих моделей, включающих:
- высокая степень интерпретируемости результатов модели, обусловленная представлением выявленных зависимостей в форме логических правил вида «если..., то...»;
- возможность моделировать нелинейные зависимости;
- устойчивость к качеству данных и изменению тенденций. [18]
Однако деревья решений обладают рядом недостатков, таких, как:
- высокий риск переобучения;
- неоднозначность алгоритма построения дерева, выраженная в существовании нескольких возможных способов построения дерева, которые могут привести к различным структурам и результатам. Это может быть вызвано различными факторами, такими как порядок выбора признаков для разделения узлов, критерии остановки, или начальные условия. [18]
Таким образом, регрессионные деревья решений имеют ряд недостатков, которые не всегда позволяют получать достаточно точные прогнозы для всех исследуемых процессов. Поэтому возникает необходимость применения альтернативных моделей краткосрочного прогнозирования социально-экономических показателей, компенсирующих недостатки регрессионных деревьев решений. В качестве такой модели можно рассмотреть модель случайного леса.
Модель случайного леса. Модель случайного леса — это ансамбль моделей деревьев решений, которые обучаются независимо друг от друга и затем комбинируются для получения более точного и устойчивого прогноза. Основная идея случайного леса заключается в том, что каждое дерево строится на основе случайной подвыборки обучающих данных и случайного подмножества признаков. Модель случайного леса также в задачах краткосрочного прогнозирования социально-экономических показателей состоит из регрессионных деревьев решений, процесс создания которых был описан ранее в данной главе.
Процесс построения случайного леса включает следующие шаги:
создание случайной подвыборки обучающих данных для каждого дерева из случайного леса, что способствует разнообразию моделей;
- выбор случайного подмножества признаков при построении каждого узла дерева с целью исключения переобучения;
- настройка параметров обучения случайного леса, а именно количество регрессионных деревьев в рамках модели случайного леса, а также параметры алгоритма их построения, указанные ранее при описании регрессионных деревьев решений;
- построение каждого дерева леса на основе выбранной подвыборки данных и признаков;
- комбинация результатов всех построенных деревьев путем усреднения.
Модель случайного леса хорошо зарекомендовала себя в сфере
краткосрочного прогнозирования социально-экономических показателей. Например, в работе [15] авторы построили краткосрочные прогнозы социально-экономических показателей, таких, как например, ВВП, валовое накопление, уровень. Модель случайного леса позволила получить высококачественные результаты моделирования, что подтверждено не превышающими одного процента значениями корня средней квадратичной ошибки построенных краткосрочных прогнозов.
Также модель случайного леса доказала свою эффективность в задачах краткосрочного прогнозирования социально-экономических показателей в работе [9]. Авторы получили адекватные исследуемым процессам модели и подтвердили это высокими значениями коэффициента детерминации (больше 0.99) и невысокими значениями средней относительной ошибки (не более 0.5 %).
Модели случайного леса обладают рядом достоинств, благодаря котором возможно их применение в задачах краткосрочного прогнозирования социально-экономических показателей:
- масштабируемость;
- возможность моделировать нелинейные зависимости;
- высокая точность получаемых результатов;
- нечувствительность к качеству данных. [58]
Однако они обладают и некоторыми недостатками, а именно:
- сложная интерпретируемость;
- высокая вычислительная сложность;
- высокие трудовые и временные затраты на настройку. [58]
Таким образом, модели случайного леса как правило эффективно моделируют нелинейные зависимости. Однако, данные модели также не являются универсальными и не всегда позволяют получить достаточно достоверные прогнозы. Для прогнозирования показателей, для которых не удается получить удовлетворительный уровень точности и качества прогноза с помощью модели случайного леса, возможно применение модели градиентного бустинга.
Модель градиентного бустинга. Градиентный бустинг — это мощный метод машинного обучения, который используется для решения задач регрессии и классификации. Он основан на принципе ансамблевого обучения, где несколько слабых моделей (обычно деревьев решений) комбинируются для создания более точной предсказательной модели. Идея обучения градиентного бустинга заключается в последовательном построении ансамбля моделей, где каждая новая модель обучается на ошибках (остатках) предыдущих моделей. Этот подход позволяет улучшать предсказания, минимизируя функцию потерь.
Построение модели градиентного бустинга включает в себя несколько этапов:
- настройка параметров модели градиентного бустинга, включая количество итераций обучения, что эквивалентно количеству используемых регрессионных деревьев в рамках алгоритма градиентного бустинга, а также параметры самих деревьев, которые описывались ранее при описании модели регрессионных деревьев решений;
- создание первой базовой модели регрессионного дерева решений;
- вычисление остатков (ошибки) между фактическими значениями и предсказаниями текущей модели. Остатки показывают, насколько текущая модель ошибается;
- обучение новой модели регрессионного дерева решений на основе остатков предыдущей модели, которая пытается предсказать эти остатки.
- обновление предсказаний путем добавления предсказаний новой модели к предыдущим предсказаниям. Это делается с учетом некоторого коэффициента обучения (learning rate), который контролирует, насколько сильно новая модель влияет на итоговые предсказания;
- повторение процесса обучения, при котором на каждом шаге вычисляются новые остатки, обучается новая модель и обновляются предсказания. Этот процесс продолжается до тех пор, пока не будет достигнуто заданное количество итераций или не будет выполнено условие остановки (например, когда улучшение становится незначительным).
Основная идея заключается в том, что каждая новая модель минимизирует функцию потерь, используя градиентный спуск. Градиентный бустинг объединяет предсказания нескольких моделей, что позволяет улучшить общую точность и устойчивость к переобучению.
Кроме того, для предотвращения переобучения могут использоваться различные методы, такие как ограничение глубины деревьев, использование бутстрэппинга и добавление случайности в выборку данных.
Модели градиентного бустинга обладают следующими преимуществами:
- способность находить сложные зависимости в данных и обеспечивать высокую предсказательную способность;
- устойчивость к переобучению, что делает его релевантным для работы с небольшими наборами данных;
- поддержка параллельной обработки, что значительно повышает эффективность процесса обучения;
- возможность обработки пропущенных значений в данных.
Однако, модели градиентного бустинга обладают и некоторым недостатками:
- высокий уровень вычислительной сложности алгоритма;
- чувствительность к шуму в данных;
- сложность настройки гиперпараметров;
- низкий уровень интерпретируемости.
Однако, не всегда удается получить прогнозы высокого уровня точности при использовании модели градиентного бустинга. Еще одним эффективным методом для краткосрочного прогнозирования показателей, которые обладают сложными нелинейными зависимостями от рассматриваемых факторных признаков, является модель искусственной нейронной сети.
Модель искусственной нейронной сети. В общем случае ИНС представляет собой математическую модель, которая моделирует работу человеческого мозга. Такая сеть обычно моделируется с использованием программных средств. Для достижения высокого уровня производительности рассматриваются связи между нейронами, которые играют важную роль при обучении ИНС. [65]
Основная отличительная черта искусственных нейронных сетей заключается в том, что в их основе использовании принципов работы биологического мозга. Мозг организует работу своих нейронов таким образом, что вычислительные процессы происходят гораздо быстрее, чем в вычислительных системах. Это связано с таким свойством мозга, как пластичность, то есть способность настройки нервной системы в соответствии с окружающими условиями. [65] Данное свойство аналогично применяется при настройке нейронов в искусственных нейронных сетях.
Алгоритм обучения - это процедура, используемая для обучения нейронных сетей. Благодаря этому алгоритму выстраиваются синаптические связи между нейронами ИНС для получения необходимой организации нейронов с целью максимальной эффективности результатов вычисления. Наиболее часто используемый принцип, заложенный в основу алгоритмов обучения, основан на изменении значений синаптических весов в процессе ее обучения.
Основными преимуществами нейронной сети являются способность к обобщению (самообучению), адаптивность, нелинейность, масштабируемость, отказоустойчивость.
Основной единицей нейронных сетей как биологических, так и искусственных является нейрон - единица обработки информации. Нейрон состоит из следующего набора основных элементов:
- Синапсы. Каждый синапс представляет собой связь между нейронами и имеет такие характеристики, как вес и сила. Как правило вес обозначается
где j является обозначением текущего рассматриваемого нейрона, к - обозначение входного окончания синапса, с которым связан данный вес. Отличительной особенностью весов искусственной нейронной сети является то, что значения весов могут быть как положительными, так и отрицательными числами (в отличие от нейробиологии, где значения всегда положительны).
- Сумматор или ядро (сома) нейрона. Основное назначение данного модуля - это сложение взвешенных сигналов нейрона. Этот процесс имитирует записывается, как линейная комбинация:
т
(49)
У=1
где (х1; х2,..., хт) - входные сигналы нейрона;
( ..., м^у) - синаптические веса нейрона;
и* - линейная комбинация входных воздействий.
- Пороговое значение, которое характеризует увеличение или уменьшение входного сигнала. Обозначается, как Ьк.
- Функция активации. Данный компонент позволяет получить выходное значение данного нейрона. Область значений классических функций активации лежит в диапазонах [0, 1] или [-1, 1]. Математически, выход нейрона записывается, как:
У* = + М. (50)
Общий вид нейрона представлен на рисунке 13.
Рисунок 13 - Математическая структура нейрона ИНС
Источник [65]
Существует множество функций активации, которые возможно использовать в нейронных сетях. Единственное условие, накладываемое на функцию, которую возможно использовать в качестве функции активации нейрона, - ее непрерывность на всей области ее определения.
В рамках данной работы в качестве одной из функций активации рассматривались несколько функций активации: сигмоидальная, ReLU и SeLU.
Сигмоидальная функция активации является одной из самых распространенных при создании ИНС. График ее функции имеет форму буквы S. Функция является быстро возрастающей. Другое название данной функции -логистическая. Она задается следующей формулой:
1
(р(у) =
(51)
1 + exp(-av)' где v = (и + Ь);
а- параметр наклона сигмоидальной функции. Область значений сигмоидальной функции лежит в диапазоне [0,1]. Функция ReLU (Rectified linear unit) так же является распространенной в теории нейронных сетей. Данная функция решает проблему с затухающим градиентом при больших положительных значениях v, что позволяет получать
более точные результаты, чем в сигмоидальной функции. Функция ReLu записывается формулой (46):
Еще одной функцией активации в рамках данной работы является SeLU (Scaled Exponential Linear Units), которая является самонормирующийся. Активации нейронов сети SELU автоматически сходятся к нулевому среднему и единичной дисперсии. Математически данная функция записывается формулой:
где а = 1,67326; Я = 1,0507.
Структура нейронной сети, отображающая организацию нейронов и связей между ними. Называют архитектурой ИНС. Существует множество различных типов архитектур нейронных сетей, используемых в задачах прогнозирования.
В рамках данного исследования была реализована архитектура полносвязного многослойного персептрона. В результате проведенных компьютерных экспериментов была выбрана архитектура персептрона с одним скрытым слоем. Данный вид ИНС представляет собой сеть прямого распространения сигнала и имеет в своем составе входной слой, на который подаются входные данные, один или несколько скрытых слоев, преобразующих входной сигнал, и выходной слой, в результате вычислений на котором осуществляется расчет результирующей переменной.
Многослойный персептрон имеет три отличительных признака:
что позволяет сети извлекать наиболее важные признаки из данных в процессе обучения.
(50)
(51)
- Каждый нейрон имеет как правило нелинейную функцию активации. В рамках данного исследования использовалась логистическая функция.
- Данный тип ИНС всегда имеет один или несколько скрытых нейронов,
Персептроны обладают высоким уровнем связности нейронов.
Пример полносвязного персептрона с одним скрытым слоем представлен на рисунке 14.
Входной 1 скрытый Выходной
слой слой слой
Рисунок 14 - Пример архитекторы многослойного персептрона с двумя
скрытыми слоями
Источник [65]
В рамках такой архитектуры сети существует два типа сигналов:
- Функциональный сигнал, который представляет собой входной сигнал, который поступает на синапсы входного слоя нейронной сети и передается от нейрона к нейрону в направлении выходного слоя.
- Сигнал ошибки. Данный вид сигнала формируется на выходном слое нейронной сети и распространяется в обратном направлении (от выхода ко входу), корректируя значения весов в зависимости от функции ошибки.
Принцип передачи сигналов в нейронной сети представлены на рисунке 15.
Наиболее часто применяемый алгоритм обучения для многослойных персептронов - это алгоритм обратного распространения ошибки (back propagation). Этот алгоритм позволяет обучать сети со скрытыми слоями, для которых неизвестен желаемый отклик. Он является методом обучения с учителем (то есть известны эталонные значения-отклики).
Рисунок 15 - Принцип передачи сигналов нейронной сети прямого
распространения
Источник [65]
Обучение производится в несколько итераций (эпох) с целью минимизации функции ошибок (потерь).
На первом этапе вычислений необходимо определить отклонение значения выходных нейронов от требуемых откликов (эталонов) по формуле:
е,- (п) = (п) - у (п), (5 2)
где еу (п) - это значение ошибки j-го нейрона при п-той эпохе обучения;
^у(п) - это эталонное значение (учитель) j-го нейрона при п-той эпохе обучения;
Уу (п) - расчетное значение на выходе j-го нейрона при п-той эпохе обучения.
Далее необходимо вычислить сумму квадратов ошибок по всем выходным нейронам для данной эпохи:
ОД^^/^), (53)
где С - общее количество нейронов на выходном слое персептрона.
Для обучения исходные данные разделяются на тестовую и обучающую выборки. Предположим, что N - количество примеров обучающей выборки. Тогда значение среднеквадратичной ошибки по всем выходным нейронам, нормализованное по количеству примеров обучающей выборки N будет равно:
N
Еау(п) = 1^Е(п) (54)
п=1
Таким образом, Еау(п) является функцией, аргументы которой - это веса связей между нейронами (синаптические веса). Тогда Еау(п) - это функция потерь, которую необходимо минимизировать в процессе обучения. Веса корректируются на каждой эпохе обучения. Настройка весов корректируется в зависимости от значений ошибок на каждой итерации обучения для каждого обучающего примера.
Значение сумматора (индуцированное локальное поле) для j-го нейрона будет равно:
т
V] (п) = (п)у1 (п), (55)
1=0
где т - общее число входов исследуемого нейрона j,
у^(п) - значение выходов нейронов, предшествующих j-му, то есть входные значения j-го нейрона.
Тогда выход j-го нейрона будет равен:
у](п) = (у](п)) ^
Необходимо вычислить значения изменения весов при данной итерации обучения Awij, которое бы приближало значение функции ошибки к минимуму. Для определения Аwij применяется дельта-правило [65]:
дЕ(п) , л
где ц - параметр скорости обучения нейронной сети, который задается экзогенно.
Отрицательный знак связан с методом градиентного спуска, который предполагает поиск направления изменения весов для минимизации функции ошибок.
Тогда изменения весов будет равно:
= 1^8](п)у1(п) (ЗД
Где 5/(п) является локальным градиентом и задается выражением:
5;(п) = еДп)<р' (р;(п)) . (59)
Роль локального градиента заключается в указании на требуемое изменение синаптического веса. Однако задача поиска изменения весов при обратном распространении ошибок является более сложной и имеет 2 случая:
- Первый случай простой, когда изменение веса происходит для выходного нейрона, то есть известны эталонные значения выхода. Тогда значение 5у(п) рассчитывается по формуле (59).
- Второй случай, когда нейрон находится на скрытом слое. В этом случае при расчете локального градиента необходимо учитывать все значения ошибок всех нейронов, с которыми текущий нейрон непосредственно связан. В результате преобразований формулы (59) получим уравнение для расчета локального градиента для скрытого нейрона многослойного персептрона:
5;(п) = р' (рДп)) ^ ^(п^Дп), (60)
к
где к - выходной нейрон.
Для нахождения локального градиента необходимо, чтобы функция активации была дифференцируема на всей области определения (непрерывна).
Параметр скорости обучения ^ является важным критерием формирования траектории обучения методом градиентного спуска. Чем ниже значение данного параметра, тем меньше меняются значения синаптических весов на каждой итерации, и тем более гладкая траектория изменения весов. Однако в этом случае увеличивается время, затрачиваемое на обучение. То есть снижается скорость обучения. Повышение скорости обучения может привести к неустойчивому состоянию системы за счет быстрого изменения значений синаптических весов.
Для этого случая вводится параметр момент (д), который представляет собой коэффициент, характеризующий момент инерции. В результате ввода данного параметра Л ш^у будет рассчитываться следующим образом:
Л ш0-(п) = дЛш0-(п - 1) + 775;(п)у^(п) (61)
Введение критерия момента обучения является несущественной корректировкой алгоритма обратного распространения ошибки, однако довольно эффективно для сохранения стабильности обучения. Кроме того, он предотвращает нежелательную остановку обучения в точке локального минимума на поверхности ошибок. [65]
Условие останова обучения задается как максимальное допустимое значение ошибки обучения или указанием количества эпох обучения.
Обобщенная блок-схема работы метода обратного распространения ошибки представлена на рисунке 16.
Для построения модели искусственной нейронной сети прямого распространения (персептрона) необходимо пройти несколько этапов. На первом этапе необходимо провести разметку исходных данных, то есть выделить входные и выходные параметры для обучения. На следующем шаге исходная выборка данных разбивается на обучающее и тестовое множества. Обучающее множество является набором примеров для процесса непосредственного обучения модели. Тестовое множество не принимает участие в обучении, а используется для проверки обобщающей способности модели.
Далее выбираются параметры архитектуры персептрона. Эти параметры включают в себя количество скрытых слоев и количество нейронов на них. Нет строгих правил, как именно подбирать параметры архитектуры нейронной сети. Однако существует риск переобучения в случае, например, слишком громоздких архитектур при малом количестве данных. Архитектура персептрона подбирается путем проведения компьютерных экспериментов.
На следующем этапе для всех нейронов выбирается функция активации, которая будет использоваться в модели (в рамках данной работы - логистическая), а также задается коэффициенты этой функции (в случае логистической параметр а - степень крутизны функции).
Затем производится настройка параметров метода обучения. Алгоритм обратного распространения ошибок включает в себя параметр скорости обучения, момента обучения, количества эпох обучения, максимальную ошибку обучения,
при которой пример считается распознанным, а также максимальную ошибку тестовой выборки.
Далее производится обучение путем корректировки весов на каждом этапе с использованием описанного метода градиентного спуска.
Обобщающий алгоритм обучения нейронной сети представлен на рисунке 17.
Начало
Рисунок 16 - Блок-схема алгоритма обратного распространения ошибки
Источник [53]
Основы искусственных нейронных сетей были разработаны У. Мак-Каллоком и У. Питтсом, которые первыми разработали математическую модель нейрона [86]. Большой вклад в развитие нейронных сетей был внесен такими учеными, как Н. Винер, Д. Хебб, Ф. Розенблатт [78, 93, 95].
Рисунок 17 - Обобщенная блок-схема процесса обучения ИНС Источник: [53]
В рамках многих современных исследований представлены высококачественные результаты краткосрочного прогнозирования социально-экономических показателей с использованием искусственных нейронных сетей. Например, в работе [51] продемонстрировано успешное применение нейронной сети для краткосрочного прогнозирования показателей российских инвестиций.
Авторы работы [4-5, 71] обосновали эффективность применения нейронных сетей в краткосрочном прогнозировании социально-экономических показателей на основании полученных результатов. В работе [17] исследуются влияние изменения параметров нейронных сетей в краткосрочном прогнозировании показателя инфляции. Авторы статьи [20] продемонстрировали эффективность использования
искусственных нейронных сетей при прогнозировании динамических процессов в сложных экономических системах.
У моделей прогнозирования на основе искусственных нейронных сетей есть ряд преимуществ, таких как:
- способность выявления сложных нелинейных зависимостей за счет способности к обобщению;
- адаптивность модели;
- масштабируемость;
- нечувствительность к качеству данных.
Однако, на создание таких моделей требуется много времени. Также существенным недостатком такой модели является то, что выявленные знания хранятся в виде весов, что приводит к сложности интерпретируемости полученных результатов.
Результат сравнения моделей. В результате изучения приведенных моделей можно сделать вывод о том, что описанные классы моделей эффективно применимы в задачах краткосрочного прогнозирования социально-экономических показателей, что подтверждается примерами решения подобных задач в рамках исследований современных авторов. Также рассмотренные модели имеют ряд достоинств, позволяющих получать модели адекватные исследуемым процессам. Кроме того, использование моделей в совокупности позволит компенсировать их выявленные недостатки. Однако построение всех отобранных классов моделей краткосрочного прогнозирования для каждого исследуемого показателя, а затем отбор наиболее релевантной ему, является слишком трудоемким и долгим процессом. Поэтому автором предлагается выполнить ранжирование отобранных моделей согласно сформированным ранее критериям, а именно вычислительной сложности, устойчивости и интерпретируемости.
2.2 Ранжирование моделей информационно-аналитической системы прогнозирования социально-экономических показателей России
Рассмотренные в рамках данного исследования модели обладают различным уровнем вычислительной сложности, устойчивости и интерпретируемости.
Вычислительная сложность (или асимптотическая сложность, или производительность) - это объем вычислений при реализации алгоритма должен обеспечивать его выполнение за разумное время и по возможности быть нетребовательным к ресурсам компьютера. [47] Для определения асимптотической сложности моделей краткосрочного прогнозирования используется нотация 0(f(x)) (нотация «О большое»). Данная нотация подразумевает подбор функции, определяющей степень ухудшения работы алгоритма при усложнении поставленной задачи. Для определения вычислительной сложности отобранных автором моделей краткосрочного прогнозирования социально-экономических показателей, были использованы функции 0(f(x)), описанные авторами библиотеки «Scikit-learn», реализованной на языке программирования python, [94]. Данные функции представлены в таблице 2. Переменные m и n обозначают объем входных данных (длину ряда данных) и количество факторов соответственно (количество факторов для сравнения моделей задано равным шести, как максимальное количество факторов в рамках данной работы); М означает количество регрессионных деревьев в модели случайного леса (для сравнения моделей задано равным семи, как максимальное количество деревьев в модели случайного леса в рамках данной работы), h - количество нейронов на скрытых слоях (для сравнения моделей задано равным двадцати, как максимальное количество скрытых нейронов в рамках данной работы), к - число скрытых слоев (равен двум, так как все нейронные сети в рамках данной работы имеют не более двух скрытых слоев); о - количество выходных нейронов (равен единице, так как все нейронные сети в рамках данной работы имеют один выходной нейрон), i -количество эпох обучения (задано равным семидесяти, как максимальное
количество эпох обучения в рамках данной работы). На рисунке 17 представлен график функций 0(f(x)) из таблицы 2.
Таблица 2 - Функции 0(/(х)) для рассматриваемых моделей краткосрочного прогнозирования социально-экономических показателей.
Название модели Функция 0(f(x))
Модели временных рядов 0(т2)
Регрессионные модели 0(п* т2)
Модели нейронных сетей 0(т * п* hk * о * i)
Модели и методы на базе классификационно-регрессионных (CART) деревьев 0(т2 *п* \ogrn)
Модели случайного леса 0(М *т2 * \ogrn)
Модели градиентного бустинга 0(М *т2 *т)
Источник: разработано автором на основе [94]
На рисунке 18 отображается зависимость количества вычислительных операций относительно длины ряда данных. Так как в работе осуществляется краткосрочное прогнозирование в условиях малых объемов данных, то показатель длины ряда рассматривается в пределах от нуля до сорока. При изучении рисунка 18 можно заметить, что на заданном интервале длины исходного ряда данных наибольшую вычислительную сложность имеет модель нейронной сети. Случайный лес является второй по величине вычислительной сложности.
Таким образом, модели краткосрочного прогнозирования социально-экономических показателей при заданных максимальных значениях их параметров, установленных в работе, могут быть упорядочены согласно их вычислительной сложности следующим образом:
- модели временных рядов;
- модели линейной регрессии;
- модели регрессионных деревьев решений;
- модели случайного леса;
модели градиентного бустинга; модели нейронных сетей.
8000000 -
......Регрессионное дерево решений Нейронная сеть
— — Случайный лес Градиентный бустинг
Рисунок 18 - График функций 0(f(x)) для рассматриваемых классов моделей краткосрочного прогнозирования социально-экономических показателей.
Источник: разработано автором на основе [94]
Однако, кроме вычислительной сложности моделей краткосрочного прогнозирования социально-экономических показателей, необходимо учитывать их устойчивость.
Устойчивость рассматриваемых моделей означает обеспечение достижения достоверных результатов даже при низком качестве исходных данных, наличии в них шумов, аномалий и противоречий. [47] Оценка устойчивости модели включает в себя анализ точности и качества результатов прогнозирования при варьировании одного или двух входящих в модель факторов. На основании экспериментальных вычислений автора, работ [14, 77] была оценена устойчивость рассмотренных моделей краткосрочного прогнозирования. Модели краткосрочного
прогнозирования социально-экономических показателей демонстрирует чувствительность моделей временных рядов и множественной линейной регрессии к качеству данных и частой смене тенденций, что делает их менее устойчивыми по отношению к остальным. Модели регрессионных деревьев решений менее чувствительны к качеству данных в силу особенностей алгоритма их построения, основанных на разбиении исходного набора данных. Однако они обладают склонностью к переобучению, что также снижает их устойчивость. [47] Наиболее устойчивыми моделями краткосрочного прогнозирования рассматриваемых показателей являются модели нейронных сетей, модели градиентного бустинга и модели случайного леса. Модели случайного леса и градиентного бустинга являются более устойчивыми по сравнению с моделями временных рядов, множественной линейной регрессии и регрессионных деревьев решений, так как она основывается на ансамбле из нескольких деревьев решений. В случае моделей случайного леса каждое регрессионное дерево обучается на случайной подвыборке данных и с использованием случайного подмножества признаков. При использовании модели градиентного бустинга каждое новое дерево обучается с учетом ошибок модели дерева, полученного на предыдущем этапе обучения. Это позволяет снизить переобучение рассматриваемых моделей и улучшить их точность и качество. Устойчивость нейронных сетей обусловлена особенностями представления информации в виде распределенных активаций нейронов на различных слоях сети. Это означает, что информация распределена по нескольким нейронам, а не зависит от одного конкретного элемента. Таким образом, по критерию устойчивости модели могут быть упорядочены в порядке степени устойчивости:
- градиентный бустинг, нейронные сети и случайный лес, имеющие одинаково высокий уровень устойчивости,
- регрессионные деревья решений,
- модели временных рядов и модели линейной регрессии, имеющие одинаково низкий уровень устойчивости,
Помимо устойчивости и вычислительной сложности еще одним важным требованием к модели краткосрочного прогнозирования социально-экономических процессов является ее интерпретируемость.
Интерпретируемость модели краткосрочного прогнозирования рассматриваемых показателей - это способность понимать и объяснять принципы работы и оценивать степень вклада каждого фактора в результат. Модели временных рядов и модели линейной регрессии являются легко интерпретируемыми, так как имеют вид линейного уравнения, которое легко объясняет выявленные зависимости.
Регрессионные деревья решений также хорошо интерпретируемы, так как представляют собой набор правил «если..., то...», на основе которых легко определить влияние каждого фактора в модели на результат. Однако дерево может иметь сложную структуру, поэтому интерпретирование полученных зависимостей требует больше усилий, чем в линейных моделях. Самую низкую степень интерпретируемости имеют модели случайного леса, градиентного бустинга и нейронной сети. Слабая интерпретируемость случайного леса вызвана тем, что обучение входящих в него регрессионных деревьев решений производится с использованием случайно выбранных подвыборок и влияющих факторов. Модель градиентного бустинга также является ансамблем из множества регрессионных деревьев решений. Каждое дерево вносит свой вклад в итоговое предсказание, и когда количество деревьев велико, становится сложно интерпретировать степень влияния каждого дерева на конечный результат. Это делает модель менее прозрачной по сравнению с простыми моделями, такими как линейная регрессия, где влияние каждого признака легко оценить.
Низкая степень интерпретируемости модели нейронных сетей вызвана тем, что информация о влиянии факторов на результат представлена в форме матрицы весов, из которой сложно выявить выявленные моделью зависимости в изучаемых процессах.
Таким образом, по уровню интерпретируемости исследуемые модели можно упорядочить по убывания степени интерпретируемости:
- модели временных рядов и модели линейной регрессии, одинаково легко интерпретируемы,
- модели регрессионных деревьев решений,
- модели случайного леса, градиентного бустинга и нейронной сети, одинаково сложно интерпретируемы.
По результатам изучения различных способов ранжирования рассматриваемых классов моделей автором составлена итоговая таблица рангов. В ней по каждому рассматриваемому критерию, а именно вычислительная сложность, устойчивость и интерпретируемость, каждому классу модели присвоен ранг согласно присвоенному ему порядку в ранее приведенных упорядоченных по установленным критериям списках моделей. Если модели имели одинаковые места в списке, то ранг рассчитывался, как среднее арифметическое занимаемых ими мест. Например, если модели делили первое и второе место, то ранги этих моделей был равны одной целой пяти десятым (1.5). Результирующий ранг каждого класса моделей рассчитывается, как сумма рангов по всем критериям. Итоговые значения рангов представлены в таблице 3.
Таблица 3 - Значения рангов рассматриваемых моделей краткосрочного
прогнозирования социально-экономических показателей.
Модель В ычислительная сложность Устойчивость Интерпретируемость Сумма рангов
модель временных рядов 1 4.5 1.5 7
модель линейной регрессии 2 4.5 1.5 8
модель регрессионных деревьев решений 3 3 3 9
модель случайного леса 4 1.5 4.5 10
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.