Эффективные вычислительные методы прогнозирования финансовых потоков с использованием моделей временных рядов и анализа новостного фона тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Рябых Алексей Геннадьевич
- Специальность ВАК РФ00.00.00
- Количество страниц 171
Оглавление диссертации кандидат наук Рябых Алексей Геннадьевич
Введение
Глава 1. Прогнозирование налично-денежного потока с
использованием подходов локальных и глобальных
моделей
1.1 Введение
1.2 Связанные работы
1.3 Основные положения
1.4 Методология
1.4.1 Метрики
1.4.2 Процедура предобработки данных
1.4.3 Определение последней корректной истории
1.4.4 Обнаружение дней массовых выплат
1.4.5 Выбор и замена истории
1.4.6 Замена случайных выбросов
1.4.7 Подход локальной модели
1.4.8 Подход глобальной модели
1.5 Эксперименты
1.5.1 Данные
1.5.2 Результаты прогнозирования
1.5.3 Обсуждение результатов
1.5.4 Выводы
1.6 Заключение
Глава 2. Прогнозирование изменений потоков финансовой
ликвидности с использованием подхода к созданию
текстовых признаков на основе энтропии
2.1 Введение
2.2 Связанные работы
2.3 Методология
2.3.1 Измерения энтропии
2.3.2 Энтропийный подход к созданию признаков на уровне слов
2.3.3 Признаки, основанные на представлениях документов в
виде вероятностных тем
2.3.4 Признаки, основанные на контекстных векторных представлениях документов
2.3.5 Метрики
2.4 Данные и целевые переменные
2.4.1 Данные торговой активности фондового рынка и целевая переменная
2.4.2 Данные налично-денежного обращения в банкоматной
сети и целевая переменная
2.4.3 Данные экономических новостей
2.4.4 Процедура предобработки текстовых данных
2.5 Эксперименты
2.5.1 Базовый набор признаков: эндогенные модели
2.5.2 Расширенный набор признаков: модели обогащённые признаками на основе контекстых векторных представлений
2.5.3 Энтропийный подход к генерации текстовых признаков: модели обогащённые признаками на основе энтропии
2.5.4 Процедура оценки
2.6 Обсуждение численных результатов
2.6.1 Предсказание изменений объемов торгов на фондовом
рынке
2.6.2 Предсказание изменений объемов снятий в налично-денежном обращении
2.7 Заключение
Глава 3. Прогнозирование направлений движения фондового рынка с использованием подходов мульти-модальных
тематических моделей
3.1 Введение
3.2 Связанные работы
3.3 Методология
3.3.1 Процедура предобработки данных
3.3.2 Тематическое моделирование
3.3.3 Определение тональности тем на основе тональности входящих в нее слов
3.3.4 Тональный тематический поток
3.3.5 Индекс БТТМ
3.4 Данные
3.4.1 Данные котировок акций на фондовом рынке
3.4.2 Данные экономических новостей
3.4.3 Процедура предобработки текстовых данных
3.5 Метрики
3.5.1 Тест причинности Грейнджера
3.5.2 Коэффициент Шарпа и годовая доходность
3.6 Эксперименты
3.6.1 БТТМ
3.6.2 БЕБТМ
3.6.3 Методы обработки текста на основе контекстых векторных представлений
3.6.4 Эндогенные модели
3.6.5 Процедура оценки
3.7 Численные результаты
3.7.1 Тесты причинности по Грейнджеру
3.7.2 Эффективность стратегии еженедельной торговли
3.8 Обсуждение
3.8.1 Тесты причинности по Грейнджеру
3.8.2 Эффективность стратегии еженедельной торговли
3.9 Заключение
3.10 Границы применимости предложенного метода
Заключение
Список литературы
Список рисунков
Список таблиц
Приложение А
А.1 Финансовые новости торгового терминала Московской Биржи . . 142 А.2 Качественный анализ тематического моделирования российских
экономических новостей
А.3 Статистики текстовых данных крупнейших русскоязычных медиа
А.4 Тематическое моделирование: определение количества тем .... 150 А.5 Тематическое моделирование: сравнение тематических профилей новостей национальных медиа и торгового терминала
Московской Биржи
А.6 Модель БТТМ: иллюстрации
А.7 Модель БЕБТМ: частотность и тональность
А.8 Таблицы с результатами тестов причинности по Грейнджеру
Приложение Б
Б.1 Неагрегированные численные результаты прогнозирования
изменений потоков финансовой ликвидности
Б.2 Статистики текстовых данных крупнейших русскоязычных медиа
Б.3 Тематическое моделирование: определение количества тем
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Организация и регулирование наличного денежного обращения в РФ на современном этапе2003 год, кандидат экономических наук Комракова, Ирина Львовна
Современные финансовые инструменты экономики России: с использованием золота2008 год, доктор экономических наук Бауэр, Владимир Петрович
Развитие операционного механизма денежно-кредитной политики Банка России в условиях инфляционного таргетирования2025 год, кандидат наук Аниканов Ефим Игоревич
Оценка компаний: Опыт США и российская специфика2001 год, кандидат экономических наук Ширинян, Армен Рубенович
Моделирование кривой бескупонных доходностей и её динамики на российском рынке государственных облигаций2026 год, кандидат наук Макушкин Михаил Сергеевич
Введение диссертации (часть автореферата) на тему «Эффективные вычислительные методы прогнозирования финансовых потоков с использованием моделей временных рядов и анализа новостного фона»
Введение
Актуальность темы. Прогнозирование финансовых потоков играет важную роль для финансовых организаций, банков и трейдеров во всём мире. Ключевыми направлениями в этой сфере являются:
1. Прогнозирование налично-денежного потока, позволяющее оптимизировать управление сетью банкоматов, минимизировать затраты на инкассацию и фондирование избыточных денежных остатков, а также повысить уровень обслуживания клиентов, и сохранить стабильность налично-денежного обращения в периоды «черных лебедей» и структурных шоков в экономике [1—4]
2. Прогнозирование изменений потоков финансовой ликвидности, необходимое для управления рисками, выполнения регуляторных требований и обеспечения стабильной работы финансовых организаций и их способности выполнять обязательства [5—9]
3. Прогнозирование направлений движения фондового рынка, которое позволяет инвесторам и трейдерам принимать обоснованные решения, минимизировать риски и разрабатывать эффективные инвестиционные стратегии [10; 11]
Большинство задач прогнозирования финансовых потоков сводятся к прогнозированию множественных стохастических временных рядов, что делает эту область значимой как для теории, так и для практики. Современные исследования показывают, что методы машинного обучения (МЬ) могут превосходить традиционные статистические подходы в задачах прогнозирования временных рядов [12]. В частности, глобальные модели [13] демонстрируют высокую эффективность благодаря учёту сложных взаимосвязей между временными рядами, что обеспечивает лучшее качество прогнозов по сравнению с классическими методами. Эти подходы доказали свою состоятельность, включая победу в знаменитом соревновании М4 [14]. Однако, несмотря на эти успехи, внедрение глобальных моделей сопряжено с рядом проблем, включая их высокую чувствительность к качеству данных, что подчёркивает необходимость разработки процедур предварительной обработки данных.
Одним из преимуществ современных моделей машинного обучения является их способность обрабатывать большие объёмы сложной информации, поступающей из различных источников. За последнее десятилетие объём неструктурированных данных значительно вырос [15], и текстовые данные, среди них, стали ценным источником информации для решения широкого спектра задач — от оценки рисков [16] до анализа качества банковских услуг [17]. Несмотря на это, универсальные подходы, способные эффективно интегрировать данные разной природы, включая временные ряды и текстовые данные, остаются слабо изученными. Для финансовой области одной из ключевых проблем мульти-модальных моделей является их низкая интерпретируемость. При этом автоматизированные и одновременно интерпретируемые способы работы с текстовыми данными в задачах прогнозирования временных рядов практически не находят отражения в актуальных обзорах литературы [18—20].
В связи с этим представляется актуальным разработка универсальных вычислительных методов прогнозирования финансовых потоков с использованием эффективных процедур предобработки данных, подходов к построению глобальных моделей, а также моделей способных интегрировать временные ряды и текстовые данные, сохраняя при этом высокую степень интерпретируемости. Эти направления способствуют решению важнейших задач финансового сектора, обеспечивая его стабильность и развитие.
Степень разработанности темы. Прогнозирование спроса на наличные деньги в банкоматной сети является актуальной задачей для исследователей по всему миру, что подтверждается значительным количеством работ, основанных на данных конкурса NN5 [21—26]. Участникам конкурса предлагалось прогнозировать ежедневный клиентский спрос на наличные средства, что стало эталоном для сравнения различных методов прогнозирования. Однако большинство существующих работ не учитывает ключевые особенности реальных данных банкоматной сети, такие как нестационарность и прерывистость клиентского спроса, а также влияние внешних событий, что значительно усложняет адаптацию предложенных методов к условиям реального сектора экономики. Кроме того, упомянутые исследования избегают использования подходов глобальных моделей, несмотря на их потенциальную эффективность. Ещё одной важной особенностью является полное отсутствие в указанных работах использования неструктурированных текстовых данных, которые представляют собой
ценный источник дополнительной экзогенной информации и могут существенно повысить точность и надёжность прогнозов.
Прогнозирование потоков финансовой ликвидности также является предметом активных исследований. Ранние работы сосредоточены на изучении таких аспектов ликвидности, как структура рынка [27], её влияние на способность компаний привлекать внешние средства [28] и ограничения, накладываемые ликвидностью на поведение людей в области сбережений [29]. Однако эти исследования в основном фокусируются на экономической природе ликвидности, не затрагивая моделирование её потоков. В то же время более поздние работы пытаются описать и измерить ликвидность с помощью эконометрических моделей, таких как СЛИСЫ [30], и алгоритмов машинного обучения [8]. Однако использование неструктурированных данных в подобных исследованиях остаётся крайне ограниченным. Проблемы эффективной предобработки текстовых данных и оптимальной генерации признаков для задач прогнозирования финансовой ликвидности по-прежнему остаются значительными вызовами, требующими дальнейших исследований.
Прогнозирование направления движения фондового рынка — одна из самых сложных задач в финансовой аналитике, что объясняется высокой вола-тильностью котировок акций и множеством влияющих факторов. Несмотря на утверждения гипотезы эффективного рынка (ЕМЫ) [31; 32], что вся доступная информация уже отражена в ценах, современные исследования показывают, что сочетание технического и фундаментального анализа с методами машинного обучения может эффективно прогнозировать рыночные тренды [10; 11]. Технический анализ сосредоточен на изучении исторических данных и трендов цен, тогда как фундаментальный анализ оценивает внутреннюю стоимость активов, принимая во внимание такие показатели, как выручка, прибыль и другие аналитические данные. Оба подхода всё чаще используют внешние источники информации, такие как неструктурированные текстовые данные, включая финансовые новости. Эти данные помогают инвесторам минимизировать риски и принимать более обоснованные решения. При этом большинство подходов, использующих финансовые новости как источник информации, опираются на методы поверхностных признаков и контекстных векторных представлений, которые в свою очередь применяются для построения предиктивных моделей рыночных трендов. Однако эти подходы страдают низкой интерпретируемостью:
трудно объяснить, почему модель обучилась определённым эмбеддингам слов и как они повлияли на конечный результат. Такая непрозрачность затрудняет использование подобных моделей в практическом применении для инвесторов. Вероятностные тематические модели, напротив, обеспечивают высокую интерпретируемость за счёт генерации тем, которые можно легко интерпретировать на основе наиболее вероятных слов. Однако в контексте прогнозирования движения фондового рынка такие модели практически не исследованы, что создаёт перспективное направление для дальнейших исследований и разработок.
Целью данной работы является разработка и исследование эффективных вычислительных методов прогнозирования финансовых потоков, которые объединяют анализ временных рядов и текстовых данных. Особое внимание уделено учёту специфики данных из реального экономического сектора, применению глобальных моделей, их устойчивости к внешним макроэкономическим шокам, а также интеграции текстовых данных для повышения точности прогнозов и обеспечения их интерпретируемости.
Для достижения поставленной цели необходимо было решить следующие задачи:
1. Исследовать проблему нестационарности данных в задаче прогнозирования спроса на наличные деньги в банкоматной сетри и разработать эффективную процедуру предобработки данных для её решения. Кроме этого, разработать локальные и глобальные модели машинного обучения для прогнозирования спроса на наличные деньги в банкоматной сети, а также доказать их эффективность по сравнению с существующими подходами, специально применяемыми для прогнозирования спроса на наличные деньги
2. Разработать подход к формированию признаков на основе новостных сообщений, позволяющий учитывать события, отражённые в новостях, при решении задач прогнозирования изменений в потоках финансовой ликвидности, и доказать его эффективность для прогнозирования объёмов снятий в налично-денежном обращении и объемов торгов на фондовом рынке, с возможностью обобщения подхода на другие сферы финансового сектора
3. Разработать мульти-модальную модель, объединяющую временные ряды и текстовые данные, не требующую использования специализиро-
ванных словарей и обладающую возможностью адаптивной настройки для отдельных временных рядов котировок акций. Обеспечить повышение точности и интерпретируемости прогнозов, а также доказать ее эффективность в задачах прогнозирования направлений движения фондового рынка, максимизации прибыли торговых стратегий и решении других задач финансовой аналитики
Научная новизна:
1. Разработаны локальные и глобальные модели (с новой схемой дообучения) машинного обучения для прогнозирования спроса на наличные деньги в банкоматной сети, включающие эффективную процедуру предобработки данных для решения проблемы нестационарности, которая до этого не рассматривалась в соотвествующей литературе. Доказана их эффективность по сравнению с существующими подходами, специально применяемыми для прогнозирования спроса на наличные деньги, а также по сравнению с классическими подходами к прогнозированию временных рядов. Кроме того, исследована зависимость между падением качества и горизонтом прогнозирования, а также стабильность качества моделей при появлении «черных лебедей», таких как СОУГО-19
2. Предложен подход к формированию текстовых признаков на основе новостных сообщений, использующий различные уровни абстракции текста (от частотности слов и вероятностных тем до контекстных эм-беддингов) для задач прогнозирования изменений в потоках финансовой ликвидности. Доказана эффективность подхода для прогнозирования объёмов торгов на фондовом рынке и объёмов снятий наличных средств в налично-денежном обращении, чему не посвящено ни одного исследования в настоящее время, особенно для развивающихся рынков
3. Разработана мульти-модальная тематическая модель, объединяющая временные ряды и текстовые данные, не требующая использования специализированных словарей и обладающая высокой степенью адаптивности для анализа отдельных временных рядов. Модель демонстрирует большую интерпретируемость и точность прогнозов, в сравнении с существующими методами, что подтверждено в задачах прогнозирования направлений движения фондового рынка и оптимизации торговых стратегий
Теоретическая и практическая значимость. Во-первых, задачи прогнозирования налично-денежного потока имеют критическое значение для банковского сектора. Оптимизация инкассационных операций позволяет существенно сократить затраты на обслуживание банкоматов, минимизировать фондирование избыточных денежных остатков и обеспечить высокий уровень обслуживания клиентов. Однако существующие коммерческие решения в этой области имеют ряд ограничений, включая высокую стоимость, закрытость алгоритмов и низкую интерпретируемость результатов. В работе уделено внимание разработке локальных и глобальных моделей прогнозирования спроса на наличные средства, что открывает новые возможности для создания адаптивных и высокоэффективных систем управления наличностью. Во-вторых, прогнозирование изменений потоков финансовой ликвидности представляет собой ключевую задачу в управлении рисками. Умение предсказывать скачки ликвидности на рынке и объёмы торгов позволяет финансовым организациям лучше адаптироваться к изменяющимся условиям. Неструктурированные текстовые данные, такие как бизнес-новости, могут содержать значимую информацию для анализа таких изменений. В настоящей работе предложен новый подход к созданию текстовых признаков, основанный на энтропии и методах сокращения размерности, что обеспечивает высокую интерпретируемость результатов и применимость для различных задач прогнозирования. Предложенный подход позволяет учитывать как систематические изменения в ликвидности, так и неожиданные шоки, вызванные внешними факторами. В-третьих, прогнозирование направлений движения фондового рынка остаётся одной из самых сложных и актуальных задач в финансовой области. Высокая волатильность рынков и нестабильность котировок требуют применения методов, которые могут объединить числовые и текстовые данные для получения более точных и интерпретируемых прогнозов. В рамках работы разработан подход, использующий мульти-модальное тематическое моделирование для анализа новостного фона и его влияния на фондовый рынок. Данный подход не только улучшает точность прогнозов, но и позволяет формировать эффективные инвестиционные стратегии, что подтверждается результатами эмпирических исследований. Таким образом, диссертация отвечает на ряд практических и теоретических вызовов, связанных с прогнозированием финансовых потоков. Предложенные методы имеют высокую степень универсальности, что делает их пригодными
для применения в различных областях финансового сектора, включая управление наличностью, мониторинг и стрес-тестирование потоков ликвидности и разработку инвестиционных стратегий. Это подчёркивает значимость работы как с научной, так и с прикладной точки зрения.
Методология и методы исследования. Результаты диссертационной работы были получены с использованием методов и моделей, применяемых для прогнозирования финансовых потоков на основе анализа временных рядов и текстовых данных. Основу методологии составляют интеграция данных различной природы, разработка вычислительных алгоритмов и их эмпирическая проверка на данных реального сектора российской экономики. Математическую и вычислительную основу работы составляют: теория вероятностей и математическая статистика, применяемые для анализа временных рядов, построения прогнозных моделей и оценки их качества, методы линейной алгебры и математического анализа, использованные при разработке моделей и алгоритмов, а также методы обработки текстов на естественном языке применяемые для анализа и извлечения предиктивных сигналов из экономического новостного фона.
Основные положения, выносимые на защиту:
1. Процедура предобработки данных, решающая проблему нестационарности реальных данных банкоматной сети в задаче прогнозирования спроса в налично-денежном обращении
2. Подходы к построению локальных и глобальных моделей машинного обучения предсказания временных рядов клиентских снятий в банко-матной сети с процедурой дообучения глобальных моделей по квантилям объема спроса
3. Энтропийный подход к формированию признаков на основе новостных сообщений, основанный на различных типах энтропий и уровнях абстракции текста (частотность слов, ТР-ГОР, вероятностные темы, контекстные эмбеддинги), позволяющий учитывать события из новостей и повышать качество прогнозирования изменений в потоках финансовой ликвидности в областях налично-денежного обращения и фондового рынка
4. Тематическая модель (БТТМ), предназначенная для оценки взаимосвязи между потоком финансовых новостей и ценами акций с целью макси-
мизации прибыли трейдера, обеспечивающая улучшение качества прогнозов, высокую интерпретируемость результатов, не требующая специализированных словарей и обладающая возможностью адаптации к отдельным временным рядам котировок акций
Достоверность. Эффективность предложенных в работе методов прогнозирования финансовых потоков, в сравнении с существующими подходами, представленными в литературе, подтверждена экспериментально на обширных наборах данных, охватывающих два ключевых сектора российской экономики за значительный период времени.
Апробация работы. Результаты работы докладывались на следующих мероприятиях:
1. Научный семинар "Foundations of Data Science", Апрель, 2021, Сколковский институт науки и технологий
2. Конференция по анализу данных и технологиям искусственного интеллекта "Data Fusión", Март, 2021, Москва, секция: «Временные ряды в экономике»
3. Конференция по анализу данных и технологиям искусственного интеллекта "Data Fusión", Апрель, 2022, Москва, секция: «Повышение эффективности в NLP»
Личный вклад. Вклад автора в исследования, описанные в данной диссертации, заключается в следующем:
1. В статье "ATM Cash Flow Prediction Using Local and Global Model Approaches in Cash Management Optimization" [33] автор предложил процедуру предобработки данных, решающую проблему нестационарности реальных данных банкоматной сети, а также подходы к построению локальных и глобальных моделей прогнозирования. Вместе с соавторами провел эксперименты, интерпретировал результаты и подготовил текст статьи.
2. В работе "STTM: an efficient approach to estimating news impact on stock movement direction" [34] автор предложил эффективную мульти-модаь-ную модель на основе техник тематического моделирования для задачи предсказания направления движения фондового рынка, разработал методику оценки предложенного метода, провел эксперименты и интер-
претировал их результаты. Автор подготовил текст статьи и все его правки.
3. В работе "Entropy-based text feature engineering approach for forecasting financial liquidity changes" [35] автор предложил обобщение энтропийного подхода к генерации признаков на различные уровни абстракции текста, а также экспериментальную методику оценки подхода и участвовал в проведении экспериментов. Совместно с соавторами автор подготовил текст статьи и его правки.
Публикации. Основные результаты по теме диссертации изложены в следующих работах:
1. Aleksei Riabykh, Ilias Suleimanov, Denis Surzhko, Maxim Konovalikhin, Vladimir Ryazanov. "ATM Cash Flow Prediction Using Local and Global Model Approaches in Cash Management Optimization" [33]. Работа опубликована в Pattern Recognition and Image Analysis (Том 32, страницы 803-820, 2022)
2. Aleksei Riabykh, Denis Surzhko, Maxim Konovalikhin, Sergei Koltcov. "STTM: an efficient approach to estimating news impact on stock movement direction" [34]. Работа опубликована в PeerJ Computer Science (Том 8, e1156, 2022).
3. Aleksei Riabykh, Ilias Suleimanov, Ilya Nagovitcyn, Denis Surzhko, Maxim Konovalikhin, Olessia Koltsova. "Entropy-based text feature engineering approach for forecasting financial liquidity changes" [35]. Работа опубликована в EPJ Data Science (Том 14, выпуск 1, начальная страница 17, 2025)
Кроме того, отметим патенты, основанные на результатах данной работы:
1. Aleksei Riabykh, Denis Surzhko, Maxim Konovalikhin, Vadim Kulik «(RU) Способ классификации тональности текстового документа и определения влияния текстового документа на изменение объекта» [36], Евразийское патентное ведомство (ЕАПВ), 2023.
Объем и структура работы. Диссертация состоит из введения, трех глав, заключения и двух приложений. Полный объём диссертации составляет 171 страницу с 69 рисунками и 26 таблицами. Список литературы содержит 92 наименования.
Глава 1. Прогнозирование налично-денежного потока с использованием подходов локальных и глобальных моделей
Оптимизация управления налично-денежными средствами — одна из ключевых задач для любого банка, работающего в реальном секторе экономики, так как она позволяет существенно экономить затраты на фондирование неизрасходованных денежных средств в банкоматах и на их инкассацию. Эта глава сосредоточена на прогнозировании спроса клиентов банка на наличные деньги, которое является одним из основных компонентов системы оптимизации. Впервые рассматривается проблема нестационарности, характерная для данных реальных банкоматов, и предлагается процедура предобработки данных для ее решения. Кроме того предлагаются новые методы прогнозирования в парадигмах локальных и глобальных моделей, а также доказывается их эффективность в сравнении с классическими подходами к прогнозированию временных рядов и методами, специально применяемыми для прогнозирования спроса на наличные деньги.
1.1 Введение
Одной из ключевых задач, которую банки должны решить при выходе на рынок наличного денежного обращения, является создание оптимальной системы рекомендаций для инкассационных услуг. Эта система должна включать указание даты, времени и суммы наличных денег для загрузки или выгрузки в каждом конкретном банкомате. Оптимальные рекомендации должны минимизировать затраты на фондирование неизрасходованных денежных средств (остатков) и на выезды инкассационной службы. Более того, инкассационные рекомендации также должны соответствовать бизнес-ограничениям по уровню сервиса обслуживания клиентов (время простоя банкоматов из-за отсутствия наличных денег не должно превышать заранее заданные величины).
Для практической реализации упомянутой системы рекомендаций необходимо моделировать спрос клиентов на наличные деньги. Чем лучше банк по-
Рисунок 1.1 — Примеры банкоматов различных типов
нимает будущие потребности клиентов в наличных деньгах, тем оптимальнее можно организовать процесс инкассаций, что уменьшает вероятность нехватки наличных денег в каждом банкомате. Моделирование спроса осложняется большим количеством различных типов банкоматов (Рис. 1.1).
Такую систему можно приобрести как рыночное решение у специализированных компаний: NCR, KAL или BPC. Однако эти решения обладают высокой стоимостью, закрытым исходным кодом, значительным влиянием аналитиков на процесс прогнозирования и зачастую низким качеством прогноза спроса на наличные деньги. В то же время бизнесу необходимы автоматизированные процессы, высокая интерпретируемость, сравнимая с подходами с участием аналитиков, и возможность корректировки алгоритмов. Таким образом, часто оказывается правильным решением разрабатывать собственные алгоритмы прогнозирования спроса клиентов на наличные деньги.
Теперь мы проиллюстрируем основные особенности задачи прогнозирования на основе исторических данных снятий наличных денег. Ось X соответствует времени, измеренному в днях, а ось Y — дневным объемам снятия наличных денег. Начнем с примера банкомата, который за всю историю работы функционирует в нормальном режиме и демонстрирует стандартные процессы движения денежных средств (Рис. 1.2). На рисунке можно увидеть временной ряд с ярко выраженной еженедельной, ежемесячной и годовой сезонностью, днями массовых выплат (дни выплат заработной платы и авансов), небольшим растущим трендом, связанным с инфляцией, а также характерным спадом объемов снятия наличных денег во время пандемии COVID-19.
Еще один пример эффективно работающего банкомата иллюстрирует влияние места расположения банкомата на паттерны спроса клиентов (Рис. 1.3). В
о -
2019-01 2019-05 2019-09 2020-01 2020-05 2020-09 2021-01 2021-05 2021-09
Рисунок 1.2 — Пример «почти идеального» процесса снятий наличных денег в
банкомате
этом случае, помимо еженедельной, ежемесячной и годовой сезонности, наблюдаются циклы, связанные с учебными семестрами и праздниками, поскольку данный банкомат расположен в одном из учебных заведений Москвы.
2019-01 2019-04 2019-07 2019 10 2020-01 2020 04 2020-07 2020 10 2021-01 2021-04
Рисунок 1.3 — Пример банкомата, расположенного в учебном заведении
Кроме того, во временных рядах внесений и снятий наличных денег клиентами встречается множество аномальных значений различной природы. Эти аномалии могут быть случайными выбросами, обусловленными аномальным пиковым спросом клиентов (Рис. 1.4), или регулярными паттернами, связанными с днями выплаты заработной платы сотрудникам компаний, расположенных рядом с банкоматами (Рис. 1.5). В такие дни спрос может возрастать до 15-30 средних значений временного ряда, особенно если регулярный оборот наличных денег в устройстве низкий. Важно различать случайные выбросы и регулярные закономерности: случайные выбросы приводят к переобучению моделей прогнозирования, а неверное моделирование массовых выплат ведет к дополнительным затратам на фондирование неизрасходованных остатков денежных средств или их дефициту, что в свою очередь может негативно сказаться на репутации банка.
Рисунок 1.4 — Пример банкомата с большим количеством стохастических
аномалий клиентского спроса
Рисунок 1.5 — Пример банкомата с большим количеством аномалий, связанных с днями выплат заработной платы
Еще одним важным моментом является то, что банкоматы подвержены различным поломкам, которые могут привести к ситуациям, когда банкоматы физически не могут выдавать или принимать наличные деньги. В отличие от простоя банкоматов, вызванного нехваткой наличных денег, что является для нас качественным параметром системы оптимизации, вынужденный простой является ситуацией, при которой фактический клиентский спрос не был полностью реализован в истории внесений или снятий. Дни с такими поломками вносят искажения в данные, влияющие на процесс моделирования. В связи с этим на графике мы отмечаем зелёным цветом дни, когда вынужденный простой составил от 0 до 30% от рабочего времени банкомата, жёлтым — от 30% до 80% включительно, а красным — более 80% (Рис. 1.6). На рисунке наблюдается корреляция между продолжительностью простоя и падением клиентского спроса. Однако есть дни, когда клиентский спрос остаётся практически неизменным при простое банкомата более 80% и наоборот. С другой стороны, если простой составляет менее 30%, мы можем наблюдать спрос, близкий к нулю.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Управление инвестициями и прогнозирование динамики фондового рынка на основе алгоритмов ассоциативного поиска2010 год, кандидат технических наук Валиахметов, Равиль Талгатович
Механизмы и инструменты взаимодействия денежно-кредитного и реального секторов экономики2014 год, кандидат наук Акинина, Валентина Петровна
Развитие рынка платежных карт в российской экономике2013 год, кандидат наук Бикмаев, Шамиль Ряисович
Методология и механизмы денежного обращения в России2008 год, доктор экономических наук Семенов, Сергей Константинович
Теневые финансовые доходы и инновационные банковские инструменты противодействия их легализации в России2009 год, кандидат экономических наук Морозов, Андрей Владимирович
Список литературы диссертационного исследования кандидат наук Рябых Алексей Геннадьевич, 2025 год
Список литературы
1. Serengil S., Ozpinar A. ATM Cash Flow Prediction and Replenishment Optimization with ANN. — 2019. — янв. — DOI: 10.29137/umagd.484670.
2. Arabani S. P., Komleh H. E. The improvement of forecasting atms cash demand of iran banking network using convolutional neural network // Arabian Journal for Science and Engineering. — 2019. — т. 44, № 4. — с. 3733—3743.
3. Atm cash prediction using time series approach / M. Rafi [и др.] // 2020 3rd International Conference on Computing, Mathematics and Engineering Technologies (iCoMET). — IEEE. 2020. — с. 1—6.
4. Lázaro J. L, Jiménez A. B., Takeda A. Improving cash logistics in bank branches by coupling machine learning and robust optimization // Expert Systems With Applications. — 2018. — т. 92. — с. 236—255.
5. De Meijer C. R., Limburg L. Intraday liquidity management and reporting: How to meet the challenges // Journal of Risk Management in Financial Institutions. — 2014. — Vol. 7, no. 4. — P. 395-408.
6. Soprano A. Liquidity Management: A Funding Risk Handbook. — 03.2015. — с. 1—191. — ISBN 9781118413999. — DOI: 10.1002/9781119087946.
7. Pflueger C. E., Viceira L. M. Return predictability in the Treasury market: real rates, inflation, and liquidity // Handbook of Fixed-Income Securities. — 2016. — с. 191—209.
8. Guerra P., Castelli M., Nadine C.-R. Machine learning for liquidity risk modelling: A supervisory perspective // Economic Analysis and Policy. — 2022. — Vol. 74. — P. 175-187.
9. Climenta F., Momparlerb A., Carmona P. Anticipating bank distress in the Eurozone: An Extreme Gradient Boosting approach // Journal of Business Research. — 2019. — т. 101. — с. 885—896.
10. Fundamentals of Institutional Asset Management / под ред. F. J. Fabozzi, F. A. Fabozzi. — World Scientific Publishing Co. Pte. Ltd., 2020. — ISBN 9789811221590.
11. Machine Learning in Finance: From Theory to Practice / под ред. M. F. Dixon, I. Halperin, P. Bilokon. — Springer International Publishing, 2020. — ISBN 978303410674.
12. Fu W., Chien C.-F., Lin Z.-H. A hybrid forecasting framework with neural network and time-series method for intermittent demand in semiconductor supply chain // IFIP International Conference on Advances in Production Management Systems. — Springer. 2018. — с. 65—72.
13. DeepAR: Probabilistic forecasting with autoregressive recurrent networks / D. Salinas [и др.] // International Journal of Forecasting. — 2020. — т. 36, № 3. — с. 1181—1191.
14. Smyl S. A hybrid method of exponential smoothing and recurrent neural networks for time series forecasting // International Journal of Forecasting. — 2020. — т. 36, № 1. — с. 75—85.
15. Balducci B., Marinova D. Unstructured data in marketing // Journal of the Academy of Marketing Science. — 2018. — т. 46, № 4. — с. 557—590.
16. Nopp C., Hanbury A. Detecting risks in the banking system by sentiment analysis // Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing. — 2015. — с. 591—600.
17. Leem B.-H., Eum S.-W. Using text mining to measure mobile banking service quality // Industrial Management & Data Systems. — 2021. — т. 121, № 5. — с. 993—1007.
18. Usmani S., Shamsi J. A. News sensitive stock market prediction: literature review and suggestions // PeerJ Computer Science. — 2021. — т. 7.
19. Jurczenko E. Machine Learning for Asset Management: New Developments and Financial Applications. // John Wiley & Sons Ltd. — 2020.
20. Shah Dev H. I., Zulkernine F. Stock Market Analysis: A Review and Taxonomy of Prediction Techniques // International Journal of Financial Studies. — 2019. — т. no. 2: 26.
21. Andrawis R. R., Atiya A. F., El-Shishiny H. Forecast combinations of computational intelligence and linear models for the NN5 time series forecasting competition // International journal of forecasting. — 2011. — т. 27, № 3. — с. 672—688.
22. Wichard J. D. Forecasting the NN5 time series with hybrid models // International Journal of Forecasting. — 2011. — t. 27, № 3. — c. 700—707.
23. A review and comparison of strategies for multi-step ahead time series forecasting based on the NN5 forecasting competition / S. B. Taieb [h gp.] // Expert systems with applications. — 2012. — t. 39, № 8. — c. 7067—7083.
24. Kamini V., Ravi V., Kumar D. N. Chaotic time series analysis with neural networks to forecast cash demand in ATMs // 2014 IEEE International Conference on Computational Intelligence and Computing Research. — IEEE. 2014. — c. 1—5.
25. Cash demand forecasting in ATMs by clustering and neural networks / K. Venkatesh [h gp.] // European Journal of Operational Research. — 2014. — t. 232, № 2. — c. 383—392.
26. K-means clustering with neural networks for ATM cash repository prediction / P. K. Jadwal [h gp.] // International Conference on Information and Communication Technology for Intelligent Systems. — Springer. 2017. — c. 588—596.
27. Grossman S., Miller M. Liquidity and market structure // The Journal of Finance. — 1988. — t. 43, № 3. — c. 617—633.
28. Myers S. C, Rajan R. G. The paradox of liquidity // The Quarterly Journal of Economics. — 1998. — t. 113, № 3. — c. 733—771.
29. Deaton A. Savings and liquidity constraints // Econometrica. — 1991. — t. 59, № 5. — c. 1221—1248.
30. Zhao W, Gao Y, Wang M. Measuring liquidity with return volatility: An analytical approach based on heavy-tailed Censored-GARCH model // The North American Journal of Economics and Finance. — 2022. — t. 62.
31. Fama E. F. Efficient capital markets: A review of theory and empirical work // The Journal of Finance. — 1970. — Mafi. — t. 25. — c. 383—417.
32. Fama E. F. Efficient Capital Markets: II // The Journal of Finance. — 1991. — geK. — t. 46. — c. 1575—1617.
33. ATM Cash Flow Prediction Using Local and Global Model Approaches in Cash Management Optimization / A. Riabykh [и др.] // Pattern Recognition and Image Analysis. — 2022. — дек. — т. 32, № 4. — с. 803—820. — DOI: 10.1134/S1054661822040113.
34. STTM: an efficient approach to estimating news impact on stock movement direction / A. Riabykh [и др.] // PeerJ Computer Science. — 2022. — т. 8. — e1156. — DOI: 10.7717/peerj-cs.1156.
35. Entropy-based text feature engineering approach for forecasting financial liquidity changes / A. Riabykh [и др.] // EPJ Data Science. — 2025. — т. 14. — с. 17. — DOI: 10.1140/epjds/s13688-025-00535-z.
36. Патент EA044248 Евразийское патентное ведомство, МПК7 G06F 40/20. Способ классификации тональности текстового документа и определения влияния текстового документа на изменение объекта [текст] / А. Г. Рябых [и др.] (Евразийское патентное ведомство) ; П. Б. ВТБ ; патент. поверенный Котлов Д. В. — № 202390217 ; заявл. 04.08.2023 ; опубл. 02.08.2023, приоритет 30.12.2022 (Рос. Федерация). — 7 с.: ил. — URL: https: //patentscope.wipo.int/search/ru/detail.jsf?docId=EA406234139.
37. Nikolopoulos K. We need to talk about intermittent demand forecasting // European Journal of Operational Research. — 2021. — т. 291, № 2. — с. 549— 559.
38. Kovacs L, Vass D., Vidacs A. Improving quality of service parameter prediction with preliminary outlier detection and elimination // Proceedings of the second international workshop on inter-domain performance and simulation (IPS 2004), Budapest. т. 2004. — Citeseer. 2004. — с. 194—199.
39. Time-series anomaly detection service at microsoft / H. Ren [и др.] // Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. — 2019. — с. 3009—3017.
40. Multidimensional Time Series Anomaly Detection: A GRU-based Gaussian Mixture Variational Autoencoder Approach / Y. Guo [и др.] // Proceedings of The 10th Asian Conference on Machine Learning. т. 95 / под ред. J. Zhu, I. Takeuchi. — PMLR, 11.2018. — с. 97—112. — (Proceedings of Machine Learning Research).
41. Farkas K. CUSUM Anomaly Detection // Measurement Lab. — 2015. — c. 1— 25.
42. Barrow D., Kourentzes N. The impact of special days in call arrivals forecasting: A neural network approach to modelling special days // European Journal of Operational Research. — 2018. — t. 264, № 3. — c. 967—977.
43. Optimizing dynamic time warping's window width for time series data mining applications / H. A. Dau [h gp.] // Data mining and knowledge discovery. — 2018. — t. 32, № 4. — c. 1074—1120.
44. Regression analysis for ATM cash flow prediction / A. Rajwani [h gp.] // 2017 International Conference on Frontiers of Information Technology (FIT). — IEEE. 2017. — c. 212—217.
45. News impact on stock price return via sentiment analysis / X. Li [h gp.] // Knowledge-Based Systems. — 2014. — t. 69. — c. 14—23.
46. Technical analysis and sentiment embeddings for market trend prediction /
A. Picasso [h gp.] // Expert Systems with Applications. — 2019. — t. 135. — c. 60—70.
47. Machine learning for quantitative finance applications: A survey / F. Rundo [h gp.] // Applied Sciences. — 2019. — t. 9, № 24. — c. 5574.
48. Matsubara T, Akita R., Uehara K. Stock price prediction by deep neural generative model of news articles // IEICE TRANSACTIONS on Information and Systems. — 2018. — t. 101, № 4. — c. 901—908.
49. Stock market trend prediction using recurrent convolutional neural networks /
B. Xu [h gp.] // CCF international conference on natural language processing and Chinese computing. — Springer. 2018. — c. 166—177.
50. Stock trend prediction using news sentiment analysis / J. Kalyani, P. Bharathi, P. Jyothi [h gp.] // arXiv preprint arXiv:1607.01958. — 2016.
51. Li X, Wu P., Wang W. Incorporating stock prices and news sentiments for stock market prediction: A case of Hong Kong // Information Processing & Management. — 2020. — t. 57, № 5. — c. 102212.
52. Feuerriegel S., Prendinger H. News-based trading strategies // Decision Support Systems. — 2016. — t. 90. — c. 65—74.
53. Stock volatility prediction by hybrid neural network / Y. Wang [h gp.] // IEEE Access. — 2019. — t. 7. — c. 154524—154534.
54. Predicting the direction of stock markets using optimized neural networks with Google Trends / H. Hu [h gp.] // Neurocomputing. — 2018. — t. 285. — c. 188— 195.
55. Listening to chaotic whispers: A deep learning framework for news-oriented stock trend prediction / Z. Hu [h gp.] // Proceedings of the eleventh ACM international conference on web search and data mining. — 2018. — c. 261— 269.
56. Tan S. D., Tas O. Social Media Sentiment in International Stock Returns and Trading Activity // Journal of Behavioral Finance. — 2021. — t. 22, № 2. — c. 221—234. — DOI: 10.1080/15427560.2020.1772261.
57. Alanyali M, Moat H. S., Preis T. Quantifying the relationship between financial news and the stock market // Scientific reports. — 2013. — t. 3, № 1. — c. 1—6.
58. Quantifying the diversity of news around stock market moves / C. Curme [h gp.] // Chester Curme, Ying Daisy Zhuo, Helen Susannah Moat and Tobias Preis, Quantifying the diversity of news around stock market moves, Journal of Network Theory in Finance. — 2017. — t. 3, № 1. — c. 1—20.
59. Blei D., Ng A., Jordan M. Latent Dirichlet Allocation. // Journal of Machine Learning Research. — 2003. — t. 3. — c. 993—1022.
60. Boubaker S., Liu Z, Zhai L. Big data, news diversity and financial market crash // Technological Forecasting and Social Change. — 2021. — t. 168. — c. 120755. — DOI: https://doi.org/10.1016Zj.techfore.2021.120755. — URL: https://www.sciencedirect.com/science/article/pii/S0040162521001876.
61. Hendrickx J. Ballon P. R. H. Dissecting news diversity: An integrated conceptual framework // Journalism. — 2020. — t. 23, № 8. — c. 1751—1769.
62. Lad F., Sanfilippo G., Agro G. Extropy: Complementary Dual of Entropy // Statistical Science. — 2015. — t. 30, № 1. — c. 40—58. — DOI: 10.1214/14-STS430. — URL: https://doi.org/10.1214/14-STS430.
63. Blei D., Lafferty J. Dynamic topic models. // ICML 2006 - Proceedings of the 23rd International Conference on Machine Learning. — 2006. — hhb. — c. 113—120.
64. Bengio Y, Ducharme R., Vincent P. A neural probabilistic language model // Advances in neural information processing systems. — 2000. — t. 13.
65. S.Gopal, Patro K., Sahu K. K. Normalization: A Preprocessing Stage // ArXiv. — 2015. — t. abs/1503.06462. — URL: https://api.semanticscholar. org/CorpusID:16159835.
66. OECD. Data and Metadata Reporting and Presentation Handbook. — 2007. — c. 50. — DOI: https://doi.org/https://doi.org/10.1787/9789264030336-en. — URL: https://www.oecd-ilibrary.org/content/publication/9789264030336-en.
67. Roder M, Both A., Hinneburg A. Exploring the Space of Topic Coherence Measures. // WSDM 2015 - Proceedings of the 8th ACM International Conference on Web Search and Data Mining. — 2015. — c. 399—408.
68. Babu M. . S., Geethanjali D. N., Satyanarayana B. S. Clustering Approach to Stock Market Prediction // Int. J. Advanced Networking and Applications. — 2011. — t. 03. — c. 1281—1291.
69. Ke Z. T., Kelly B. T., Xiu D. Predicting Returns with Text Data // Economics Working Paper No. 2019-69, Yale ICF Working Paper No. 2019-10, Chicago Booth Research Paper No. 20-37. — 2020.
70. Loughran T, Mcdonald. B. Textual Analysis in Accounting and Finance: A Survey. // Journal of Accounting Research. — 2016. — t. 54. — c. 1187—1230.
71. Kim Y, Jeong S. R., Ghani I. Text Opinion Mining to Analyze News for Stock Market Prediction. // International Journal of Advances in Soft Computing and its Applications. — 2014. — t. 6.
72. Stock Prediction via Sentimental Transfer Learning / X. Li [h gp.] // IEEE Access. — 2018. — hoh6. — t. PP. — c. 1—1.
73. AffectiveSpace 2: Enabling affective intuition for concept-level sentiment analysis / E. Cambria [h gp.] // Proc. AAAI. — 2015. — hhb. — c. 508— 514.
74. Panchenko A. Sentiment Index of the Russian Speaking Facebook. //In Proceedings of the 20th International Conference on Computational Linguistics and Intellectual Technologies. — 2014.
75. PolSentiLex: Sentiment Detection in Socio-Political Discussions on Russian Social Media. / O. Koltsova [h gp.] //In book: Artificial Intelligence and Natural Language, 9th Conference, AINL. — 2020. — ceHT. — c. 1—16.
76. Thakkar A., Chaudhari K. Fusion in stock market prediction: A decade survey on the necessity, recent developments, and potential future directions // Information Fusion. — 2021. — t. 65. — c. 95—107.
77. Discovering Public Sentiment in Social Media for Predicting Stock Movement of Publicly Listed Companies / L. Bing [h gp.] // Information Systems. — 2017. — ^eBp. — t. 69.
78. Mahmoudi N., Docherty P., Moscato P. Deep neural networks understand investors better // Decision Support Systems. — 2018. — t. 112. — c. 23—34.
79. Stock movement predictive network via incorporative attention mechanisms based on tweet and historical prices / H. Xu [h gp.] // Neurocomputing. — 2020. — t. 418. — c. 326—339.
80. Gu S., Kelly B., Xiu D. Empirical Asset Pricing via Machine Learning // The Review of Financial Studies. — 2020. — ^eBp. — t. 33, № 5. — c. 2223—2273.
81. Henrique B. M., Sobreiro V. A., Kimura H. Literature review: Machine learning techniques applied to financial market prediction // Expert Systems with Applications. — 2019. — t. 124. — c. 226—251.
82. Khedr A., S.E.Salama, Yaseen Hegazy N. Predicting Stock Market Behavior using Data Mining Technique and News Sentiment Analysis // International Journal of Intelligent Systems and Applications. — 2017. — uronb. — t. 9. — c. 22—30.
83. Manela A., Moreira A. News implied volatility and disaster concerns // Journal of Financial Economics. — 2017. — t. 123, № 1. — c. 137—162.
84. Predicting short-term stock prices using ensemble methods and online data sources / B. Weng [h gp.] // Expert Systems with Applications. — 2018. — t. 112. — c. 258—273.
85. Gerrish S., Blei D. A Language-based Approach to Measuring Scholarly Impact. // ICML 2010 - Proceedings, 27th International Conference on Machine Learning. — 2010. — июль. — с. 375—382.
86. Park S., Lee W., Moon I. C. Associative topic models with numerical time series. // Information Processing and Management. — 2015. — июль. — т. 51. — с. 737—755.
87. Kanungsukkasem N., Leelanupab T. Financial Latent Dirichlet Allocation (FinLDA): Feature Extraction in Text and Data Mining for Financial Time Series Prediction // IEEE Access. — 2019. — май. — т. PP. — с. 1—1.
88. Mining Causal Topics in Text Data: Iterative Topic Modeling with Time Series Feedback. / H. D. Kim [и др.] // Proceedings of the 22nd ACM international conference on Information & Knowledge Management. — 2013.
89. Kotelnikov E., Razova E., Fishcheva I. A Close Look at Russian Morphological Parsers: Which One Is the Best? // Proceedings of the Conference on Artificial Intelligence and Natural Language. — Communications in Computer, Information Science, 09.2018.
90. A Sentiment Analysis Approach to the Prediction of Market Volatility / J. Deveikyte [и др.] // ArXiv. — 2020. — дек. — т. abs/2012.05906.
91. Chester Curme Ying Daisy Zhuo H. S. M., Preis T. Quantifying the diversity of news around stock market moves. // Journal of Network Theory in Finance. — 2017. — т. 3(1). — с. 1—20.
92. Finding a "Kneedle"in a Haystack: Detecting Knee Points in System Behavior. / V. Satopaa [и др.] // 31st International Conference on Distributed Computing Systems Workshops. — 2011.
Список рисунков
1.1 Примеры банкоматов различных типов............... 17
1.2 Пример «почти идеального» процесса снятий наличных денег в банкомате................................ 18
1.3 Пример банкомата, расположенного в учебном заведении..... 18
1.4 Пример банкомата с большим количеством стохастических аномалий клиентского спроса..................... 19
1.5 Пример банкомата с большим количеством аномалий, связанных
с днями выплат заработной платы .................. 19
1.6 Пример банкомата с большим количеством вынужденных простоев 20
1.7 Пример банкомата с изменением часов работы в месте его физического расположения...................... 21
1.8 Пример банкомата с перемещением в другую локацию ...... 21
1.9 Пример банкомата с прерывистой структурой спроса, связанной
с низкой популярностью банкомата среди клиентов ................21
1.10 Визуализация процедуры предобработки данных....................27
1.11 Визуализация результатов определения последней корректной истории на основе значительного увеличения количества аномалий 28
1.12 Пример результатов применения алгоритма CUSUM к временным рядам клиентских снятий наличных денег ..............30
1.13 Визуализация алгоритма выбора истории ............................32
1.14 Процесс отбора валидной истории ....................................33
1.15 Визуализация зависимости WAPE от объема накопленной
истории при холодном старте ..........................................34
1.16 Визуализация результатов замены случайных выбросов ............35
1.17 Визуализация архитектуры свёрточной нейронной сети (CNN) . . 36
1.18 Визуализация зависимости WAPE от этапов предобработки данных и настройки гипер-параметров модели......................37
1.19 Визуализация архитектуры LSTM с энкодером и декодером ... 37
1.20 Визуализация процедуры до-настройки глобальной модели под различные объемы спроса ..............................................38
1.21 Визуализация ошибок моделей по месяцам ..........................43
1.22 Визуализация зависимости ошибки прогноза от объема спроса
для LSTM с дообучением и без него................. 45
2.1 Объем торгов VTBR.......................... 63
2.2 Пример временного ряда спроса на наличные деньги в банкомате 64
2.3 Интерфакс: Общее количество новостей по календарным неделям и эмпирическое распределение количества символов в новостях................................. 66
2.4 Структура экспериментов....................... 68
2.5 Разделение на обучающую и тестовую выборки: схема кросс-валидации в расширяющемся окне .............. 72
2.6 Результаты прогнозирования, агрегированные по подходу к построению признаков в области фондового рынка ......... 76
2.7 Результаты прогнозирования, агрегированные по энтропии, область фондового рынка ....................... 77
2.8 Результаты прогнозирования, агрегированные по модели,
область фондового рынка ....................... 78
2.9 Результаты прогнозирования, агрегированные по уровню абстракции, область налично-денежного обращения........ 80
2.10 Результаты прогнозирования, агрегированные по типу энтропии, область налично-денежного обращения ............... 83
2.11 Результаты прогнозирования, агрегированные по модели,
область налично-денежного обращения ............... 84
2.12 Результаты прогнозирования, агрегированные по источнику новостей, область налично-денежного обращения .......... 85
3.1 Биржевая тональность новостного потока: структура метода
STTM .................................. 97
3.2 Схема процедуры прогнозирования движения рынка на основе STTM..................................102
3.3 Динамика индекса Московской Биржи (MOEX Russia Index) . . . 103
3.4 Коммерсант: общее количество статей по календарным неделям
и эмпирическое распределение по количеству символов......105
3.5 Процедура построения моделей прогнозирования направления движения акций на фондовом рынке с использованием методов
обработки текста на основе контекстных эмбеддингов.......111
3.6 Процедура построения эндогенных моделей прогнозирования направления движения акций на фондовом рынке.........112
3.7 Разделение на обучающую и тестовую выборки: схема кросс-валидации в расширяющемся окне ..............113
3.8 Количество значимых корреляций по Грейнджеру в процентах от размера портфеля для различных моделей и источников новостей.................................115
3.9 Кумулятивная доходность рассматриваемых стратегий. Рис. А -С: доходность стратегий, основанных на восьми лучших моделях и двух базовых моделях, использующих данные новостных агенств Коммерсант, РИА Новости и Ведомости соответственно. Рисунок Э: стратегии с коэффициентом Шарпа, превышающим единицу, а также базовые торговые стратегии на основе
индексов МОЕХ и ЕИ........................119
А1 Среднее количество статей по часам с 1 января 2017 года по 1
января 2020 года............................142
А2 Косинусные сходства между темами из различных тематических
моделей и национальных медиа....................143
А3 Плотность распределения разнообразия для новостей торгового терминала Московской Биржи и ежедневных экономических
новостей национального медиа Коммерсант.............145
А4 Кумулятивное распределение тем, динамика КЬ-дивергенции внутри дня, количество новостей торгового терминала
Московской Биржи...........................146
А5 Распределение точек насыщения тематических профилей.....147
А6 Ведомости: Общее количество статей по календарным неделям и
эмпирическое распределение количества символов.........148
А7 РИА Новости: Общее количество статей по календарным
неделям и эмпирическое распределение количества символов . . . 149 А8 Интерфакс: Общее количество статей по календарным неделям
и эмпирическое распределение количества символов........149
А9 Коммерсант: Динамика оценки Су-метрики.............150
А10 Ведомости: Динамика оценки Су-метрики..............150
А11 РИА Новости: Динамика оценки Су-метрики............150
А12 Кумулятивное расхождение тематических профилей между
новостными агентствами Коммерсант и Интерфакс........151
А13 Распределение р-уа1ие корреляций Пирсона между
тематическими потоками в данных новостных агенств
Коммерсант и Интерфакс.......................151
А14 Иллюстрация модели БТТМ .....................152
А15 Иллюстрирация динамики цен акции с наложением значений
индекса БТТМ и новостей, отсортированных по их тональности . 153
А16 Тональный тематический поток (ТТБ)................153
А17 Темы и их тональность для заданной новости, распределения
слов внутри тем, распределение тональности по словам ...... 154
А18 Слова с самой высокой положительной тональностью и самые частотные слова с положительной тональностью. Ряд данных —
цена акций ВТБ (УТБЯ) .......................155
А19 Слова с самой высокой отрицательной тональностью и самые частотные слова с отрицательной тональностью. Ряд данных — цена акций ВТБ (УТБЯ) .......................155
Б1 Ведомости: Общее количество статей по календарным неделям и
эмпирическое распределение количества символов.........168
Б2 РИА Новости: Общее количество статей по календарным
неделям и эмпирическое распределение количества символов . . . 169 Б3 Коммерсант: Общее количество статей по календарным неделям
и эмпирическое распределение количества символов........169
Б4 Коммерсант: Динамика оценки Су-метрики.............170
Б5 Ведомости: Динамика оценки Су-метрики..............170
Б6 РИА Новости: Динамика оценки Су-метрики............170
Б7 Интерфакс: Динамика оценки Су-метрикие.............171
Список таблиц
1 Результаты прогнозирования с горизонтом в 1 день........ 41
2 Результаты прогнозирования с горизонтом в 15 дней ....... 42
3 Результаты прогнозирования с горизонтом в 30 дней ....... 42
4 Сводная статистика собранных новостей .............. 67
5 Топ-10 подходов, ранжированных по ROC-AUC и проценту временных рядов с улучшением качества прогнозирования в области фондового рынка....................... 74
6 Топ-10 признаков, ранжированных по среднему значению ROC-AUC и проценту временных рядов с улучшением качества прогнозирования в области фондового рынка............ 75
7 Топ-10 подходов, ранжированных по % улучшения MAE и по проценту временных рядов с улучшением качества прогнозирования в области налично-денежного обращения .... 79
8 Топ-5 признаков, ранжированных по среднему значению целевых метрик для трех информационных агентств, в области налично-денежного обращения .................... 81
9 Сводная статистика собранных ежедневных новостей.......105
10 Эффективность базовых торговых стратегий............116
11 Эффективность торговых стратегий, основанных на методах тематического моделирования .................... 116
12 Эффективность торговых стратегий, основанных на методах с использованием контекстных векторных представлений ...... 117
13 Эффективность торговых стратегий для подходов, основанных
на эндогенных моделях........................118
A.1 Причинность по Грейнджеру. Модель: LDA, Новостное
агентство: Коммерсант.........................156
A.2 Причинность по Грейнджеру. Модель: LDA, Новостное
агентство: Ведомости .........................157
A.3 Причинность по Грейнджеру. Модель: LDA, Новостное
агентство: РИА Новости........................158
А.4 Причинность по Грейнджеру. Модель: ЭТМ, Новостное
агентство: Коммерсант ......................... 159
А.5 Причинность по Грейнджеру. Модель: ЭТМ, Новостное
агентство: Ведомости ......................... 160
А.6 Причинность по Грейнджеру. Модель: ЭТМ, Новостное
агентство: РИА Новости ........................ 161
Б.1 Результаты моделей на основе эндогенного набора признаков,
область фондового рынка.......................162
Б.2 Результаты моделей, обогащённых признаками на основе
контекстых векторных представлений, область фондового рынка 162 Б.3 Результаты моделей, обогащённых признаками на основе контекстых векторных представлений, область
налично-денежного обращения....................163
Б.4 Результаты моделей, использующих энтропийный подход к
генерации текстовых признаков, область фондового рынка .... 164 Б.5 Результаты моделей, использующих энтропийный подход к
генерации текстовых признаков, источник данных Коммерсант,
область налично-денежного обращения ............... 165
Б.6 Результаты моделей, использующих энтропийный подход к генерации текстовых признаков, источник данных Ведомости,
область налично-денежного обращения ............... 166
Б.7 Результаты моделей, использующих энтропийный подход к генерации текстовых признаков, источник данных РИА Новости, область налично-денежного обращения .......... 167
Приложение А
В этом дополнительном разделе мы проводим качественный анализ различных методов тематического моделирования, а также отношений между экономическими новостями ведущих национальных медиа и новостями торгового терминала Московской Биржи.
А.1 Финансовые новости торгового терминала Московской Биржи
Рисунок Л1 — Среднее количество статей по часам с 1 января 2017 года по 1
января 2020 года
Мы рассматриваем новости торгового терминала в режиме реального времени, выпускаемые агентством Интерфакс (ознакомительная версия доступна на сайте: https://interfax.com/products/news-products/). Мы собрали 739,680 новостных сообщений с 1 января 2017 года по 1 января 2020 года. Общее количество новостных статей по календарным неделям и эмпирическое распределение количества символов приведены на Рисунке Л8. Следует отметить, что
количество статей в неделю коррелирует с аналогичными графиками для экономических новостей агенств Коммерсант, Ведомости и РИА Новости. Это иллюстрирует общее восприятие экономических процессов как в ежедневных экономических, так и в торговых новостях. Также можно отметить отсутствие аналитических обзоров среди торговых новостей. В течение дня торговые новости распределены с одной ярко-выраженной модой. Рисунок Л1 показывает среднее количество статей в каждом часовом интервале торгового дня.
А.2 Качественный анализ тематического моделирования российских экономических новостей
DTM vs DTM DTM vs DTM DTM vs DTM
О 2 4 6 8 10 12 14 16 18 0 2 4 6 8 10 12 14 16 18 0 2 4 6 8 10 12 14 16 18
Topics: Kommersant Topics: Vedomosti Topics: Vedomosti
0 2 4 6 8 10 12 14 16 18 0 2 4 6 8 10 12 14 16 18 0 2 4 6 8 10 12 14 16 18
Topics: LDA Topics: LDA Topics: LOA
Рисунок Л2 — Косинусные сходства между темами из различных тематических моделей и национальных медиа
Мы исследовали сходство национальных новостных агентств и оценили объем новой информации, содержащейся в новостях торгового терминала Мос-
ковской Биржи, с точки зрения тематического моделирования. Мы обучаем алгоритмы тематического моделирования на каждом из источников национальных медиа отдельно. После этого мы применяем предварительно обученные модели к новостям в реальном времени полученных из торгового терминала. Выбор такого порядка обусловлен, с одной стороны, техническими особенностями алгоритмов тематического моделирования: в более длинных текстах им проще выделить осмысленные темы, а с другой стороны, естественными особенностями редакционной политики: в национальных медиа новости публикуются с учетом соответствующего контекста, в то время как торговые новости публикуются как есть и содержат много нерелевантного шума.
Мы используем две базовые модели тематического моделирования: ЬЭЛ и ЭТМ. Как отмечалось в разделе 3.6.1, мы установили один месяц в качестве временного интервала для частоты изменения вероятностей слов в темах модели ЭТМ и число тем п = 20, которое дало наибольший показатель кривой Су перед ее выходом на насыщение. Полученные темы можно озаглавить следующим образом: макроэкономические показатели, заявления Центрального Банка, пенсионное законодательство, налоговое право, экономические реформы, денежно-кредитная политика, финансирование национальных проектов, государственные закупки, торговые пошлины, инвестиционный климат и экономическое развитие, показатели экспорта, изменения правил в предпринимательстве и торговле, тарифы на энергоресурсы, страхование, цифровые технологии, международные торговые соглашения, долговая нагрузка, труд и занятость, добыча полезных ископаемых и энергетика, международные отношения.
На Рисунке Л2 показано сходство тем для различных моделей и источников данных, выровненное с использованием венгерского алгоритма1. Поскольку распределение слов в темах модели ЭТМ меняется от месяца к месяцу, мы используем усредненное по времени распределение слов для каждой рассматриваемой темы. Результаты тематического моделирования показывают высокую косинусную схожесть между одной и той же моделью, основанной на данных из разных источников, и между разными моделями, основанными на одном источнике данных. Исключение составляет национальное агентство Ведомости, модель ЬЭЛ обученная на его данных слабо согласуется с аналогичной моделью ЭТМ и моделями ЬЭЛ на основе данных Коммерсанта и РИА Новости.
1Мы используем реализацию на Python, доступную по адресу https://software.clapper.org/munkres/.
Далее мы применяем полученные модели к новостям торгового терминала Московской Биржи.
Density of Diversity Feature
Рисунок А3 — Плотность распределения разнообразия для новостей торгового терминала Московской Биржи и ежедневных экономических новостей
национального медиа Коммерсант
Мы можем оценить объем новой информации в данных за день с помощью характеристики разнообразия [91], которая характеризует в том числе степень уверенности тематической модели:
N
н± = рг>п (8)
п= 1
где рг,п — относительный вес темы п в новостях во временном интервале Предлагаемая гипотеза проста: каждая новость должна принадлежать к небольшому количеству значимых тем. Соответственно, характеристика разнообразия (энтропия) тематической модели должна быть низкой. Когда для новости в тематической модели нет подходящих тем, модель стремится распределить вероятности равномерно. Таким образом, показатель разнообразия завышается. Рисунок А3 показывает распределение характеристик разнообразия модели ЬЭА в ее обучающей выборке (Коммерсант) и при применении к новостям торгового терминала (Интерфакс). Можно наблюдать незначительное смещение в распределении разнообразия, но в целом модель демонстрирует значительную уверенность при отнесении к темам обучающей выборки. Исходя из этих соображений, мы можем оценить объем новой информации, содержащейся в новостях
торгового терминала, и одновременно теряющейся в ежедневных экономических новостях. Кроме того, тематические потоки ежедневных экономических новостей и новостей торгового терминала показывают значимую корреляцию (см. Рисунок Л13), что еще раз подтверждает единство экономических процессов, отраженных в различных медиа. С другой стороны, существует кумулятивное расхождение профилей тем (см. Рисунок Л12): национальные медиа чаще пишут на следующие темы: макроэкономические показатели, заявления Центрального Банка, пенсионное законодательство, тогда как новости торгового терминала чаще освещают такие темы, как труд и занятость, добыча полезных ископаемых и энергетика, международные отношения.
Рисунок Л4 — Кумулятивное распределение тем, динамика КЬ-дивергенции внутри дня, количество новостей торгового терминала Московской Биржи
Кроме того, мы оценили распределение полученных тем в рамках рассматриваемого дня. На Рисунке Л4 показано накопленное распределение внутридневных новостей по темам: каждый час рассчитываются суммарные вероятности тем для новых поступающих данных, которые добавляются к уже накопленным значениям за предыдущие часы и нормализуются. На графике можно видеть насыщение тем с определённого часа. Для определения точки перегиба
Distribution of saturation point in time
Saturation point
1
.
Ö 250
Q.
о 200 та
В 150
tu
1Л
'S 100
О)
-О 50
z о
о4' & & é' ф' о0' & <$>' <с;' v>" -vй' -о'' №>'• ч?' л>' v' о*' о0'
Рисунок A5 — Распределение точек насыщения тематических профилей
на временной шкале используется функция KL-дивергенции между накопленным распределением тем на конкретный момент времени и итоговым распределением тем в конце торгового дня:
DKL(Pt || Q) = £ fH,i log(, (9)
г=1 \ * '
где pt,i — кумулятивный вес темы г в новостях торгового терминала в течение дня на временном интервале t, а ^ — окончательный вес темы г в конце торгового дня. После этого мы определяем, когда график вышеописанной функции KL-дивергенции (средний график Рисунка A4) достигает плато и находим точку излома. Для этой цели мы используем алгоритм Kneedle2 [92]. В данном примере (средний график на Рисунке A4) насыщение тем происходит с 8 часов утра. С этого времени профиль тем практически не меняется в течение дня, и новая информация в основном уточняет предыдущую. Мы выполнили вышеописанную процедуру для всех дат в наборе данных новостей торгового терминала Московской Биржи и получили следующую картину распределения точек насыщения тематических профилей, что продемонстрировано на Рисунке A5. Можно наблюдать одну ярко выраженную моду данных с центром в 9 часов утра, что согласуется со временем открытия Московской биржи. Таким образом, в среднем основное обсуждение экономической ситуации в российских торговых новостях происходит до начала торгов.
2Мы используем реализацию алгоритма на Python, доступную по адресу https://pypi.org/project/kneed/
А.3 Статистики текстовых данных крупнейших русскоязычных
медиа
Number of Characters in Articles: Vedomosti
0 2000 4000 6000 8000 10000
Number of Charades
Number of Articles by Calendar Week: Vedomosti
□а<е
Рисунок Л6 — Ведомости: Общее количество статей по календарным неделям и эмпирическое распределение количества символов
Number of Characters in Articles: Ria
6000
«
0 5000
1 4000
0
fc 3000 n
1 2000
z
1000 0
4000 6000
Number of Charades
Number of Articles by Calendar Week: Ria
Рисунок Л7 — РИА Новости: Общее количество статей по календарным неделям и эмпирическое распределение количества символов
о
Number of Characters in Articles: Interfax
"g 15000 Z 10000 5000 0
0
6000
и
■g 5000 t
< 4000
0
щ 3000 n
1 2000
1000
4000 6000
Number of Charades
Number of Articles by Calendar Week: Interfax
2017-01 2017-05 2017-09 2018-01 2018-05 2018-09 2019-01 2019-05 2019-09 2020-01
□ate
Рисунок A8 — Интерфакс: Общее количество статей по календарным неделям и эмпирическое распределение количества символов
о
А.4 Тематическое моделирование: определение количества тем
CV-measure score: Kommersant
0.56 0.54 - CV-measure ^-ч /--
0.48 0.46 044
10 20 30 40 50
Number of Topics
Рисунок A9 — Коммерсант: Динамика оценки Cv-метрики
CV-measure score: Vedomosti
Рисунок A10 — Ведомости: Динамика оценки Cv-метрики
CV-measure score: Ria
0.58
0.54
0.48 0.46
10 20 30 40 50
Number of Topics
Рисунок A11 — РИА Новости: Динамика оценки Cv-метрики
А.5 Тематическое моделирование: сравнение тематических
__1 о о
профилен новостей национальных медиа и торгового терминала
Московской Биржи
Topic: 4 Topic: 12 Topic: 5 Topic: 13 Topic: 0 Topic: 16 Topic: 10 Topic: 9 Topic: 3 Topic: 19 Topic: 2 Topic: 15 Topic: 8 Topic: 17 Topic: 1 Topic: 7 Topic: 14 Topic: 18 Topic: 11 Topic: 6
Cumulative divergence of topic profiles
Interfax
acroeconomic indicators I Central Bank statements
I ma
pension legislation
_| tax law
I economic reforms monetary policy financing of national projects H public procurement ■ trade duties
I investment climate & economic development I export figures
I rules in entrepreneurship and trade I energy tariffs I insurance I digital technologies
I international trade agreements I debt burden I labor and employment I mining and energy
I international relations Kommersant
-0.08 -0.06 -0.04
-0.02
0.00
0.02
0.04
0.06
0.08
Рисунок А12 — Кумулятивное расхождение тематических профилей между новостными агентствами Коммерсант и Интерфакс
Distribution of Pearson correlation p-value: Kommersant and Interfax
0.00 0.02 0.04 0.06 0.08 0.10
Pearson correlation p-value
Рисунок А13 — Распределение р-уа1ие корреляций Пирсона между тематическими потоками в данных новостных агенств Коммерсант и
Интерфакс
А.6 Модель ЯТТМ: иллюстрации
На Рисунке Л14 представлена общая иллюстрация результатов модели БТТМ для отдельного временного ряда. Рисунок Л15 иллюстрирует динамику цен акции с наложением значений индекса БТТМ (положительные — зелёные, отрицательные — красные, около нуля — синие) и новостей, отсортированных по их тональности. Рисунок Л16 демонстрирует тональный тематический поток для данного временного ряда. Рисунок Л17 иллюстрирует полученные темы, их тональности, а также распределения слов внутри тем, и распределение тональности по словам (красный цвет соотвествует отрицательной тональности, зеленый цвет - положительной, синий цвет - нулевой тональности).
Рисунок Л14 — Иллюстрация модели БТТМ
Рисунок А15 — Иллюстрирация динамики цен акции с наложением значений индекса ЯТТМ и новостей, отсортированных по их тональности
Tonal Topic Stream of news flow
2013 2014 2015 2016 2017 2018 2019 2020
Time
Рисунок A16 — Тональный тематический поток (TTS)
Probability
Рисунок A17 — Темы и их тональность для заданной новости, распределения слов внутри тем, распределение тональности по словам
А.7 Модель SESTM: частотность и тональность
Positive topic: tone
Positive topic: frequency
■ э* shale
housing
indexation
lardianshipreferendum
fossil
climatic
european commission
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.