Метод генерации ответно-вопросных реплик с учетом особенностей письменной речи пользователя тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Матвеева Анастасия Андреевна

  • Матвеева Анастасия Андреевна
  • кандидат науккандидат наук
  • 2025, «Национальный исследовательский университет ИТМО»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 255
Матвеева Анастасия Андреевна. Метод генерации ответно-вопросных реплик с учетом особенностей письменной речи пользователя: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет ИТМО». 2025. 255 с.

Оглавление диссертации кандидат наук Матвеева Анастасия Андреевна

Оглавление

Реферат

Synopsis

Введение

Глава 1 Анализ современного состояния исследований и

существующих решений в предметной области

1.1 Методы выявления речевых характеристик письменной речи

1.1.1 Базовые характеристики речи

1.1.2 Использование технологий искусственного интеллекта и машинного обучения в выявлении речевых характеристик

1.2 Методы выявления эмоциональной окраски письменной речи

1.2.1 Системы классификации эмоций

1.2.2 Методы выявления эмоциональной окраски

1.3 Современные подходы к аугментации

1.4 Современные подходы к генерации отвентно-вопросных реплик

1.5 Выводы по главе

Глава 2 Формирование и подготовка корпусов данных для

генерации ответно-вопросных реплик

2.1 Анализ существующих корпусов данных

2.1.1 Корпуса речи с высокой и низкой речевой активностью

2.1.2 Персонализированные корпусы данных

2.1.3 Корпуса данных с эмоциями

2.2 Методика сбора русскоязычного полилогового корпуса данных с эмоциональной разметкой

2.2.1 Технические требования и регламент сбора данных

2.2.2 Обработка данных

2.2.3 Анализ полученного корпуса данных

2.3 Метод аугментации, сохраняющий индивидуальные речевые особенности письменной речи и ее эмоциональной окраски

2.4 Выводы по главе

Глава 3 Метод выявления речевых особенностей письменной

речи и ее эмоциональной окраски

3.1 Метод выявления изменения характеристик письменной речи в зависимости от речевой активности

3.1.1 Лексические, синтаксические и семантические характеристики письменной речи

3.1.2 Метод выявления речевой активности

3.1.3 Результаты оценки метода выявления речевой активности

3.2 Метод распознавания эмоциональной окраски реплик

3.2.1 Схема работы многозадачной модели

3.2.2 Обучение и оценка модели

3.2.3 Результаты кросс-доменной проверки модели

3.3 Выводы по главе

Глава 4 Метод генерации эмоциональных

персонифицированных и персонализированных ответно-вопросных реплик

4.1 Метод генерации эмоциональных ответно-вопросных реплик

4.1.1 Описание метода генерации эмоциональных ответно-вопросных реплик

4.1.2 Проведение эксперимента и анализ полученных результатов

4.1.3 Сравнительный анализ с существующими аналогами

4.2 Метод генерации персонифицированных и персонализированных ответно-вопросных реплик

4.2.1 Описание метода генерации персонифицированных и персонализированных ответно-вопросных реплик

4.2.2 Проведение эксперимента и анализ полученных результатов

4.3 Выводы по главе

Глава 5 Архитектура программной библиотеки для создания

русскоязычных диалоговых агентов

5.1 Архитектурные решения и структурная организация библиотеки

5.2 Техническая реализация и интеграция библиотеки

5.3 Выводы по главе

Заключение

Список литературы

Список рисунков

Список таблиц

Приложение А Акт об использовании и внедрении результатов

диссертационного исследования

Приложение Б Свидетельство о регистрации программы для

ЭВМ

Приложение В Основные публикации автора по теме

диссертации

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Метод генерации ответно-вопросных реплик с учетом особенностей письменной речи пользователя»

Реферат

Общая характеристика диссертации

Актуальность темы исследования. В последние годы наблюдается стремительный рост значимости информационных технологий, особенно диалоговых агентов, в различных сферах общества.

Согласно данным маркетинговой компании Mordor Intelligence [54], объем рынка интеллектуальных виртуальных помощников оценивается в 19,60 млрд долларов США в 2025 году и, как ожидается, достигнет 80,72 млрд долларов США к 2030 году при среднегодовом темпе роста 32,72% в течение прогнозируемого периода (2025-2030 гг.) [54]. Кроме того, к 2027 году диалоговые помощники могут стать неотъемлемой частью рабочего процесса сотрудников в организациях. Это подчеркивает очевидную потребность в разработке более адаптивных и человекоподобных решений.

Среди актуальных задач, стоящих перед исследователями и разработчиками данных решений, выделяется необходимость персонификации и персона-лизации диалоговых агентов, что подразумевает учет эмоциональной окраски и речевых особенностей письменной речи пользователей. Способность виртуальных ассистентов адаптировать свои ответы в зависимости от настроения и эмоционального контекста диалога может значительно повысить степень удовлетворенности и лояльности клиентов к сервису. Современные языковые модели, несмотря на их способность генерировать осмысленные и грамматически правильные тексты, часто не обладают достаточными навыками для адекватного выражения и распознавания эмоций, окрашивающих реплики. Это связано с тем, что их обучение происходит на данных, где эмоциональная компонента может быть недостаточно представлена или не учитываться вовсе. Генерация эмоциональных ответно-вопросных реплик за счет больших языковых моделей имеет другой значительный недостаток, а именно, потребность в больших объемах данных и вычислительных ресурсах.

Недавние исследования, например работа Jamin Shin, Peng Xu и др. [108], рассматривают подход к персонифицированной генерации ответно-вопросных реплик, в котором акцент делается в первую очередь на прогнозирование эмоции пользователя и, соответственно, на актуальность и релевантность ответа, а

не на добавлении эмоции в ответ самого бота. В другой работе был представлен метод Sentiment Look-ahead, который представляет собой функцию вознаграждения в рамках структуры обучения с подкреплением, которая обеспечивает более высокое вознаграждение генеративной модели, когда сгенерированное высказывание улучшает настроение пользователя.

Помимо этого, в данной области наблюдается нехватка качественных и разнообразных корпусов данных на русском языке. Существующие ресурсы часто ограничиваются аннотацией базовых эмоций. Для более глубокого анализа необходимы корпуса, аннотированные психолингвистическими параметрами, такими как валентность, возбужденность и доминантность. Эти измерения позволяют описать более тонкие и сложные эмоциональные состояния, выходящие за рамки базовых категорий. Существующие корпуса данных часто ограничены по объему, контексту или языковой специфике, что затрудняет разработку и тестирование моделей, способных эффективно работать с русскоязычными данными. Это создает значительный пробел в исследованиях, особенно в задачах, требующих учета культурных и языковых особенностей при анализе эмоций.

Таким образом, актуальность данного исследования обусловлена необходимостью решения указанных научно-практических проблем. Научная задача работы заключается в исследовании и разработке методов обеспечения эмоциональной адаптивности диалоговых агентов для русскоязычной коммуникации, которые были бы эффективны в условиях ограниченных вычислительных ресурсов и недостатка размеченных данных. Решение этой задачи позволит не только предложить новые практические инструменты, но и внести вклад в фундаментальные знания в области обработки естественного языка и человеко-машинного взаимодействия, радикально изменить принципы человеко-машинного взаимодействия, одновременно формируя стратегические преимущества для бизнеса в таких аферах, как: клиентский сервис, организация учебных процессов и оптимизация административных решений.

Задача разработки методов обеспечения эмоциональной адаптивности диалоговых агентов для русскоязычной письменной коммуникации соответствует задачам национального проекта «Экономика данных и цифровая трансформация государства» (утвержденная протоколом Президиума Совета при Президенте Российской Федерации по стратегическому развитию и национальным проектам от 20 декабря 2024 г. № 12пр.) в части развития электронных услуг и сервисов, а также внедрении ИИ в экономике, госуправлении и соцсфере.

Разработанные методы генерации эмоционально-адаптивных и персонифицированных диалоговых агентов соответствуют пункту «Технологии искусственного интеллекта в отраслях экономики, социальной сферы (включая сферу общественной безопасности), а также в органах публичной власти» обновленного «Перечня важнейших наукоемких технологий» (утвержденный указом Президента РФ № 529 от 18 июня 2024 г.). Создание программной библиотеки с открытым исходным кодом и внедрение результатов работы в ИМО ФГБУ «НМИЦ им. В.А. Алмазова» Минздрава России в образовательную программу по дисциплине «Речевые технологии», при проведении лекционных, практических занятий и семинаров по темам «Методы искусственного интеллекта в анализе речевых характеристик и генерации эмоционально-адаптивных ответов диалоговых агентов», напрямую способствуют развитию кадрового потенциала в сфере ИИ.

Степень разработанности темы исследования. Разработка методов анализа и генерации эмоционально окрашенной речи с учетом индивидуальных речевых особенностей письменной речи располагает обширным инструментарием, развивавшимся в течение последних десятилетий. В области формирования корпусов данных сложились различные методики сбора и разметки. Для англоязычной среды характерно создание многомодальных корпусов с использованием актерской озвучки эмоциональных состояний, таких как IEMOCAP (С. Busso, С. Lee, A. Kazemzadeh et al) и MELD (S. Poria, D. Hazarika, N. Majumder, et al), обеспечивающих высокую чистоту и контролируемость эмоциональных проявлений, но ограниченных в естественности эмоциональных проявлений. Аннотирование в таких корпусах основано на априорно известных эмоциональных метках, соответствующих сценарию исполнения, что обеспечивает высокую согласованность разметки, но ограничивает естественность и вариативность эмоциональных проявлений.

Альтернативный подход демонстрирует EmoReact (B. Nojavanasghari et al), где сбор данных осуществляется в условиях естественного взаимодействия с участием детей, что обуславливает его специфику: спонтанные и яркие эмоциональные реакции, но одновременно ограничивает применимость моделей, обученных на таких данных, для анализа взрослой речи с ее социальными и культурными нормами регуляции эмоций. Аннотирование выполнялось через краудсорсинг, что позволило масштабировать процесс, но снижает согласованность аннотаций.

Для русскоязычных исследований разработаны корпуса RuSentiment (А. Роджерс, А. Романов, А. Румшиски и др.) на основе социальных медиа с бинарной аннотацией тональности, Dusha (В. Кондратенко, А. Соколов, Н. Карпов и др.) со смешанной естественностью данных и категориальной разметкой эмоций, RESD (А. Аментес, И. Лубенец, Н. Давидчук) с заранее заданными эмоциональными состояниями и MURCO (Е. Гришина), сочетающий различные подходы к сбору: часть материалов получена в лабораторных условиях с участием актеров, другая часть представляет собой естественные эмоциональные реакции. При этом существующие русскоязычные ресурсы либо ограничены текстовой модальностью, либо содержат преимущественно одиночные высказывания, либо используют упрощенные схемы эмоциональной разметки, что существенно сужает их применение для задач анализа естественной коммуникации в полилогах.

В области аугментации текстовых данных традиционно применяются методы обучения без учителя (P. Bafna, D. Pramod, A. Vaidya), однако генерация синтетических данных, сохраняющих семантику, синтаксис и лексику исходных текстов, остается сложной задачей. Классические подходы включают лексические подстановки (H. Guo, Y. Mao, R. Zhan), синтаксические трансформации (J. Nivre et al) и методы обратного перевода Современные подходы основаны на синтаксических трансформациях SeqMix (R. Zhang, Y. Yu, C. Zhang) и TreeMix (L. Zhang, Z. Yang, D. Yang), а также на непараллельном переносе стиля (T. Shen, T. Lei, R, Barzilay, T. Jaakkola). Однако все эти методы имеют существенные ограничения: лексические подстановки искажают семантику, синтаксические трансформации нарушают идиоматику, а гибридные подходы страдают от высокой вычислительной сложности и не обеспечивают полного разделения стиля и содержания. Ключевой проблемой остается неспособность существующих методов комплексно сохранять речевые характеристики и эмоциональную окраску. Сравнительный анализ показывает, что даже современные подходы обеспечивают лишь частичную сохранность отдельных аспектов текста, нарушая при этом его целостные характеристики.

В области анализа эмоций и речевых характеристик исторически сложились различные подходы. Первые методы сентимент-анализа использовали размеченные словари оценочных слов, что позволяло только упростить оценку тональности текста, но и скорректировать ее при необходимости (И.А Бессмертный, З.О. Джалиашвили, В. В. Максимов, Д.А. Маркин). Позже методы на

основе психолингвистических словарей (R. Plutchik, P. Ekman, А.А. Двойнико-ва, О.В. Верхоляк, А.А. Карпов) сыграли важную роль, но требуют экспертного труда и плохо адаптируются к индивидуальным паттернам. Для задач синтаксического и семантического анализа русскоязычных текстов следует отметить работу Д.А. Кан и И.С. Лебедева, разработавших анализатор на основе семантической модели Тузова, который позволяет строить точные графы для русскоязычных предложений и формализовать связи в тексте. Для задач муль-тимодального распознавания эмоций представляет интерес работа (Е.Е. Ляксо, О.В. Фролова, Ю.Н. Матвеев, А.Ю. Матвеев), в которой показаны различия в точности определения состояний комфорта и дискомфорта у детей с РАС. Современные подходы включают димензиональные модели эмоций VAD (А. Mehrabian, J.A. Russell), нейросетевые архитектуры (W. Shen., S. Wu, Y. Yang, X. Quan). Однако существующие подходы фокусируются на отдельных аспектах речи и не обеспечивают комплексного анализа речевых характеристик письменной речи как интегрального показателя, что ограничивает их применение для создания персонифицированных речевых профилей.

В области генерации ответно-вопросных реплик. В последние годы доминирующее положение заняли большие языковые модели, обученные на огромных выборках неразмеченных текстов и предназначенные для решения широкого спектра задач генерации (J. Zhang, Q. Chen, J. Lu, et al.). Несмотря на их впечатляющие способности к генерации связного текста, тонкая настройка сценариев эмоционального реагирования и сохранение индивидуального речевого профиля в диалоге остаются сложными задачами, требующими специализированных архитектурных решений. Таким образом, при наличии множества эффективных методов для решения частных задач, комплексный подход, объединяющий сбор мультимодальных данных с VAD-разметкой, аугментацию с сохранением стиля и эмоций, и генерацию персонализированных реплик на основе динамического контекста, остается недостаточно разработанным, особенно для русскоязычной коммуникации, что определяет научную новизну настоящего исследования.

Персонификация представляет собой методологический подход в области машинного обучения и искусственного интеллекта, заключающийся в наделении модели набором атрибутов, которые имитируют личностные или индивидуальные черты.

Персонализация — это процесс адаптации модели или системы под потребности и предпочтения пользователя на основе анализа его данных.

Целью диссертационной работы является повышение смысловой точности, естественности, эмоциональной согласованности и вариативности сгенерированных диалоговыми агентами персонализированных и персонифицированных ответно-вопросных реплик за счет учета речевых особенностей письменной речи человека и ее эмоциональной окраски.

Для достижения цели исследования поставлены следующие задачи:

1. Анализ области исследования и аналитический обзор современных методов выявления эмоциональной окраски реплик и речевых особенностей письменной речи человека, а также методов генерации персонифицированных и персонализированных ответно-вопросных реплик диалоговыми агентами.

2. Сбор русскоязычного мультимодального корпуса диалоговых данных с аннотациями по эмоциям, валентности, возбужденности и доминантности.

3. Исследование и разработка метода аугментации текстовых данных с сохранением индивидуальных речевых особенностей письменной речи человека и эмоциональной окраски.

4. Разработка метода выявления речевых особенностей письменной речи и ее эмоциональной окраски.

5. Разработка метода генерации персонифицированных и персонализированных ответно-вопросных реплик, учитывающих эмоциональную окраску и речевые особенности письменной речи.

6. Экспериментальное исследование и качественная оценка метода генерации персонифицированных и персонализированных ответно-вопросных реплик.

7. Разработка программной библиотеки на базе предложенных методов.

Объектом исследования являются речевые особенности письменной речи человека и ее эмоциональная окраска.

Предметом исследования является метод генерации персонализированных и персонифицированных ответно-вопросных реплик с учетом особенностей письменной речи пользователя.

Методология и методы исследования включают в себя подходы и методы обработки естественного языка, машинного обучения, теории нейронных сетей, объектно-ориентированного проектирования и программирования.

Положения, выносимые на защиту, обладающие научной новизной:

1. Методика сбора русскоязычного корпуса полилогов, отличающаяся совместным использованием автоматического и экспертного аннотирования для определения валентности, возбуждённости, доминантности (УЛЭ) и последующего определения категориальных эмоций через их комбинацию, позволяющая сформировать корпус данных для распознавания сложных эмоций.

2. Метод аугментации текстовых данных, отличающийся использованием перефразирования на основе синтаксических персонализированных шаблонов и контролируемой генерации текста с валидацией эмоциональной окраски, позволяющий расширять обучающие выборки с сохранением индивидуальных речевых особенностей письменной речи и ее эмоциональной окраски.

3. Метод выявления особенностей письменной речи, отличающийся использованием лексико-синтаксических характеристик для определения речевой активности и многозадачного подхода на основе предобученных языковых моделей для распознавания эмоциональной окраски, обеспечивающий повышение точности распознавания сложных эмоций и создание персонифицированных речевых профилей.

4. Метод генерации персонифицированных ответно-вопросных реплик, отличающийся использованием ЯЛО-механизма для динамической настройки запросов к языковой модели на основе анализа текущего диалогового контекста, а также адаптацией генерируемых реплик с учетом эмоциональной окраски и речевых особенностей письменной речи пользователя, позволяющий повысить качество сгенерированных реплик.

Научная новизна диссертации обусловлена тем, что впервые механизм Retгieval-Augmented СепегаШп применен не для дополнения знаний, а для динамической настройки запросов к языковой модели для адаптации генерируемых реплик с учетом речевых особенностей и эмоционального состояния пользователя; предложена методика сбора корпуса, сочетающая автоматическое и экспертное УАЭ-аннотирование для распознавания сложных эмоций в отличии от аналогов, использующих базовые категориальные эмоции; предложен метод аугментации, сохраняющий индивидуальные речевые особенности письменной речи и эмоциональную окраску при расширении обучающих выборок; предложен метод выявления особенностей письменной речи, использующий лексико-синтаксические характеристики для определения речевой активности и многозадачный подход на основе предобученных языковых моделей для повышения точности распознавания сложных эмоций и создания персонифицированных речевых профилей письменной речи человека.

Диссертационное исследование выполнено в соответствии с паспортом специальности 2.3.8 — «Информатика и информационные процессы».

— первое положение, выносимое на защиту, соответствует пункту 7: «Разработка методов обработки, группировки и аннотирования информации, в том числе, извлеченной из сети интернет, для систем поддержки принятия решений, интеллектуального поиска, анализа»;

— второе и четвертое положение, выносимое на защиту, соответствует пункту 4: «Разработка методов и технологий цифровой обработки аудиовизуальной информации с целью обнаружения закономерностей в данных, включая обработку текстовых и иных изображений, видео контента. Разработка методов и моделей распознавания, понимания и синтеза речи, принципов и методов извлечения требуемой информации из текстов»;

— третье положение, выносимое на защиту, соответствует пункту 5: «Лингвистическое обеспечение информационных систем и процессов. Методы и средства проектирования словарей данных, словарей индексирования и поиска информации, тезаурусов и иных лексических комплексов. Методы семантического, синтаксического и прагматического анализа текстовой информации для представления в базах данных и организации интерфейсов информационных систем с пользователями».

Теоретическая значимость диссертационного исследования состоит в развитии методов искусственного интеллекта в области обработки и анализа текстов на естественном языке, направленных на автоматизацию задач выявления эмоциональной окраски и индивидуальных речевых особенностей в письменной речи, что вносит вклад в теорию построения интеллектуальных агентов с повышенной эффективностью персонификации и персонализации генерации ответов диалоговыми системами.

Практическая значимость состоит в разработке вычислительных методов и алгоритмов, которые могут использоваться для создания эмоционально-адаптивных диалоговых агентов в целях персонализации взаимодействия в задачах клиентского сервиса, образовательных технологий и социальных коммуникаций; а также в разработке тиражируемой программной библиотеки гирег80паа§еп1 с открытым исходным кодом, которые могут использоваться для генерации персонифицированных ответно-вопросных реплик с сохранением эмоциональной окраски и речевых особенностей пользователя.

Особое практическое значение разработанные методы имеют для использования в социальных и развлекательных чат-ботах ("болталках"), составляющих существенную долю рынка диалоговых систем. Разработанный метод генерации персонифицированных ответно-вопросных реплик может использоваться для поддержания длительных, эмоционально насыщенных диалогов, адаптированных под индивидуальные речевые особенности пользователей, что критически важно для удержания аудитории в развлекательных и социальных чатах. Собранный русскоязычный корпус данных и метод аугментации текста могут использоваться для решения проблемы недостатка лингвистических ресурсов при обучении подобных систем, ориентированных на русскоязычных пользователей. Реализация части методов, разработанных в рамках диссертационного исследования, доступна в публичном репозитории О^ЬаЬ: https://gitlab.com/Iolly/rupersonaagent

Достоверность научных положений, выводов и доказательств, полученных в рамках диссертационной работы, основана на известных, поддающихся проверке данных и фактах, согласуется с опубликованными экспериментальными данными по теме диссертации или в смежных областях, подтверждается экспериментальными исследованиями, успешным представлением основных

положений в докладах на международных и всероссийских конференциях, публикациями результатов в рецензируемых изданиях.

Публикации Основное содержание диссертации опубликовано в 10 публикациях, из них 4 публикации рецензируемых Web of Science или Scopus, 5 публикаций в иных изданиях и 1 охранный документ на результат интеллектуальной деятельности.

Внедрение результатов работы. Отдельные результаты, полученные в ходе выполнения диссертационного исследования, были использованы в следующих прикладных научных исследованиях:

— НИРМА, выполняемая в рамках Университета ИТМО на тему «Разработка русскоязычного персонифицированного эмоционального диалогового агента» №623088 (руководитель проекта);

— НИРМА, выполняемая в рамках Университета ИТМО на тему «Разработка русскоязычного персонифицированного диалогового агента с динамической долгосрочной памятью» №622282 (руководитель проекта);

— НИРМА, выполняемая в рамках Университета ИТМО на тему «Разработка методов и алгоритмов для мультимодального распознавания валентности высказываний и доминантности дикторов в полилогах» № 622281 (участник);

— РНФ на тему «Разработка и исследование технологий персонификации разговорных агентов с использованием глубоких нейронных сетей» № 22-11-00128 (участник).

Получен акт о внедрении результатов работы в ИМО ФГБУ «НМИЦ им. В.А. Алмазова» Минздрава России, в образовательную программу по дисциплине «Речевые технологии», при проведении лекционных, практических занятий и семинаров по темам «Методы искусственного интеллекта в анализе речевых характеристик и генерации эмоционально-адаптивных ответов диалоговых агентов».

Апробация результатов исследования. Ключевые результаты исследований были представлены и обсуждались на следующих конференциях и конгрессах: Международной конференции «26th International Conference on

Speech and Computer SPECOM 2024» (Белград, Сербия, 2024); Международной конференции «24th International Conference on Speech and Computer SPECOM 2022» (Гургаон, Индия, 2022), Международной конференции «31st FRUCT Conference» (Хельсинки, Финляндия, 2022); Пятьдесят четвертой научной и учебно-методической конференции Университета ИТМО. (Санкт-Петербург, Россия, 2025); Пятьдесят третьей научной и учебно-методической конференции Университета ИТМО. (Санкт-Петербург, Россия, 2024); Пятьдесят второй научной и учебно-методической конференции Университета ИТМО (Санкт-Петербург, Россия, 2023); Пятьдесят первой научной и учебно-методической конференции Университета ИТМО (Санкт-Петербург, Россия, 2022); XIV Всероссийском конгрессе молодых ученых (Санкт-Петербург, Россия, 2025); XIII Всероссийском конгрессе молодых ученых (Санкт-Петербург, Россия, 2024); XII Всероссийском конгрессе молодых ученых ИТМО (Санкт-Петербург, Россия, 2023); XI Всероссийском конгрессе молодых ученых (Санкт-Петербург, Россия, 2022).

Личный вклад автора. Постановка цели и задач диссертационной работы выполнена совместно с научным руководителем. Все результаты, приведенные в диссертации, составляющие ее научную новизну и выносимые на защиту, получены лично автором или при его непосредственном участии. Статьи подготовлены автором совместно с научным руководителем и соавторами.

В статье [82] соискателем разработан метод аугментации с сохранением отличительных характеристик речи и подготовлены вопросы для проведения MOS-оценки. В статье [116] соискателем реализован метод тонкой настройки промпта и составлена часть вопросов для оценки результатов генерации методом SSA. В статьях [95] и [96] соискателем проведена предобработка данных, а также разработана часть модификаций генеративных архитектур из представленных в статьях.

Соавтором публикации [82] является научный руководитель, которым была проведена постановка задачи, организована MOS-оценка разработанного метода. Соавторы публикаций [116], [95] и [96] разрабатывали модели поиска, модели генерации и составляли часть вопросов для оценки результатов генерации методом SSA.

Объём и структура работы. Диссертация состоит из введения, 5 глав, заключения и 3 приложений. Полный объем диссертации составляет 254 страницы, включая 38 рисунков и 52 таблицы. Список литературы содержит 128 наименований.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Заключение диссертации по теме «Другие cпециальности», Матвеева Анастасия Андреевна

Заключение

Предложен метод аугментации текстовых данных, который сохраняет стиль речи и словарный запас. В работе использованы наборы данных MELD, MELDRU и RuTweetCorp для экспериментов по оценке эмоционального состояния пользователя. Замечено, что аугментация данных с помощью представленного метода приводит к повышению точности при доле аугментированных данных к исходным менее 1,0, потому что в этом случае есть шанс, что исходное сообщение останется неизменным. Исходное сообщение, каким бы хорошим ни было дополнение, содержит данные, которые максимально подходят к домену, из которого оно было взято. С другой стороны, полезно увеличить разнообразие данных с помощью аугментации, повышающей приобретенную способность сохранять стиль речи за счет лучшего обобщения. Наблюдалось увеличение точности для разных моделей до 2 %.

Список литературы диссертационного исследования кандидат наук Матвеева Анастасия Андреевна, 2025 год

Литература

1. Giridhara P.K., Mishra C., Venkataramana R.K., Bukhari S.S., Dengel A.R. A study of various text augmentation techniques for relation classification in free text // Proc. of the 8th International Conference on Pattern Recognition Applications and Methods. 2019. P. 360-367 https://doi.org/10.5220/0007311003600367

2. Papadaki M. Data Augmentation Techniques for Legal Text Analytics: A thesis submitted to Athens University of Economics and Business in fulfillment of the requirements for the degree of Master in Data Science. 2017. 33 p.

3. Zhang Z., Zweigenbaum P. GNEG: Graph-based negative sampling for word2vec // Proc. of the 56th Annual Meeting of the Association for Computational Linguistics. V. 2. 2018. P. 566-571. https://doi. org/10.18653/v1/P18-2090

4. Wei J., Zou K. EDA: Easy data augmentation techniques for boosting performance on text classification tasks // Proc. of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP). 2018. P. 6382-6388. https://doi. org/10.18653/v1/D19-1670

5. Wu X., Xia Y., Zhu J., Wu L., Xie S., Fan Y., Qin T. mixSeq: A simple data augmentation method for neural machine translation // Proc. of the 18th International Conference on Spoken Language Translation (IWSLT 2021). 2021. P. 192-197. https://doi.org/10.18653/v1/2021. iwslt-1.23

References

1. Giridhara P.K., Mishra C., Venkataramana R.K., Bukhari S.S., Dengel A.R. A study of various text augmentation techniques for relation classification in free text. Proc. of the 8th International Conference on Pattern Recognition Applications andMethods, 2019, pp. 360-367 https://doi.org/10.5220/0007311003600367

2. Papadaki M. Data Augmentation Techniques for Legal Text Analytics. A thesis submitted to Athens University of Economics and Business in fulfillment of the requirements for the degree of Master in Data Science, 2017, 33 p.

3. Zhang Z., Zweigenbaum P. GNEG: Graph-based negative sampling for word2vec. Proc. of the 56th Annual Meeting of the Association for Computational Linguistics. V. 2, 2018, pp. 566-571. https://doi. org/10.18653/v1/P18-2090

4. Wei J., Zou K. EDA: Easy data augmentation techniques for boosting performance on text classification tasks. Proc. of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), 2018, pp. 6382-6388. https://doi.org/10.18653/ v1/D19-1670

5. Wu X., Xia Y, Zhu J., Wu L., Xie S., Fan Y, Qin T. mixSeq: A simple data augmentation method for neural machine translation. Proc. of the 18th International Conference on Spoken Language Translation (IWSLT2021), 2021, pp. 192-197. https://doi.org/10.18653/v1/2021. iwslt-1.23

6. Kumar V., Choudhary A., Cho E. Data augmentation using pre-trained transformer models // Proc. of the 2nd Workshop on Life-long Learning for Spoken Language Systems. 2020. P. 18-26.

7. Kobayashi S. Contextual augmentation: Data augmentation by words with paradigmatic relations // Proc. of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers). 2018. P. 452-457. https://doi.org/10.18653/v1/N18-2072

8. Yu A., Dohan D., Luong M., Zhao R., Chen K., Norouzi M., Le Q. QANet: Combining local convolution with global self-attention for reading comprehension // Proc. of the ICLR Conference. 2018.

9. Mehdi R., Meyer M., Goutal S. Text Data Augmentation: Towards better detection of spear-phishing emails // arXiv. 2020. arXiv:2007.02033. https://doi.o^/10.48550/arXiv.2007.02033

10. Edunov S., Ott M., Auli M., Grangier D. Understanding backtranslation at scale // Proc. of the 2018 Conference on Empirical Methods in Natural Language Processing. 2018. P. 489-500. https:// doi.org/10.18653/v1/D18-1045

11. Guo H., Mao Y., Zhang R. Augmenting data with mixup for sentence classification: An empirical study // arXiv. 2019. arXiv:1905.08941. https://doi.org/10.48550/arXiv.1905.08941

12. Coulombe C. Text data augmentation made simple by leveraging NLP cloud APIs // arXiv. 2018. arXiv:1812.04718. https://doi. org/10.48550/arXiv.1812.04718

13. Shen T., Lei T., Barzilay R., Jaakkola T. Style transfer from nonparallel text by cross-alignment // Advances in Neural Information Processing Systems. 2017. V. 30.

14. Yang S., Huang X., Lau J.H., Erfani S. Robust task-oriented dialogue generation with contrastive pre-training and adversarial filtering // Findings of the Association for Computational Linguistics (EMNLP 2022). 2022. P. 1220-1234.

15. Kovriguina L., Shilin I., Shipilo A., Putintseva A. Russian tagging and dependency parsing models for stanford CoreNLP natural language toolkit // Communications in Computer and Information Science. 2017. V. 786. P. 101-111. https://doi.org/10.1007/978-3-319-69548-8_8

16. Matveev Y., Matveev A., Frolova O., Lyakso E., Ruban N. Automatic speech emotion recognition of younger school age children // Mathematics. 2022. V. 10. N 14. P. 2373. https://doi.org/10.3390/ math10142373

17. Lyakso E., Frolova O., Matveev A., Matveev Y., Grigorev A., Makhnytkina O., Ruban N. Recognition of the emotional state of children with down syndrome by video, audio and text modalities: human and automatic // Lecture Notes in Computer Science. 2022. V. 13721. P. 438-450. https://doi.org/10.1007/978-3-031-20980-2_38

18. Kim T., Vossen P. EmoBERTa: Speaker-Aware Emotion Recognition in Conversation with RoBERTa // arXiv. 2021. arXiv:2108.12009. https://doi.org/10.48550/arXiv.2108.12009

19. Song X., Zang L., Zhang R., Hu S., Huang L. Emotionflow: Capture the dialogue level emotion transitions // Proc. of the ICASSP 20222022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). 2022. P. 8542-8546. https://doi.org/10.1109/ ICASSP43922.2022.9746464

20. Shen W., Chen J., Quan X., Xie Z. DialogXL: All-in-One XLNet for multi-party conversation emotion recognition // Proceedings of the AAAI Conference on Artificial Intelligence. 2021. V. 35. N 15. P. 13789-13797 https://doi.org/10.1609/aaai.v35i15.17625

21. Shen W., Wu S., Yang Y., Quan X. Directed acyclic graph network for conversational emotion recognition // Proc. of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). 2021. P. 1551-1560.

Авторы

Матвеева Анастасия Андреевна — инженер, Университет ИТМО, Санкт-Петербург, 197101, Российская Федерация, sc 57204215042, https://orcid.org/0000-0002-2935-991X, anastasiamatveevaitmo@gmail. com

Махныткина Олеся Владимировна — кандидат технических наук, доцент, Университет ИТМО, Санкт-Петербург, 197101, Российская Федерация, sc 57208002090, https://orcid.org/0000-0002-8992-9654, makhnytkina@itmo.ru

6. Kumar V., Choudhary A., Cho E. Data augmentation using pre-trained transformer models. Proc. oof the 2nd Workshop on Life-long Learning for Spoken Language Systems, 2020, pp. 18-26.

7. Kobayashi S. Contextual augmentation: Data augmentation by words with paradigmatic relations. Proc. oof the 2018 Conference oof the North American Chapter oof the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers), 2018, pp. 452-457. https://doi.org/10.18653/v1/N18-2072

8. Yu A., Dohan D., Luong M., Zhao R., Chen K., Norouzi M., Le Q. QANet: Combining local convolution with global self-attention for reading comprehension. Proc. oof the ICLR Conference, 2018.

9. Mehdi R., Meyer M., Goutal S. Text Data Augmentation: Towards better detection of spear-phishing emails. arXiv, 2020, arXiv:2007.02033. https://doi.org/10.48550/arXiv.2007.02033

10. Edunov S., Ott M., Auli M., Grangier D. Understanding backtranslation at scale. Proc. oof the 2018 Conference on Empirical Methods in Natural Language Processing, 2018, pp. 489-500. https:// doi.org/10.18653/v1/D18-1045

11. Guo H., Mao Y., Zhang R. Augmenting data with mixup for sentence classification: An empirical study. arXiv, 2019, arXiv:1905.08941. https://doi.org/10.48550/arXiv.1905.08941

12. Coulombe C. Text data augmentation made simple by leveraging NLP cloud APIs. arXiv, 2018, arXiv:1812.04718. https://doi.org/10.48550/ arXiv.1812.04718

13. Shen T., Lei T., Barzilay R., Jaakkola T. Style transfer from nonparallel text by cross-alignment. Advances in Neural Information Processing Systems, 2017, vol. 30.

14. Yang S., Huang X., Lau J.H., Erfani S. Robust task-oriented dialogue generation with contrastive pre-training and adversarial filtering. Findings oof the Association for Computational Linguistics (EMNLP 2022), 2022, pp. 1220-1234.

15. Kovriguina L., Shilin I., Shipilo A., Putintseva A. Russian tagging and dependency parsing models for stanford CoreNLP natural language toolkit. Communications in Computer and Information Science, 2017, vol. 786, pp. 101-111. https://doi.org/10.1007/978-3-319-69548-8_8

16. Matveev Y., Matveev A., Frolova O., Lyakso E., Ruban N. Automatic speech emotion recognition of younger school age children. Mathematics, 2022, vol. 10, no. 14, pp. 2373. https://doi.org/10.3390/ math10142373

17. Lyakso E., Frolova O., Matveev A., Matveev Y., Grigorev A., Makhnytkina O., Ruban N. Recognition of the emotional state of children with down syndrome by video, audio and text modalities: human and automatic. Lecture Notes in Computer Science, 2022, vol. 13721, pp. 438-450. https://doi.org/10.1007/978-3-031-20980-2_38

18. Kim T., Vossen P. EmoBERTa: Speaker-Aware Emotion Recognition

in Conversation with RoBERTa. arXiv, 2021, arXiv:2108.12009. https://doi.org/10.48550/arXiv.2108.12009

19. Song X., Zang L., Zhang R., Hu S., Huang L. Emotionflow: Capture the dialogue level emotion transitions. Proc. of the ICASSP 20222022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2022, pp. 8542-8546. https://doi.org/10.1109/ ICASSP43922.2022.9746464

20. Shen W., Chen J., Quan X., Xie Z. DialogXL: All-in-One XLNet for multi-party conversation emotion recognition. Proceedings of the AAAI Conference on Artificial Intelligence, 2021, vol. 35, no. 15, pp. 13789-13797 https://doi.org/10.1609/aaai.v35i15.17625

21. Shen W., Wu S., Yang Y., Quan X. Directed acyclic graph network for conversational emotion recognition. Proc. oof the 59th Annual Meeting oof the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), 2021, pp. 1551-1560.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.