Методы сквозного обучения моделей семантического поиска и генерации текста в интеллектуальных диалоговых системах с доступом к неструктурированной базе знаний тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Маслюхин Сергей Михайлович

  • Маслюхин Сергей Михайлович
  • кандидат науккандидат наук
  • 2025, «Национальный исследовательский университет ИТМО»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 264
Маслюхин Сергей Михайлович. Методы сквозного обучения моделей семантического поиска и генерации текста в интеллектуальных диалоговых системах с доступом к неструктурированной базе знаний: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет ИТМО». 2025. 264 с.

Оглавление диссертации кандидат наук Маслюхин Сергей Михайлович

Оглавление

Реферат

Synopsis

Введение

Глава 1. Интеллектуальные диалоговые системы с доступом к неструктурированным базам знаний

1.1 Диалоговые системы в современном мире

1.2 Диалоговые системы с доступом к неструктурированным данным

1.3 Семантический поиск

1.3.1 Модели плотного поиска (Dense Retrieval)

1.3.2 Обучение моделей семантического поиска

1.3.3 Метрики оценки качества поиска

1.3.4 Вызовы и направления развития

1.4 Условная генерация текста

1.4.1. Эволюция моделей генерации текста

1.4.2. Генерация текста с опорой на внешние знания

1.4.3. Проблемы и вызовы в условной генерации текста

1.4.4. Метрики оценки качества генерации

1.5 Архитектура RAG

1.5.1. Общий принцип работы RAG

1.5.2. Варианты архитектуры RAG

1.5.3. Преимущества RAG

1.5.4. Проблемы и ограничения традиционных RAG-систем

1.6 Методы сквозного обучения RAG систем

1.6.1. Принципы и вызовы сквозного обучения RAG

1.6.2. Преимущества сквозного обучения

1.6.3. Сложности и открытые вопросы

1.7 RAG системы на основе LLM. Методы PEFT

1.7.1. Интеграция LLM в RAG-архитектуры

1.7.2. Параметро-эффективное дообучение (PEFT)

1.7.3. Применение PEFT в сквозном обучении RAG систем

Глава 2. Разработка и исследование метода сквозного обучения диалоговой системы

2.1 Постановка задачи и используемые наборы данных

2.1.1 Постановка задачи

2.1.2 Используемые наборы данных

2.2 Предлагаемый метод построения и обучения диалоговой системы

2.2.1 Общая структура диалоговой системы

2.2.2 Задача аугментации данных для адаптации к устной речи

2.2.3 Задача обнаружения необходимости обращения к базе знаний

2.2.4 Задача выбора релевантного текстового фрагмента из базы знаний

2.2.5 Задача генерации ответа

2.2.6 Предлагаемый метод сквозного обучения: генерация, дополненная поиском (RAG)

2.3 Эксперименты и результаты

2.3.1 Влияние аугментации данных на задачу обнаружения

2.3.2 Результаты моделей классификаторов на задаче обнаружения

2.3.3 Результаты моделей на задаче выбора

2.3.4 Результаты моделей на задаче генерации

2.3.5 Итоговое сравнение с базовой моделью на тестовых данных DSTC10

2.4 Обсуждение практических аспектов и ограничений

2.5 Выводы

Глава 3. Разработка и исследование метода обучения устойчивой модели семантического поиска

3.1 Постановка задачи повышения робастности семантического поиска

3.2 Предлагаемый метод промпт-ориентированного многозадачного обучения модели семантического поиска

3.2.1 Архитектура базовой модели-энкодера

3.2.2 Набор задач для многозадачного обучения

3.2.3 Контрастивное обучение с InfoNCE

3.2.4 Стратегии использования промптов

3.3 Экспериментальное исследование робастности модели поиска

3.3.1 Метрики оценки

3.3.2 Сравнение однозадачных и многозадачных моделей

3.3.3 Сравнение эффективности различных типов промптов

3.3.4 Влияние применения промптов к запросу и/или кандидату

3.4 Калибровка оценок релевантности для отсечения ранжированного списка

3.4.1 Краткое описание проблемы отсечения и метода с TMP Adapter

3.5 Выводы

Глава 4. Интеграция методов параметро-эффективного дообучения в сквозное обучение моделей поиска и генерации

4.1 Проблема вычислительных ресурсов при адаптации больших языковых моделей в RAG-системах

4.2 Обзор методов параметро-эффективного дообучения (PEFT)

4.3 Предлагаемый метод интеграции PEFT в сквозное обучение RAG-систем

4.3.1 Применение PEFT к компонентам RAG

4.3.2 Механизм сквозного обучения с PEFT

4.4 Экспериментальное исследование эффективности метода

4.4.1 Наборы данных и метрики оценки

4.4.2 Базовые модели и конфигурация экспериментов

4.4.3 Результаты экспериментов и их анализ

4.4.4 Итоговое сравнение рассматриваемых методов

4.5 Выводы

Заключение

Список сокращений и условных обозначений

Словарь терминов

Список литературы

Приложение А. Акт внедрения и свидетельство о регистрации программ для ЭВМ

Приложение Б. Тексты публикаций автора по теме диссертации

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Методы сквозного обучения моделей семантического поиска и генерации текста в интеллектуальных диалоговых системах с доступом к неструктурированной базе знаний»

Реферат

Общая характеристика диссертации Актуальность темы. Экспоненциальный рост объемов неструктурированных данных и повсеместное внедрение диалоговых систем формируют острую потребность в интеллектуальных агентах нового поколения. Их интеллектуальность заключается не в простом выполнении команд, а в комплексной способности: глубоко понимать запрос, самостоятельно принимать решение о необходимости обращения к внешним знаниям, эффективно извлекать сведения из слабоструктурированных массивов и синтезировать на их основе содержательные и точные ответы.

Ключевое место в решении этой задачи занимают подходы, основанные на генерации, дополненной поиском (RAG). Однако их традиционные реализации, как правило, страдают от раздельного обучения компонентов поиска и генерации, что приводит к рассогласованию их целей и снижает общую эффективность. Таким образом, создание методов сквозного обучения, позволяющих оптимизировать совместную работу этих компонентов, является центральной научной проблемой, решение которой позволит значительно повысить качество и достоверность генерируемых ответов.

Разработка усовершенствованных методов сквозного обучения имеет широкий спектр практических применений. Речь идет о создании более эффективных чат-ботов для клиентской поддержки, продвинутых вопросно-ответных систем и персонализированных обучающих платформ, способных работать с произвольными текстовыми источниками. Способность таких систем эффективно обрабатывать динамически меняющиеся неструктурированные информационные потоки особенно актуальна в условиях современной информационной перегрузки.

Несмотря на значительный прогресс, существующие подходы сталкиваются с рядом фундаментальных ограничений. Раздельное обучение компонентов приводит к их рассогласованной работе, а сложность семантического

представления и индексации неструктурированных данных остается нерешенной задачей. Кроме того, высокие требования современных моделей к вычислительным ресурсам и объемам размеченных данных серьезно ограничивают их практическое применение. Таким образом, необходимость в разработке методов сквозного обучения, которые были бы не только эффективными, но и ресурсосберегающими, остается крайне актуальной.

В рамках данной диссертационной работы предлагается комплекс новых методов, алгоритмов и программных средств, целенаправленно решающих вышеописанные проблемы. Предлагаемые подходы ориентированы на разработку более эффективных, ресурсосберегающих и гибких методов сквозного обучения, позволяющих создавать интеллектуальные диалоговые системы нового поколения.

Степень разработанности темы исследования. Анализ существующих решений показывает, что архитектура Retrieval—Augmented Generation (RAG) стала общепринятым стандартом для интеграции внешних знаний в большие языковые модели. Однако доминирующей парадигмой её реализации остается конвейерный подход «извлеки-затем-прочти», при котором модули поиска и генерации обучаются раздельно. Это порождает фундаментальную проблему рассогласования их целей: ретривер, оптимизированный на поиск семантически похожих документов (Karpukhin et al.), не всегда предоставляет информацию, максимально полезную для генератора.

Для преодоления этого ограничения был предложен ряд методов, направленных на более тесную интеграцию компонентов. Одним из направлений стало совместное асинхронное обучение, где ретривер периодически обновляется на основе сигналов от генератора, как, например, в подходе REALM (Guu et al.). Более прямой подход к сквозному (end-to-end) обучению был предложен в оригинальной работе по RAG (Lewis et al.), где применяется механизм маргинализации по извлеченным документам для создания единого дифференцируемого процесса. Параллельно развивались и архитектурные решения, направленные на улучшение синтеза информации, такие как Fusion-in-

Decoder (FiD) (Izacard & Grave), а также итеративные RAG-системы (Trivedi et al.) для решения задач, требующих многошаговых рассуждений. При этом общая проблема недифференцируемого шага извлечения решалась с помощью методов обучения с подкреплением или аппроксимации градиентов, например, с помощью Gumbel-Softmax (Jang, Gu, & Poole).

Несмотря на разнообразие подходов, их практическое применение выявило общие фундаментальные ограничения. Главным из них является экстремально высокая вычислительная сложность: одновременное хранение в памяти активаций и вычисление градиентов для двух сложных моделей предъявляет колоссальные требования к ресурсам GPU, что практически исключает полное дообучение современных LLM в таких архитектурах. Вторым ограничением является нестабильность процесса обучения, в частности, риск появления "ленивого ретривера", когда мощный генератор игнорирует выходы поискового компонента, прерывая поток обучающих градиентов к нему.

Таким образом, степень разработанности темы характеризуется наличием множества теоретически обоснованных, но практически ограниченных решений. Существующие подходы к совместному обучению RAG-систем остаются либо вычислительно неподъемными для современных LLM, либо сложными в настройке и нестабильными, что препятствует их широкому применению. Сохраняется явный научный пробел в области разработки методов, которые делают сквозное обучение эффективным, стабильным и, что критически важно, ресурсосберегающим, позволяя раскрыть полный потенциал синергии поиска и генерации в RAG-системах на базе больших языковых моделей.

Целью диссертационной работы является повышение производительности моделей семантического поиска (точность, полнота) и моделей генерации текста (связность, релевантность, фактологическая обоснованность) в интеллектуальных диалоговых системах с доступом к неструктурированной базе знаний.

Для достижения данной цели в рамках диссертации были поставлены и решены следующие задачи:

1. Анализ и систематизация существующих методов построения интеллектуальных диалоговых систем на основе архитектуры Retrieval-Augmented Generation (RAG), методов семантического поиска по неструктурированным данным и моделей генерации текста.

2. Разработка новых методов сквозного обучения для RAG-подобных архитектур, обеспечивающих совместную оптимизацию модулей семантического поиска и генерации текста.

3. Разработка механизмов представления и индексации неструктурированных данных, эффективно (т.е. результативно с точки зрения целевых метрик и реализуемо с вычислительной точки зрения) интегрируемых в процесс сквозного обучения.

4. Разработка интеллектуальных диалоговых систем, реализующих предложенные методы сквозного обучения, с акцентом на эффективное взаимодействие между поисковым и генеративным компонентами при работе с неструктурированными источниками данных.

5. Экспериментальное исследование разработанных методов на релевантных данных, оценка их эффективности в сравнении с современными методами по метрикам качества поиска, генерации и общей производительности интеллектуальной диалоговой системы.

6. Разработка программного прототипа, реализующего предложенные методы сквозного обучения моделей семантического поиска и генерации текста для диалоговых систем, и демонстрация его применимости для решения практических задач обработки неструктурированных данных.

Методы исследования. В диссертации применялись методы машинного обучения и глубокого обучения (включая трансформерные архитектуры, механизмы внимания), методы обработки естественного языка (NLP), методы информационного поиска и векторного представления данных, методы оптимизации и статистический анализ.

Положения, выносимые на защиту:

1. Метод сквозного обучения для RAG-систем с генератором на основе энкодер-декодер архитектуры, отличающийся введением специализированного дифференцируемого модуля объединения, который использует механизм перекрестного внимания генератора для обеспечения прямой оптимизации ретривера посредством функции потерь и улучшения согласованности извлекаемой информации.

2. Метод обучения робастной модели семантического поиска, основанный на многозадачном обучении и отличающийся использованием промпт-ориентированного управления, что, в отличие от обучения на одной задаче, формирует более обобщенные семантические представления для повышения устойчивости ретривера к вариациям запросов и смене доменов.

3. Метод ресурсоэффективного сквозного обучения для RAG-систем с генератором на основе архитектуры только с декодером, отличающийся комплексным решением, которое интегрирует методы параметро-эффективного дообучения для обновления только легковесных параметров, и вводит механизм инъекции контекста во входную последовательность, что в совокупности делает совместную оптимизацию практически реализуемой для современных больших языковых моделей.

Научная новизна работы состоит в разработке комплекса взаимосвязанных методов и архитектурных решений, позволяющих на единой методологической основе осуществить сквозное обучение RAG-систем, решая при этом ключевые проблемы рассогласования целей, недостаточной робастности и высокой вычислительной стоимости. Впервые предложен метод сквозной оптимизации, основанный на специализированном дифференцируемом модуле объединения с механизмом внимания, который обеспечивает прямое распространение обучающего сигнала от генератора на основе архитектуры с энкодером и декодером к ретриверу и тем самым устраняет фундаментальное рассогласование их целей. Для повышения надежности этого процесса разработан метод промпт-ориентированного многозадачного обучения поискового компонента, который

целенаправленно повышает его робастность к доменным сдвигам и вариациям формулировок, обеспечивая более качественный отбор данных для генератора. Наконец, для обеспечения практической применимости при работе с современными большими языковыми моделями предложен и исследован метод интеграции методов параметро-эффективного дообучения (PEFT), который кардинально снижает вычислительные барьеры для сквозного обучения, сохраняя при этом его преимущества и обеспечивает адаптацию сквозного обучения для моделей генераторов только с декодером путем инъекции контекста во входную последовательность.

Соответствие паспорту специальности. Исследования, выполненные в рамках диссертационной работы, соответствуют пункту 4 «Разработка методов, алгоритмов и создание систем ИИ и машинного обучения для обработки и анализа текстов на естественном языке, для изображений, речи, биомедицины и других специальных видов данных» паспорта специальности 1.2.1 «Искусственный интеллект и машинное обучение».

Научно-техническая задача, решаемая в диссертации, заключается в создании методов и алгоритмов сквозного обучения для интеллектуальных диалоговых систем, основанных на архитектуре Retrieval-Augmented Generation (RAG) и работающих с неструктурированными данными.

Объект исследования. Процессы совместного обучения моделей семантического поиска и генерации текста на естественном языке в интеллектуальных диалоговых системах, взаимодействующих с неструктурированными базами знаний.

Предмет исследования. Методы и алгоритмы сквозного обучения для RAG-архитектур, направленные на повышение эффективности извлечения релевантной информации из неструктурированных данных и генерации точных и релевантных ответов в интеллектуальных диалоговых системах.

Теоретическая значимость диссертационной работы заключается в разработке новых методов, используемых при построении интеллектуальных

диалоговых систем, взаимодействующих с неструктурированными данными. В частности, разработаны и формализованы методы сквозного обучения, объединяющие семантический поиск и генерацию текста в RAG-системах, что вносит вклад в понимание механизмов их совместной оптимизации. Также проведено исследование и систематизация влияния стратегий промпт-ориентированного многозадачного обучения и параметро-эффективного дообучения (PEFT) на характеристики моделей, такие как робастность, релевантность и точность, в рамках сквозного обучения для диалоговых задач. Кроме того, обоснованы методы генерации диалога, на основе тесной интеграции поиска и генерации, что создает теоретическую базу для разработки более когерентных и фактологически точных интеллектуальных диалоговых систем.

Практическая значимость результатов диссертационной работы заключается в том, что разработанные методы и алгоритмы могут быть непосредственно использованы при создании интеллектуальных диалоговых систем нового поколения с улучшенными характеристиками. Предложенные решения позволяют создавать более эффективные чат-боты для клиентской поддержки, способные точнее находить информацию в больших базах знаний, и строить продвинутые вопросно-ответные системы, которые синтезируют фактологически обоснованные ответы из различных неструктурированных источников (например, новостей, научных статей или корпоративных документов). В системах управления корпоративными знаниями разработанные решения могут быть интегрированы для обеспечения быстрого семантического поиска по внутренней документации и генерации кратких справок, повышая эффективность работы сотрудников. Особую практическую ценность представляет интеграция методов параметро-эффективного дообучения (PEFT), которая кардинально снижает вычислительные затраты и требования к ресурсам. Это делает внедрение таких сложных диалоговых систем более доступным на практике, способствуя повышению качества взаимодействия человека с компьютером и эффективности обработки информации в широком спектре приложений.

Достоверность научных положений, выводов и результатов, полученных в рамках данной диссертационной работы, подтверждается корректной постановкой задач исследования, основанной на анализе ограничений существующих методов к построению диалоговых систем на основе RAG; использованием современных методов исследования, включая методы машинного обучения, обработки естественного языка, информационного поиска и экспериментального моделирования; применением общепринятых метрик для оценки качества семантического поиска (Retrieval Recall) и генерации текста (BLEU, ROUGE, METEOR); тщательным проведением экспериментальных исследований на данных международного конкурса DSTC10 (The Tenth Dialog System Technology Challenge)); сравнением полученных результатов с результатами известных современных методов, демонстрирующим преимущества разработанных методов сквозного обучения, промпт-ориентированного многозадачного обучения и интеграции PEFT. Достоверность также подтверждается апробацией основных результатов работы, нашедшей отражение в 3 публикациях в рецензируемых научных изданиях, индексируемых в международных базах данных (Scopus, Web of Science) и входящих в перечень ВАК, включая статьи, посвященные промпт-ориентированному многозадачному обучению для текстового поиска и диалоговым системам с доступом к неструктурированным базам знаний, а также представлением и обсуждением ключевых положений диссертации на российских и международных научных конференциях.

Внедрение результатов работы.

Результаты диссертационной работы использованы при проведении следующих прикладных научных исследований:

1. Грант РНФ №22-11-00128 "Разработка и исследование технологий персонификации разговорных агентов с использованием глубоких нейронных сетей".

2. НИР "Разработка русскоязычного персонифицированного диалогового агента с динамической долгосрочной памятью", Университет ИТМО.

3. НИР "Выполнение опережающих исследований и разработок в области алгоритмов сильного искусственного интеллекта", Университет ИТМО.

4. НИР "Разработка виртуального диалогового помощника для поддержки проведения дистанционного экзамена на основе моделей-трансформаторов и понимания естественного и математического языка", Университет ИТМО.

5. Результаты диссертации были успешно применены в ООО «ЦРТ-Инновации» группы копаний ЦРТ при разработке коммерческих продуктов SpeechExplore и ChatNavigator.

Апробация результатов работы. Основные результаты работы докладывались и обсуждались на следующих конференциях: L научная и учебно-методическая конференция университета ИТМО (Санкт-Петербург, Россия, 2021); X Всероссийский конгресс молодых ученых (Санкт-Петербург, Россия, 2021); LI научная и учебно-методическая конференция университета ИТМО (Санкт-Петербург, Россия, 2022); XI Всероссийский конгресс молодых ученых (Санкт-Петербург, Россия, 2022); LII научная и учебно-методическая конференция университета ИТМО (Санкт-Петербург, Россия, 2023); XII Всероссийский конгресс молодых ученых (Санкт-Петербург, Россия, 2023); LIV научная и учебно-методическая конференция университета ИТМО (Санкт-Петербург, Россия, 2025); XIV Конгресс молодых ученых ИТМО (Санкт-Петербург, Россия, 2025); The 63rd Annual Meeting of the Association for Computational Linguistics (Vienna, Austria, 2025) A*.

Личный вклад автора в выполнении представленных в диссертационной работе теоретических и экспериментальных исследований по разработке и исследованию методов сквозного обучения моделей семантического поиска и генерации текста для интеллектуальных диалоговых систем, работающих с неструктурированными базами знаний. Автором проведен анализ современных методов построения RAG-систем, методов семантического поиска, моделей

генерации текста, стратегий их совместной оптимизации, а также методов промпт-инжиниринга и параметро-эффективного дообучения (PEFT). На основе проведенного анализа лично автором предложен и исследован основной метод сквозного обучения RAG-систем, направленный на совместную оптимизацию моделей поиска и генерации текста для улучшения согласованности и фактологической точности ответов. Идея метода обучения робастной модели семантического поиска с использованием промпт-ориентированного многозадачного обучения для повышения его устойчивости к вариациям данных и доменов принадлежит лично автору. Реализация метода и проведение экспериментов выполнены совместно с П. Посоховым и С. Скрыльниковым. Идея метода обрезки поисковой выдачи TMP Adapter принадлежит лично П. Посохову. Реализация метода и проведение вычислительных экспериментов выполнены совместно автором диссертации, П. Посоховым, С. Скрыльниковым и Д. Тирских. Лично автором проведены эксперименты по оценке методов обрезки поисковой выдачи (в т.ч. TMP Adapter) на основе полученной робастной модели семантического поиска на данных датасета FIQA (Financial Opinion Mining and Question Answering). Кроме того, лично автором предложен и исследован метод интеграции методов параметро-эффективного дообучения в сквозное обучение RAG-систем с целью снижения вычислительных затрат и повышения практической применимости методики. Автором спланированы и проведены комплексные экспериментальные исследования, подтверждающие эффективность разработанных методов по сравнению с существующими. Соавторы совместных публикаций внесли следующий вклад:

[2] - P.A. Posokhov занимался разработкой моделей семантического поиска, проведением обучения и валидации нейросетевых моделей, S.S. Skrylnikov занимался сбором и анализом данных, проведением обучения и валидации моделей семантического поиска, O.V. Makhnytkina - осуществляла общее руководство и занималась вычиткой статей, T.Yu. Ivanovskaya - предоставляла консультации и занималась вычиткой статей.

[3] - P.A. Posokhov разработал идею метода TMP Adapter, занимался проведением обучения и валидации нейросетевых моделей на основе архитектуры би-энкодер, S.S. Skrylnikov занимался сбором и анализом данных, проведением обучения и валидации нейросетевых моделей, D.A. Tirskikh занимался разработкой моделей на основе архитектуры кросс-энкодер, проведением обучения и валидации нейросетевых моделей, O.V. Makhnytkina - предоставляла консультации и занималась вычиткой статей.

Структура и объем диссертации.

Диссертация состоит из введения, 4 глав и заключения. Полный объём диссертации составляет 140 страниц, включая 38 рисунков и 24 таблицы. Список литературы содержит 97 наименований.

Публикации. Основные результаты по теме диссертации изложены в 8 публикациях. Из них 3 опубликованы в изданиях, индексируемых в базе цитирования Scopus. Также получено 1 свидетельство о государственной регистрации программ для ЭВМ.

Заключение диссертации по теме «Другие cпециальности», Маслюхин Сергей Михайлович

200 Заключение

В настоящей диссертационной работе проведено комплексное исследование и разработка методов сквозного обучения моделей семантического поиска и генерации текста, предназначенных для интеграции в интеллектуальные диалоговые системы с доступом к неструктурированным базам знаний. Актуальность исследования обусловлена экспоненциальным ростом объемов неструктурированной информации и возрастающей потребностью в диалоговых агентах, способных эффективно извлекать и использовать эти знания для формирования содержательных и фактологически точных ответов.

Основной целью работы являлось повышение ключевых показателей производительности таких систем: точности и полноты семантического поиска, а также связности, релевантности и фактологической обоснованности генерируемого текстового ответа. Для достижения этой цели были решены научно-технические задачи и получены следующие основные результаты, обладающие научной новизной и практической значимостью.

Во-первых, разработан и экспериментально исследован метод сквозного (end-to-end) обучения для RAG-систем с генератором на основе encoder-decoder архитектуры. Предложенный метод, включающий встраиваемый модуль объединения на основе механизма внимания, успешно решает проблему рассогласования целей компонентов. Эксперименты на данных международного конкурса DSTC10 показали, что такая совместная оптимизация позволяет значительно улучшить согласованность между извлекаемыми данными и генерируемым текстом, что приводит к статистически значимому повышению качества. В частности, по сравнению с базовой конвейерной моделью, качество генерации по метрике Rouge-1 возросло на 31% (с 0.136 до 0.178), а точность выбора релевантного документа по метрике R@1 — на 15.6% (с 0.495 до 0.572). Данный результат соответствует первому положению, выносимому на защиту (Научная новизна 1).

Во-вторых, предложен и исследован метод обучения робастной модели семантического поиска (encoder-only), основанный на промпт-ориентированном многозадачном обучении (MTL). Экспериментально доказано, что такой подход существенно повышает устойчивость модели поиска к вариациям в формулировках запросов и доменным сдвигам (out-of-domain generalization) по сравнению с традиционными однозадачными моделями. Например, для задач, требующих обобщения на новые домены, качество ранжирования по метрике MRR выросло более чем на 60%, что обеспечивает более надежный отбор релевантных фрагментов для генеративного компонента RAG-системы и соответствует второму положению, выносимому на защиту (Научная новизна 2).

В-третьих, разработан и апробирован ресурсоэффективный метод сквозного обучения для RAG-систем с генератором на основе decoder-only архитектуры, интегрирующий техники параметро-эффективного дообучения (PEFT) и механизм инъекции контекста. Данный метод решает двойную проблему: обеспечивает канал для передачи знаний в такие модели и кардинально снижает вычислительные затраты. Эксперименты показали, что данный подход позволяет сократить количество обучаемых параметров на два порядка (-98%) и снизить требования к GPU-памяти более чем в 2 раза, сохраняя и даже улучшая качество. Применение этого метода к современным LLM позволило достичь прорывных показателей: точность выбора (R@1) возросла на 90% (до 0.942), а информативность ответа (Rouge-1) — на 220% (до 0.435) по сравнению с базовой моделью. Этот результат соответствует третьему положению, выносимому на защиту (Научная новизна 3).

Все предложенные методы и модели были реализованы и прошли тщательную экспериментальную проверку на репрезентативных наборах данных. Полученные количественные результаты подтвердили эффективность разработанных подходов и их преимущество перед существующими решениями. Таким образом, настоящая диссертационная работа вносит весомый вклад в теорию и практику построения интеллектуальных диалоговых систем, предлагая целостный и архитектурно-ориентированный фреймворк, который способствует

созданию более качественных, робастных и доступных для внедрения систем, способных к глубокому взаимодействию с неструктурированными базами знаний.

Список литературы диссертационного исследования кандидат наук Маслюхин Сергей Михайлович, 2025 год

Список литературы

1. Brandtzaeg, P. B., & Folstad, A. (2017). Why people use chatbots. Lecture Notes in Computer Science (including subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics), 10673 LNCS, 377-392.

2. Laranjo, L., Dunn, A. G., Tong, H. L., Kocaballi, A. B., Chen, J., Bashir, R., ... & Coiera, E. (2018). Conversational agents in healthcare: a systematic review. Journal of the American Medical Informatics Association, 25(9), 12481258.

3. Jurafsky, D., & Martin, J. H. (2023). Speech and language processing (3rd ed. draft). (Доступно онлайн).

4. Weizenbaum, J. (1966). ELIZA - a computer program for the study of natural language communication between man and machine. Communications of the ACM, 9(1), 36-45.

5. Colby, K. M. (1975). Artificial paranoia: A computer simulation of paranoid processes. Pergamon Press.

6. Allen, J. F., Byron, D. K., Dzikovska, M., Ferguson, G., Galescu, L., & Stent, A. (2001). Towards conversational human-computer interaction. AI magazine, 22(4), 27-27.

7. Rudnicky, A. I., Hauptmann, A. G., & Lee, K. F. (1994). Survey of current speech technology. Communications of the ACM, 37(3), 52-57.

8. Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., ... & Polosukhin, I. (2017). Attention is all you need. Advances in neural information processing systems, 30.

9. Serban, I. V., Sordoni, A., Lowe, R., Charlin, L., Pineau, J., Courville, A., & Bengio, Y. (2017). A hierarchical latent variable encoder-decoder model for generating dialogues. Proceedings of the AAAI Conference on Artificial Intelligence, 31(1).

10.Budzianowski, P., Wen, T. H., Tseng, B. H., Su, P. H., Ultes, S., & Gasic, M. (2018). MultiWOZ - A Large-Scale Multi-Domain Wizard-of-Oz Dataset for Task-

Oriented Dialogue Modelling. Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, 5016-5026.

11.Adiwardana, D., Luong, M. T., So, D. R., Hall, J., Fiedel, N., Thoppilan, R., ... & Le, Q. V. (2020). Towards a human-like open-domain chatbot. arXiv preprint arXiv:2001.09977.

12.Roller, S., Dinan, E., Goyal, N., Ju, D., Williamson, M., Liu, Y., ... & Weston, J. (2021). Recipes for building an open-domain chatbot. Proceedings of the 16th Conference of the European Chapter of the Association for Computational Linguistics: Main Volume, 219-233.

13.Chen, D., & Manning, C. (2014). A fast and accurate dependency parser using neural networks. Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), 740-750.

14.Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., ... & Kiela, D. (2020). Retrieval-augmented generation for knowledge-intensive nlp tasks. Advances in Neural Information Processing Systems, 33, 9459-9474.

15.Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018). Improving language understanding by generative pre-training. OpenAI blog.

16.Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., ... & Amodei, D. (2020). Language models are few-shot learners. Advances in neural information processing systems, 33, 1877-1901.

17.Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805.

18.Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., ... & Liu, P. J. (2020). Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of Machine Learning Research, 21(140), 1-67.

19.Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., ... & Fung, P. (2023). Survey of hallucination in natural language generation. ACM Computing Surveys, 55(12), 138.

20.Lyman, P., & Varían, H. R. (2003). How much information? 2003. School of Information Management and Systems, University of California at Berkeley.

21.Gandomi, A., & Haider, M. (2015). Beyond the hype: Big data concepts, methods, and analytics. International Journal of Information Management, 35(2), 137-144.

22.Zhang, Y., Li, Y., Li, L., Chen, Q., & de Rijke, M. (2023). Sirens: A Simple REasoning framework for knowledge-intensive Natural language proceSsing. arXivpreprint arXiv:2305.00973.

23.Karpukhin, V., Oguz, B., Min, S., Lewis, P., Wu, L., Edunov, S., ... & Yih, W. T. (2020). Dense passage retrieval for open-domain question answering. arXiv preprint arXiv:2004.04906.

24.Guu, K., Lee, K., Tung, Z., Pasupat, P., & Chang, M. W. (2020). Retrieval augmented language model pre-training. International Conference on Machine Learning, PMLR, 3920-3930.

25.Chen, D., Fisch, A., Weston, J., & Bordes, A. (2017). Reading Wikipedia to answer open-domain questions. arXiv preprint arXiv:1704.00051.

26.Маслюхин, С. М. (2023). Диалоговая система на основе устных разговоров с доступом к неструктурированной базе знаний. Научно-технический вестник информационных технологий, механики и оптики, 23(1), 88-95.

27.Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press.

28.Robertson, S. E., & Zaragoza, H. (2009). The probabilistic relevance framework: BM25 and beyond. Foundations and Trends® in Information Retrieval, 3(4), 333389.

29.Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence embeddings using Siamese BERT-networks. Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP), 3982-3992.

30.Liu, Y., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., ... & Stoyanov, V. (2019). Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692.

31. Wang, L., Yang, N., Du, X., Wang, W., Li, D., & Wei, F. (2022). Text embeddings by weakly-supervised contrastive pre-training. arXiv preprint arXiv:2212.03533.

32.Johnson, J., Douze, M., & Jegou, H. (2019). Billion-scale similarity search with gpus. IEEE Transactions on Big Data, 7(3), 535-547.

33.Malkov, Y. A., & Yashunin, D. A. (2018). Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs. IEEE transactions on pattern analysis and machine intelligence, 42(4), 824-836.

34.Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A simple framework for contrastive learning of visual representations. International conference on machine learning, PMLR, 1597-1607.

35.Oord, A. V. D., Li, Y., & Vinyals, O. (2018). Representation learning with contrastive predictive coding. arXiv preprint arXiv:1807.03748.

36. MultipleNegativesRankingLoss, [Online], https://sbert.net/docs/package reference/sentence transformer/losses.html#multip lenegativesrankingloss, [Accessed: Nov. 14, 2025].

37.Xiong, L., Xiong, C., Li, C., Tang, R., & Hendry, G. (2020). Approximate nearest neighbor negative contrastive learning for dense text retrieval. arXiv preprint arXiv:2007.00808.

38.Thakur, N., Reimers, N., Ruckl'e, A., Srivastava, A., & Gurevych, I. (2021). BEIR: A Keterogeneous benchmark for zero-shot evaluation of information retrieval models. Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 2).

39.Masliukhin, S. M., Posokhov, P. A., Skrylnikov, S. S., Makhnytkina, O. V., & Ivanovskaya, T. Y. (2024). Prompt-based multi-task learning for robust text retrieval. Scientific and Technical Journal of Information Technologies, Mechanics and Optics, 24(6), 1016-1023.

40.Liu, X., He, P., Chen, W., & Gao, J. (2019). Multi-task deep neural networks for natural language understanding. arXiv preprint arXiv:1901.11504.

41.McKeown, K. R. (1985). Text generation: using discourse strategies and focus constraints to generate natural language text. Cambridge University Press.

42.Koehn, P. (2009). Statistical machine translation. Cambridge University Press.

43.Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural computation, 9(8), 1735-1780.

44.Cho, K., Van Merrienboer, B., Gulcehre, C., Bahdanau, D., Bougares, F., Schwenk, H., & Bengio, Y. (2014). Learning phrase representations using RNN encoderdecoder for statistical machine translation. arXiv preprint arXiv:1406.1078.

45.Bahdanau, D., Cho, K., & Bengio, Y. (2014). Neural machine translation by jointly learning to align and translate. arXiv preprint arXiv:1409.0473.

46.Lewis, M., Liu, Y., Goyal, N., Ghazvininejad, M., Mohamed, A., Levy, O., ... & Zettlemoyer, L. (2019). Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension. arXiv preprint arXiv:1910.13461.

47.Izacard, G., & Grave, E. (2020). Leveraging passage retrieval with generative models for open domain question answering. arXiv preprint arXiv:2007.01282.

48.Papineni, K., Roukos, S., Ward, T., & Zhu, W. J. (2002). Bleu: a method for automatic evaluation of machine translation. Proceedings of the 40th annual meeting of the Association for Computational Linguistics, 311-318.

49.Lin, C. Y. (2004). Rouge: A package for automatic evaluation of summaries. Text summarization branches out: Proceedings of the ACL-04 workshop, 74-81.

50.Banerjee, S., & Lavie, A. (2005). METEOR: An automatic metric for MT evaluation with improved correlation with human judgments. Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization, 65-72.

51.Zhang, T., Kishore, V., Wu, F., Weinberger, K. Q., & Artzi, Y. (2019). Bertscore: Evaluating text generation with bert. arXiv preprint arXiv:1904.09675.

52.Novikova, J., Dusek, O., Curry, A. C., & Rieser, V. (2017). Why we need new evaluation metrics for NLG. Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, 2241-2251.

53.Asai, A., Kasai, J., Wang, H., & Hajishirzi, H. (2023). Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection. arXiv preprint arXiv:2310.11511.

54.Lin, S., Hilton, J., & Evans, O. (2023). RA-DIT: Retrieval-Augmented Dual Instruction Tuning. arXiv preprint arXiv:2310.01352.

55.Trivedi, H., Balasubramanian, N., Khot, T., & Sabharwal, A. (2022). IRCoR: Iterative Retrieval and Reranking for Open-Domain Multi-hop Question Answering. Findings of the Association for Computational Linguistics: EMNLP 2022, 2049-2061.

56.Jiang, Z., Qian, F., Xu, C., Liu, Y., & Lin, J. (2023). Active Retrieval Augmented Generation. arXiv preprint arXiv:2305.06983.

57.Shi, F., Chen, X., Misra, K., Scales, N., Dathathri, S., & Yu, R. (2023). REPLUG: Retrieval-Augmented Black-Box Language Models. arXiv preprint arXiv:2301.12613.

58.Izacard, G., Caron, M., Hosseini, L., Riedel, S., Bojanowski, P., Joulin, A., & Grave, E. (2021). Towards Unsupervised Dense Information Retrieval with Contrastive Learning. arXiv preprint arXiv:2112.09118.

59.Sachan, D. S., Zaheer, M., & Salakhutdinov, R. (2021). End-to-End Training of Neural Retrievers for Open-Domain Question Answering. arXiv preprint arXiv:2101.00408.

60.Wang, B., Liu, K., & Zhao, J. (2018). Differentiable R-network for abstractive sentence summarization. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 1868-1878.

61.Das, R., Zaheer, M., Reddy, S., & Poczos, B. (2017). Question answering by reasoning across documents with graph convolutional networks. arXiv preprint arXiv:1708.00189.

62.Jang, E., Gu, S., & Poole, B. (2016). Categorical reparameterization with gumbel-softmax. arXivpreprint arXiv:1611.01144.

63.Min, S., Zhong, V., Zettlemoyer, L., & Hajishirzi, H. (2023). Non-parametric entidad linking. arXiv preprint arXiv:2305.10754.

64.OpenAI (2023). GPT-4 Technical Report. arXiv preprint arXiv:2303.08774.

65.Chowdhery, A., Narang, S., Devlin, J., Bosma, M., Mishra, G., Roberts, A., ... & Fiedel, N. (2022). Palm: Scaling language modeling with pathways. arXiv preprint arXiv:2204.02311.

66.Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M. A., Lacroix, T., ... & Lample, G. (2023). Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971.

67.Houlsby, N., Giurgiu, A., Jastrzebski, S., Morrone, B., De Laroussilhe, Q., Gesmundo, A., ... & Gelly, S. (2019). Parameter-efficient transfer learning for NLP. International Conference on Machine Learning, PMLR, 2790-2799.

68.Lialin, V., Deshpande, V., & Rumshisky, A. (2023). Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning. arXiv preprint arXiv:2303.15647.

69.Pfeiffer, J., Ruder, S., Vulic, I., & Gurevych, I. (2020). AdapterHub: A framework for adapting transformers. Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, 46-54.

70.Hu, E. J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., ... & Chen, W.

(2021). Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:2106.09685.

71.Li, X. L., & Liang, P. (2021). Prefix-tuning: Optimizing continuous prompts for generation. arXiv preprint arXiv:2101.00190.

72.Lester, B., Al-Rfou, R., & Constant, N. (2021). The power of scale for parameter-efficient prompt tuning. arXiv preprint arXiv:2104.08691.

73.Liu, H., Tam, D., Muqeeth, M., Mohta, J., Huang, T., Bansal, M., & Raffel, C.

(2022). Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-

Context Learning. Advances in Neural Information Processing Systems, 35, 19801993.

74.Kim, S., Liu, Y., Jin, D., Papangelis, A., Hedayatnia, B., Gopalakrishnan, K., & Hakkani-Tur, D. (2021). DSTC10 Track Proposal: Knowledge-grounded Task-oriented Dialogue Modeling on Spoken Conversations.

75.Kim, S., Eric, M., Gopalakrishnan, K., Hedayatnia, B., Liu, Y., & Hakkani-Tur, D. Z. (2020). Beyond domain APIs: Task-oriented conversational modeling with unstructured knowledge access. Proceedings of the 21st Annual Meeting of the Special Interest Group on Discourse and Dialogue, 278-289.

76.Budzianowski, P., Wen, T. H., Tseng, B. H., Casanueva, I., Ultes, S., Ramadan, O., & Gasic, M. (2018). MultiWOZ - A large-scale multi-domain wizard-of-oz dataset for task-oriented dialogue modelling. Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, 5016-5026.

77. Eric, M., Goel, R., Paul, S., Sethi, A., Agarwal, S., Gao, S., ... & Hakkani-Tur, D. (2020). Multiwoz 2.1: Multi-domain dialogue state corrections and state tracking baselines. Proceedings of the Twelfth Language Resources and Evaluation Conference, 422-428.

78. Zang, X., Rastogi, A., Sunkara, S., Gupta, R., Zhang, J., & Chen, J. (2020). MultiWOZ 2.2: A dialogue dataset with additional annotation corrections and state tracking baselines. Proceedings of the 2nd Workshop on Natural Language Processing for Conversational AI, 109-117.

79. Baevski, A., Zhou, H., Mohamed, A., & Auli, M. (2020). wav2vec 2.0: A framework for self-supervised learning of speech representations. Advances in Neural Information Processing Systems, 33, 12449-12460.

80. Panayotov, V., Chen, G., Povey, D., & Khudanpur, S. (2015). Librispeech: An ASR corpus based on public domain audio books. 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 5206-5210.

81. Heafield, K. (2011). KenLM: Faster and smaller language model queries. Proceedings of the sixth workshop on statistical machine translation, 187-197.

82. Gopalakrishnan, K., Hedayatnia, B., Wang, L., Liu, Y., & Hakkani-Tur, D. (2020). Are neural open-domain dialog systems robust to speech recognition errors in the dialog history? an empirical study. ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 7919-7923.

83.Wang, L., Fazel-Zarandi, M., Tiwari, A., Matsoukas, S., & Polymenakos, L. (2020). Data Augmentation for Training Dialog Models Robust to Speech Recognition Errors. Proceedings of the 2nd Workshop on Natural Language Processing for Conversational AI, 63-70.

84. Hearst, M. A., Dumais, S. T., Osuna, E., Platt, J., & Scholkopf, B. (1998). Support vector machines. IEEE Intelligent Systems and their applications, 13(4), 18-28.

85.Johnson, R., & Zhang, T. (2016). Convolutional neural networks for text categorization: Shallow word-level vs. deep character-level. arXiv preprint arXiv:1609.00718.

86.Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners. OpenAI Blog, 1(8), 9.

87.Humeau, S., Shuster, K., Lachaux, M. A., & Weston, J. (2019). Poly-encoders: Architectures and pre-training strategies for fast and accurate multi-sentence scoring. arXiv preprint arXiv:1905.01969.

88.Posokhov, P.A., Masliukhin, S.M., Skrylnikov, S.S., Tirskikh, D.A., & Makhnytkina, O.V. (2025). Relevance Scores Calibration for Ranked List Truncation via TMP Adapter. Findings of the Association for Computational Linguistics: ACL 2025.

89.Ruder, S. (2017). An overview of multi-task learning in deep neural networks. arXiv preprint arXiv:1706.05098.

90.Matveev, Y., Makhnytkina, O., Posokhov, P., Matveev, A., & Skrylnikov, S. (2022). Personalizing hybrid-based dialogue agents. Mathematics, 10(24), 4657.

91.Posokhov, P., Apanasovich, K., Matveeva, A., Makhnytkina, O., & Matveev, A. (2022). Personalizing dialogue agents for Russian: Retrieve and refine. 2022 Conference of Open Innovations Association (FRUCT), 245-252.

92.Posokhov, P., Matveeva, A., Makhnytkina, O., Matveev, A., & Matveev, Y. (2022). Personalizing retrieval-based dialogue agents. Lecture Notes in Computer Science, 13721, 554-566.

93.Su, H., Shi, W., Kasai, J., Wang, Y., Hu, Y., Ostendorf, M., ... & Yu, T. (2022). One embedder, any task: Instruction-finetuned text embeddings. arXiv preprint arXiv:2212.09741.

94.Kingma, D. P., & Ba, J. (2014). Adam: A method for stochastic optimization. arXiv preprint arXiv:1412.6980.

95.Pfeiffer, J., Ben Abacha, A., Rückle, A., Vulic, I., Poth, C., Kamath, A., ... & Gurevych, I. (2023). Modular Deep Learning. arXiv preprint arXiv:2302.11529.

96.Zaken, E. B., Ravfogel, S., & Goldberg, Y. (2021). Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models. arXiv preprint arXiv:2106.10199.

97.Маслюхин С.М. (науч. рук. Матвеев Ю.Н.) Исследование методов выбора релевантных элементов в диалоговых системах с доступом к неструктурированным данным // Сборник тезисов докладов конгресса молодых ученых. Электронное издание. - СПб: Университет ИТМО, [2025]

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.