Методы и наборы данных для оценки моделей информационного поиска и обработки естественного языка тема диссертации и автореферата по ВАК РФ 00.00.00, доктор наук Браславский Павел Исаакович
- Специальность ВАК РФ00.00.00
- Количество страниц 371
Оглавление диссертации доктор наук Браславский Павел Исаакович
Введение
Глава 1. Обзор исследований
1.1 Оценка задач информационного поиска
1.1.1 Лабораторная парадигма и ее альтернативы
1.1.2 Представление результатов поиска, сниппеты
1.1.3 Анализ запросов и поведения пользователей
1.1.4 Перенос обучения в задачах поиска
1.2 Оценка задач обработки естественного языка
1.2.1 Мультиязычная оценка
1.2.2 Машинный перевод
1.2.3 Извлечение информации
1.2.4 Межъязыковой перенос
1.3 Оценка вопросно-ответного поиска
1.3.1 Подходы к оценке
1.3.2 Извлечение ответов, или «понимание прочитанного»
1.3.3 Поиск ответов в базе знаний
1.4 Оценка задач вычислительного юмора
1.4.1 Наборы данных
1.4.2 Распознавание юмора
1.4.3 Генерация юмора
Глава 2. Методы оценки задач информационного поиска
2.1 Комплексная оценка веб-сниппетов
2.1.1 Эксперименты с участием пользователей
2.1.2 «Лабораторная» оценка
2.1.3 Автоматические метрики
2.1.4 Онлайн-оценка
2.2 Анализ вопросов и поведения пользователей
2.2.1 Тематическая классификация поисковых вопросов
2.2.2 Как-вопросы и межъязыковой поиск по видео
2.2.3 Сравнительные и дискуссионные вопросы
2.2.4 Вопросы о медицине и здоровье
2.3 Оценка переноса обучения в задачах поиска
2.3.1 Ранжирование на основе модели BERT
2.3.2 Поиск ответа на медицинские вопросы
Глава 3. Оценка задач обработки естественного языка
3.1 Оценка машинного перевода «английский - русский»
3.1.1 Данные
3.1.2 Методы
3.1.3 Результаты
3.2 Создание наборов данных для задач излечения информации
3.2.1 Набор данных WikiOrg
3.2.2 Набор данных NEREL
3.2.3 Набор данных NEREL-BIO
3.3 Оценка межъязыкового выравнивания и переноса обучения
3.3.1 Межъязыковой перенос и выравнивание
3.3.2 Данные и задачи
3.3.3 Результаты экспериментов
3.4 Оценка больших языковых моделей
3.4.1 Данные
3.4.2 Модели
3.4.3 Результаты
Глава 4. Методы создания вопросно-ответных наборов данных
4.1 Набор данных SberQuAD
4.1.1 Основные характеристики
4.1.2 Анализ вопросов и ответов
4.1.3 Оценка качества моделей
4.2 Набор данных RuBQ
4.2.1 Часть 1: Вопросы и ответы викторин
4.2.2 Часть 2: Вопросы из подсказок поисковых запросов
4.2.3 Эксперименты на данных RuBQ
4.3 Набор данных KazQAD
4.3.1 Данные и разметка
4.3.2 Структура и статистика
4.3.3 Результаты базовых методов
Глава 5. Методы оценки задач вычислительного юмора
5.1 Методы создания наборов данных
5.1.1 Наборы данных Stierlitz и FUN
5.1.2 Набор данных KoWit-24
5.2 Устойчивость и переносимость моделей распознавания юмора
5.2.1 Данные
5.2.2 Методы
5.2.3 Результаты
5.3 Оценка автоматически сгенерированного юмора
5.3.1 Эксперименты с пользователями
5.3.2 Эксперименты по генерации юмора
5.3.3 Оценка на основе краудсорсинга
Заключение
Список сокращений и условных обозначений
Список литературы
Список рисунков
Список таблиц
Приложение A. Наборы данных и кодовые базы
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Контекстно-ассоциативный метод уточнения поисковых запросов с обратной связью по релевантности2006 год, кандидат физико-математических наук Беляев, Дмитрий Владимирович
Методы и модели анализа больших коллекций веб-документов медицинской тематики2019 год, кандидат наук Белобородов Александр Владимирович
Метод и алгоритмы интерпретации неполных высказываний пользователя для управления устройствами Интернета вещей на основе онтологического подхода2019 год, кандидат наук Шилин Иван Андреевич
Модели и методы автоматической обработки неструктурированной информации на основе базы знаний онтологического типа2014 год, кандидат наук Лукашевич, Наталья Валентиновна
Нейросетевые методы работы с базами знаний для ответа на вопросы, ведения диалога и обработки текста2023 год, кандидат наук Евсеев Дмитрий Андреевич
Введение диссертации (часть автореферата) на тему «Методы и наборы данных для оценки моделей информационного поиска и обработки естественного языка»
Введение
Модели информационного поиска (ИП, information retrieval) и обработки естественного языка (ОЕЯ, natural language processingпринадлежат классу моделей анализа данных и искусственного интеллекта. На сегодняшний день системами на их основе пользуются практически все люди с доступом в интернет, т.е. около 2/3 населения Земли.2 Оценка (evaluation)3 этих моделей является важным инструментом для выявления проблем и ограничений, а также основой для их улучшения. Популярность и широта применения, разнообразие контекстов использования и характеристик пользователей делают оценку моделей информационного поиска и обработки естественного языка особенно актуальной. Оценка особенно важна в областях, где критичны безопасность и надежность, например медицина и финансы.
Оценку моделей ИП и ОЕЯ невозможно провести полностью автоматически и формально: люди участвуют либо непосредственно в процессе оценки, либо на этапе разметки данных, что делает оценку ресурсоемким и трудозатрат-ным процессом. Разные языки неравномерно обеспечены данными для оценки, а качество существующих данных для малоресурсных языков обычно ниже [1]. В этих условиях особенно актуальными становятся методы, ориентированные на мультиязычные задачи, основанные на переиспользовании существующих данных, оптимизации процесса оценки и разметки данных, в том числе комбинирующие ручные и автоматические методы.
Оценка является «ускользающей целью»: постоянный прогресс моделей требует обновления существующих и разработки новых методов оценки и наборов данных [2]. Кроме того, расширяется область применения моделей и их аудитория, развитие больших языковых моделей (БЯМ) демонстрирует это особенно наглядно. Для оценки БЯМ стали использовать более широкий спектр наборов данных и оценивать такие аспекты моделей, как безопасность, соответствие культурным предпочтениям, а также их творческие способности [3]. Одновременно БЯМ стали активно использовать в качестве арбитра для оцен-
1 Другое название - автоматическая обработка текстов (АОТ).
2По данным Международного союза электросвязи на конец 2024 года, https://www.itu.int/itu-d/ reports/statistics/facts-figures-2024/.
3Русский термин оценка - аналог английского evaluation, т.е. имеется в виду процесс оценивания.
ки (LLM-as-a-judge) - подход привлекает простотой реализации и снижением расходов по сравнению с ручной оценкой, однако его результаты могут быть смещенными [4].
Степень разработанности темы. Мероприятия по оценке моделей ИП
и ОЕЯ регулярно проводятся в рамках TREC, CLEF, SemEval и других инициатив. Исследователи совершенствуют методы оценки и публикуют новые наборы данных. Однако динамика области и особенности оценки, упомянутые выше, не позволяют говорить о «полностью решенных проблемах», скорее - о тенденциях и смене акцентов. Можно выделить несколько востребованных направлений развития методов оценки.
Взрывной рост объемов информации, доступной в интернете, и рост аудитории пользователей поставил новые задачи перед оценкой систем информационного поиска. Для получения более реалистичных результатов необходимо учитывать особенности взаимодействия пользователей с системой и характеристики самих пользователей, для этого - развать методы анализа логов поисковых запросов [5] и методы оценки с участием пользователей [6].
Ограниченность данных для обучения и оценки моделей можно частично компенсировать подходами на основе переноса обучения: модели обучаются на данных, не связанных напрямую с целевым использованием [7]. Перенос можно осуществлять между наборами данных, доменами, языками. Однако результаты, описанные в литературе, часто противоречивы, поэтому исследования этой перспективной темы остаются актуальными. Неравномерная обеспеченность языков ресурсами для обучения и оценки моделей делает создание неанглийских наборов данных актуальной задачей [8].
Вопросно-ответный поиск - особая дисциплина на пересечении информационного поиска и обработки естественного языка: он имеет важное практическое значение и одновременно является гибким форматом для диагностики отдельных характеристик и способностей моделей. Несмотря на обилие вопросно-ответных ресурсов, большинство из них - на английском языке, поэтому остается актуальной разработка методов создания новых наборов данных в условиях ограниченности ресурсов [9].
Современные модели разговорного искусственного интеллекта (conversational AI) должны обладать эмоциональным интеллектом, желательно - понимать и генерировать шутки. Автоматические методы распознавания
и генерации юмора - сложная и перспективная область междисциплинарных исследований [10]. Субъективность восприятия юмора и его зависимость от контекста делают оценку и создание наборов данных в этой области непростыми задачами.
Таким образом, в области оценки информационного поиска и обработки естественного языка, несмотря на значительный прогресс, остается много открытых задач.
Целью работы является развитие методов и ресурсного обеспечения оценки широкого спектра задач информационного поиска и обработки естественного языка. Для достижения этой цели были решены следующие задачи:
1. Разработка методов создания наборов данных для оценки моделей информационного поиска и обработки естественного языка.
2. Совершенствование методов оценки задач информационного поиска и обработки естественного языка в условиях ограниченных ресурсов.
3. Анализ качества моделей информационного поиска и обработки естественного языка при переиспользовании данных и переносе обучения, формулировка рекомендаций на основе результатов анализа.
4. Разработка методов оценки, которые учитывают характеристики пользователей, выработка подходов к повышению качества систем с учетом полученных результатов.
Объекты исследования - модели информационного поиска и обработки естественного языка, в частности - модели поиска и ранжирования, генерации сниппетов, классификации текстов по различным основаниям, модели извлечения информации, машинного перевода, мультизадачные большие языковые модели.
Предмет исследования - методы оценки моделей информационного поиска и обработки естественного языка, включая методы создания наборов данных для оценки.
Научная новизна:
1. Разработана автоматизированная технология создания вопросно-ответных наборов данных на основе коллекций пар «вопрос-ответ», сервисов подсказок поисковых запросов, вопросно-ответных коллекций на других языках. На основе предложенной технологии созданы и опубликованы первый русскоязычный набор данных для поиска ответов по
базе знаний RuBQ [11; 12] и первый казахский вопросно-ответный набор KazQAD [13].
2. Разработаны автоматизированные методы создания наборов данных для задач вычислительного юмора. Созданы новые русскоязычные наборы данных: большой двухклассовый набор данных FUN [14] и набор данных с гранулярной разметкой игры слов в новостных заголовках KoWit-24. Разработан оригинальный метод лексической балансировки набора данных для распознавания юмора, предложен автоматический метод оценки интерпретации игры слов языковыми моделями.
3. Разработаны автоматизированные методы создания наборов данных для задач извлечения информации. Подготовлены и опубликованы новые наборы данных на русском языке: NEREL (общая тематика) [15— 17] и NEREL-BIO (биомедицинская тематика) [18]. Датасеты характеризуются большим размером, подробностью и полнотой разметки.
4. Предложен новый метод комплексной оценки веб-сниппетов, который включает ручную оценку, автоматические метрики качества и онлайн-оценку [19].
5. Предложены методы сегментации лога поисковых запросов, которые используются для оценки качества, повышения удобства и безопасности веб-поиска. Впервые проведен комплексный анализ большого русскоязычного лога вопросов веб-поиска и информационных потребностей пользователей [20—25].
6. Проведена первая систематическая оценка машинного перевода для пары «английский ^ русский» на основе ручных и автоматических методов, подготовлены и опубликованы данные, предложен оригинальный метод сокращения объема ручной оценки [26].
7. Получены новые результаты, касающиеся эффективности переноса обучения между доменами [20; 27—29] и языками [13; 30] в задачах информационного поиска и обработки естественного языка.
8. Предложен метод учета социально-демографических факторов для повышения надежности крауд-оценки смешных текстов [31].
Научная и практическая значимость. Предложенные в работе мето-
ды решают важную научную проблему оценки моделей информационного поиска и обработки естественного языка. Созданные в рамках работы наборы
данных находятся в открытом доступе и активно используются в индустрии и академических исследованиях. Предложенные новые научно обоснованные решения позволяют оптимизировать процесс оценки и создания наборов данных. Результаты анализа переноса обучения с помощью моделей на основе архитектуры Трансформер в различных конфигурациях (между языками и предметными областями) на широком спектре задач имеют важное теоретическое и прикладное значение.
Методы и подходы. В работе используются методы машинного обучения (в том числе глубинного обучения) и статистики, методы автоматической и ручной разметки данных, большой набор методов информационного поиска и обработки естественного языка.
Степень достоверности полученных результатов обеспечивается тщательным планированием экспериментов и анализом полученных результатов, перекрытием при разметке данных и учетом согласованности асессоров, использованием стандартных программных библиотек, учетом случайных факторов при обучении нейросетевых моделей и расчетом статистической значимости различий между результатами.
Апробация работы. Основные результаты работы докладывались на
международных конференциях «Диалог»(2017), ACL (2013, 2019, 2023) (A*), AINL'2018, AIST'2020, CHIIR'2018, CIKM (2015, 2021) (A), CLEF (2011, 2014, 2016, 2017, 2020), C0LING'2022 (A), ECIR'2013 (B), ECIR'2023 (A), EMNLP'2023 (A*), ESWC'2021 (A), ISWC'2020 (A), KESW'2016, LREC (2022), LREC-C0LING'2024 (B), RANLP'2021, SIGIR (2021, 2022) (A*), WSDM (2020, 2022) (A*). Результаты работы получены в том числе в рамках проектов, поддержанных РФФИ (проект № 14-07-00589 «Анализ данных и моделирование пользователей тематических социальных медиа») и РНФ (проект № 20-11-20166 «Автоматические методы построения и пополнения баз знаний на основе кросс-языковых технологий»). Часть результатов была получена в рамках стажировок в Emory University (грант Fulbright Visiting Scholar program, 2015-2016 гг.) и Bauhaus Universität Weimar (гранты DAAD 2013 и 2018 гг.). Цикл статей 2019-2023 гг. был отмечен премией Yandex ML Prize 2023 в номинации «Научные руководители».
Основные положения, выносимые на защиту:
1. Методы создания и анализа вопросно-ответных датасетов, наборы данных RuBQ и KazQAD.
2. Методы создания и анализа наборов данных для задач вычислительного юмора, датасеты FUN и KoWlT-24.
3. Методы создания наборов данных для обучения и оценки моделей извлечения информации, датасеты NEREL и NEREL-BIO.
4. Методы сегментации большого лога вопросов веб-поиска и анализа информационных потребностей пользователей.
5. Оценка качества и анализ переноса обучения в различных конфигурациях в задачах информационного поиска и обработки естественного языка.
6. Методы комплексной оценки веб-сниппетов и машинного перевода, крауд-оценки автоматически сгенерированных смешных текстов.
Личный вклад. В качестве главного соавтора автор формулировал цели и задачи исследований, планировал эксперименты, определял методы, разрабатывал схемы и организовывал работы по разметке данных, занимался обработкой, анализом, обобщением полученных результатов, а также подготовкой статей. Во всех исследованиях, включенных в диссертацию, автор принимал участие в концептуализации целей и задач, определении методов, проведении экспериментов, анализе результатов, написании статей. В части работ автор также участвовал в разработке кода для проведения экспериментов и участвовал в разметке данных.
Публикации. Основные результаты по теме диссертации опубликованы в 35 работах, проиндексированных в базах Web of Science и/или Scopus. Две работы опубликованы в журналах уровня Q1, 13 - уровня Q2 (из них пять - в трудах конференций уровня CORE A), 16 статей - в трудах конференций уровня A и A* по рейтингу CORE. Автор является главным соавтором 18 статей, из них 14 - повышенного уровня: 9 опубликованы в изданиях уровня Q2 (из них 4 - в трудах конференций уровня CORE A), 9 - в трудах конференций уровня A и A* по рейтингу CORE.
Объем и структура работы. Диссертация состоит из введения, пя-
ти глав, заключения и приложения. Полный объём диссертации составляет
371 страницу с 44 рисунками и 88 таблицами. Список литературы содержит 579 наименований.
Глава 1. Обзор исследований
1.1 Оценка задач информационного поиска
Инструменты поиска информации существовали уже в древних библиотеках. Например, коллекция глиняных табличек, найденная при раскопках города Эбла в Сирии и датируемая периодом между 2500 и 2250 гг. до н. э., содержит специальные глиняные ярлыки для навигации и поиска.1 На протяжении всей истории библиотеки совершенствовали методы поиска, в том числе - за счет более продвинутых схем индексирования. Первые системы информационного поиска на основе компьютеров появились в 1950-х годах [32].
1.1.1 Лабораторная парадигма и ее альтернативы
Рисунок 1.1 — Основные компоненты и схема взаимодействия при поиске
информации
Рис. 1.1 иллюстрирует классическую схему информационного поиска (information retrieval): информационно-поисковая система по запросу пользователя возвращает набор документов из коллекции. В контексте информационного поиска важно разделять информационную потребность (information need) и запрос (query). Информационная потребность возникает у пользователя в результате недостатка информации для решения конкретной проблемы. Запрос -
1 Ш;р8://ги^1к1реё1а.о^^1к1/Царский_архив_Эблы
это выражение информационной потребности в терминах, «понятных» информационной системе. Формулировка информационной потребности в виде запроса может быть нетривиальной проблемой; одной и той же информационной потребности могут соответствовать разные запросы - как удачные, так и неудачные. На начальном этапе развития информационного поиска усилия исследователей и практиков были направлены в основном на разработку эффективных методов индексирования документов, т.е. таких представлений, которые обеспечивали бы быстрый и точный поиск. Скорость работы - понятный и легко измеримый критерий, однако достаточно рано появилось понимание, что качество информационно-поисковой системы определяется в основном релевантностью ответа, т.е. соответствием возвращаемых документов информационной потребности пользователя. При этом релевантность документа сложно формализовать и оценить без участия человека, что определяет основную проблему оценки в информационном поиске.
Первые предложения по формализации оценки (evaluation) информационного поиска были сделаны еще в 1950-е годы Кирилом Клевердоном (Cyril Cleverdon) [33]. Правда, они касались сравнительной оценки различных схем ручного индексирования и поиска документов в библиотечной каталоге. Однако предложенные концепции (запрос, документ, релевантность, индекс, поиск) и сами подходы позже успешно применялись к компьютерным системам. Эти идеи были развиты в Крэнфилдовских экспериментах (Cranfield experiments) в 1960-х годах [34], от которых ведет отсчет история оценки систем информационного поиска.
В 1992 году состоялся первый цикл Text REtrieval Conference (TREC). В следующие годы TREC стал лидирующей площадкой для экспериментальной оценки систем информационного поиска, развития ресурсов и методологии оценки. В рамках TREC проводились разные «дорожки» (tracks)2:
— Ad Hoc Retrieval - классическая задача поиска документов по текстовым запросам,
— Filtering - выбор новостных документов из потока на основании профиля пользователя,
2Английское track было выбрано по созвучию с названием конференции, русский вариант использовался в рамках Российского семинара по оценке методов информационного поиска (РОМИП). Другие термины, которые стали общепринятыми благодаря РОМИП, - метод общего котла (pooling) и асессор (judge).
Рисунок 1.2 — Метод общего котла для оценки информационного поиска
— Question Answering (QA) - методы извлечения коротких ответов на вопросы (подробнее см. § 1.3),
— Web Track - поиск по большой веб-коллекции,
— Cross-Language IR (CLIR) - поиск, при котором запросы и документы -на разных языках.
Кроме того, в рамках TREC были проведены специализированные дорожки -поиск по коллекции юридических и медицинских документов, коллекции бло-гов. Полный список дорожек и годы их проведения можно найти на сайте TREC.3 Каждая дорожка включает стандартную коллекцию, набор описаний информационных потребностей (topic в терминах TREC), которые в свою очередь включают заголовок (title), описание (description) и развернутое пояснение (narrative), а также оценки релевантности пар «запрос-документ» (qrels, бинарные или с градациями). Важно подчеркнуть, что «лабораторная парадигма» оценки TREC является абстракцией реального использования информационно-поисковых систем: не учитываются особенности конкретных пользователей, интерфейс и язык запросов системы, скорость работы. Пара «запрос-документ» оценивается изолированно, без учета других результатов поиска по тому же запросу или результатов предыдущих запросов в поисковой сессии.
Набор документов для оценки в TREC формировался «методом общего котла» (pooling): объединяются топ-^ результатов систем участников по каждому запросу, см. Рис. 1.2. Оценку проводили аналитики Национального института стандартов (NIST), организатора TREC. На основе полученных оценок пар «запрос-документ» вычисляются метрики качества. Базовые метрики - это метрики на множествах документов в отклике (ранжирование не учитывает-
3https://pages.nist.gov/trec-browser/
ся): точность (Precision), полнота (Recall) и F-мера (взвешенное гармоническое среднее точности и полноты). Эти метрики используются и в задачах классификации. Есть варианты этих метрик на топе результатов, например precision@1 или precision@10 - точность на уровне первого или десяти первых результатов, соответственно.
Макроусредненная средняя точность (Mean Average Precision, MAP) учитывает позиции релевантных документов и позволяет унифицировать вклад запросов с разным количеством релевантных документов в коллекции:
i Л i w
МАР = о Е ж Е р<@к • , (1.1)
q=1 q k=1
где:
— Rq - количество релевантных документов для запроса q,
— N - глубина пула,
— Pk - точность выдачи по запросу q на уровне к,
— relfhk = 1, если документ по запросу q на позиции к релевантный и 0 иначе.
Еще одна метрика, которая активно использовалась в экспериментах по ранжированию, - дисконтированная накопленная полезность (Discounted Cumulative Gain, DCG) и ее нормализованный вариант nDCG [35]. Важные отличия в том, что метрика использует не бинарные, а уровневые оценки релевантности (обычно 4-5 уровней); релевантность дисконтируется с увеличением позиции документа в выдаче.
к 2reli — 1
DCG@k = V--——, (1.2)
ti + 1)
где:
— reli - оценка релевантности документа на позиции i,
— к - глубина оценки.
Нормализованны полезность nDCG вычисляется как отношение наблюдаемого DCG и идеальному: nDCG@k = Рвыжк.
Важно отметить особенности «классической схемы» TREC по сравнению с более поздними подходами: описания информационной потребности формируются аналитиками (не реальными пользователями), в стандартном наборе нет
данных для обучения (но можно использовать размеченные данные прошлых лет), размечаются только данные участников, допускаются ручное формирование/корректировка запросов участниками (эти «ручные прогоны» должны быть специально помечены при подаче результатов). В каждый цикл размечалось небольшое количество запросов (-50) при относительно большой глубине «котла» (-100-200).
Методология TREC содержит ряд потенциальных недостатков: несогласованность оценок асессоров (в том числе при повторной оценке одним и тем же асессором), смещение/неполнота набора релевантных/нерелевантных документов, неизвестный уровень чувствительности, т.е. способности различать системы с близким уровнем качества. Как было показано на данных TREC, несмотря на несогласованность асессоров, ранжирование систем остается стабильным [36]. Джастин Зобель показал в своем исследовании, что набор систем-участниц и глубина пула могут влияют на набор релевантных документов, но влияние этих факторов на относительное ранжирование систем невелико [37]. Этот результат позволяет переиспользовать разметку релевантности для оценки систем, которые не участвовали в оригинальном цикле TREC. Проблема чувствительности метрик рассматривалась в нескольких исследованиях [38— 40]. Эксперименты, в частности, продемонстрировали разные различительные способности метрик: например, MAP (см. формулу 1.1) более стабильна и информативна, но менее интуитивна по сравнению с precision@10.
TREC оказал большое влияние на развитие информационного поиска: стал де-факто стандартом оценки систем ИП, ввел набор стандартных процедур и метрик качества, способствовал созданию и распространению данных, а также формированию сообщества, объединившего профессионалов из индустрии и академии. История, методология и основные результаты TREC описаны в обширной литературе [41—43].
По образцу TREC была организована Document Understanding Conference (DUC) (2001-2007), которая фокусировалась на оценке методов автоматического реферирования. В 2008 появилась Text Analysis Conference (TAC), преемница DUC и дорожки TREC по вопросно-ответному поиску. Помимо «унаследованных» задач - реферирования и ответов на вопрос, - TAC включала задачи автоматического наполнения баз знаний (Knowledge Base Population) и распознавания текстовой импликации (Recognizing Textual Entailment, RTE).
По модели TREC позже были образованы аналогичные инициативы в других странах - европейский CLEF [44], NTCIR в Японии , FIRE в Индии и РО-МИП в России6. Все эти инициативы объединяют важные принципы: стандартные правила проведения, открытость данных и результатов. Это способствует прогрессу в решении конкретных задач и, что важно, - позволяет измерять этот прогресс.
CLEF (изначально - Cross-Language Evaluation Forum, после «переформатирования» в 2010 - Conference and Labs of the Evaluation Forum), стартовавшая в 2000 году, изначально была ориентирована на задачи многоязычного поиска и извлечения информации, а затем существенно расширила спектр «лабораторий» - аналогов «дорожек» TREC. NTCIR (NII Testbeds and Community for Information access Research) — это серия кампаний по оценке, проводимых с конца 1990-х годов Национальным институтом информатики Японии (NII). Основное внимание NTCIR уделяется задачам мультиязычного информационного поиска и извлечения информации, с особым акцентом на азиатские языки (японский, китайский, корейский и др.). Индийский FIRE (Forum for Information Retrieval Evaluation) с 2008 года готовит ресурсы и проводит соревнования по различным задачам поиска, включая межъязыковой поиск и обработку текстов на индийских языках.
РОМИП (Российский семинар пои оценке Методов Информационного Поиска) объединил российских исследователей и представителей индустрии в 2002-2013 годах [45]. Во многом РОМИП ориентировался на опыт и модель TREC, но были некоторые важные особенности. Так, изначально запросы для дорожки по поиску были сэмплированы из поискового лога Яндекса, причем участники должны были вернуть результаты для всего набора запросов, из которых потом оценивалось небольшая часть (это исключало возможность «ручных» прогонов). Для более надежной и согласованной оценки оригинальные запросы сопровождались описанием информационной потребности для асессоров. Еще одна особенность - оценка большого количества запросов для коллекции By.Web с уменьшенной глубиной «котла» - 20. Статистика самых больших коллекций РОМИП для задачи поиска по запросу приведена в Табл. 1. Кроме классической задачи поиска, за десятилетие РОМИПа были проведены
4https://research.nii.ac.jp/ntcir/index-en.html
5https://fire.irsi.org.in/
6http://romip.ru/
дорожки по тематической классификации документов, генерации сниппетов, вопросно-ответному поиску и извлечению фактов, кластеризации новостей, анализу тональности. Кроме того, были проведены дорожки по компьютерному зрению и машинному переводу (см. § 3.1). Несмотря на то, что РОМИП больше
7
не проводит мероприятий, данные остаются доступными для исследователей. Таблица 1 — Самые большие поисковые коллекции РОМИП
Коллекция Документы Запросы Оцененные
Legal -300 000 14 974 220
By.Web 1524 676 -60 000 1500+
KM.RU 3 010 455 -60 000 -250
Классическая модель ранжирования BM25 [46], которая широко использовалась в экспериментах TREC и до сих пор считается «сильной отправной точкой», имеет всего два настраиваемых параметра (к\ и Ь). Оценка релевантности документа d для запроса q вычисляется как сумма по терминам запроса:
BM25(M) = Е IDF(£)--f {t,d)(kl + 1) , дч , (1.3)
ti f (М) + к! ^ - b + bJgL)
где
— f (t,d) — частота термина t в документе d,
— |d| — длина документа,
— avgdl — средняя длина документа в коллекции,
— к\ > 0 — параметр, влияющий на учет частоты термина,
— b е [0,1] — параметр нормализации по длине документа.
Обратная документная частота (inverse document frequency, IDF) документа обычно определяется как:
IDF(i) = log "-++-Р5, (1.4)
где N - количество документов в коллекции, щ - количество документов, содержащих термин t.
На 2000-е годы пришлись активные эксперименты с машинным обучением ранжированию в информационном поиске (Learning to Rank, LETOR).8 Методы
7http://romip.ru/
8 О ранних экспериментах и возможных причинах «запаздывания» использования методов машинного
обучения в информационном поиске см. [47].
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Моделирование процесса автоматического извлечения знаний в вопросно-ответных системах2008 год, кандидат технических наук Степанова, Надежда Александровна
Разработка и модификация моделей и алгоритмов поиска данных в INTERNET/INTRANET среде для улучшения качества поиска2014 год, кандидат наук Хорошко, Максим Болеславович
Терминологический поиск в коллекциях математических текстов2014 год, кандидат наук Заикин, Данила Александрович
Методы группировки и структуризации поисковых запросов и их реализация2011 год, кандидат физико-математических наук Киселёва, Юлия Евгеньевна
Список литературы диссертационного исследования доктор наук Браславский Павел Исаакович, 2026 год
Источник Q P+ P-
NQ (train) 3 487 3 893 3 558
ЕНТ (dev) 548 769 229
ЕНТ (test) 1929 2 718 653
Всего 5 964 7 380 4 440
Части ЕНТ и NQ довольно схожи по длине вопросов, но ответы ЕНТ значительно короче. Обратите внимание, что исходные данные ЕНТ состоят из пар «вопрос-ответ», и большинство ответов были оставлены аннотаторами без изменений. Последняя строка в Табл. 60 оценивает сходство вопросов и текстов с ответами, используя длину наибольшей общей подстроки.37 Высокое лексическое перекрытие между вопросом и соответствующим контекстом упрощает
37Мы использовали библиотеку difflib, см. https://docs.python.org/3/library/difflib.html.
Таблица 60 — Статистика KazQAD и переведенных данных NQ (LCS - longest common substring, наибольшая общая подстрока)
KazQAD
- NQtransl.
train dev test
# пары «вопрос-ответ» 3163 764 2 713 61 606
# уникальные вопросы 2 920 545 1 927 61 198
# уникальные абзацы 1 993 697 2 137 53 204
# короткие ответы 3 826 910 3315 71 242
ср. длины абзаца в словах 72,9 105,1 107,1 72,7
ср. длина вопроса в словах 6,1 6,8 6,8 6,6
ср. длина ответа в словах 3,5 2,0 1,9 3,6
ср. длина ЬС8 «вопрос—абзац» 11,6 12,9 13,0 13,1
задачу поиска ответа (см. § 1.3.2). Хотя прямое сравнение между языками не является точным из-за морфологических различий, мы можем предположить, что сходство вопросительно-отрывочных предложений в KazQAD намного ниже, чем, например, в английском SQuAD и русских SbeгQuAD/XQuAD (см. раздел 4.1).
В Табл. 61 представлены две тройки «вопрос-абзац-ответ» из KazQAD: первая содержит перевод вопроса из английского набора NQ, вторая - оригинальный казахский вопрос из ЕНТ (хотя и с небольшой ручной модификацией оригинального вопроса с выбором из нескольких вариантов ответа). Эти примеры иллюстрируют, что ЕНТ содержит больше «локализованных» вопросов (по крайней мере, в подразделах, соответствующих истории Казахстана и казахской литературе). Это соответствует рекомендациям о том, что вопросно-ответные данные должны по возможности отражать культурный, исторический и географический контекст [267; 268].
4.3.3 Результаты базовых методов
Чтобы оценить сложность набора данных, мы реализовали и оценили модели поиска по коллекции и извлечения ответа из текста. Впоследствии мы интегрировали модели поиска и понимания прочитанного для оценки качества «полной» вопросно-ответной системы (ODQA).
Таблица 61 — Примеры троек «вопрос-абзац-ответ» из вопросно-ответной части KazQAD
Казахский
Q: Эйелдер хоккей кашан олимпиадальщ спорт тYрiне айналды?
1998 жылдан бастап Олимпиадаларда эйелдер арасындаFы хоккей турнирi де етюзше ба-стады.
Q: Казак халкынан шыккан алFашкы Fарыш-кер юм?
Токтар ОцFарбаЙYлы Эубэкiров (27 шшде 1946 жыл, Каркаралы ауданы, K,араFанды облысы, Казакстан) — казактан шыккан тYЦFыш Fарышкер, Yшкыш, Кецес ОдаFыныц Батыры (1988), Казакстан Республикасыныц Халык каЬарманы (1995), техника Fылы-мынын, докторы (1998), профессор (1997), Коркыт Ата атындаFы Кызылорда мемле-кеттж университетiнiц кYPметтi профессоры. Академик Е.А.Бекетов атындаFы KараFанды университетiнiц KYPметтi профессоры (3 мамыр 2022 жыл).
Перевод на русский
Q: Когда женский хоккей стал олимпийским видом спорта?
Начиная с 1998 на олимпийских играх проводятся соревнования по хоккею среди женщин.
Q: Кто первый казахстанский космонавт?
Токтар Онгарбаевич Аубакиров (род. 27 июля 1946, Каркаралинский район, Карагандинская область, Казахстан) - первый казахский космонавт, летчик, герой Советского Союза (1988), Народный герой республики Казахстан (1995), доктор технических наук (1998), профессор (1997), почетный профессор Карагандинского университета имени Академика Е. А. Букетова (3 мая 2022 года).
Выделенные ответы подчеркнуты. Пример в верхней части - из обучающей выборки, основанной на NQ: вопрос переведён машинным переводом, а текст взят из казахской Википедии. Пример внизу - оригинальный вопрос на казахском языке (возможно, перефразированный аннотатором) из ЕНТ, сопоставленный с текстом из казахской Википедии.
Основные модели. Мы используем несколько моделей на основе архитектуры Трансформер для наших базовых решений. Казахский язык представлен в популярных предобученных многоязычных моделях, таких как mBERT [106] и XLM-R [504]. Мультиязычные модели обеспечивают межъязыковой перенос обучения, при котором модель обучается на данных одного языка и впоследствии применяется к другому (см. п. 1.2.4). mBERT - это многоязычный вариант BERT, предварительно обученный на данных Википедии, соответствующих 104 языкам. mBERT имеет общий словарь из 110 000 токенов, 12 скрытых слоев с 12 «головами внимания». XLM-R [504] - это мультиязычный вариант модели RoBERTa, которая, в свою очередь, следует режиму обучения BERT с некоторыми оптимизациями. XLM-R обучена на данных 100 языков из корпуса Common Crawl. Мы используем базовую версию модели со словарём из 250 000 токенов, 12 скрытыми слоями и 12 «головами внимания». Эта модель
превосходит mBERT в ряде задач, особенно в случае малоресурсных языков. XLM-V [233] - это преемник XLM-R, призванный преодолеть узкие места предшественника: словарь модели увеличен до миллиона токенов, что обеспечивает более качественную токенизацию. XLM-V превосходит XLM-R в мультиязыч-ных задачах естественно-языкового вывода (NLI), распознавания именованных сущностей (NER) и извлечения ответов (QA). Kaz-RoBERTa38 - это модель, обученная на коллекции казахских текстов из Common Crawl, Leipzig Corpora Collection, корпуса OSCAR, а также казахских книг и новостей общим объемом около двух миллиардов токенов. Словарь модели составляет 52 000 токенов, она включает шесть скрытых слоев (в отличие от 12 слоев в других моделях на основе Трансформер, представленных в исследовании) и 12 «голов внимания».
Важно отметить, что объём доступных данных на казахском языке относительно невелик по сравнению со общим корпусом для обучения мультия-зычных моделей, упомянутых выше. Например, количество казахских статей в Википедии, использованных для предобучения mBERT, примерно в 30 раз меньше количества английских статей. Разрыв становится ещё больше, если учесть количество токенов, поскольку казахские статьи, как правило, короче английских. XLM-R была предварительно обучена на более крупном мульти-язычном корпусе, созданном на основе Common Crawl, в котором казахский язык занимает 44-е место из 100 по объёму обучающих данных. По количеству токенов казахский подкорпус в 117 раз меньше английского и в 5,8 раза меньше турецкого [504]. Объем языковых данных, используемых для предобучения, и объем словаря модели, выделенный для данного языка, являются основными факторами, влияющими на качество обученных моделей и эффективность межъязыкового переноса [240; 241].
Базовые модели поиска. Мы реализовали классический многоступенчатый поиск с фильтрацией и уточнением [532], где документы-кандидаты, входящие в топ-& (в наших экспериментах к = 104), полученные с помощью быстрой модели ранжирования BM25 (см. формулу 1.3), переранжируются с помощью более точной, но более медленной модели. Наши эксперименты используют библиотеку FlexNeuART [533].
38https://huggingface.co/kz-transformers/kaz-roberta-conversational
Предварительная обработка данных включает токенизацию по пробелам, перевод всех слов в нижний регистр и удаление знаков препинания. Единица поиска - это текст абзаца, объединенный с заголовком соответствующей страницы Википедии. Мы реализовали две модели ранжирования с линейной комбинацией нескольких признаков, веса подбираются на небольшом подмножестве обучающего множества. Первая модель основана представлении документа двумя полями - заголовком и абзацем. Каждое из этих полей разбивается на токен-ты двумя способами: 1) по пробелам и 2) с помощью токенизатора mBERT, в итоге единица поиска представлена четырьмя полями, по которым считаются значения BM25.
Вторая модель ранжирования основана моноязычном варианте IBM Model1 [534] - лексической модели перевода, которая обучается на параллельном корпусе. В качестве параллельного корпуса мы используем вопросы в паре с фрагментами текста с ответами. Чтобы найти эти фрагменты, мы используем BM25 для извлечения абзацев, а затем выбираем подстроки, содержащие текст ответа. В итоге используются фрагменты текста, включающие по пять слов до и после ответа. На этапе тестирования мы можем сопоставить паре «вопрос-документ» (q, d) вероятность «перевода»:
1 т I
рЫ I d) = ñ+1\m ПЕ% I di), (4.1)
(í + 1) j=l i=0
где I - длина документа d = (d\,d2,... ,di), d0 соответствует специальному слову NULL, т - длина вопроса q = (qi,q2,... ,qm), t - вероятность «перевода» слова вопроса в слово документа («вероятностный словарь», обученный на параллельном корпусе).
100 лучших результатов, полученных лучшей ненейронной моделью ранжирования (из 104 кандидатов, полученных с помощью BM25), переранжируются с помощью ранжирующего кросс-энкдера [431] (см. формулу 2.3). Мы реализовали варианты кросс-энкодера на основе XLM-R и mBERT. Модель ранжирования предварительно обучается на английских данных MS MARCO passages [428], а затем дообучается на данных KazQAD. Несмотря на то, что KazQAD содержит ручную разметку релевантности, мы обнаружили, что можно улучшить результаты, если обучаться на большем объем данных с «опосредованной разметкой» по аналогии с подходом DPR [121]. Как и в случае создания
параллельного корпуса, для каждого вопроса мы сначала извлекли абзацы с помощью ВМ25. Абзацы, содержащие текст ответа, считались релевантными. При этом оценка проводилась на данных, размеченных вручную.
Таблица 62 — Базовые решения для поиска абзацев в коллекции (верхняя часть), выделения ответа из абзаца (середина) и комбинации поиска и выделения ответа (нижняя часть, приведены результаты для разных моделей поиска и лучшей модели выделения ответов на основе ХЬМ-У). Для моделей извлечения ответа указаны данные, на которых они обучались
Поиск (MRR)
BM25 0,14
BM25 (2 поля) 0,20
BM25+Model1 0,27
... +mBERT (zero-shot) 0,35
... +mBERT (fine-tuned) 0,36
... +XLM-R (zero-shot) 0,37
... +XLM-R (fine-tuned) 0,39
Извлечение ответов (F\)
Kaz-RoBERTa + ...
NQtransl. 31,82
KazQAD 18,31
NQtransl.+KazQAD 35,46
XLM-R +...
NQtransl. 47,75
KazQAD 37,49
NQen+KazQAD 52,67
NQtransl.+KazQAD 51,87
XLM-V +...
NQen+KazQAD 54,18
NQtransl.+KazQAD 52,78
Вопросно-ответный поиск (F\)
BM25 (title+text) 12,6
BM25+Model1 (multi-field) 19.8
BM25+XLM-R (fine-tuned) 25,2
BM25+Model1+XLM-R (fine-tuned) 28,1
BM25+Model1+XLM-R (fine-tuned)+fusion 28,7
Мы оценили как напрямую перенесенные модели (zero-shot), так дообу-ченные на целевых данных. Согласно результатам, представленным в Табл. 62 (верхняя часть), прямой перенос моделей XLM-R и mBERT, обученных на MS MARCO, демонстрирует высокие результаты, которые улучшаются после дообучения на данных KazQAD.
Базовые модели извлечения ответа. Мы провели эксперименты по пониманию прочитанного (MRC), используя три предобученные модели на базе Трансформер: Kaz-RoBERTa, XLM-R и XLM-V. Мы провели тонкую настройку этих моделей в нескольких сценариях: на 61 тыс. автоматически переведенных пар вопрос-абзац (NQtransl.), на 69 тыс. пар вопрос-абзац на английском языке (NQen), которые не использовались при создании KazQAD, на тренировочном наборе KazQAD и на их комбинациях. Для обучения моделей мы использовали скрипты и параметры из официального репозитория HuggingFace.39 Для каждой конфигурации обучающих данных мы экспериментировали с разным количество эпох и выбирали наилучшую модель на основе настроечного подмножества KazQAD. В сценариях с двумя источниками данных мы сначала выбирали наилучшую модель, обученную на первом наборе данных, а затем продолжали ее обучение на втором.
Результаты для различных моделей и конфигураций обучающей выборки представлены в Табл. 62, средняя часть. Мы обнаружили, что моноязычная модель Kaz-RoBERTa работает значительно хуже мультиязычных моделей. Это может быть связано с тем, что Kaz-RoBERTa - модель меньшего размера, содержащая только шесть скрытых слоев. Ещё одним неожиданным результатом стало то, что мультиязычные модели, обученные на английских данных и на переводе NQ, демонстрируют близкое качество. Более того, при обучении XLM-R на обучающей выборке KazQAD с ручными аннотациями мы получили гораздо более низкие результаты. Однако дополнительное обучение на KazQAD улучшет значения F\ примерно на пять пунктов. Использование XLM-V вместо XLM-R дополнительно увеличило F\ примерно на два пункта.
Поиск ответа в коллекции (ODQA). Мы оценили нашу лучшую модель извлечения ответов на основе XLM-V в сценарии общего вопросно-ответного поиска (ODQA) [535]: модель применяется к топу абзацев, ранжированных моделью поиска. Ответы, извлеченные из каждого абзаца, необходимо агрегировать или отобрать. Мы применили два простых подхода: 1) использование ответа из лучшего найденного документа (топ-1) и 2) комбинация значений, которые возвращают модели ранжирования и извлечения ответа на топ-100 абзацев (с последующим выбором ответа с лучшим результатом) [536]. Веса для комбина-
39https://github.com/huggingface/transformers/tree/main/examples/pytorch/question-answering
ции подбирались на настроечном наборе. В Табл. 62 (нижняя часть) приведены результаты для систем поиска с увеличением качества.
Использование только BM25 на документах с двумя полями дает очень низкий результат: F\ = 12,6, который увеличился в 1,6 раза при использовании конвейера BM25+Model1. Применение нейронной модели ранжирования улучшает результат ещё в 1,4 раза. Нейронная модель ранжирования оказываается весьма полезной, даже если мы использовали ее после нашей самой слабой системы (см. результаты для «BM25 + XLM-R»). Однако полученный результат ниже, чем у лучшей системы без комбинации результатов. Это подчёркивает необходимость тщательно оптимизации модели поиска и ранжирования. Комбинация значений, возвращаемых моделями ранжирования и извлечения ответа, дала лишь незначительное улучшение.
ChatGPT. В феврале 2024 года мы использовали KazQAD для оценки модели gpt-3.5-turbo-0 1 2 540 в режиме «закрытой книги». Мы использовали вопросы из тестового набора, предваряя их простым промптом на английском языке: The question is in the Kazakh language. Provide a short and concise answer in Kazakh. Учитывая то, что ChatGPT часто возвращает довольно длинные ответы, мы использовали полноту (recall) лемматизированных слов в качестве метрики качества. В случаях, когда в KazQAD было доступно несколько ответов, мы объединяли их для согласованности. Токенизация и лемматизация проводились с использованием библиотеки Stanza [503]. Дополнительным критерием оценки была длина наибольшей общей подстроки между ответами, сгенерированными ChatGPT, и ответами, представленными в KazQAD. Из 1 927 вопросов теста на 173 (9%) модель вернула ответы с полнотой 0,5 или выше, и только для 86 (4,5%) были получены идеальные значения полноты. Ручная проверка результатов выявила случаи, когда ChatGPT давала явно ошибочные ответы, например, на вопрос Кто был преемником Абылай-хана? возвращала Шекспир (правильный ответ Вали-хан). Модель иногда давала ответы, которые можно рассматривать как корректные варианты, хотя они и не совпадают с эталонными ответами из данных ЕНТ. Например, на вопрос Кецес елтщ бас-шысы М. С. Горбачевтщ жYргiзген реформаасыныц аты щандай? (Как называется реформа М. С. Горбачева?) KazQAD содержит ответ Цайта цуру кезещ,
40https://platform.openai.com/docs/models/gpt-3-5-turbo
а ChatGPT вернул оригинальный русский термин Перестройка, который можно считать правильным. Также были замечены систематически неточности в использовании символов разных алфавитов. Например, витамин D в KazQAD против Д в ChatGPT) или использование символа i там, где ожидается и (Галилей, Италия, испандыц в KazQAD против Галыей, ¡талия, юпандыц в ответах ChatGPT). Эти результаты отражают заметно худшее качество модели OpenAI при ответе на фактографические вопросы на казахском языке и подчеркивают важность наборов данных, аннотированных вручную. Первая систематическая оценка БЯМ на задачах, сформулированных на казахском языке, описана в разделе 3.4.
* * *
Мы представили первый казахский набор KazQAD, который можно использовать для задачи поиска и ранжирования, «понимания прочитанного» и общего вопросно-ответного поиска. Набор данных является одним из немногих аннотированных ИП/ОЕЯ ресурсов для казахского языка. Аннотированные данные находятся в открытом доступе вместе с коллекцией казахских текстов из Вики-педии и автоматически переведенным подмножеством набора данных Natural Questions. При подготовке набора данных мы оптимизировали затраты на разметку, предложенный подход может быть использован для подготовки новых аналогичных датасетов.
Глава 5. Методы оценки задач вычислительного юмора
Юмор в самом общем смысле - все, что может вызвать улыбку и смех, поднять настроение. Юмор - важная часть человеческого общения. В 1950 году Алан Тьюринг предложил игру в имитацию - тест для оценки машинного интеллекта на основе общения, позже названный «тестом Тьюринга» [338]. Чтобы приблизиться к человеческому уровню разговорного интеллекта, машины должны уметь распознавать юмор и шутить. Участники большого опроса о качестве диалоговых агентов упоминали юмор как важный важный атрибут общения и отмечали, что юмор делает взаимодействие с агентами более увлекательным.
Теоретические исследования юмора восходят к Аристотелю - утерянная вторая часть его «Поэтики» была посвящена комедии и природе комического. Юмор активно исследовался в психологии и лингвистике [364; 537; 538]. Развитие разговорного искусственного делает автоматические методы обработки юмора востребованными для практических приложений. Однако свойства юмора - разнообразие, субъективность и непредсказуемость - делают задачи вычислительного юмора особенно сложными.
5.1 Методы создания наборов данных
Подавляющее большинство наборов данных для задач вычислительного юмора - на английском языке (см. п.1.4.1). В серии наших работ мы разработали русскоязычные наборы данных для обучения и оценки моделей распознавания юмора.
5.1.1 Наборы данных 8Т1ЕКЬГ^ и FUN
В рамках экспериментов по поиску смешного ответа в диалоге мы собрали большую коллекцию шуток на русском языке [539].1 Источниками шуток были четыре популярных юмористических сообщества ВКонтакте (сейчас УК) и шесть аккаунтов Твиттера (сейчас X). Мы отобрали посты без изображений и видео, набравшие более 500 лайков в ВКонтакте и более одного в Твиттере. Для постов ВКонтакте было дополнительное ограничение по длине - 250 символов. В Табл. 63 представлены источники исходного корпуса.
Таблица 63 — Исходная коллекция шуток: источники и статистика
Сообщество/аккаунт таь #
Тряхни Нормальность Ь^рБ //ук.сотДгаЬшпогтаМоБЙ 70 647
Корпорация зла Ь^рБ //vk.com/evil тсограга1е 69 431
Остроумные Ь^рБ //vk.com/o8troym 42 267
Странный юмор Ь^рБ //vk.eom/c.umor 44 287
Юмор ЕМ Ь^рБ //twitter.com/ humor ^ 3 578
О юморе Ь^рБ //twitter.com/abouthumor 332
Пьяный Твиттер Ь^рБ //twitter.com/drunktwi 15 335
Кавказский юмор Ь^рБ //twitter.com/kavhum 4988
Веселое радио Ь^рБ //twitter.com/veBeloeradio 12312
Шутки и анекдоты Ь^рБ //twitter.com/anecdot _ eshe 5 181
Всего 268 358
Из этих сообщений мы оставили только однострочные шутки и двухчастные диалоги:
Пример 1. Лекарства так подорожали, что скоро мы будем дарить их друг другу на день рождения, чтобы дожить до следующего.
Пример 2. — Ты спать собираешься?
— Да, сейчас, закончу делать ничего и пойду.
Из оставшихся 226 431 шутки мы удалили дубликаты, основываясь на сходстве лемматизированных представлений в виде мешка слов; эта операция сократила размер коллекции до 63 293 шуток. Случайно отобранные 47 000 шуток стали основой набора данных для распознавания юмора STIERLITZ [540].
1 Позже мы провели аналогичные эксперименты на материале английского языке, см. раздел 5.3.2.
Несмешную часть образовали предложения из русских классических романов (28 000), новостные заголовки (13 000) и пословицы (6 000). Дополнительным параметром была длина - в коллекцию включены предложения длиной до 25 слов (средняя длина - 14 слов). Для экспериментов коллекция была разделена на обучающую/тестовую выборку в соотношении 80/20, см. Табл. 64. Кроме того, мы вручную собрали небольшую коллекцию Риш из 200 каламбуров, большинство из них связаны с мемом «Омская птица» и анекдотами про Штирлица. Этот небольшой набор мы использовали только для тестирования классификаторов.
Таблица 64 — Статистика русскоязычных наборов данных для распознавания юмора
Набор данных Шутки Нешутки Всего
Stierlitz 46 608 46 608 93 216
train 37447 37 447 65 530
test 9 361 9 361 18 722
Fun 156 605 156 605 313 210
train 125 708 125 708 251 416
test 30 897 30 897 61794
Gold 899 978 1877
Puns 213 0 213
На основе обзора литературы и анализа коллекции мы реализовали шесть групп текстовых признаков, которые потенциально способны различать юмористический и неюмористический контент. Мы использовали LibSVM [541] для обучения классификаторов. В Табл. 65 представлены основные результаты. Столбцы 2-5 содержат результаты, полученные на тестовом наборе «большого» набора данных, состоящем из однострочных и несмешных предложений; точность, полнота и F\ соответствуют юмористическому классу. В последнем столбце таблицы представлена полнота классификатора, обученного на «большом» наборе данных и затем применённого к коллекции каламбуров.
Как видно из таблицы, классификация, основанная на лексических признаках («мешок слов», BOW), является сильным базовым решением (F\ = 0,846 на наборе Stierlitz, R = 0,671 на Puns). С одной стороны, это можно объяснить способом построения коллекции: позитивный и негативный классы довольно сильно различаются на лексическом уровне. С другой стороны, полнота на независимой коллекции Puns также относительно высока. Классификатор на основе векторного представления предложения (S2V) занимает второе место среди отдельных групп признаков (F\ = 0,811 на Stierlitz, R = 0,601
Таблица 65 — Результаты классификации на коллекциях STIERLITZ и PüNS
Признаки Stierlitz Puns
Acc. P R Fi R
BOW 0,848 0,855 0,837 0,846 0,671
S2V 0,813 0,820 0,801 0,811 0,601
SF 0,671 0,658 0,715 0,685 0,385
LF 0,618 0,603 0,690 0,643 0,117
RWN 0,563 0,626 0,311 0,416 0,211
W2V 0,527 0,579 0,196 0,293 0,160
BOW + S2V 0,868 0,873 0,861 0,867 0,695
BOW + S2V + SF + LF + RWN 0,885 0,892 0,875 0,884 0,620
BOW + S2V + SF + LF + RWN + W2V 0,885 0,892 0,876 0,884 0,615
Точность (P), полнота (R) и F\ соответствуют классу шуток. Группы признаков: BOW (bag of words) - представление «мешок слов», S2V (sentence2vec) - векторное представление предложения на основе взвешенной с помощью idf суммы векторов word2vec, SF (structural features) - признаки сложности предложения (средняя длина слова, доля стоп-слов, знаки препинания), LF (lexical features) - частоты слов по НКРЯ, имена собственные, словарные пометы, RWN (Russian WordNet) - признаки на основе тезауруса, W2V (word2vec) -максимальное и минимальное расстояние между векторами пар слов в тексте.
на PüNS). Комбинация этих двух представлений предложения (BOW + S2V) улучшает результаты по сравнению с отдельными подходами и достигает наилучшего результата на коллекции PüNS (R = 0,695). Другие группы признаков, рассматриваемые по отдельности, демонстрируют гораздо более низкое качество. Комбинация всех групп признаков дает дополнительную прибавку в качестве на большой коллекции.
FUN
На следующем этапе мы поставили цель увеличить размер русскоязычной коллекции для распознавания юмора и сделать оба класса лексически более однородными [14]. Во-первых, мы собрали более 1 млн шуток из юмористических сообществ социальной сети VK.com и с сайта anekdot.ru, старейшего онлайн-ресурса юмористического контента в Рунете. Затем мы отфильтровали непопулярные шутки на основе оценок пользователей, дубликаты и шуток, уже представленные в STIERLITZ и PüNS. Полученная коллекция весьма разнообразна: она содержит однострочные шутки, диалоговые шутки и короткие скетчи.
Во-вторых, мы скачали и проиндексировали около 10 млн постов интернет-форума Екатеринбурга E1.ru. Мы выбрали интернет-форум в качестве источника отрицательных (несмешных) примеров, поскольку социальные сети и системы общения являются наиболее перспективными областями применения методов распознавания юмора. Используя каждую шутку в качестве запроса, мы получили ранжированные списки постов форума на основе модели BM25 (формула 1.3). Чтобы отфильтровать потенциальные вхождения шуток, мы удалили посты форума, которые очень похожи на шутки на основании коэффициента Жаккара. После этого мы добавили в коллекцию пост с самым высоким рейтингом для каждой шутки. При составлении набора данных мы ввели пороги для минимальной/максимальной длины текста, но не пытались сбалансировать распределение длин шуток/нешуток. В результате распределение длин шуток смещено в сторону более длинных текстов по сравнению с нешутками, см. Рис. 5.1. Наконец, мы сформировали набор данных Fun, разделив коллекцию на обучающее и тестовое подмножества в соотношении 80/20 (при этом исходные обучающие и тестовые подмножества Stierlitz принадлежат соответственно обучающим и тестовым подмножествам нового датасета), см. Табл. 64. Для оценки лексического разнообразия полученного набора данных мы вычислили расстояние Кульбака-Лейблера между сглаженными (smoothed) распределениями слов в обоих классах.
D%L(P I Q) = £ P.Mloggg, (5.1)
x<E.V
где Ре(х), Qe(x) - сглаженные по Лапласу распределения, V - словарь коллекции:
п ы= +е = +6 (5,)
Q'(x) = №') + 0=1 + ^I ■ (52)
Результат составил 0,18 для Fun и 0,50 для Stierlitz, что показывает, что классы шутка/нешутка в новом наборе данных лексически более схожи, чем в наборе данных Stierlitz. Мы также рассмотрели слова с наибольшими диспропорциями частот в смешных/несмешных частях набора данных. Местные топонимы, аббревиатуры и нестандартные написания, типичные для онлайн-общения, оказались наиболее выделяющимися словами в «несмешной» части набора данных, а имена некоторых персонажей шуток и русская ненормативная лексика наиболее типичны для смешной части.
I I Non-jokes I I Jokes
20000
1
15000
10000
5000
A
50 100 150 200 250 300 Length in characters
Рисунок 5.1 — Распределение длин шуток/нешуток в наборе данных FUN
Чтобы оценить полностью автоматический метод составления набора данных, мы оценили по 1000 случайных шуток/нешуток по трехбалльной шкале: «нешутка», «несмешная шутка» и «шутка». Нам удалось привлечь к онлайн-разметке более 100 добровольцев через социальные сети. В результате 1877 примеров были оценены минимум тремя асессорами и сформировали «золотое» подмножество набора данных Gold. В случае 238 текстов (12,7%) мы могли наблюдать противоположные оценки, т. е. «не шутка» и «шутка», что является приемлемым согласием для краудсорсинга. Большинством голосов 94% нешуточных сообщений были помечены как «не-шутка», а 95% шуток были помечены как «несмешная шутка» или «шутка», что свидетельствует о хорошей работе автоматической процедуры.2 Среди «ошибок» в основном юмористические ответы пользователей форума, например:
пригласите даму в гости, приготовьте ужин на двоих. только через неделю не спрашивайте: «как избавиться от девушки?»
Отрывки из юмористических источников, помеченные как «нешутка», являются примерами сухого юмора или шуток, предполагающих знакомство с контекстом, например: Десять в тридцатой степени электронов это почти килограмм.
Итоговая статистика наборов данных приведена в Табл. 64.
Мы провели серию экспериментов для создания «базовых решений» для набора данных FüN. В первой серии экспериментов мы обучили линейную модель SVM на признаках tf.idf и модель ULMFit [542], предобученную на коллекции постов форума E1 (в контексте проекта модель получила имя ULMFun).
2Например, ручная проверка набора данных 16k Oneliners [339] выявила 9% шума.
Модели были оценены на тестовых наборах Stierlitz и Fun, а также на небольших коллекциях Gold и Puns, размеченных вручную. Простая линейная модель достигает F\ = 0,91 на Stierlitz. Это еще раз говорит о большой разнице на уровне лексики между позитивным и негативным классами. Предобученная языковая модель показывает еще более высокий результат. Несмотря на то, что Fun содержит существенную часть шуток из коллекции Stierlitz, качество моделей, обученных на Stierlitz, падает на тестовом наборе Fun. Интересно отметить, что ULMFun, обученная на Stierlitz, демонстрирует лучшую полноту на Puns. Fun является более сложным набором данных по сравнению с Stierlitz, хотя простой подход на основе признаков tf.idf и линейной модели SVM достигает F\ = 0,8. Качество обоих методов на Gold снижается менее чем на 5% от ожидаемого в данных уровня шума.
Таблица 66 — Качество классификации моделей, обученных на Stierlitz (верхняя часть) и FUN (нижняя часть); столбцы - тестовые наборы
Модель Stierlitz, Fx Fun, Fi Gold, Fx Puns, R
SVM (tf.idf) 0,910 0,677 0,643 0,725
ULMFun 0,965 0,768 0,662 0,920
SVM (tf.idf) 0,787 0,798 0,803 0,436
ULMFun 0,921 0,907 0,890 0,892
Набор данных Fun востребован научным сообществом и, например, использовался при создании наборов данных SPARROW [543] и CleanComedy [357].
5.1.2 Набор данных KoWit-24
Игра слов - это творческое использование языка, часто намеренно нарушающее лингвистические нормы и направленное на привлечение внимания и развлечение читателя/слушателя. Этот обобщающий термин включает в себя различные приёмы, такие как каламбур, спунеризм, оксюморон, словослияние и их комбинации. Даже современные БЯМ не всегда распознают игру слов и испытывают трудности с генерацией оригинальных шуток [401]. При этом чувство юмора является желательным свойством систем разговорного искусственного интеллекта [544]. Следуя современной тенденции, мы дополнили существующие
русскоязычные коллекции для распознавания юмора относительно небольшой коллекцией с более подробной разметкой [545].
Утверждены клинические рекомендации по алкогольному амнестическому
В России впервые появились профильные клинические рекомендации по лечению алкогольного амнестического синдрома. Это тяжелое нарушение памяти, при котором человек теряет способность запоминать новую информацию. Эксперт отмечает, что расстройство развивается у 5-8% людей с тяжелым алкоголизмом и часто остается недиагностированным, поэтому клинические рекомендации так
Рисунок 5.2 — Заголовок статьи, отсылающий к фразе из поэмы в прозе Венедикта Ерофеева «Москва — Петушки», https://www.kommersant.ru/doc/8157844
Источник данных, определение игры слов
Игра слов довольно часто встречается в новостях [546; 547]; см. пример на Рис. 5.2. Основой коллекции K0MMERSANTWIT-24, или KoWIT-24 стали заголовки газеты «Коммерсантъ».3 Газета, основанная в 1990 году, является одним из ведущих российских деловых ежедневных изданий. С момента своего создания «Коммерсантъ» выработал ироничный стиль, который ярче всего проявляется в заголовках. Набор данных содержит 2 700 заголовков, почти половина из которых (1340) помечена как содержащие игру слов. Для этих заголовков дополнительно указан тип игры слов, триггер - слово или фраза, «ответственная» за игру слов, а также в некоторых случаях - ссылка на статью Википедии или Викисловаря, которая описывает сущность или фразу, к которой отсылает игра слов. KoWIT-24 имеет несколько важных особенностей, которые отличают его от других наборов данных в области вычислительного юмора: 1) ассоциированные новостные контексты, 2) большая доля примеров игры слов на основе трансформаций известных фраз - этот тип плохо представлен в предыдущих
3https://www.kommersant.ru/about
наборах данных, 3) неанглоязычный контент, 4) многоуровневая разметка и 5) структура: элементы с игрой слов и без нее происходят из одного и того же источника, в отличие от предыдущих наборов данных.
Мы собрали данные из газеты «Коммерсантъ» через RSS-канал4 в период с января 2021 г. по декабрь 2023 г. Каждый элемент данных соответствует статье на сайте и содержит следующие поля: URL, категория (Мировые новости, Бизнес, Общество и т. д.), заголовок, подзаголовок (lead), краткое содержание, временная метка и необязательная ссылка на изображение.
Игра слов - многогранное понятие. В качестве основы нашей работы мы использовали подход, предложенный Алланом Партингтоном [546]. Автор определяет две возможных интерпретации текста как основную характеристику игры слов. Дополнительно, эти два смысла должны быть противоположными, а игра слов должна быть намеренной (неслучайной). Партингтон выделяет два основных механизма игры слов: 1) переопределение (relexicalization) и 2) модификация (reworking/reconstuction). Первый соответствует традиционным каламбурам, где два значения возникают из-за лексической или фонетической неоднозначности. Во втором случае игра слов основана на модификации известной фразы; эффект возникает из-за взаимодействия значений текущей и исходной фразы, которую слушатель/читатель реконструирует. Партингтон также отмечает, что игра слов часто включает в себя различные виды готовых фраз, таких как пословицы, цитаты, идиомы, распространённые словосочетания, названия фильмов и книг и т. д. Это определение игры слов отличается, например, от определений, которые использовались в других исследованиях [547; 548]. В этих исследованиях такие языковые приёмы в новостных заголовках, как олицетворение, метафора, метонимия и т. д., также относят к игре слов.
Разметка данных
На первом уровне KoWlT-24 - бинарная разметка наличия/отсутствия игры слов. Для заголовков с игрой слов дополнительно указаны: 1) тип игры
4https://www.kommersant.ru/RSS/news.xml. «Коммерсантъ» разрешает использовать до 30% оригинальной статьи при сохранении текста без изменений и указании источника, см. https://www.kommersant.ru/ copyright. Собранные данные соответствуют этим требованиям.
Таблица 67 — Примеры разных типов игры слов в заголовках (приведенные подзаголовки позволяют интерпретировать игру слов)
Тип Пример
Многозначность «Волгу» не могут заставить течь быстрее Скоростной режим на федеральной трассе М7 в Подмосковье оставлен без изменений
Омонимия Туризм подрастерял Шарм Операторы корректируют египетские программы
Фонет. сходство Из-под земли до стали НДПИ для металлургов будет повышен с 2022 года
Уст. словосочетание Особо бумажные персоны Как частные инвесторы трансформируют рынок IPO
Идиома Код накликал Зачем и кому нужен Open Source в России
Отсылка Миссия сократима Как Россия может ответить на высылку своих дипломатов из постпредства при НАТО
Окказионализм От запчастного к общему Дефицит автомобилей привел к падению продаж
Оксюморон Новый премьер Израиля начал со старого Нафтали Беннет отправился с визитом в Вашингтон
слов, 2) триггеры, т.е. слова или фразы, «запускающие» игру слов, 3) отсылка триггера, например, похожее по звучанию слово или исходная фраза, на которые ссылается триггер (в случае каламбуров, основанных на многозначных словах, отсылка отсутствует), 4) для заголовков, представляющих собой модификации устойчивого словосочетания, идиомы или отсылающих к популярной сущности (названиям фильмов или книг, крылатым выражением и т.д.), мы добавляем ссылку на описание оригинальной фразы/сущности в Викисловаре или Википедии, если это возможно.
Разметка была выполнено с помощью инструмента Label Studio5 тремя аннотаторами, двое из которых - профессиональные лингвисты, а один - специалист по компьютерным наукам. Все трое - носители русского языка и имеют обширный опыт работы с проектами, связанными с обработкой естественного языка.
Три аннотатора параллельно размечали каждый элемент данных, делая заметки о спорных случаях, которые затем обсуждались. Мы сравнивали результаты, обсуждали расхождения и согласовывали их в процессе аннотирования. Среднее значение попарных к Коэна для первоначальной разметки игры
5https://labelstud.io/
слов до обсуждения составило 0,42, что указывает на нетривиальный характер задачи (два аннотатора с лингвистическим образованием показали лучшее согласие с к = 0,58).6 Большинство расхождений было обнаружено в категориях «Отсылка» и «Устойчивое словосочетание». При аннотировании оксюморонов и омонимии разногласий практически не было. Мы надеемся, что обсуждение и устранение расхождений обеспечило высокое качество итоговой разметки. Разметка с перекрытием оказалась особенно полезной в этом случае: различные культурные предпочтения и вкусы аннотаторов позволили добиться более полного охвата, поскольку не все интерпретации очевидны и понятны сразу.
Далее, мы приписали заголовкам с игрой слов, выявленным на первом этапе, до двух механизмов. Список механизмов формировался на основе данных: мы группировали заголовки на основе сходства механизмов игры слов по мере анализа коллекции, присваивали им метки и иногда повторно аннотировали некоторые элементы. Окончательный список механизмов игры слов и примеры приведены в Табл. 67. Две основные группы, Каламбуры и Трансформации (см. Табл. 68), соответствуют механизмам, выделенным Партингтоном [546], -переопределению и модификации. Среди каламбуров мы различаем основанные на многозначности, омонимии и фонетическом сходстве. Мы классифицируем игру слов, основанную на трансформации, по исходным фразам - общепринятым устойчивым словосочетаниям (collocations), идиомам или отсылкам к именованным сущностям - цитатам, названиям книг, фильмов и т. д. Окказионализмы и оксюмороны образуют отдельную группу.
Наконец, мы выделили триггеры игры слов, добавили фразу/слово, к которой отсылает триггер, а также, по возможности, добавили ссылку на соответствующую страницу Викисловаря или Википедии.7 Формат набора данных подробнее описан в репозитории GitHub.8
6Низкое согласие типично для аннотаций, связанных с юмором. Например, работа [352] сообщает о согласии асессоров при разметке определений шуток к = 0,58 и к = 0,41 при оценке шуток. Аналогичная низкая согласованность была отмечена в исследованиях по выявлению в тексте сарказма [549] и оскорблений [550].
7Пример игр слов на Рис. 5.2 будет аннотирован типом Отсылка, триггером является вся фраза И немедленно забыл, оригинальная фраза - И немедленно выпил.
8https://github.com/Humor-Research/KoWit-24
Статистика и анализ набора данных
В общей сложности мы разметили 2 700 заголовков, из которых 1 340 содержат игру слов, т.е. набор данных практически идеально сбалансирован. Интересно отметить, что заголовки с игрой слов в среднем на одно слово короче заголовкой без игры слов (3,88 против 4,81 слова). Чтобы охарактеризовать KoWlT-24, мы рассчитали перплексию (perplexity) заголовков в обоих классах с помощью модели ruGPT-3.5 13B [551] и сопоставили их с новостными заголовками из набора данных РИА Новости [552]. Как показывает Рис. 5.3, у заголовков «Коммерсанта» перплексия выше, чем у более традиционных заголовков агентства РИА Новости, а у заголовков KoWit-24 с игрой слов перплексия еще выше.
Распределение заголовков по типу игры слов представлено в Табл. 68. Наиболее частым механизмом игры слов в нашем наборе данных является трансформация существующих известных фраз - устойчивых словосочетаний, идиоматических выражений и именованных сущностей. Примечательно, что этот тип игры слов практически не представлен в предыдущих наборах данных, посвященных юмору. Как и ожидалось, средняя длина триггеров также выше в классах, соответствующих трансформации (средняя длина триггеров во всей коллекции составляет 2,65 слова). Наши наблюдения хорошо согласуются с исследованием [546], которое утверждает, что игра слов встречается преимущественно на уровне фраз, а не отдельных слов.
Примерно половина всех заголовков с игрой слов, основанной на трансформации, снабжены ссылками на страницы Википедии (290) и Викисловаря (168), которые описывают исходную фразу или сущность. Наличие статьи в одном из вики-ресурсов можно рассматривать как индикатор популярности исходной фразы/сущности, что снижает риск субъективных и ложных ассоциаций.
Рисунок 5.3 — Распределение заголовков по уровню перплексии в двух классах (+/-) KoWIT-24 и подборке РИА Новости. Вертикальные линии соответствуют медианам распределений, «хвост» гистограммы отсечен
Таблица 68 — Статистика набора данных KoWIT-24: тип игры слов, средняя длина триггера (СДТ) в словах, ссылки на Вики. Три типа в верхней части соответствуют каламбурам, три типа в середине - игре слов на основе трансформации существующих фраз
Тип # СДТ Ссылки
Калам. Многозначность 190 1,51
Омонимия 26 1,57
Фонет. сходство 98 1,80
б h4 Устойч. словосоч. 423 2,64 126
h4 а л Идиомы 177 3,43 118
н Отсылка 353 3,73 214
Окказионализм 185 1,44
Оксюморон 48 2,02
Эксперименты
Для экспериментов мы выделили 200 записей (по 100 из каждого класса) для настроечного набора, обеспечив в нем наличие всех типов игры слов. Таким образом, тестовый набор содержит 2 500 заголовков (1290 с игрой слов и 1310 без). Поскольку набор данных в первую очередь предназначен для экспериментов с современными БЯМ в режиме few-shot или zero-shot, мы не выделяли отдельное обучающее подмножество. При количестве тестовых заданий более 2 000 KoWlT-24 должен обеспечить устойчивость результатов.
Мы экспериментировали с двумя задачами: 1) распознавание игры слов и 2) интерпретация игры слов. Мы использовали пять моделей: GPT-4o, Mistral NeMo 12B, YandexGPT4, GigaChat Lite и GigaChat Max. Мы включили в эксперименты YandexGPT, GigaChat Lite и GigaChat Max, поскольку они позиционируются как БЯМ для работы с русским языком. Среди них GigaChat Lite9 -это открытая модель, веса которой распространяются по лицензии MIT. Кроме того, мы включили Mistral Nemo10 - открытую модель с официальной поддержкой русского языка, распространяемую по лицензии Apache 2.0. Наконец, мы включили GPT-4o как одну из передовых моделей. Дополнительная информация о моделях представлена в Табл. 69.
Таблица 69 — Пять больших языковых моделей в исследовании
Модель Статус xMMLU,% Дата N
GigaChat Lite [553] Открытая 58,38a 2024-12-13 20B
GigaChat Max [554] Закрытая 75,00a 2024-11-02 ?
YandexGPT4 [555] Закрытая 65,00^ 2024-10-23 ?
Mistral Nemo [556] Открытая 59,20a 2024-07-18 12B
GPT-4o [498] Закрытая 86,407 2024-08-06 ?
Результаты xMMLU относятся к различным версиям оригинального бенчмарка MMLU: а -ruMMLU - открытая русская версия, ¡3 - yaMMLU - закрытая русская версия Яндекса [555], 7 - оригинальный английский MMLU [135]; N - количество параметров модели.
Температура была установлена равной 0,1 для моделей GPT-4o, GigaChat Lite, GigaChat Max и YandexGPT4 и 0,3 для модели Mistral NeMo, в соответствии с рекомендациями разработчиков. Для задачи распознавания игры слов максимальное количество сгенерированных токенов было установлено равным 128, а для задачи интерпретации игры слов - 2 048. Для GPT-4o мы использовали версию модели gpt-4o-2024-08-06, актуальную по состоянию на октябрь 2023 года. Версия модели YandexGPT4 указана по дате её выпуска, и мы использовали версию 23.10.2024. Версия GigaChat Max 26.10 использовалась через API. Пять БЯМ представляют собой репрезентативный набор открытых/ закрытых, средних/ больших и русскоязычных/мультиязычных моделей.
9https://huggingface.co/ai-sage/GigaChat-20B-A3B-instruct-v1.5
10https://huggingface.co/mistralai/Mistral-Nemo-Base-2407
Для задачи распознавания игры слов мы использовали два типа инструкций на русском языке: 1) простая инструкция с вопросом, содержит ли заголовок игру слов, и 2) расширенная инструкция с определениями и двумя примерами для каждого из восьми типов игры слов из настроечного набора. При разработке инструкций мы придерживались рекомендаций, изложенных в документации OpenAI.11 В обоих случаях входные данные БЯМ включали заголовок и подзаголовок.
Для задачи интерпретации игры слов мы использовали 1 033 заголовка с отсылками. Примеры игры слов были включены в инструкцию, аналогично расширенной инструкции в задачи распознавания. При автоматической оценке мы отмечали интерпретацию как верную, если нам удавалось найти лемматизи-рованную отсылку в ответе модели (подход аналогичен автоматической оценке объяснения каламбура, предложенному в работе [398]).
Результаты экспериментов представлены в Табл. 70. GPT-4o демонстрирует лучшие результаты в обоих задачах, значительно превосходя остальные четыре модели. В задаче распознавания расширенная инструкция улучшает как точность, так и полноту трёх из пяти моделей. Высокая точность распознавания YandexGPT достигается за счет низкой полноты. Интересно, что Mistral выдаёт «нет» во всех случаях в задаче распознавания, тогда как в задаче интерпретации модель вполне конкурентоспособна. YandexGPT4 и GigaChat Max, по всей видимости, подверглись строгой модерации: в задаче на распознавание
с простой инструкцией модели отказывались возвращать ответ в 24,8% и 15,4%
12
случаев соответственно.
На основании полноты распознавания различных типов игры слов (Табл. 71), мы не можем сделать вывод, что некоторые механизмы сложнее для всех БЯМ, но существуют небольшие различия в результатах каждого БЯМ. Расширенная инструкция повышает качество практически во всех случаях, иногда значительно. Однако качество распознавания оксюморонов и игры слов, основанной на многозначности, в случае GPT-4o несколько ухудшается. Расширенная инструкция не влияет на полноту распознавания игры слов, основанной на полисемии, в случае GigaChat Max. Полнота GPT-4o на примерах игры слов, основанной на идиомах, и окказионализмах достигает 0,96 - лучший показатель среди всех типов. Можно предположить, что несловарные окказио-
11 https://platform.openai.com/docs/guides/prompt-engineering/six-strategies-for-getting-better-results
12Процент отказов ещё выше в случае заголовков РИА Новости - 34,4% и 27,4%.
Таблица 70 — Точность и полнота распознавания игры слов с использованием простой/расширенной инструкции и полнота интерпретации заголовков с отсылками для триггеров на основе ручной / автоматической оценки
Модель Распознавание, P / R Интерпретация, Л
простая расшир. ручная авто
Giga Lite 0,50 / 0,50 0,53 / 0,72 0,11 0,19
Giga Max 0,62 / 0,48 0,68 / 0,59 0,28 0,28
YaGPT4 0,83 / 0,10 0,76 / 0,24 0,20 0,22
Mistral 0,00 / 0,00 0,00 / 0,00 0,24 0,30
GPT-4o 0,62 / 0,81 0,65 / 0,88 0,48 0,43
нализмы сильно отличаются от остальной лексики, а игра слов на основе идиом легко распознаются благодаря частоте и стабильности идиоматических выражений.
Результаты на задаче интерпретации ожидаемо ниже, чем на задаче распознавания. Можно предположить, что игру слов на основе идиом и окказионализмов, проще интерпретировать, см. Табл. 72. Хотя автоматическая оценка не идеальна, она является практичной альтернативой ручной оценки в задаче интерпретации. Более низкие оценки ручной оценки в основном связаны с галлюцинациями - модели часто генерируют вымышленные фразы, похожие на правильные.13 В целом, автоматическая оценка завышает оценки по сравнению с ручной проверкой, но иногда происходит обратное, особенно в случае СРТ-4о. Мы тщательно изучили эти случаи и обнаружили, что СРТ-4о возвращает варианты написания или ссылки, которые немного отличаются от канонических. Их невозможно обнаружить прямым сопоставлением строк, но они «засчиты-ваются» при ручной проверке.
Полученные результаты по обоим заданиям значительно ниже, чем результаты БЯМ по распознаванию и объяснению английских каламбуров [398], хотя их нельзя сравнивать напрямую.
Набор данных можно использовать для задач распознавания и интерпретации игры слов. Многоуровневая разметка не только способствует детальному лингвистическому анализу, но и позволяет реализовать автоматическую оценку задачи интерпретации, что является существенным преимуществом для генеративных задач. Как показали эксперименты, набор данных является сложным
13Аналогичным образом, когда им приходится интерпретировать заголовки РИА Новости, которые на самом деле не содержат игры слов, БЯМ часто находят в тексте многозначное слово и основывают на нём своё объяснение.
Таблица 71 — Полнота определения игры слов по типу с
простой/расширенной подсказкой (нулевые баллы Mistral не показаны)
Тип игры слов # GigaChat Lite GigaChat Max YaGPT4 GPT-4o
прост. расшир. прост. расшир. прост. расшир. прост. расшир.
Многозначность 168 0,56 0,74 0,57 0,57 0,05 0,23 0,88 0,86
Омонимия 22 0,50 0,59 0,50 0,64 0,14 0,23 0,68 0,82
Фонет. сходство 88 0,40 0,74 0,44 0,58 0,10 0,15 0,81 0,90
Устойч. словосоч. 393 0,47 0,70 0,48 0,58 0,09 0,20 0,78 0,87
Идиомы 164 0,50 0,74 0,49 0,65 0,12 0,38 0,87 0,96
Отсылка 326 0,49 0,71 0,44 0,58 0,06 0,23 0,76 0,85
Окказионализм 166 0,52 0,81 0,45 0,60 0,21 0,27 0,87 0,96
Оксюморон 34 0,68 0,79 0,68 0,71 0,21 0,41 0,85 0,82
Всего 1361 0,50 0,72 0,48 0,59 0,10 0,24 0,81 0,88
Таблица 72 — Полнота интерпретации игры слов по типу; ручная и автоматическая оценка (^ отмечает случаи, когда ручная оценка превышает автоматическую)
Тип игры слов # GigaChat Lite GigaChat Max YaGPT4 Mistral GPT-4o
ручн. авто ручн. авто ручн. авто ручн. авто ручн. авто
Многозначность 12 0,17 0,33 0,33t 0,25 0,08 0,00 0,17 0,33 0,50 0,50
Омонимия 7 0,14 0,43 0,29 0,29 0,14 0,14 0,00 0,43 0,43t 0,29
Фонет. сходство 85 0,11 0,25 0,28 0,39 0,11 0,21 0,15 0,32 0,52t 0,51
Устойч. словосоч. 393 0,07 0,18 0,27 0,27 0,16 0,20 0,20 0,30 0,44t 0,41
Идиомы 164 0,15 0,18 0,37t 0,30 0,32t 0,28 0,34t 0,30 0,55t 0,48
Отсылка 326 0,10 0,12 0,25t 0,23 0,20t 0,16 0,23 0,25 0,46t 0,36
Окказионализм 166 0,15 0,46 0,29 0,57 0,28 0,43 0,28 0,57 0,61 0,69
Оксюморон 6 0,67 0,67 0,50 0,50 0,33 0,33 0,83 0,83 0,67t 0,50
Всего 1159 0,11 0,19 0,28 0,28 0,20 0,22 0,24 0,30 0,48t 0,43
даже для передовых БЯМ. Мы ожидаем, что этот набор данных может быть использован и для других задач. Например, предыдущие исследования показывают, что подробное аннотирование шуток может улучшить генерацию юмора [352; 398; 557].
* * *
В рамках цикла работ был создан первый русскоязычный набор для задачи распознавания юмора Fun и первый русскоязычный набор с подробной разметкой примеров игры слов KoWlT-24. Большой набор данных Fun (более 313 тыс. элементов) создан автоматически, небольшое «золотое» подмножество проверено вручную. Важным аспектом набора данных является лексическая балансировка двух классов на основе механизмов поиска. Набор KoWlT-24 имеет относительно небольшой объем (2 700 новостных заголовков, примерно половина из которых - с игрой слов), но но подробно размечен вручную. Набор
данных можно использовать для задачи распознавания и интерпретации игры слов, причем разметка позволяет автоматизировать оценку.
5.2 Устойчивость и переносимость моделей распознавания юмора
На следующем этапе исследований мы сосредоточились на анализе устойчивости и переносимости моделей распознавании юмора [29]. Ранее мы исследовали переносимость моделей в задачах информационного поиска и обработки естественного языка (см. § 2.3 и § 3.3). На сегодняшний день существует несколько англоязычных наборов данных для задачи распознавания юмора (см. п. 1.4.1), но практически нет исследований о том, как соотносятся наборы данных и модели, обученные на них. Неясно также, как модели, обученные на открытых данных, ведут себя в реальных условиях. Чтобы восполнить этот пробел, мы тщательно проанализировали существующие наборы данных, обучили классификатор RoBERTa и наивный Байесовский классификатор на каждом из них и протестировали на остальных. Мы также оценили «чувство юмора» БЯМ chatGPT и Flan-UL2 в сценарии «без обучения и примеров» (zero-shot), оценили влияние размера обучающей выборки на качество модели, а также протестировали устойчивость моделей обнаружения юмора с помощью состязательной атаки. Чтобы проверить поведение моделей распознавания юмора на внедоменных данных, мы использовали несколько дополнительных коллекций: набор данных с метафорами, ироничные твиты, диалоги из английских романов XIX века разных жанров и субтитры из телесериалов.
5.2.1 Данные
Основные наборы данных
На сегодняшний день существует несколько англоязычных наборов данных для распознавания (см. раздел 1.4.1, далее мы используем те же обозначения наборов данных, что и в Табл. 5). Мы собрали девять англоязычных наборов данных для распознавания юмора, которые были представлены в предыдущих академических исследованиях (FL+HME представляет собой объединение двух родственных наборов данных FunLines и Humicroedits). Мы дополнили коллекцию почти 9 тыс. заголовками сатирического новостного сайта The Onion (TheO), чтобы разнообразить источники шуток в нашем исследовании (Unfun.me основан на заголовках The Onion, но на порядок меньше). Примеры из всех наборов данных можно найти в Табл. 73.
Таблица 73 — Примеры из смешного/несмешного классов. В случае заголовок и текст поста ИЫ^ разделяются чертой; отрицательный пример из NF обрезан
Датасет Смешной текст
Несмешной текст
16kOL
PotD
EnPuns
ShJ
ReJ
Couldn't afford to fix my brakes, so I made my horn louder.
in order to talk to a viking you need to know norse code
Dateline London : Eccentric ornithologist travels to foreign land to teach pigeon English.
Why couldn't the cop save the hippie from drowning? He was too far out man
I just downloaded the Bohemian Rhapsody
movie._____I think it was filmed in a movie
theater, though - I see a little silhouetto of a man.
Haha
FL+HME
Unfun.me
NF
My wife thinks I don't give her enough privacy. At least that's what she said in her diary.
Topless protesters crash pro-Franco bus in Madrid
Obama's Declaration Of Swine Flu Emergency Prompts Pro-Swine-Flu Republican Response
My crush told me that she sees me as a brother I hope she's just as fond of incest as I am
Abbott says AIDS drug wins European approval.
I believe that the people of this town want a mayor who s not afraid
The best defense against logic is stupidity .
If Hu is successful, he will be freer to boost spending on health, education and other services long-neglected in the headlong drive for economic growth. "The effect on the whole population needs to be considered, not just one age group."
I went to the liquor store on my bicycle and bought a bottle vodka, put it in the basket on the front and then it occurred to me that if I fall or something happens, the bottle might break, so I drank it all right there and it's a good thing
I did..._____...'cause I fell 7 times on the way
home...
"If you love someone, you tell them. Even if you're scared that it's not the right thing. Even if you're scared that it'll cause problems."
Topless protesters crash pro-Franco demonstration in Madrid
Obama's declaration of swine flue emergency prompts pro-vaccine republican response
Half of Japan firms see no escape from deflation this year: Reuters poll Around half of Japanese firms believe their country will have failed to rid itself of deflation a year from now, a Reuters poll shows, a sign that authorities are not gaining the traction they want as they battle an entrenched deflationary mindset...
TheO
North Korean Defector Says Kim Jong-Un Won't Last
Мы привели все наборы данных к единому формату. Датасеты, не имеющие официального разделения на обучающую/настроечную/тестовую выбор-ки,мы разделили на соответствующие подмножества соотношении 70/10/20. Пе-
ред разделением мы проанализировали данные на наличие дубликатов внутри и между наборами. Мы использовали простой подход для поиска похожих элементов: точное совпадение строк после приведения к нижнему регистру и удаления знаков препинания. Мы исключили дубликаты внутри наборов данных (поэтому статистика может немного отличаться от ранее опубликованной). В случае дубликатов между наборами мы удостоверились, что они находятся в обучающих подмножествах, чтобы избежать утечки данных. В случае наборов данных ShJ, ReJ и Haha мы сохранили исходное разбиение.
Основываясь на экспериментах с комбинированными наборами данных для вопросов и ответов [558; 559] и нашими предварительными экспериментами, мы также создали набор данных COMB с целью диверсификации источников шуток. Этот набор данных представляет собой комбинацию PoD, Haha, Unfun.me и TheO. Мы также добавили 10 000 примеров из обучающего набора и по 5 000 из настроечного и тестового наборов ShJ. Мы сохранили исходные разбиения на обучающее/настроечное/тестовое подмножества в объедиенном наборе данных.
В Табл. 5 представлены характеристики наборов данных, использованных в исследовании. Как видно, девять наборов данных сильно различаются по размеру. Мы выделяем три группы: small (до 5 тыс. примеров в обоих классах), medium (до 50 тыс.) и large, представленную двумя наборами - NF и ShJ. Не все наборы данных сбалансированы, и в некоторых наборах длина смешных и несмешных примеров сильно различается (это особенно заметно в случае NF). Юмор часто используется для выхода за ограничения культурных норм и выражения подавленных желаний, поэтому значительная часть юмора связана с табуированными и «низкими» темами (это основная функция юмора согласно теории снятия напряжения, см. раздел 1.4). Мы подсчитали количество элементов набора данных, содержащих нецензурную лексику, с помощью специального инструмента.14 Доля таких текстов ожидаемо выше в NF, но остальные наборы данных (особенно основанные на контенте Reddit) также не являются полностью «чистыми». Расстояние Кульбака-Лейблера (KL divergence, формула 5.1) показывает, насколько лексически схожи позитивные и негативные классы (более низкие значения указывают на большее лексическое сходство двух частей). Как и ожидалось, минимальные значения соответствуют набо-
14https://github.com/snguyenthanh/better_profanity
рам данных FL+HME и Unfun.me, где позитивные и негативные примеры различаются минимальными правками (обычно заменами одного слова). Обе части ИеЯ имеют один и тот же источник (ИЫ^), что объясняет близость распределений слов в двух классах. Создатели наборов данных 16kOL и Ра10 приложили особые усилия при составлении «серьёзных» частей наборов, чтобы минимизировать лексические различия между классами, что отражено в низких значениях расстояния Кульбака-Лейблера. Высокие значения свидетельствуют о том, что классы могут быть разделены на основе лексических признаков, что подтверждается результатами наивных Байесовских классификаторов на основе униграмм (см. Табл. 75).
Дополнительные наборы данных
Для проверки поведения моделей распознавания юмора на данных, не относящихся к предметной области, мы использовали несколько дополнительных наборов: предложения с метафорами, иронические твиты, диалоги из романов XIX века разных жанров и субтитры к телесериалам.
Мы использовали набор данных [560], который стоит из троек
предложений: посылки с метафорическим выражением и двух импликаций, одна из которых верна. Мы применяли модели к посылкам и верным импликациям. Мы также протестировали модели на наборе иронических твитов [374]. Кроме того, мы собрали двухчастные диалоги из трёх английских романов XIX века: «Лавка древностей» (1841) Чарльза Диккенса, «Приключения Алисы в Стране чудес» (1865) Льюиса Кэрролла и «Трое в лодке, не считая собаки» (1889) Джерома К. Джерома. Драма Диккенса фигурирует в нескольких он-лайн-списках «книги, которые заставят вас плакать», роман Кэрролла - пример литературного нонсенса, полный каламбуров и пародий, а «Трое в лодке» - известный комический роман. Мы получили тексты из проекта «Гутенберг» и извлекли все пары реплик прямой речи, которые находятся друг от друга на расстоянии менее 200 символов текста. Аналогичным образом мы собрали пары реплик диалогов из двух популярных сериалов: фильма ужасов «Ходячие мертвецы» ^Э) (2010-2022) и ситкома «Друзья» (1994-2004). Мы скачали суб-
титры с сайта OpenSubtitles.org и сформировали пары реплик с интервалом не более 10 секунд. Эти коллекции могут служить аппроксимацией реальных диалогов, которые, по нашему мнению, является наиболее перспективной областью применения моделей распознавания юмора. В верхней части Табл. 77 представлена статистика этих дополнительных наборов данных; примеры можно найти в Табл. 79.
Хотя данные не содержат разметки отдельных элементов, их жанр дает полезную информацию. Ожидаемое поведение модели распознавания юмора заключается в том, что она будет срабатывать чаще на текстах юмористических романов, чем драматических произведений, и на диалогах из ситкомов, чем на диалогах из фильмов ужасов. Результаты, полученные на этих наборах данных, также могут пролить свет на способность моделей к обобщению и их устойчивость, поскольку ожидается, что тексты в дополнительных данных существенно отличаются как от положительных, так и от отрицательных примеров основных наборах.
5.2.2 Методы
RoBERTa-base [232] - это «рабочая лошадка» многих приложений обработки естественного языка, которая предоставляет хорошее соотношение производительности и размера. Модель имеет 125 млн параметров, следует режиму обучения BERT [106] с некоторыми модификациями и немного превосходит BERT по ряду задач.15
Вход модели - последовательность токенов исходного текста, помещенная между специальными токенами: х ^ [CLS], t\,t2,... , tn, [SEP]. Итоговое скрытое представление, соответствующее специальному токену [CLS], используется линейного классификатора на С классов:
z = WhcLS + b, W e Rcxd (5.3)
15Мы также провели предварительные эксперименты с RoBERTa-large. Это привело к незначительному улучшению результатов на больших наборах данных, но к очень нестабильному поведению на малых наборах данных (PotD и EnPuns), поэтому мы остановились на версии base.
Вероятности классов вычисляются с помощью многопеременной логистической функции (softmax):
exp(zc)
E£=I exP(^')
Р(У = с | х) = _ce ( ) ,. (5-4)
На обучающей выборки вида {(хг,угклассификатор обучается путём минимизации функции потерь на основе перекрестной энтропии:
N
С = logР(Уг 1 Xi). (5-5)
i=1
Мы использовали реализацию RoBERTa на основе PyTorch из библиотеки HuggingFace. Размер батча составлял 4 для малых и средних наборов данных и 32 - для больших наборов данных, темп обучения - 5 х 10-5. При обучении на малых наборах данных разогрев не использовался, а на остальных наборах разогрев использовался в течение первых 100 шагов. Ранняя остановка применялась, если в течение пяти шагов оценки на настроечных данных не наблюдалось положительных изменений. Мы использовали оптимизатор Adam с коэффициентом снижения веса по умолчанию 0,01. Каждая модель обучалась в течение одной эпохи на графическом процессоре Nvidia Tesla V100.
Для обеспечения воспроизводимости результатов мы использовали фиксированное начальное значение (seed) для генераторов случайных чисел PyTorch, NumPy и Python при обучении моделей. Кроме того, мы использовали параметры CUDA, который определяют использование детерминированных алгоритмов.16 Каждая модель обучалась с пятью различными начальными значениям для генерации случайных чисел для получения более надежных результатов классификации [561]; мы приводим медианные оценки F1. Мы также приводим результаты сглаженных мультиномиальных NB-классификаторов.17
Мы дополнили наши эксперименты двумя БЯМ: Flan-UL2 [562] и chatGPT.18 Flan-UL2 - это инструктивная модель UL2 с 20B параметрами, которая немного превосходит Flan-T5-XXL и приближается к производительности более крупной модели Flan-PaLM на нескольких тестах. Flan-UL2 - од-
16См. общие рекомендации по воспроизводимости здесь: https://pytorch.org/docs/stable/notes/ randomness.html
17https://scikit-learn.org/stable/modules/generated/sklearn.naive_bayes.MultinomialNB.html
18
https://openai.com/blog/chatgpt
на из немногих моделей, которая была доступна на момент проведения экспериментов с точки зрения требуемых вычислительных ресурсов и лицензии. ChatGPT - модель, выпущенная Open AI в конце 2022 года и быстро завоевавшая всемирную популярность. Модель является развитием InstructGPT [563]. В наших экспериментах мы использовали версию gpt-3.5-turbo-0301 через её API. В обоих случаях мы использовали простую инструкцию для классификации в режиме zero-shot.
Помимо классификации, мы также дали БЯМ задание на продолжение шуток, чтобы проверить, запомнили ли они некоторые из них во время обучения [564]. Для этого мы отобрали 12 000 примеров длиной более одного предложения из 16kOL (2 787) и ReJ (10 083). Мы подавали первое предложение на вход модели и сравнили возвращенное продолжение с оригинальным с помощью ROUGE-2 [57] (формула 1.5).
Для проверки устойчивости моделей распознавания юмора мы разработали специальную состязательную атаку. Целью атаки было ввести в заблуждение модели, заменив одно слово в серьезных текстах. Эту атаку можно рассматривать как упрощённую версию метода генерации юмористических текстов, предложенного в работе [387]. В отличие от атак на классификаторы по темам или тональности текста, в нашем случае не требуется сохранять смысл исходного текста. Модификация состоит из следующих этапов:
1. Словам сопоставляются частеречные теги (POS tags) с помощью spaCy;19
2. Последнее найденное существительное в тексте отправляется в API Datamuse, в ответ мы получаем до 10 похожих по звучанию слов; 20
3. Слово в исходном предложении заменяется наиболее удалённым из найденных на основе косинусной меры близости векторных представлений fastText [565].
Из-за ограничений API Datasmuse мы провели эксперимент на 500 примеров из несмешных частей каждого набора данных. Мы изучили примеры изменённых текстов, чтобы убедиться, что этот подход не генерирует по-настоящему смешные шутки - в лучшем случае изменённый текст выглядит как бессмысленный, например: Law catches flies, but lets hornets go free. ^ Law catches flies, but lets hairnets go free.
19https://spacy.io
20https://www.datamuse.com/api/
5.2.3 Результаты
Переносимость
В Табл. 74 и 75 представлены результаты классификации с помощью моделей на основе RoBERTa и наивного Байесовского классификатора. Диагональные элементы верхней части таблицы показывают, что классификаторы на основе RoBERTa, обученные и протестированные на одних и тех же наборах данных, достигают хороших результатов - во всех случаях, кроме одного, значения F\ превышают 0,9. Исключением является ReJ (F\ = 0,70), где положительные и отрицательные классы сформированы из шуток предположительно разного качества. В большинстве случаев классификаторы RoBERTa значительно превосходят свои аналоги на основе наивного Байесовского подхода, см. Табл. 75. Рост особенно заметен в случае наборов данных, основанных на редактировании -Unfun.me (+81 пункта) и FL+HME (+43 пункта). Однако на трёх наборах данных - NF, ShJ и EnPuns - прирост оказался гораздо меньше (в случае NF классификаторы RoBERTa и NB достигли почти идеального результата). Именно в этих наборах данных наблюдается наибольшее лексическое различие между классами (см. расстояния Кульбака-Лейблера в Табл. 5).
Переносимость моделей варьируется в более широком диапазоне. Модель, обученная на PotD, показывает худшие результаты: на многих наборах данных F\ близок к нулю, а макроусреднённый F\ составляет всего 0,27. Обратите внимание, что PotD - второй по величине набор данных в исследовании с 3 323 примерами в обучающем наборе. FL+HME и ReJ демонстрируют плохую переносимость: макроусреднённый F\ немного выше 0,30. Интересно, что Unfun.me, самый маленький набор данных в исследовании, вполне конкурентоспособен с точки зрения переносимости, достигая макроусреднённого F\ = 0,73. Классификатор Unfun.me, обученный на заголовках The Onion и их «серьёзных» модификациях, достигает почти идеальной полноты (0,99) на бoльшей выборке из того же источника. Классификатор, обученный на COMB, превосходит другие модели по макроусредненному показателю F\ (0,80).
Результаты говорят о том, что разнообразие обучающих данных способствует лучшей переносимости моделей распознавания юмора. Модель на основе не входит в число лучших, что указывает на отсутствие прямой связи между размером набора данных и качеством. NF - самый «лёгкий» набор данных из всех. Несколько удивительно, что, несмотря на простоту композиции набора данных, классификатор, обученный на NF, показывает довольно хорошие результаты на других наборах. Распознавание сатиры в ТЬеО также представляется относительно простой задачей для моделей на основе КоБЕКГа (хотя близкие к идеальным оценки полноты могут указывать на переобучение). СЬа1СРТ и Е1ап-иЬ2 весьма конкурентоспособны: хотя они и работают хуже на отдельных наборах данных по сравнению с моделями после тонкой настройки, они занимают второе и третье места на многих наборах данных и достигают довольно высоких значений по макроусредненным
Таблица 74 — Качество бинарной классификации моделей КоБЕКГа
Модель 16kOL PotD EnPuns J h S J e Pi Haha FL+HME Unfun.me F N COMB cC £ * O e h T
К 16kOL 0,92 0,30 0,67 0,63 0,68 0,77 0,28 0,38 0,91 0,65 0,62 0,57
PotD 0,01 0,98 0,09 0,64 0,04 0,23 0,12 0,01 0,09 0,52 0,27 0,01
К сб EnPuns 0,53 0,74 0,92 0,53 0,67 0,76 0,70 0,61 0,85 0,69 0,70 0,91
К ShJ 0,73 0,72 0,62 0,93 0,57 0,82 0,37 0,28 0,92 0,78 0,67 0,38
у ^ ReJ 0,36 0,13 0,18 0,21 0,70 0,56 0,22 0,16 0,44 0,29 0,33 0,25
VQ О Haha 0,62 0,71 0,70 0,84 0,66 0,94 0,36 0,40 0,95 0,79 0,70 0,47
£ н m FL+HME 0,03 0,50 0,03 0,51 0,26 0,17 0,98 0,31 0,33 0,40 0,35 0,13
Uf,me 0,68 0,54 0,79 0,58 0,66 0,74 0,72 0,92 0,92 0,73 0,73 0,99
NF 0,67 0,68 0,85 0,65 0,67 0,76 0,72 0,61 1,00 0,75 0,74 1,00
о Pi COMB 0,64 0,97 0,54 0,85 0,65 0,93 0,57 0,97 0,96 0,92 0,80 0,99
chatGPT 0,77 0,85 0,78 0,85 0,67 0,91 0,42 0,56 0,70 0,82 0,73 0,59
FLAN 0,75 0,74 0,66 0,86 0,67 0,91 0,65 0,69 0,96 0,83 0,77 0,67
Приведены значения F\ на отдельных наборах данных и макроусредненный результат по всем наборам; * на наборе данных TheO - полнота. В верхней части таблицы - классификаторы на основе предобученной модели RoBERTa, в нижней - результаты двух БЯМ в режиме без примеров (zero-shot). Лучший результат для каждого набора данных выделен полужирным, второй - подчеркнут.
Таблица 75 — Качество бинарной классификации наивных Байесовских классификаторов
н
Модель 16kOL PotD EnPuns h S e tf Haha M H + L F s d u f n U F N COMB avg F1 * O e h H
16kOL 0,81 0,61 0,76 0,79 0,66 0,77 0,40 0,43 0,97 0,75 0,69 0,61
PotD 0,30 0,70 0,78 0,37 0,34 0,42 0,47 0,46 0,46 0,45 0,47 0,35
EnPuns 0,52 0,74 0,89 0,56 0,62 0,71 0,64 0,55 0,79 0,66 0,67 0,71
ShJ 0,71 0,60 0,74 0,89 0,66 0,83 0,39 0,29 0,98 0,77 0,69 0,44
ReJ 0,37 0,32 0,46 0,24 0,52 0,36 0,35 0,30 0,31 0,31 0,35 0,25
Haha 0,58 0,67 0,77 0,77 0,64 0,87 0,49 0,50 0,95 0,74 0,70 0,50
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.