Методы распознавания и генерации коротких юмористических текстов тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Баранов Александр Михайлович
- Специальность ВАК РФ00.00.00
- Количество страниц 101
Оглавление диссертации кандидат наук Баранов Александр Михайлович
Введение
Глава 1. Теоретические основы вычислительного юмора
Глава 2. Детекция юмора
2.1 Цель и задачи главы
2.2 Постановка задачи и критерии качества
2.2.1 Постановка задачи
2.2.2 Оценка моделей и метрики классификации
2.2.3 Метрики согласованности
2.3 Обзор литературы
2.4 Данные
2.4.1 Академические наборы данных
2.4.2 Дополнительные наборы данных
2.5 Модели и эксперименты
2.5.1 Основные классификаторы
2.5.2 Сторонние классификаторы
2.5.3 Применение больших языковых моделей для задачи классификации
2.5.4 Состязательные атаки
2.6 Результаты и выводы
2.6.1 Результаты оценки моделей
2.6.2 Зависимость результатов от объёма обучающих данных
2.6.3 Устойчивость к состязательной атаке
2.6.4 Поведение моделей на дополнительных наборах данных
2.6.5 Анализ воспроизведения шуток большими языковыми моделями
2.6.6 Выводы
Глава 3. Генерация юмора
3.1 Цель и задачи главы
Стр.
3.2 Обзор литературы
3.3 Модели и данные
3.4 Эксперименты
3.5 Выводы
Глава 4. Интерпретация юмора
4.1 Цель и задачи главы
4.2 Обзор литературы
4.3 Данные
4.3.1 Сбор данных
4.3.2 Опрелеление термина «игра слов»
4.3.3 Разметка данных
4.3.4 Статистика и анализ набора данных
4.4 Модели и эксперименты
4.5 Выводы
Заключение
Список литературы
Список рисунков
Список таблиц
Приложение А. Материалы к главе 2: лицензии наборов и
примеры данных
Приложение Б. Материалы к главе 4: примеры данных и
инструкции для ЬЬЫ
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Семантика юмора с позиций грамматики конструкций (на материале анекдотов на английском языке)2024 год, кандидат наук Уханова Мария Александровна
Автоматизация создания неправильных вариантов (дистракторов) для банков заданий языкового тестирования2026 год, кандидат наук Логин Никита Вячеславович
Методы и наборы данных для оценки моделей информационного поиска и обработки естественного языка2026 год, доктор наук Браславский Павел Исаакович
Структурно-семантические типы и языковые характеристики комизма (на материале испаноязычных стендап-комедий)2024 год, кандидат наук Зайцева Екатерина Сергеевна
Автоматический анализ прагматики и дискурса в диалогах на повседневные темы2025 год, кандидат наук Остякова Лидия Николаевна
Введение диссертации (часть автореферата) на тему «Методы распознавания и генерации коротких юмористических текстов»
Введение
С развитием методов автоматической обработки естественного языка на первый план вышли диалоговые системы, ориентированные на человекоподобное общение; в этом контексте у пользователей сформировалось ожидание, что такие системы будут распознавать, интерпретировать и уместно поддерживать юмор. Такие диалоговые системы применяются в различных прикладных областях и влияют на пользовательский опыт. Исследования взаимодействия человека с голосовыми ассистентами показывают, что часть пользователей ожидает от системы наличие чувства юмора [1]. Другие работы фиксируют запрос на остроумные, ситуативно уместные ответы и указывают на ограничения заранее заготовленных шуток, которые могут снижать удовлетворённость взаимодействием [2].
Появление больших языковых моделей вновь поставило вопрос о том, решают ли они задачи детекции, генерации и интерпретации юмора «из коробки» [3]. Экспериментальные наблюдения показывают, что при использовании простых инструкций генерация 1000 шуток сводится к 25 паттернам, которые модель воспроизводит. При решении задачи интерпретации модель нередко предлагает правдоподобные, но фиктивные объяснения. Эти факты свидетельствуют, что одних лишь простых приёмов недостаточно для полноценного решения задач вычислительного юмора.
Поскольку типизации юмора в литературе не унифицированы и зависят от цели исследования, далее мы ограничиваемся типами, которые проявляются в коротких письменных высказываниях. Длинные и многосоставные форматы (стендап, драматургия, сценарная комедия) остаются за рамками работы. Отдельное направление составляет мультимодальный анализ юмора. Несмотря на появление первых работ [4—6], мы не включаем мультимодальные подходы в рассмотрение по следующим причинам: во-первых, число доступных публикаций и наборов данных пока невелико; во-вторых, проведение сопоставимых экспериментов требует существенно больших вычислительных ресурсов и доступа к крупным моделям; в-третьих, сохраняются юридические и организационные ограничения, связанные с лицензированием имеющихся корпусов, необходимостью сбора новых данных и их дополнительной разметкой.
В общем случае задачи автоматического анализа юмора подразделяют на три компонента: детекцию, генерацию и интерпретацию. Чтобы зафиксировать теоретические основания и используемые далее понятия, кратко обозначим ключевые этапы становления лингвистических представлений о юморе и формальных моделей.
Интерес к природе юмора восходит к античной философии: уже Аристотель и Платон обсуждали причины комического. До начала XX века исследования юмора преимущественно оставались в рамках философских концепций [7]. В XX веке оформляется лингвистическая проблематика и появляются формальные модели, в частности Script-based Semantic Theory of Humor (SSTH) [8] и её развитие - General Theory of Verbal Humor (GTVH) [9]. Эти модели важны как теоретическая рамка для описания механизмов комизма и постановки вычислительных задач детекции, генерации и интерпретации юмора.
Исследования юмора в коротких текстах развивались синхронно с прогрессом методов автоматической обработки языка: от правил и простых вероятностных моделей [10] (например, наивного байесовского классификатора) к глубоким нейронным сетям на основе CNN и LSTM [11], а затем -к трансформерным архитектурам [12]. При этом во многих работах основное внимание уделялось предложенной архитектуре, тогда как межкорпусная обобщающая способность рассматривались ограниченно. Подходы к генерации юмора обычно делят на алгоритмические и «чёрного ящика»; первые обеспечивают большую управляемость и интерпретируемость, вторые — гибкость и эмпирическую эффективность. Гибридные стратегии, сочетающие эти принципы, представляются перспективными.
Задача интерпретации рассматривается как встраиваемая подсистема классификации, способная улучшать метрики за счёт объяснений при классификации [13], так и как самостоятельное направление, где модели должны явно обосновывать выявленные значения и механизмы комизма [14]. Вместе с тем современный массив работ по интерпретации зачастую ограничен контекстом каламбуров и преимущественно англоязычными данными.
Целью данной работы является разработка и экспериментальная оценка методов детекции, интерпретации и контролируемой генерации юмора в коротких текстах на естественных языках.
Объект исследования: короткие тексты на естественных языках, содержащие юмористический смысл или языковую игру слов.
Предмет исследования: методы и модели автоматической обработки коротких текстов для детекции, интерпретации и контролируемой генерации юмора, а также методики их экспериментальной оценки на корпусах с использованием формализованных протоколов и метрик.
Для достижения поставленной цели необходимо было решить следующие задачи:
1. Выполнить обзор лингвистических теорий юмора и показать их влияние на методы вычислительного юмора.
2. Провести систематический анализ существующих корпусов, выявить их ограничения и сформировать собственные репрезентативные наборы данных, компенсирующие выявленные пробелы.
3. Разработать и оценить модели автоматической детекции юмора, исследовать их межкорпусную переносимость и устойчивость, а также эффективность больших языковых моделей в этой задаче.
4. Разработать алгоритм контролируемой генерации юмористических текстов и провести его оценку.
5. Разработать корпус и поставить эксперименты по интерпретации юмора на русском языке с автоматической и экспертной оценкой.
Научная новизна:
1. Разработана методика экспериментальной оценки устойчивости обучения моделей детекции юмора на академических корпусах, предусматривающая межкорпусное тестирование переносимости и проверку устойчивости к состязательным атакам
2. Разработан подход к сбору и многоуровневому аннотированию русскоязычных текстов для детекции юмора и его объяснения
3. Разработан смешанный подход к генерации контекстуализированных юмористических новостных заголовков
Теоретическая значимость:
1. Показано, что задачи юмора и игры слов могут выступать диагностическим классом задач для анализа ограничений современных языковых моделей. Это особенно важно в ситуациях, где правдоподобность ответа не означает корректность интерпретации и требуется восстановление смысла по контексту.
2. Выявлена закономерность, что обобщающая способность моделей детекции юмора определяется разнообразием юмористических меха-
низмов, представленных в обучающих данных. Эта закономерность проявляется и при переносе на материалы вне домена, включая художественные тексты и диалоги из фильмов.
3. Показано, что устойчивость детекторов к состязательным атакам зависит от свойств данных и от доменно-специфических маркеров. Это уточняет представления о типичных уязвимостях моделей и о том, какие характеристики данных делают их более выраженными.
4. На материале ]оЫпдЫг& исследован механизм контролируемой генерации юмора в новостных заголовках на основе редактирования устойчивых словосочетаний. Сформулированы условия, при которых подстановка сохраняет связность текста и может приводить к юмористическому эффекту. Описаны ограничения такого механизма.
Практическая значимость:
1. Протоколы оценивания и сравнения моделей детекции юмора.
Разработаны и экспериментально обоснованы протоколы, повышающие качество и устойчивость предсказаний: проанализировано влияние разнообразия типов/механизмов юмора и объёма обучающей выборки, оценена устойчивость к специфичной состязательной атаки, выполнено межкорпусное тестирование на данных из разнородных источников, что повышает сопоставимость результатов и надёжность внедрения.
2. Русскоязычный корпус для детекции и интерпретации. Корпус К<Э"^Т-24 позволяет обучать и валидировать модели распознавания и объяснения игры слов; служит бенчмарком для сравнения методов и источником потенциальных задач.
3. Автоматические метрики интерпретации. Предложенная методика автоматической оценки по аннотированным «якорям» и отсылкам снижает затраты на ручную экспертизу и ускоряет оценку решений.
4. Гибридная контролируемая генерация. Метод «Локт§ЬМ» может использоваться в редакционных инструментах как ассистент по вариантам заголовков с управляемыми параметрами (механизм, опора), а также как источник «безопасного» расширения обучающих данных.
5. Переход в смежные задачи. Подходы к детекции/интерпретации распространяются на задачи рекламных слоганов, выявления
языковых игр в соцсетях, маркировки потенциально рискованного юмористического контента и поддержки возрастных ограничений.
6. Открытость и воспроизводимость. Публикация данных, кода и протоколов обеспечивает проверяемость результатов, облегчает внедрение в индустрии и служит базой для дальнейших исследований управляемой генерации и интерпретации.
Методология и методы исследования. Исследование выполнено на основе системного анализа и эмпирической проверки с применением методов вычислительной лингвистики и машинного обучения. Использованы корпусные методы сбора, очистки и предобработки текстов, а также процедуры аннотирования с контролем качества разметки по коэффициентам межаннотаторского согласия. Моделирование реализовано нейросетевыми методами, включая обучение языковых моделей, а также применение больших языковых моделей в режиме следования инструкциям. Оценивание организовано как вычислительный эксперимент с воспроизводимыми протоколами валидации, межкорпусным тестированием и анализом результатов.
Основные положения, выносимые на защиту:
1. Показано, что качество переноса детекторов юмора определяется разнообразием типов юмора в обучающих данных, а не их объёмом; при переносе на внешние корпуса специализированные модели оказываются нестабильны. Для обоснования вывода систематизированы существующие корпуса и проведены два типа испытаний: (1) межкорпусное тестирование (перенос внутри домена) и (п) кросс-доменное (ССЭ) тестирование; установлено, что большие языковые модели работают более стабильно в ССЭ-сценариях при уступке в нишевых задачах; показано, что модели, обученные на каламбурах, уязвимы к доменно-специфическим лексическим заменам.
2. Предложена и формализована воспроизводимая схема аннотирования новостных заголовков с игрой слов и соответствующий регламент разметки, включающий правила, примеры и протокол разрешения спорных случаев. Схема задаёт многоуровневую разметку наличия и типа игры слов, «якорей», отсылок с вики-ссылками и контекстов заголовка в виде лида и краткого содержания. На основе данной схемы создан и опубликован корпус Ко"^Т-24, обеспечивающий воспроизводимость и возможность дальнейшего расширения.
3. Обоснована и внедрена методика автоматической оценки интерпретаций по аннотированным «якорям» и отсылкам; ручная валидация показала сопоставимость автоматической и ручной оценки; проанализированы причины расхождений между ними (варианты написания и наименований, различия в разрешении отсылок, галлюцинации модели).
4. Предложен гибридный метод контролируемой генерации юмористических заголовков на основе коллокаций и подстановок, генерируемых языковой моделью; экспериментально показана высокая грамматическая корректность при умеренной комичности.
Достоверность и воспроизводимость обеспечены использованием открытых корпусов и тестовых коллекций, апробированных в научной литературе. Данные разделены на независимые обучающие, валидационные и тестовые подмножества. Эксперименты проведены многократно с фиксацией случайных инициализаций. Воспроизводимость подтверждена открытой публикацией исходного кода, конфигураций и сформированных корпусов. Для интерпретации протоколированы версии и параметры моделей. Методика построения нового корпуса формализована. Качество аннотаций проверено по показателям согласия. Оценивание выполнено по заранее определённым протоколам и метрикам качества.
Апробация работы. Результаты работы докладывались на конференциях:
1. Analysis of Images, Social Networks and Texts (AIST 2021). Тема: «Jokingbird: Funny headline generation for news»
2. Conference on Empirical Methods in Natural Language Processing (EMNLP 2023). Тема: «You told me that joke twice: A systematic investigation of transferability and robustness of humor detection models»
3. Recent Advances in Natural Language Processing (RANLP 2025). Тема: «KoWit-24: A Richly Annotated Dataset of Wordplay in News Headlines»
Личный вклад. Вклад автора в исследования, описанные в данной диссертации, заключается в следующем:
1. В статье «Jokingbird: Funny headline generation for news» [15] автор занимался выбором классификатора для ранжирования получаемых смешных заголовков, реализовал часть алгоритма замены целевых
слов. Участвовал в оценке полученного решения. Вместе с соавторами готовил текст статьи.
2. В статье «You told me that joke twice: A systematic investigation of transferability and robustness of humor detection models» [16] автор занимался сбором и систематизацией существующих наборов данных для детекции юмора, реализацией последовательности обучения и тестирование моделей на собранных наборах данных, тестированием больших языковых моделей. Вместе с соавторами готовил текст статьи.
3. В статье «KoWit-24: A Richly Annotated Dataset of Wordplay in News Headlines» [17] автор занимался сбором и систематизацией данных из выбранного источника. Автор предложил алгоритм и формат разметки набора данных. Реализовал последовательность тестирования больших языковых моделей. Участвовал в разметке данных. Вместе с соавторами готовил текст статьи.
Публикации. Основные результаты по теме диссертации изложены в следующих работах:
1. Nikita Login, Alexander Baranov, Pavel Braslavski. «Jokingbird: Funny headline generation for news» [15]. Работа опубликована в International Conference on Analysis of Images, Social Networks and Texts. (стр. 97-109, 2022, индексируется в Scopus)
2. Alexander Baranov, Vladimir Kniazhevsky, Pavel Braslavski. «You told me that joke twice: A systematic investigation of transferability and robustness of humor detection models» [16]. Работа опубликована в Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP). (стр. 13701-13715, 2023, рейтинг CORE A*)
3. Alexander Baranov, Anna Palatkina, Yulia Makovka, Pavel Braslavski «KoWit-24: A Richly Annotated Dataset of Wordplay in News Headlines» [17]. Работа опубликована в Proceedings of the 15th International Conference on Recent Advances in Natural Language Processing (стр. 125-132, 2025, индексируется в Scopus)
Объем и структура работы. Диссертация состоит из введения, 4 глав, заключения и 2 приложений. Полный объём диссертации составляет 101 страницу, включая 5 рисунков и 22 таблицы. Список литературы содержит 100 наименований.
Глава 1. Теоретические основы вычислительного юмора
Вычислительный юмор представляет собой стык двух научных дисциплин: вычислительной лингвистики и искусственного интеллекта. Однако, юмор как феномен человеческого сознания и коммуникации привлекал различных ученых во все времена. В современных же исследованиях теоретические основы юмора становятся ключевым этапом для его изучения, в частности, анализа механизмов генерации, восприятия и применения. Данная глава непосредственно посвящена рассмотрению теорий юмора. Основополагающими работами в этой области являются труды Виктора Раскина [8], Сальваторе Ат-тардо [9]. Их работы рассматривают юмор с разных стороны, заостряя внимание на вкладе в понимание юмора как семантического, лингвистического и психологического явления.
Данные теории являются базовыми для исследования юмора в целом, то есть они не затрагивают вычислительные методы, речь о которых будет в последующих разделах диссертации. Поэтому цель данной главы показать универсальность и потенциал данных теорий юмора в различных сферах. Обзор опирается на классические подходы к изучению юмора, такие как теории превосходства (англ. superiority), облегчения (англ. relief) и несоответствия (англ. incongruity), эволюционировавшие в более формализованные модели. Данный теоретический базис поможет сформировать основы для понимания того, как же юмор функционирует в языке и человечком сознании.
Комплексный анализ феномена юмора в различных сферах рассматривают на трех классических теориях, упомянутых раннее. Лингвист Виктор Раскин говорил об этих теориях так: «все три подхода оценивают такое сложное явление как юмор с различных углов и совершенно не противоречат друг другу -скорее они довольно тонко дополнят друг друга» [8].
Рассмотрим каждую из теорий. Первыми о теории превосходства говорили Платон и Аристотель. Современная психология подчеркивает роль этой теории в социальных взаимодействиях, так как в ее основе лежит эгоизм человека. Юмор в данном случае возникает как превосходство над другими, когда сочетается высмеивание слабостей и возникновение чувства удовольствия. При этом английский философ Т. Гоббс впервые сказал, что смех выражает внезапный триумф в борьбе за власть.
В теории облегчения или разрядки (relief theory) юмор рассматривается как механизм высвобождения энергии. В этом случае юмор выполняет функцию снятия стресса и напряжения. Наиболее полно эта теория представлена в работах З. Фрейда. Он различал 3 типа юмористических ситуаций и, таким образом, определял различия между юмором, комизмом и остротой. Английский философ А. Бэн также рассматривал смех как психическую разрядку и временное забывание общественных правил. Возможно, именно этот фактор оказывает влияние на популярность юмористических шоу в современном обществе.
Последняя же теория, которая объясняет юмор, как несоответсвие (incongruity theory), связана с противоречием между ожидаемым и реальным. Эта концепция А. Шопенгауэра говорит о распознавании абсурда, именно в успешном распознавании кроется причина смеха. Данная теория преобладает в современных исследованиях и лежит в основе многих лингвистических моделей. Американский антрополог Э. Оринг переосмысляет теорию и говорит о том, что логическое несоответствие не всегда является юмором, ведь подобные противоречия могут быть также частью метафор и дефиниций. Это объясняется тем, что противоречия в шутках основаны на нерациональности и на несхожести образов.
Рассмотрение юмора как превосходства, облегчения и несоответствия позволяет нам исследовать его только на базовом уровне. Для более глубокого анализа рассмотрим специализированные подходы: семантические и корпусные анализы. Семантическая теория юмора была предложена В. Раскиным. В его книге «Semantic Mechanisms of Humor» автор предлагает семантическую теорию скриптов юмора (Semantic Script Theory of Humor, SSTH). Данная теория основывается на вербальном юморе. Согласно Раскину, юмористический эффект возникает, когда текст совместим с двумя противоположными контекстами — когнитивный диссонанс. То есть два совершенно чуждых контекста начинают казаться ассоциированными. Например, «врач» (медицинский контекст) может пересекаться с «любовник» (романтический контекст), создавая юмор через неожиданное совмещение.
Структуры, в которых хранится информация, Раскин назвал скриптами. Скрипт — это структурированное описание объекта вместе с его типичными признаками. Автор формулирует два основных условия для возникновения юмористического эффекта:
1. Текст должен быть несовместим, полностью или частично, с двумя разными скриптами.
2. Два скрипта должны быть противоположными в определенном смысле (например, реальное и нереальное, нормальное и абсурдное).
Теория Раскина подчеркивает семантический аспект юмора, делая акцент на лингвистических механизмах, таких как неоднозначность слов. Ограничения SSTH включают фокус только на вербальном юморе и отсутствие учета контекста.
Вслед за Раскиным С. Аттардо в «Linguistic Theories of Humor» развивает теорию SSTH, предлагая общую теорию вербального юмора (General Theory of Verbal Humor, GTVH). GTVH вводит шесть иерархических ресурсов знаний (англ. Knowledge Resources), которые определяют структуру шутки:
1. Противопоставление скриптов (англ. Script Opposition): Основной элемент, аналогичный SSTH.
2. Логический механизм (англ. Logical Mechanism): Способ разрешения несоответствия двух скриптов в тексте шутки (например, аналогия или игнорирование).
3. Ситуация (англ. Situation): Контекст шутки
4. Цель (англ. Target): Объект насмешки.
5. Нарративная стратегия (англ. Narrative Strategy): Форма изложения шутки (например, анекдот или диалог).
6. Язык (англ. Language): Лексико-стилистические средства выражения.
Аттардо С. подчеркивает иерархичность ресурсов. Таким образом, изменения в первых уровнях (например, Script Opposition) влияют на юмор сильнее, чем в последних. GTVH применима к анализу различных типов вербального юмора и пытается учитывать культурные различия.
Глава 2. Детекция юмора 2.1 Цель и задачи главы
Цель главы - формализовать постановку задачи детекции юмора и систематизировать подходы к её оцениванию, а также очертить актуальное состояние области в части моделей и наборов данных. Для достижения цели решаются следующие задачи:
— Дать формальное определение задачи детекции юмора;
— Проанализировать применяемые методологии оценки качества алгоритмов: Метрики и стратегии валидации;
— Провести обзор литературы с выделением наиболее распространённых корпусов;
— Систематизировать актуальные модели, применяемые для решения задачи детекции юмора;
— Рассмотреть вопрос переносимости моделей между наборами данных и их устойчивости на данных вне домена;
— Исследовать применимость больших языковых моделей к задаче детекции юмора без дообучения на целевом корпусе.
2.2 Постановка задачи и критерии качества 2.2.1 Постановка задачи
На практике распознавание юмора формулируется как задача бинарной классификации [18]: для каждого текста х € X требуется определить, относится ли он к классу «юмор» (у = 1) или «не юмор» (у = 0). Пусть (Х,У) ~ V — неизвестное распределение на X х У, где У = {0,1}. Задана выборка независимых одинаково распределённых наблюдений Б = {(хг,уг)}™=1.
Ищется алгоритм /е : X ^ R с пороговым правилом
0т(ж) = !{/е(ж) ^ т},
где т G R подбирается по валидационной части данных под целевую метрику и далее фиксируется. Для вероятностной интерпретации используют оценку
ре(х) = о(/е(ж)) « Рг(У =1 | X = х), v(t) = ,
1 + е 1
при необходимости калиброванную на валидации.
Оптимальные параметры находятся минимизацией эмпирического риска с регуляризацией как приближения истинного риска R(e) = E(x,y)~v l(X,fe(X)):
1 n
0 G arg min Rs (е) + Л ОД, Rs (е) = - V HyiJe(xi)),
е п
г=1
где I — функция потерь, П(е) — штраф по норме параметров (например, L2), Л ^ 0. Для меток {0,1} используется кросс-энтропийная функция потерь
Му,/) = - У log а(/) - (1 - у) log(1 - а(/)).
2.2.2 Оценка моделей и метрики классификации
В задачах классификации для оценки качества моделей используются стандартные метрики, которые позволяют унифицировать подход к анализу результатов на протяжении всей работы. Оценивание проводится либо на отложенной тестовой подвыборке после разбиения данных на обучающую, ва-лидационную и тестовую части, либо по схеме многократной перекрёстной проверки с К блоками (стратифицированное разбиение по классам для сохранения баланса). В случае выраженного дисбаланса классов (п = P{у = 1} ^ п0) применяются следующие стратегии: (i) взвешенные версии функции потерь, (ii) балансировка мини-батчей (англ. mini-batches) при стохастическом обучении, (iii) настройка порога т под целевую меру качества.
Для вычисления метрик используются количества истинно-положительных (TP), ложно-положительных (FP), истинно-отрицательных (TN) и ложно-отрицательных (FN) решений, определяемые относительно положительного
класса у =1. На основе этих величин вычисляются ключевые метрики качества, такие как доля верных ответов (accuracy), полнота (recall), точность (precision) и Fi-мера.
Обозначения и стандартные метрики. TP — число истинно-положительных, FP — ложно-положительных, TN — истинно-отрицательных, FN — ложно-отрицательных ответов модели.
Доля верных ответов (accuracy, Acc). Общая доля правильно классифицированных объектов:
TP + TN
Acc =
TP + TN + FP + FN
Полнота (recall, Rec). Доля верно распознанных положительных объектов среди всех реально положительных (чувствительность):
TP
Rec =
TP + FN
Точность (precision, Prec). Доля верных положительных предсказаний среди всех положительных предсказаний:
TP
Prec =
TP + FP
Fl-мера (F1-score). Гармоническое среднее точности и полноты:
Prec • Rec 2 TP
Fi = 2
Prec + Rec 2 TP + FP + FN
2.2.3 Метрики согласованности
При подготовке наборов данных для задач классификации важно оценивать качество аннотаций. Для этого применяют метрики качества разметки и согласия, поскольку корпуса формируются людьми. Такие метрики позволяют выявлять систематические ошибки, сопоставлять работу аннотаторов и обеспечивать надежность последующего обучения моделей.
Коэффициент согласованности Криппендорфа (аКг).
1
О-Кг = 1 - ,
где наблюдаемое несогласие
^Е0^ 52 (^с>)
= -с с'
Ог
ее с с'
ЕЕ
а ожидаемое несогласие
= ЕЕРсРс'52(Рс = , пс = Е°сс'■
е с' ^ Пс' е'
Здесь осс; — элементы матрицы совпадений, построенной по всем парам оценок (для объекта с пи аннотациями пары учитываются с весом 1/(пи — 1)); 5(-,-) — метрика расстояния между категориями (для номинальной шкалы 52(с,с') = ¥[с = с']). Значения аКг Е (—то,1]: 1 — полное согласие, 0 — не выше случайного.
Коэффициент каппы Коэна (к).
_ 1 1 — Ро _ Ро — Ре к — 1 - — -,
1 — Ре 1 — Ре где наблюдаемая доля согласия двух аннотаторов
N
N
р° = ^ЕЕ " = с] = С],
1=1 с
а ожидаемая при случайной разметке
Ре = ^ Р\с Р2е^ Р\е = N Е¥[Г 1г = С], ^е = N Е ^ ^ = с] ■
с
Предназначен для двух аннотаторов и номинальных категорий; интерпретация значений как у а: 1 — полное согласие, 0 — на уровне случая.
Коэффициент каппы Флейсса (кр). Пусть объект г размечён щ раз по К
категориям, п^ — число присвоений категории с. Доля согласия для объекта:
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Юмористический дискурс в испанской и баскской лингвокультурах: сопоставительный анализ2017 год, кандидат наук Фернандес Санчес, Юлия Васильевна
Когнитивно-прагматические основания порождения юмористического эффекта: на материале англоязычных юмористических текстов2015 год, кандидат наук Шмулевич, Лия Ильинична
Методы и программные средства автоматического рецензирования исходного кода2025 год, кандидат наук Качанов Владимир Владимирович
Русский юмористический текст на фоне вьетнамской лингвокультурной традиции2014 год, кандидат наук Чан Тхань Тунг
Противопоставления как средства реализации комического в дискурсе стендап-комедии2024 год, кандидат наук Гальцов Петр Ильич
Список литературы диссертационного исследования кандидат наук Баранов Александр Михайлович, 2026 год
Список литературы
1. Eliciting and Analysing Users' Envisioned Dialogues with Perfect Voice Assistants [Текст] / S. T. Volkel [и др.] // Proceedings of the 2021 CHI Conference on Human Factors in Computing Systems. — Yokohama, Japan : Association for Computing Machinery, 2021. — (CHI '21). — URL: https: //doi.org/10.1145/3411764.3445536.
2. "Funny How?" A Serious Look at Humor in Conversational Agents [Текст] / N. Zargham [и др.] // Proceedings of the 5th International Conference on Conversational User Interfaces. — Eindhoven, Netherlands : Association for Computing Machinery, 2023. — (CUI '23). — URL: https://doi.org/10.1145/ 3571884.3603761.
3. Jentzsch, S. ChatGPT is fun, but it is not funny! Humor is still challenging Large Language Models [Текст] / S. Jentzsch, K. Kersting // Proceedings of the 13th Workshop on Computational Approaches to Subjectivity, Sentiment, & Social Media Analysis / под ред. J. Barnes, O. De Clercq, R. Klinger. — Toronto, Canada : Association for Computational Linguistics, 07.2023. — С. 325—340. — URL: https://aclanthology.org/2023.wassa-1.29/.
4. UR-FUNNY: A Multimodal Language Dataset for Understanding Humor [Текст] / M. K. Hasan [и др.] // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP) / под ред. K. Inui [и др.]. — Hong Kong, China : Association for Computational Linguistics, 11.2019. — С. 2046—2056. — URL: https://aclanthology.org/D19-1211/.
5. Multimodal Humor Dataset: Predicting Laughter tracks for Sitcoms [Текст] / B. N. Patro [и др.] // 2021 IEEE Winter Conference on Applications of Computer Vision (WACV). — 2021. — С. 576—585.
6. The Laughing Machine: Predicting Humor in Video [Текст] / Y. Kayatani [и др.] // 2021 IEEE Winter Conference on Applications of Computer Vision (WACV). — 2021. — С. 2072—2081.
7. Morreall, J. Comic Relief: A Comprehensive Philosophy of Humor [Текст] / J. Morreall. — Malden, MA : Wiley-Blackwell, 2009.
8. Raskin, V. Semantic Mechanisms of Humor [Текст] / V. Raskin. — Dordrecht : D. Reidel, 1985. — 284 p. — (Studies in Linguistics and Philosophy ; 24).
9. Attardo, S. The General Theory of Verbal Humor [Текст] / S. Attardo // The Routledge Handbook of Language and Humor / под ред. S. Attardo. — New York : Routledge, 2017.
10. Mihalcea, R. Making Computers Laugh: Investigations in Automatic Humor Recognition [Текст] / R. Mihalcea, C. Strapparava // Proceedings of Human Language Technology Conference and Conference on Empirical Methods in Natural Language Processing / под ред. R. Mooney [и др.]. — Vancouver, British Columbia, Canada : Association for Computational Linguistics, 10.2005. — С. 531—538. — URL: https://aclanthology.org/H05-1067/.
11. Chen, P.-Y. Humor Recognition Using Deep Learning [Текст] / P.-Y. Chen, V.-W. Soo // Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Short Papers) / под ред. M. Walker, H. Ji, A. Stent. — New Orleans, Louisiana : Association for Computational Linguistics, 06.2018. — С. 113—117. — URL: https://aclanthology.org/N18-2018/.
12. Weller, O. Humor Detection: A Transformer Gets the Last Laugh [Текст] / O. Weller, K. Seppi // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP) / под ред. K. Inui [и др.]. — Hong Kong, China : Association for Computational Linguistics, 11.2019. — С. 3621—3625. — URL: https://aclanthology.org/D19-1372/.
13. ExPUNations: Augmenting Puns with Keywords and Explanations [Текст] / J. Sun [и др.] // Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing / под ред. Y. Goldberg, Z. Kozareva, Y. Zhang. — Abu Dhabi, United Arab Emirates : Association for
Computational Linguistics, 12.2022. — С. 4590—4605. — URL: https : //aclanthology.org/2022.emnlp-main.304.
14. "A good pun is its own reword": Can Large Language Models Understand Puns? [Текст] / Z. Xu [и др.] // Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing / под ред. Y. Al-Onaizan, M. Bansal, Y.-N. Chen. — Miami, Florida, USA : Association for Computational Linguistics, 11.2024. — С. 11766—11782. — URL: https:// aclanthology.org/2024.emnlp-main.657/.
15. Login, N. Jokingbird: Funny Headline Generation for News [Текст] / N. Login, A. Baranov, P. Braslavski // Analysis of Images, Social Networks and Texts / под ред. E. Burnaev [и др.]. — Cham : Springer International Publishing,
2022. — С. 97—109.
16. Baranov, A. You Told Me That Joke Twice: A Systematic Investigation of Transferability and Robustness of Humor Detection Models [Текст] / A. Baranov, V. Kniazhevsky, P. Braslavski // Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing / под ред. H. Bouamor, J. Pino, K. Bali. — Singapore : Association for Computational Linguistics, 12.2023. — С. 13701—13715. — URL: https://aclanthology.org/
2023.emnlp-main.845/.
17. KoWit-24: A Richly Annotated Dataset of Wordplay in News Headlines [Текст] / A. Baranov [и др.] // Proceedings of the 15th International Conference on Recent Advances in Natural Language Processing. — Varna, Bulgaria : INCOMA Ltd., Shoumen, Bulgaria, 09.2025.
18. Shalev-Shwartz, S. Understanding machine learning: From theory to algorithms [Текст] / S. Shalev-Shwartz, S. Ben-David. — Cambridge university press, 2014.
19. Taylor, J. M. Computationally recognizing wordplay in jokes [Текст] / J. M. Taylor, L. J. Mazlack // Proceedings of the annual meeting of the cognitive science society. Т. 26. — 2004.
20. A comparison of event models for naive bayes text classification [Текст] / A. McCallum, K. Nigam [и др.] // AAAI-98 workshop on learning for text categorization. Т. 752. — Madison, WI. 1998. — С. 41—48.
21. Joachims, T. Text categorization with support vector machines: Learning with many relevant features [Текст] / T. Joachims // European conference on machine learning. — Springer. 1998. — С. 137—142.
22. Manning, C. D. Introduction to information retrieval [Текст] / C. D. Manning. — Syngress Publishing, 2008.
23. Buscaldi, D. Some experiments in humour recognition using the italian wikiquote collection [Текст] / D. Buscaldi, P. Rosso // International workshop on fuzzy logic and applications. — Springer. 2007. — С. 464—468.
24. Zhang, R. Recognizing humor on twitter [Текст] / R. Zhang, N. Liu // Proceedings of the 23rd ACM international conference on conference on information and knowledge management. — 2014. — С. 889—898.
25. Friedman, J. H. Greedy function approximation: a gradient boosting machine [Текст] / J. H. Friedman // Annals of statistics. — 2001. — С. 1189—1232.
26. Humor Recognition and Humor Anchor Extraction [Текст] / D. Yang [и др.] // Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing / под ред. L. Marquez, C. Callison-Burch, J. Su. — Lisbon, Portugal : Association for Computational Linguistics, 09.2015. — С. 2367—2376. — URL: https://aclanthology.org/D15-1284/.
27. Distributed representations of words and phrases and their compositionality [Текст] / T. Mikolov [и др.] // Advances in neural information processing systems. — 2013. — Т. 26.
28. Miller, G. A. WordNet: a lexical database for English [Текст] / G. A. Miller // Communications of the ACM. — 1995. — Т. 38, № 11. — С. 39—41.
29. Wilson, T. Recognizing contextual polarity in phrase-level sentiment analysis [Текст] / T. Wilson, J. Wiebe, P. Hoffmann // Proceedings of human language technology conference and conference on empirical methods in natural language processing. — 2005. — С. 347—354.
30. Bertero, D. A long short-term memory framework for predicting humor in dialogues [Текст] / D. Bertero, P. Fung // Proceedings of the 2016 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. — 2016. — С. 130—135.
31. Chen, L. Predicting audience's laughter during presentations using convolutional neural network [Текст] / L. Chen, C. Lee // Proceedings of the 12th Workshop on Innovative Use of NLP for Building Educational Applications. — 2017. — С. 86—90.
32. Kim, Y. Convolutional Neural Networks for Sentence Classification [Текст] / Y. Kim // Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). — 2014. — С. 1746—1751.
33. Miller, T. SemEval-2017 Task 7: Detection and Interpretation of English Puns [Текст] / T. Miller, C. Hempelmann, I. Gurevych // Proceedings of the 11th International Workshop on Semantic Evaluation (SemEval-2017) / под ред. S. Bethard [и др.]. — Vancouver, Canada : Association for Computational Linguistics, 08.2017. — С. 58—68. — URL: https://aclanthology.org/S17-2005/.
34. Potash, P. Semeval-2017 task 6:# hashtagwars: Learning a sense of humor [Текст] / P. Potash, A. Romanov, A. Rumshisky // Proceedings of the 11th International Workshop on Semantic Evaluation (SemEval-2017). — 2017. — С. 49—57.
35. Graves, A. Framewise phoneme classification with bidirectional LSTM and other neural network architectures [Текст] / A. Graves, J. Schmidhuber // Neural networks. — 2005. — Т. 18, № 5/6. — С. 602—610.
36. Church, K. Word association norms, mutual information, and lexicography [Текст] / K. Church, P. Hanks // Computational linguistics. — 1990. — Т. 16, № 1. — С. 22—29.
37. Short Jokes [Электронный ресурс]. — URL: https : / /www.kaggle.com/ abhinavmoudgil95/short-jokes (дата обр. 01.08.2025).
38. Findings of the 2016 conference on machine translation (wmt16) [Текст] / O. Bojar [и др.] // First conference on machine translation. — Association for Computational Linguistics. 2016. — С. 131—198.
39. Pennington, J. Glove: Global vectors for word representation [Текст] / J. Pennington, R. Socher, C. D. Manning // Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP). — 2014. — С. 1532—1543.
40. Srivastava, R. K. Highway networks [Текст] / R. K. Srivastava, K. Greff, J. Schmidhuber // arXiv preprint arXiv:1505.00387. — 2015.
41. Bert: Pre-training of deep bidirectional transformers for language understanding [Текст] / J. Devlin [и др.] // Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers). — 2019. — С. 4171—4186.
42. West, R. Reverse-engineering satire, or "paper on computational humor accepted despite making serious advances" [Текст] / R. West, E. Horvitz // Proceedings of the Thirty-Third AAAI Conference on Artificial Intelligence and Thirty-First Innovative Applications of Artificial Intelligence Conference and Ninth AAAI Symposium on Educational Advances in Artificial Intelligence. — Honolulu, Hawaii, USA : AAAI Press, 2019. — (AAAI'19/IAAI'19/EAAI'19). — URL: https://doi.org/10.1609/aaai.v33i01. 33017265.
43. SemEval-2020 Task 7: Assessing Humor in Edited News Headlines [Текст] / N. Hossain [и др.] // Proceedings of the Fourteenth Workshop on Semantic Evaluation / под ред. A. Herbelot [и др.]. — Barcelona (online) : International Committee for Computational Linguistics, 12.2020. — С. 746—758. — URL: https://aclanthology.org/2020.semeval-1.98/.
44. Annamoradnejad, I. ColBERT: Using BERT sentence embedding in parallel neural networks for computational humor [Текст] / I. Annamoradnejad, G. Zoghi // Expert Systems with Applications. — 2024. — Т. 249. — С. 123685.
45. XLNet: generalized autoregressive pretraining for language understanding [Текст] / Z. Yang [и др.] // Proceedings of the 33rd International Conference on Neural Information Processing Systems. — Red Hook, NY, USA : Curran Associates Inc., 2019.
46. SemEval 2021 Task 7: HaHackathon, Detecting and Rating Humor and Offense [Текст] / J. A. Meaney [и др.] // Proceedings of the 15th International Workshop on Semantic Evaluation (SemEval-2021) / под ред. A. Palmer [и др.]. — Online : Association for Computational Linguistics, 08.2021. — С. 105—119. — URL: https://aclanthology.org/2021.semeval-L9/.
47. The Naughtyformer: A transformer understands offensive humor [Текст] / L. Tang [и др.] // arXiv preprint arXiv:2211.14369. — 2022.
48. A Crowd-Annotated Spanish Corpus for Humor Analysis [Текст] / S. Castro [и др.] // Proceedings of the Sixth International Workshop on Natural Language Processing for Social Media. — Melbourne, Australia : Association for Computational Linguistics, 2018. — С. 7—11. — URL: https : / / aclanthology.org/W18-3502.
49. Winters, T. Dutch humor detection by generating negative examples [Текст] / T. Winters, P. Delobelle // arXiv preprint arXiv:2010.13652. — 2020.
50. Blinov, V. Large Dataset and Language Model Fun-Tuning for Humor Recognition [Текст] / V. Blinov, V. Bolotova-Baranova, P. Braslavski // Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics / под ред. A. Korhonen, D. Traum, L. Marquez. — Florence, Italy : Association for Computational Linguistics, 07.2019. — С. 4027—4032. — URL: https://aclanthology.org/P19-1394/.
51. Telling the Whole Story: A Manually Annotated Chinese Dataset for the Analysis of Humor in Jokes [Текст] / D. Zhang [и др.] // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP) / под ред. K. Inui [и др.]. — Hong Kong, China : Association for Computational Linguistics, 11.2019. — С. 6402—6407. — URL: https://aclanthology.org/D19-1673/.
52. UNIFIEDQA: Crossing Format Boundaries with a Single QA System [Текст] / D. Khashabi [и др.] // Findings of the Association for Computational Linguistics: EMNLP 2020. — Online : Association for Computational Linguistics, 11.2020. — С. 1896—1907. — URL: https://aclanthology.org/ 2020.findings-emnlp.171.
53. Talmor, A. MultiQA: An Empirical Investigation of Generalization and Transfer in Reading Comprehension [Текст] / A. Talmor, J. Berant // Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics. — Florence, Italy : Association for Computational Linguistics, 07.2019. — С. 4911—4921. — URL: https://aclanthology.org/P19-1485.
54. Testing the Ability of Language Models to Interpret Figurative Language [Текст] / E. Liu [и др.] // Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies. — Seattle, United States : Association for Computational Linguistics, 07.2022. — С. 4437—4452. — URL: https: / / aclanthology.org/2022.naacl-main.330.
55. Van Hee, C. SemEval-2018 Task 3: Irony Detection in English Tweets [Текст] / C. Van Hee, E. Lefever, V. Hoste // Proceedings of the 12th International Workshop on Semantic Evaluation. — New Orleans, Louisiana : Association for Computational Linguistics, 06.2018. — С. 39—50. — URL: https : / / aclanthology.org/S18-1005.
56. Roberta: A robustly optimized bert pretraining approach [Текст] / Y. Liu [и др.] // arXiv preprint arXiv:1907.11692. — 2019.
57. Reproducibility [Текст] : PyTorch 2.8 documentation / PyTorch. — 26.11.2024. — URL: https : / / docs . pytorch . org / docs / stable / notes / randomness.html (дата обр. 18.08.2025).
58. Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping [Текст] / J. Dodge [и др.] // arXiv preprint arXiv:2002.06305. — 2020.
59. Scikit-learn: Machine learning in Python [Текст] / F. Pedregosa [и др.] // the Journal of machine Learning research. — 2011. — Т. 12. — С. 2825—2830.
60. Ul2: Unifying language learning paradigms [Текст] / Y. Tay [и др.] // The Eleventh International Conference on Learning Representations. — 2022.
61. GPT-3.5 Turbo [Текст] / OpenAI. — 2025. — URL: https://platform.openai. com/docs/models/gpt-3.5-turbo (дата обр. 18.08.2025).
62. Training language models to follow instructions with human feedback [Текст] / L. Ouyang [и др.] // Advances in Neural Information Processing Systems. — 2022. — Т. 35. — С. 27730—27744.
63. Quantifying Memorization Across Neural Language Models [Текст] / N. Carlini [и др.] // The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1-5, 2023. — 2023.
64. Lin, C.-Y. ROUGE: A Package for Automatic Evaluation of Summaries [Текст] / C.-Y. Lin // Text Summarization Branches Out. — Barcelona, Spain : Association for Computational Linguistics, 07.2004. — С. 74—81. — URL: https://aclanthology.org/W04-1013.
65. "Let Everything Turn Well in Your Wife": Generation of Adult Humor Using Lexical Constraints [Текст] / A. Valitutti [и др.] // Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers). — Sofia, Bulgaria : Association for Computational Linguistics, 08.2013. — С. 243—248. — URL: https://aclanthology.org/P13-2044.
66. Enriching Word Vectors with Subword Information [Текст] / P. Bojanowski [и др.] // Transactions of the Association for Computational Linguistics. — Cambridge, MA, 2017. — Т. 5. — С. 135—146. — URL: https://aclanthology. org/Q17-1010.
67. Stock, O. HAHAcronym: A Computational Humor System [Текст] / O. Stock, C. Strapparava // Proceedings of the ACL Interactive Poster and Demonstration Sessions / под ред. M. Nagata, T. Pedersen. — Ann Arbor, Michigan : Association for Computational Linguistics, 06.2005. — С. 113—116. — URL: https://aclanthology.org/P05-3029/.
68. DeCastellarnau, A. A classification of response scale characteristics that affect data quality: a literature review [Текст] / A. DeCastellarnau // Quality & quantity. — 2018. — Т. 52, № 4. — С. 1523—1559.
69. Sjöbergh, J. A Measure of Funniness, Applied to Finding Funny Things in WordNet [Текст] / J. Sjobergh, K. Araki // Proceedings of the Conference of the Pacific Association for Computational Linguistics 2009. — 2009. — С. 236—241.
70. A pinch of humor for short-text conversation: an information retrieval approach [Текст] / V. Blinov [и др.] // International conference of the cross-language evaluation forum for European Languages. — Springer. 2017. — С. 3—15.
71. How to evaluate humorous response generation, seriously? [Текст] / P. Braslavski [и др.] // Proceedings of the 2018 Conference on Human Information Interaction & Retrieval. — 2018. — С. 225—228.
72. Yu, Z. A Neural Approach to Pun Generation [Текст] / Z. Yu, J. Tan, X. Wan // Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) / под ред. I. Gurevych, Y. Miyao. — Melbourne, Australia : Association for Computational Linguistics, 07.2018. — С. 1650—1660. — URL: https://aclanthology.org/P18-1153/.
73. He, H. Pun Generation with Surprise [Текст] / H. He, N. Peng, P. Liang // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers). — 2019. — С. 1734—1744.
74. Horvitz, Z. Context-Driven Satirical News Generation [Текст] / Z. Horvitz, N. Do, M. L. Littman // Proceedings of the Second Workshop on Figurative Language Processing. — 2020. — С. 40—50.
75. Liu, Y. Text Summarization with Pretrained Encoders [Текст] / Y. Liu, M. Lapata // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP) / под ред. K. Inui [и др.]. — Hong Kong, China : Association for Computational Linguistics, 11.2019. — С. 3730—3740. — URL: https://aclanthology.org/D19-1387/.
76. Language models are unsupervised multitask learners [Текст] / A. Radford [и др.] // OpenAI blog. — 2019. — Т. 1, № 8. — С. 9.
77. Winters, T. Towards a general framework for humor generation from rated examples [Текст] / T. Winters, V. Nys, D. De Schreye // http://computationalcreativity. net/iccc2019/assets/iccc_proceedings_2019. pdf. — 2019. — Proceedings of the 10th International Conference on Computational Creativit. — С. 274—281.
78. Weller, O. Can Humor Prediction Datasets be used for Humor Generation? Humorous Headline Generation via Style Transfer [Текст] / O. Weller, N. Fulda, K. Seppi // Proceedings of the Second Workshop on Figurative Language Processing. — 2020. — С. 186—191.
79. Miller, T. Automatic disambiguation of English puns [Текст] / T. Miller, I. Gurevych // Proceedings of the 53rd Annual Meeting of the Association for Computational Linguistics and the 7th International Joint Conference on
Natural Language Processing (Volume 1: Long Papers) / под ред. C. Zong, M. Strube. — Beijing, China : Association for Computational Linguistics, 07.2015. — С. 719—729. — URL: https://aclanthology.org/P15-1070/.
80. Lesk, M. Automatic sense disambiguation using machine readable dictionaries: how to tell a pine cone from an ice cream cone [Текст] / M. Lesk // Proceedings of the 5th Annual International Conference on Systems Documentation. — Toronto, Ontario, Canada : Association for Computing Machinery, 1986. — С. 24—26. — (SIGDOC '86). — URL: https://doi.org/ 10.1145/318723.318728.
81. Towards interpretable natural language understanding with explanations as latent variables [Текст] / W. Zhou [и др.] // Advances in Neural Information Processing Systems. — 2020. — Т. 33. — С. 6803—6814.
82. Khazanov, P. A Petrovich Inside of Every New Russian: The Disciplinary Regime of the Capitalist "Vanguard Group" at 1990s Kommersant [Текст] / P. Khazanov // The Russian Review. — 2023. — Т. 82, № 3. — С. 470—485. — eprint: https://onlinelibrary.wiley.com/doi/pdf/10.1111/russ.12477. — URL: https://onlinelibrary.wiley.com/doi/abs/10.1111/russ.12477.
83. Chernyshova, T. Language mechanisms of building the ironic texts and ways of their linguistic research (linguistic pragmatic aspect) [Текст] / T. Chernyshova // The European Journal of Humour Research. — 2021. — Т. 9, № 1. — С. 57—73.
84. Tymbay, A. Reading 'between the lines': How implicit language helps liberal media survive in authoritarian regimes. The Kommersant Telegram posts case study [Текст] / A. Tymbay // Discourse & Communication. — 2024. — Т. 18, № 4. — С. 557—591. — URL: https://doi.org/10.1177/17504813241236907.
85. Правовая информация [Текст] / АО «Коммерсантъ». — URL: https:// www.kommersant.ru/copyright (дата обр. 25.08.2025).
86. Partington, A. S. A linguistic account of wordplay: The lexical grammar of punning [Текст] / A. S. Partington // Journal of Pragmatics. — 2009. — Т. 41, № 9. — С. 1794—1809. — URL: https://www.sciencedirect.com/ science/article/pii/S0378216608002397.
87. Monsefi, R. Wordplay in English Online News Headlines [Текст] / R. Monsefi, T. Sepora // Advances in Language and Literary Studies. — 2016. — Т. 7, № 2. — С. 68—75. — URL: https://www.proquest.com/scholarly-journals/ wordplay-english-online-news-headlines/docview/2188087108/se-2.
88. Humor in Satirical News Headlines: Analyzing Humor Form and Content, and Their Relations with Audience Engagement [Текст] / B. C. Brugman [и др.] // Mass Communication and Society. — 2023. — Т. 26, № 6. —
C. 963—990. — URL: https://doi.org/10.1080/15205436.2022.2144747.
89. Oprea, S. iSarcasm: A Dataset of Intended Sarcasm [Текст] / S. Oprea, W. Magdy // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. — 2020. — С. 1279—1289.
90. Hatexplain: A benchmark dataset for explainable hate speech detection [Текст] / B. Mathew [и др.] // Proceedings of the AAAI conference on artificial intelligence. Т. 35. — 2021. — С. 14867—14875.
91. SaluteDevices team. ruGPT-3.5 13B. Технический отчет. [Текст] / SaluteDevices team. — 2023. — URL: https:/ /habr.com/ru/companies/ sberbank/articles/730108/ (дата обр. 15.09.2024).
92. Gavrilov, D. Self-attentive Model for Headline Generation [Текст] /
D. Gavrilov, P. Kalaidin, V. Malykh // Advances in Information Retrieval -41st European Conference on IR Research, ECIR 2019, Cologne, Germany, April 14-18, 2019, Proceedings, Part II. Т. 11438 / под ред. L. Azzopardi [и др.]. — Springer, 2019. — С. 87—93. — (Lecture Notes in Computer Science). — URL: https://doi.org/10.1007/978-3-030-15719-7%5C_11.
93. Gpt-4 technical report [Текст] / J. Achiam [и др.] // arXiv preprint arXiv:2303.08774. — 2023.
94. Mistral AI team. Mistral NeMo [Текст] / Mistral AI team. — 2024. — URL: https://mistral.ai/news/mistral-nemo/ (дата обр. 15.09.2024).
95. Yandex team. YandexGPT 4 [Текст] / Yandex team. — 2024. — URL: https: //ya.ru/ai/gpt-4 (дата обр. 09.02.2025).
96. GigaChat Family: Efficient Russian Language Modeling Through Mixture of Experts Architecture [Текст] / M. GigaChat team Valentin [и др.] // arXiv preprint arXiv:2506.09440. — 2025.
97. NLP Core Team. MMLU-RU: Massive Multitask Language Understanding (RU/EN) [Текст] / NLP Core Team. — 2023. — URL: https://huggingface. co/datasets/NLPCoreTeam/mmlu_ru (дата обр. 24.05.2025).
98. Measuring Massive Multitask Language Understanding [Текст] / D. Hendrycks [и др.] // 9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, May 3-7, 2021. — 2021. — URL: https://openreview.net/forum?id=d7KBjmI3GmQ.
99. Let's be Humorous: Knowledge Enhanced Humor Generation [Текст] / H. Zhang [и др.] // arXiv preprint arXiv:2004.13317. — 2020.
100. Hossain, N. "President Vows to Cut <Taxes> Hair": Dataset and Analysis of Creative Text Editing for Humorous Headlines [Текст] / N. Hossain, J. Krumm, M. Gamon // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers) / под ред. J. Burstein, C. Doran, T. Solorio. — Minneapolis, Minnesota : Association for Computational Linguistics, 06.2019. — С. 133—142. — URL: https:/ / aclanthology.org/N19-1012/.
Список рисунков
2.1 Архитектура модели Со1Бег1 [44]..................... 29
2.2 Сходство наборов данных по результатам классификации, визуализированное с помощью алгоритма ЕогсеАИаз2.......... 42
2.3 Влияние размера обучающей выборки на качество классификации (медианные значения по пяти случайным инициализациям)...... 46
3.1 Шаги алгоритма ЛоИ^ЬМ........................ 56
4.1 Распределение перплексии заголовков в двух классах KoWit-24
(+/-) и в коллекции «РИА Новости»................... 73
Список таблиц
1 Доля верных ответов попарной классификации: «one-liners» против трёх корпусов................................................................21
2 Результаты моделей на тестовой выборке................................24
3 Наборы данных для детекции юмора - источники и разбиение .... 32
4 Наборы данных для детекции юмора - сравнение классов............34
5 F1-мера при тестировании переносимости моделей RoBerta............40
6 F1-мера при тестировании переносимости моделей NB ................41
7 Результаты состязательной атаки на классификаторы RoBERTa . . . 44
8 Статистика дополнительных наборов данных (верхняя часть) и доля примеров, которые каждая модель классифицировала как юмористические..............................................................45
9 Средние значения метрики ROUGE-2 для сгенерированных продолжений..................................................................46
10 Среднее значение оценки классификатора ColBERT на исходных и модифицированных заголовках............................................59
11 Ручная оценка 200 заголовков системы Jokingbird ......................59
12 Взвешенная каппа Коэна между двумя аннотаторами по результатам Jokingbird ....................................................60
13 Типы игры слов и статистика KoWit-24 ..................................72
14 Используемые большие языковые модели в работе......................74
15 Качество детекции и интерпретации игры слов ..........................76
16 Recall детекции игры слов по типам при использовании простой и расширенной инструкции....................................................76
17 Recall интерпретации игры слов по типам................................77
18 Наборы данных, библиографические описания и ссылки для загрузки. 96
19 Примеры из наборов данных по детекции юмора........................97
20 Самые «смешные» примеры из дополнительных наборов данных по мнению большинства из десяти классификаторов на основе RoBERTa. 98
21 Оригинальные примеры игры слов и их интерпретации................99
22 Пользовательские и системные промпты для детекции и
интерпретации игры слов..........................100
Приложение А
Материалы к главе 2: лицензии наборов и примеры данных
Таблица 18 — Наборы данных, библиографические описания и ссылки для за-
грузки.
Датасет
Ссылка для скачивания
Лицензия
16k one-liners [10] Pun of the Day [26]
English Puns [33]
Short Jokes [11; 12]
Reddit Jokes [12]
Unfun.me [42] Humicroedits [100]
Funlines [43]
Hahackathon [46]
The Naughtyformer [47]
TheOnion
по запросу
https://github.com/orionw/ RedditHumorDetection https://alt.qcri.org/semeval2017/ task7/
https://github.com/amoudgl/
short-jokes-dataset https://github.
com/orionw/RedditHumorDetection
https://github.com/orionw/
RedditHumorDetection
https://github.com/epfl-dlab/unfun
https://cs.rochester.edu/u/nhossain/
humicroedit.html
https://cs.rochester.edu/u/nhossain/ funlines.html
http://smash.inf.ed.ac.uk/ hahackathon_data/ https://github.com/leonardtang/ The-Naughtyformer
https://github.com/lukefeilberg/onion
MIT
CC BY-NC
MIT / GPL-2.0
MIT
Таблица 19 — Примеры из наборов данных Датасет ©
по детекции юмора. ©
16kOL
PotD
EnPuns
ShJ
ReJ
Haha
NF
Couldn't afford to fix my brakes, so I made my horn louder. in order to talk to a viking you need to know norse code
Dateline London : Eccentric ornithologist travels to foreign land to teach pigeon English . Why couldn't the cop save the hippie from drowning? He was too far out man
I just downloaded the Bohemian
Rhapsody movie._____I think it was
filmed in a movie theater, though - I see a little silhouetto of a man.
FL+HME
Unfun.me
TheO
My wife thinks I don't give her enough privacy. At least that's what she said in her diary.
Topless protesters crash pro-Franco bus in Madrid
Obama's Declaration Of Swine Flu Emergency Prompts Pro-Swine-Flu Republican Response My crush told me that she sees me as a brother I hope she's just as fond of incest as I am
North Korean Defector Says Kim Jong-Un Won't Last
Abbott says AIDS drug wins European approval.
I believe that the people of this town want a mayor who s not afraid The best defense against logic is stupidity .
If Hu is successful, he will be freer to boost spending on health, education and other services long-neglected in the headlong drive for economic growth. "The effect on the whole population needs to be considered, not just one age group."
I went to the liquor store on my bicycle and bought a bottle vodka, put it in the basket on the front and then it occurred to me that if I fall or something happens, the bottle might break, so I drank it all right there and it's a good thing I
did..._____...'cause I fell 7 times on
the way home...
"If you love someone, you tell them. Even if you're scared that it's not the right thing. Even if you're scared that it'll cause problems." Topless protesters crash pro-Franco demonstration in Madrid Obama's declaration of swine flue emergency prompts pro-vaccine republican response
Half of Japan firms see no escape from deflation this year: Reuters poll Around half of Japanese firms believe their country will have failed to rid itself of deflation a year from now...
В случае И^ горизонтальная черта отделяет заголовок от основного текста поста на Иеёё^; негативный пример из КЕ усечён.
Таблица 20 — Самые «смешные» примеры из дополнительных наборов данных по мнению большинства из десяти классификаторов на основе RoBERTa.
Датасет Пример #
when the food arrived it was as hot as ice cream 9
Fig-QA the babysitter was as mature as Mary Poppins 9
premises That 400-pound man needs another donut as much as a baby needs scotch 7 whiskey.
The microphone is as jumpy as mud 6
The food was cold 4
Fig-QA the sitter was competent 6
implications That 400-pound man does not need another donut. 9
the microphone is highly insensitive / underpowered. 9
Irony
Alice
3Men
Curiousity
Friends
WD
oh lord! RT @popularmsem: RT @ShockingFactsz: Before becoming an 10 actor, Tom Cruise wanted to be a Catholic priest.
This is the weather i just love walking to work in #worst #weatherbomb 9 "Come, let's try the first figure!" said the Mock Turtle to the Gryphon. 8 "We can do without lobsters, you know. Which shall sing?" "Oh, _you_ sing," said the Gryphon. "I've forgotten the words."
"How should _I_ know?" said Alice, surprised at her own courage. "It's 8 no business of _mine_." "Off with her head! Off—"
"It's very dark. Why don't you light the gas?" "Oh!" 8
"How could I wake you, when you didn't wake me?" he retorted. "Now we 8 shan't get on the water till after twelve. I wonder you take the trouble to get up at all." "Um," I replied, "lucky for you that I do. If I hadn't woke you, you'd have lain there for the whole fortnight."
'To dinner!' thought Dick, 'that's another circumstance. I don't believe 9 that small servant ever has anything to eat.' 'Sammy won't be home,' said Miss Brass. 'Stop till I come back. I sha'n't be long.'
'A very little one,' 'Miss Sally couldn't kill me if she know'd I went down 9 there, so I'll come,' said Richard, putting the cards into his pocket. 'Why, how thin you are! What do you mean by it?'
l can't believe you haven't told that girl she doesn't have a job. You 10 haven't taken down the Christmas lights.
I foId, Iike a cheap hooker who got hit in the stomach by a fat guy with 10 sores on his face.
My wife would lock the bedroom door. I'm sad to say that couch and I 10 become old friends.
Working on your tan with a shotgun in your lap. No, I am on watch 10 against walkers.
# - число моделей, классифицировавших пример как смешной (в случае набора данных Fig-QA мы приводим «самые смешные» посылки вместе с их корректными следствиями и наоборот). Отметим, что во втором примере из Friends в двух словах стоит прописная 'i' вместо '1' -по-видимому, из-за ошибок OCR.
Приложение Б
Материалы к главе 4: примеры данных и инструкции для ЬЬМ
Таблица 21 — Оригинальные примеры игры слов и их интерпретации.
Тип Заголовок и лид Интерпретация
Полисемия «Волгу» не могут заставить течь Слово «Волга» может обозначать как ре-
быстрее // Скоростной режим на ку Волга, так и федеральную автодорогу
федеральной трассе М7 в Подмос- «Волга».
ковье оставлен без изменений
Омонимия Туризм подрастерял Шарм // Слово шарм в примре имеет два значения:
Операторы корректируют египет- прямое и сокращённая форма от Шарм-
ские программы эль-Шейх, курорта в Египте
Омофония Из-под земли до стали // НДПИ Игра слов строит на созвучии «до стали»
для металлургов будет повышен с и глагола «достали»
2022 года
Коллокации Особо бумажные персоны // Как изменение устойчивого выражения «Осо-
частные инвесторы трансформи- бо важные персоны»
руют рынок IPO
Идиома Код накликал // Зачем и кому нужен Open Source в России Трансформация идиомы «кот наплакал»
Отсылка Миссия сократима // Как Россия Отсылка к фильму «Миссия невыполни-
может ответить на высылку своих ма»
дипломатов из постпредства при
НАТО
Неологизм От запчастного к общему // Неологизм образован из слова «запча-
Дефицит автомобилей привел к сти», так как оно относится к теме, и из
падению продаж прилагательного «частный», которое подразумевается в исходной фразе.
Оксюморон Новый премьер Израиля начал со «новый» противоречит обороту «за ста-
старого // Нафтали Беннет отпра- рое».
вился с визитом в Вашингтон
Таблица 22 — Пользовательские и системные промпты для детекции и интерпретации игры слов.
Тип промпта Текст промпта
Пользовательский промпт Заголовок новости: <ЬеаШте>. Содержание новости: <1еа^
Системный промпт для детекции игры слов Присутствует ли в заголовке новости игра слов? Дай ответ с учетом содержания новости. Отвечать можешь только "да"нет"или "не знаю". <Ш81ГИС1ЮП>
Системный промпт для интерпретации Проанализируй заголовок новости в контексте ее содержания. Укажи, есть ли в заголовке игра слов. Если она есть, объясни смысл, использованные методы и связь с основным текстом. Если игры слов нет, то ответь "в заголовке нет игры слов". <тБ1гис1юп>
Листинг Б.1 Пример данных KoWit-24
headline: Диалектический пиломатериализм
lead: Цены на фанеру и доски начали снижаться вслед за спросом
summary: Пиломатериалы и лесопромышленная продукция начинают дешеветь по мере
завершения строительного сезона. По мнению аналитиков и некоторых участников
рынка, этому способствует сокращение спроса на фоне летнего всплеска
цен. И хотя на некоторые продукты, например OSB, цена упала уже на треть,
она все еще вдвое выше уровня конца прошлого года. До конца
года можно ожидать стабилизации цен, полагают участники рынка,
но едва ли возвращения к средним многолетним значениям.
is_wordplay: yes
date: 2021-10-27
article_url: https://www.kommersant.ru/doc/5051268 article_authors: Ольга Мордюшенко
annotations: [ {
headline_substring: Диалектический пиломатериализм start_index: 0 end_index: 30 wordplay_type: reference
reference_string: Диалектический материализм
reference_url: https://ru.wikipedia.org/wiki/Диалектический_материализм
}, {
headline_substring: пиломатериализм, start_index: 15 end_index: 30 wordplay_type: nonce word reference_string: [ материализм, пиломатериалы
]
}
]
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.