Автоматизация создания неправильных вариантов (дистракторов) для банков заданий языкового тестирования тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Логин Никита Вячеславович
- Специальность ВАК РФ00.00.00
- Количество страниц 121
Оглавление диссертации кандидат наук Логин Никита Вячеславович
Оглавление
ВВЕДЕНИЕ
Глава 1. Контекст исследования и обзор предшествующих подходов
1.1. Обзор существующих открытых наборов данных вопросов с множественным выбором
1.2. Обзор методов оценки качества дистракторов
1.2.1. Ручные методы
1.2.2. Автоматические методы
1.3. Обзор методов автоматического создания дистракторов
1.3.1. Словарный подход
1.3.2. Подход на основе обучения алгоритмов классификации
1.3.3. Подход на основе обучения глубоких нейронных сетей
1.3.4. Подход на основе тонкой настройки больших нейросетевых языковых моделей
1.3.5. Подход на основе промптинга больших диалоговых нейросетевых языковых моделей
1.4. Выводы к Главе
Глава 2. Автоматизация генерации лексических дистракторов
2.1. Вводные замечания
2.2. Набор данных
2.3. Ручная разметка
2.4. Методы
2.4.1. Извлечение признаков
2.4.2. Классификация дистракторов
2.4.3. Извлечение дистракторов-кандидатов в режиме порождения
2.5. Оценка
2.6. Результаты
2.7. Выводы к Главе
Глава 3. Автоматизация генерации дистракторов для русскоязычных вопросов на понимание прочитанного текста
3.1. Генерация дистракторов на базе тонкой настройки больших моделей
3.1.1. Вводные замечания
3.1.2. Материалы и методы
3.1.3. Результаты
3.1.4. Обсуждение
3.1.5. Перспективы исследования
3.1.6. Выводы
3.2. Анализ сгенерированных дистракторов и сравнение различных методов
3.2.1. Вводные замечания
3.2.2. Материал исследования
3.2.3. Методика исследования
3.2.4. Результаты исследования
3.2.5. Выводы
3.3. Выводы к Главе
ЗАКЛЮЧЕНИЕ
Благодарности
Список литературы
Приложение
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы сквозного обучения моделей семантического поиска и генерации текста в интеллектуальных диалоговых системах с доступом к неструктурированной базе знаний2025 год, кандидат наук Маслюхин Сергей Михайлович
Методы распознавания и генерации коротких юмористических текстов2026 год, кандидат наук Баранов Александр Михайлович
Методы и программные средства фонетико-языкового моделирования в системах автоматического распознавания русской речи2011 год, кандидат технических наук Кипяткова, Ирина Сергеевна
Методы и модели автоматического распознавания речи на внедоменных данных2025 год, кандидат наук Митрофанов Антон Андреевич
Эволюционные методы оптимизации для автоматической настройки гиперпараметров тематических моделей с аддитивной регуляризацией2022 год, кандидат наук Ходорченко Мария Андреевна
Введение диссертации (часть автореферата) на тему «Автоматизация создания неправильных вариантов (дистракторов) для банков заданий языкового тестирования»
Стандартизированные тесты с множественным выбором ответа представляют собой удобный способ проверки знаний, поскольку требуют сравнительно небольшого времени на выполнение заданий по сравнению с другими способами, а также могут быть легко оценены автоматически с использованием компьютерных технологий. Тесты с множественным выбором используются в качестве составных элементов государственных экзаменов, а также в качестве элементов промежуточного или итогового контроля в учебных курсах. Кроме того, распространённой является практика использования тестов с множественным выбором для распределения учащихся по изначальному уровню целевых навыков при формировании учебных групп в образовательных заведениях.
Вопросы с множественным выбором могут быть использованы как для проверки знания теоретического материала, так и для проверки практических навыков анализа предметной информации. В первом случае подобные вопросы обычно являются самодостаточными тестовыми единицами, в то время как во втором часто сопровождаются дополнительным материалом, таким как текстовые фрагменты, иллюстрации, аудио- и видеозаписи. Выбор правильного ответа в подобной конфигурации непосредственно определяется содержанием сопровождающего материала.
Важным элементом вопросов с множественным выбором являются неправильные варианты ответа, дистракторы (distractors, от англ. to distract -отвлекать). В условиях выбора ответа из закрытого множества вариантов именно дистракторы определяют сложность вопроса, так как близость дистракторов к правильному ответу увеличивает вероятность совершения тестируемым ошибки. Создание дистракторов является особенно трудоёмкой частью процесса конструирования вопросов с множественным выбором, поскольку требует от
автора не только квалификации в предмете, но и особой тщательности и изобретательности. Неверность дистракторов не должна быть слишком очевидной, в то же время инцидентальная правильность некоторых вариантов является недопустимой, так как делает тестирование нечестным. Кроме того, согласно [Кш^ et а! 2020], дистракторы должны быть достаточно разнообразны и не должны по смыслу повторять не только правильный ответ, но и друг друга.
В сфере языкового тестирования создание вопросов с множественным выбором имеет свои особенности. Задания без сопроводительного материала обычно представляют собой вопросы на владение лексико-грамматическим инструментарием, в то время как задания с сопроводительным материалом, как правило, представляют собой вопросы на понимание прочитанного текста. Дистракторы для вопросов на владение лексикой и грамматикой должны быть неправильны с точки зрения языка, что создаёт сложность для языковых моделей, обучающихся преимущественно на положительном языковом материале [Кш^ et а! 2020]. Создание дистракторов для вопросов на понимание прочитанного текста в области языка, с одной стороны, является более простым, чем для вопросов других предметных областей, так как не требует от создающего специфических предметных знаний об упоминаемых в тексте объектах, сущностях и явлениях. С другой стороны, отсутствие специфических, релевантных каждому конкретному тексту, априорных знаний, может создавать трудность для больших языковых моделей. Априорная информация, усвоенная языковыми моделями во время предварительного обучения, может оказывать большее влияние на ответы модели, чем новая информация из входных данных, что может приводить к порождению нерелевантных тексту дистракторов.
Важной особенностью стандартизированных тестов является необходимость постоянного пополнения банков заданий, обусловленная важностью предотвращения списывания. В сочетании с повышенной трудозатратностью создания вопросов с множественным выбором, данное обстоятельство создаёт довольно высокую нагрузку на экспертов. Автоматизированная генерация
дистракторов позволяет решить эту проблему, предоставляя экспертам возможность пользоваться динамически создаваемыми готовыми вариантами при составлении заданий. Помимо этого, средства автоматической генерации дистракторов могут использоваться в качестве отдельных компонентов систем полностью автоматической генерации тестовых заданий, применяемых для массового создания заданий на образовательных онлайн-платформах и для самостоятельной подготовки учащихся.
Актуальность работы обусловлена возросшим за последние годы вниманием к возможности использования искусственного интеллекта в образовательных процессах. Стоит также отметить, что предшествующие исследования, затрагивающие тему разработки автоматического генератора дистракторов, не привели к созданию общепринятого решения, а проблема генерации дистракторов заново поднимается спустя годы несмотря на стремительное развитие технологий искусственного интеллекта.
Степень разработанности проблемы генерации дистракторов в настоящее время является низкой по сравнению с другими задачами порождения текста. Так, эталонным решением проблемы считается модель, представленная в работе [Chung et al. 2020]. Отметим также, что предшествовавшие работы не использовали для обучения алгоритмов генерации дистракторов данные учебного корпуса с богатой систематизированной разметкой ошибок. Кроме того, для русского языка большинство наборов данных тестовых вопросов (например, DaNetQA [Glushkova et al. 2021], SberQUAD [Efimov et al. 2020] и RuBQ [Rybin et al. 2021]) не содержат дистракторов. Автоматическая генерация тестовых заданий на русском языке довольно редко становилась темой компьютерно-лингвистических исследований ([Makhnytkina et al. 2020], [Belyanova et al. 2022]), а генерация дистракторов для русскоязычных вопросов в предшествовавших работах вовсе не затрагивалась.
Целью исследования является разработка эффективных решений генерации дистракторов вопросов с множественным выбором на знание русского и
английского языков. Для достижения поставленной цели в ходе выполнения исследования решались следующие задачи:
• Обзор существующих актуальных методов генерации дистракторов и оценки их качества, выделение основных направлений в подходах к проблеме
• Разработка решения для генерации дистракторов для вопросов на заполнение пропусков на английском языке
• Разработка решения для генерации дистракторов для вопросов на понимание прочитанного на русском языке
• Сравнительный анализ дистракторов, полученных при помощи разработанных решений, и дистракторов, полученных при помощи промптинга больших языковых моделей
• Разработка новых автоматизированных критериев оценки качества дистракторов
Научная новизна исследования заключается в использовании данных учебного корпуса с комплексной многоуровневой системой разметки ошибок для генерации дистракторов, автоматической генерации дистракторов для русского языка, а также в применении методов сравнительного анализа к дистракторам, порождённым для русскоязычных данных.
Теоретическая значимость работы заключается в глубоком исследовании возможности использования данных учебных корпусов для генерации дистракторов, в исследовании возможности использования переведённых данных для генерации дистракторов, а также в исследовании характеристик дистракторов, порождённых разными методами.
Практическая значимость выражается в возможности использования разработанных программных средств генерации дистракторов в качестве
компонентов электронных образовательных платформ, а также в качестве инструментов помощи преподавателям иностранных языков.
Методы исследования включают в себя: методы дистрибутивной семантики (сжатые векторные представления слов и предложений); методы машинного обучения (с использованием алгоритмов классификации, градиентного бустинга, нейросетей и т.д.); методы корпусной лингвистики и автоматической обработки текста; инструктирование больших диалоговых моделей (промптинг); методы оценки качества работы алгоритмов и систем; статистические методы анализа лингвистических методы оценки качества успешности данных.
На защиту выносятся следующие положения:
• Словарь лексических дистракторов может быть построен на основе разметки учебного корпуса ошибок и ресурсов дистрибутивной семантики.
• Ручная разметка лексических дистракторов по их приемлемости в заданном контексте позволяет повысить качество алгоритма выбора дистракторов.
• Автоматически переведённые англоязычные данные вопросов с множественным выбором позволяют эффективно дообучить большую языковую модель на порождение русскоязычных дистракторов.
• Современные диалоговые большие языковые модели способны производить дистракторы, не уступающие созданным вручную по лексической и синтаксической сложности.
• Стандарт оценки сгенерированного материала для задачи генерации дистракторов должен включать метрики точного совпадения фрагментов текста, семантической близости и холистической оценки при помощи большой модели-судьи.
Достоверность и воспроизводимость результатов определяются использованием открытых программных библиотек для оценки результатов, а также открытым исходным кодом экспериментов, опубликованным в общедоступных репозиториях1. Кроме того, достоверность результатов подтверждена публикациями в следующих статьях научных изданий:
• Login N. Distractor Generation for Lexical Questions Using Learner Corpus Data // Jazykovedny Casopis. — 2023 — Vol. 74, No. 1. — P. 345-356.
• Login N. Wrong Answers Only: Distractor Generation for Russian Reading Comprehension Questions Using a Translated Dataset // Journal of Language and Education. — 2024. — Vol. 10, No. 4. — P. 56-70.
• Login N., Baranov A., Braslavski P. Jokingbird: Funny Headline Generation for News // Lecture Notes in Computer Science (including subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics). — 2022 — Volume: 13217 LNCS. — P. 97-109.
Апробация работы была произведена на следующих научных конференциях и научно-исследовательских мероприятиях: AIST 2021 (Тбилиси, Грузия); LCR Gradconf '21 (Хамар, Норвегия); Научный семинар при центре искусственного интеллекта ФГБОУ ВО «Петрозаводский государственный университет», 2022 (Петрозаводск, Россия); Отражения: Язык и культура в синхронии и диахронии, 2023 (Петрозаводск, Россия); LCR Gradconf '23 (онлайн); Международный круглый стол «Генеративные нейросети в обучении, научном исследовании, лингвистике и
1 Основной репозиторий с материалами диссертации доступен по адресу https://github.com/nicklogin/PhD-Dissertation-materials. Исходный код и данные экспериментов, описанных в Главе 2, Разделе 3.1 и Разделе 3.2 доступны в следующих репозиториях соответственно:
https://github.com/nicklogin/DistractorSelector https://github.com/nicklogin/Ru-RC-DG/tree/Cand thesis https://github.com/ni cklogin/ Analyze-Generated-Distractors
переводе», 2024 (Гомель, Беларусь - Архангельск, Россия); TERRA HOMINIS 2025 (Москва, Россия).
Структура диссертации. Глава 1 представляет собой обзор существующих подходов к решению задачи генерации дистракторов, а также её контекста. Глава 2 представляет собой описание и анализ эксперимента по генерации дистракторов для англоязычных вопросов на заполнение пропусков и основана на статье [Login 2023]. Методы автоматического заполнения пропусков, использованные в Главе 2, основываются на подходе к генерации и выбору текстового материала, впервые опробованном в статье [Login et al. 2022] и составившем личный вклад соискателя в упомянутую публикацию. Глава 3 посвящена задаче генерации дистракторов для русскоязычных вопросов на понимание прочитанного текста. Раздел 3.1 основан на статье [Login 2024] и посвящен непосредственному описанию и анализу серии экспериментов по генерации, Раздел 3.2 посвящен анализу дистракторов, сгенерированных разными методами, с точки зрения предлагаемых экспериментальных метрик качества, а также метрик лингвистической сложности. Заключение обобщает результаты работы и подводит итоги исследования.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы и наборы данных для оценки моделей информационного поиска и обработки естественного языка2026 год, доктор наук Браславский Павел Исаакович
Интерпретация представления знаний в нейросетевых моделях автоматической обработки естественного языка2024 год, кандидат наук Сериков Олег Алексеевич
Оценка сложности текста методами машинного обучения (на материале русского языка)2025 год, кандидат наук Морозов Дмитрий Алексеевич
Методы и программные средства автоматического рецензирования исходного кода2025 год, кандидат наук Качанов Владимир Владимирович
Построение модели извлечения информации из технических текстов2006 год, кандидат филологических наук Бабина, Ольга Ивановна
Заключение диссертации по теме «Другие cпециальности», Логин Никита Вячеславович
3.3. Выводы к Главе 3
В настоящей главе мы рассмотрели задачу генерации дистракторов для русскоязычных вопросов на понимание прочитанного текста. Мы выделили две конкретные категории вопросов в датасете RACE - вопросы на выбор лучшего названия для текста и вопросы на выбор единственно верного или неверного
утверждения из перечисленных, перевели данные вопросов этих категорий на русский язык при помощи модели Opus-MT и тонко настроили модели RuGPT3 и RuT5 на задаче генерации дистракторов для данных вопросов. В обоих задачах модели на базе RuT5 показали себя лучше всего.
Затем мы сравнили результаты, полученные нашими моделями генерации, с результатами аналогичных моделей, тонко настроенных на существующем русскоязычном наборе данных вопросов с множественным выбором MuSeRC и результатами передовых моделей генерации дистракторов BartDG, используя для сравнения независимый набор данных в формате Единого Государственного Экзамена по русскому языку. RuT5, тонко настроенная на полученных данных, показала здесь лучшие результаты, однако значения всех метрик, тем не менее, были довольно низки, что было обусловлено ориентацией данных метрик на совпадения с «истинно верным» вариантом, нерелевантные для задачи генерации дистракторов.
Далее результаты моделей генерации были рассмотрены с точки зрения альтернативных метрик, основанных на релевантности дистракторов относительно текста для чтения и их фактической неправильности относительно него, а также с точки зрения лексической и синтаксической сложности. Метрики релевантности были реализованы как индикаторные переменные присутствия глагольных групп, собственных имён и существительных из сопровождающего вопрос отрывка в тексте дистракторов, метрика фактической неправильности была реализована на основе опроса большой диалоговой модели Gemini. Сравнение вновь проводилось на данных вопросов ЕГЭ. К сравнению также были добавлены результаты промптинга больших диалоговых моделей ChatGPT4o и Deepseek, превзошедшие результаты всех ранее рассмотренных в этой главе моделей в рамках метрик сопоставления последовательностей. В рамках предложенных метрик релевантности данные модели превзошли не только модели, обученные на данных специально скомпилированного малого датасета, но и «истинные» дистракторы из заданий ЕГЭ. Данные модели также достигли и наибольших метрик
неправильности - наибольшей неправильности в целом и для вопросов на выбор неверного утверждения достигла модель ChatGPT4o, в то время как наибольшей неправильности для вопросов на выбор верного утверждения достигла модель Deepseek. Для всех моделей характерен довольно широкий разрыв в «неправильности» между вопросами на выбор верного и неверного утверждения в пользу первых, что позволяет говорить о наличии у языковых моделей предвзятости по отношению к характеру вопросов на понимание прочитанного текста - вопрос на выбор верного утверждения является для модели более предпочтительным, поэтому даже получая формулировку вопроса, предписывающую выбрать неверное утверждение, модели скорее будут генерировать фактически неправильные дистракторы. Корреляции между предложенными и общепринятыми метриками качества генерации, а также между предложенными метриками и метриками синтаксической сложности отсутствуют.
Наибольшая доля уникальных лемм и токенов демонстрируется моделью СИа10РТ4о, выдача которой превосходит «истинные» дистракторы по данным показателям. Наиболее высокая доля лексически значимых слов наблюдается для модели BartDG, обладающей наиболее высокими результатами из разработок предшествовавших исследований. В целом, характеристики лексическое разнообразия дистракторов, полученных разными способами, оказываются довольно близки. Наиболее длинные и синтаксически сложные дистракторы, превосходящие «истинные» по этим свойствам, генерируются моделью ЭеерБеек, в то время как выдача других моделей значительно отстаёт от «истинных» дистракторов по данным параметрам.
Данная глава показывает, что успешная генерация дистракторов для конкретных категорий вопросов на понимание прочитанного текста при помощи тонкой настройки больших моделей на переведённом наборе данных возможна. При этом качество оказывается выше по сравнению существующими, менее специализированными, передовыми моделями генерации дистракторов. Общепринятые метрики сопоставления могут быть недостаточны при оценке
качества результатов, так как лексические совпадения в данной задаче не являются показателем успеха. Более полно оценить различные способы генерации дистракторов позволяют методы с использованием большой диалоговой модели в качестве «судьи» фактической правильности ответа, а также с использованием техник извлечения фактов и совпадений значимых лексических единиц. В ходе описанного в главе исследования был реализован простой метод для оценки качества дистракторов на основе лексико-синтаксического анализа, усовершенствование методов оценки является темой для будущих исследований. Было установлено, что промптинг больших диалоговых моделей может приводить к получению более похожих на «истинные» дистракторы вариантов, чем использование специализированных моделей, как по мерам релевантности и фактической неправильности, так и по характеристикам синтаксической сложности.
В данной работе была рассмотрена автоматизация задачи создания дистракторов для заданий языкового тестирования. Автоматизация генерации дистракторов позволяет ускорить процесс создания тестовых заданий, повышая вариативность банков вопросов. Такие банки улучшат условия самоподготовки учащих, а вариативность вопросов снизит вероятность списывания и случайного «попадания» в правильный ответ. Требования к фактической либо грамматической неправильности генерируемых вариантов в сочетании с необходимостью их релевантности данному вопросу делают поставленную задачу достаточно нетривиальной.
В Главе 1 был произведён обзор и анализ публикаций по теме автоматической генерации дистракторов, рассмотрены основные подходы к её решению и существующие наборы данных, пригодные для использования в рамках рассмотренных подходов. В Главе 2 была описана разработка системы создания дистракторов для лексических вопросов на заполнение пропусков на английском языке, использующей контекстную близость и алгоритмы классификации на основе машинного обучения. Для обучения алгоритмов был вручную размечен специальный датасет, основанный на учебном корпусе REALEC. В Главе 3 были описаны эксперименты по генерации дистракторов для русскоязычных вопросов на понимание прочитанного текста на основе тонкой настройки больших моделей на специально выделенных подмножествах датасета RACE, автоматически переведённых на русский язык. Далее выдача моделей, полученная в результате экспериментов по тонкой настройке, подверглась сравнению с выдачей, полученной в результате промптинга больших диалоговых моделей. Для проведения данного сравнения были предложены автоматические метрики, оценивающие Неправильность и Релевантность вариантов. Кроме сравнения дистракторов, полученных описанными способами, с точки зрения качества
генерации относительно поставленной задачи, было также проведено их сравнение с точки зрения лексической и синтаксической сложности.
Эксперименты по генерации дистракторов для англоязычных вопросов на заполнение пропусков показали возможность использования данных размеченного учебного корпуса для успешного решения рассмотренной задачи. Было установлено, что дополнительная ручная разметка «уместности» дистракторов, извлечённых из корпусных контекстов ошибок, позволяет добиться существенного улучшения качества классификации. Был также реализован механизм получения потенциальных дистракторов, поступающих на вход классификатора. В реализованном механизме набор потенциальных дистракторов формируется из слов, употребляющихся в схожих контекстах ошибок внутри корпуса, а также слов, показывающих высокую семантическую близость к правильному ответу согласно дистрибутивной модели Word2Vec. Ручная оценка качества полученных дистракторов на основе трёхуровневой шкалы уместности показала важность классификатора в созданной схеме, так как наборы дистракторов, полученные без использования классификационной модели, показали худшее качество по сравнению с дистракторами, полученными с использованием всех компонентов системы.
Эксперименты по генерации дистракторов для вопросов на понимание прочитанного текста показали возможность использования переведённого англоязычного датасета для тонкой настройки больших моделей на задаче генерации дистракторов на русском языке. Была также продемонстрирована возможность использования тонко настроенных подобным образом моделей на данных экзаменационного формата, при этом было обнаружено преимущество моделей, тонко настроенных на определённой категории вопросов датасета (совпадающей с форматом российского государственного экзамена) перед передовыми моделями из предшествовавшего исследования [Chung et al. 2020], тонко настроенными на полном датасете. Данные существующего русскоязычного датасета оказались недостаточными для решения задачи генерации дистракторов
для русскоязычных вопросов, так как замеры с использованием формальных метрик сопоставления последовательностей показали худшее качество обученных на нём моделей, в сравнении с моделями, обученными на переведённом датасете. Во всех экспериментах модель на основе архитектуры Т5 продемонстрировала преимущество над моделью на основе архитектуры GPT-3, что свидетельствует о перспективности решения задачи генерации дистракторов именно как задачи условной генерации последовательностей, а не задачи продолжения исходного текста. В целом, значения формальных метрик для всех рассмотренных моделей оказались в данной задаче достаточно низкими в абсолютном отношении, что поставило вопрос о возможной разработке альтернативных критериев оценки качества генерации дистракторов.
Далее было проведено сравнение дистракторов полученных при помощи файн-тьюнинга на переведённом датасете с дистракторами, полученными путём промптинга больших диалоговых моделей, с точки зрения качества генерации и параметров лингвистической (лексической и синтаксической) сложности. В результате сравнения было установлено, что дистракторы, сгенерированные при помощи промптинга превосходят сгенерированные при помощи файн-тьюнинга и созданные вручную дистракторы по многим параметрам качества и лингвистической сложности. В качестве параметров качества были предложены экспериментальные метрики, основанные на присутствии в тексте дистрактора определённых лексических и синтаксических единиц из текста для чтения, а также на опросе диалоговой модели о фактической правильности сгенерированных вариантов относительно текста. Единственными показателями, по которым дистракторы, полученные путём файн-тьюнинга превзошли дистракторы, полученные путём промптинга, стали метрики на основе присутствия в тексте определённых синтаксических единиц (глагольных групп), продемонстрировавшие, однако, в целом небольшие значения. С точки зрения большинства параметров лингвистической сложности было продемонстрировано превосходство дистракторов, полученных путём промптинга, над дистракторами,
полученными другими способами, включая изначальные вручную созданные дистракторы, присутствовавшие в оригинальном наборе данных. Значительных корреляций между предложенными метриками оценки дистракторов и метриками лингвистической сложности обнаружено не было.
Проведённые исследования демонстрируют возможность успешного создания механизмов генерации дистракторов для конкретных типов языковых образовательных тестовых вопросов как с использованием инженерии признаков, так и с использованием тонкой настройки больших моделей. В экспериментах была использована смена домена исходных данных (с размеченных текстов ошибок на упражнения и с английского языка на русский) в рамках предварительной обработки при помощи различных автоматизированных инструментов (инструмента извлечения упражнений из контекстов ошибок Testmaker и нейросетевой модели машинного перевода). Для генерации дистракторов использовались классические методы машинного обучения, методы градиентного бустинга, тонкая настройка больших моделей и промптинг диалоговых моделей. Был проведён анализ результатов с использованием автоматических метрик классификации (Accuracy, Precision, Recall, F1-Меры), сопоставления последовательностей (BLEU, ROUGE, METEOR, BERTScore), ручных метрик качества, а также специальных метрик оценки дистракторов, основанных на использовании «языковой модели в качестве судьи» и совпадении единиц определённой части речи и синтаксической структуры.
Проведённые эксперименты показали важность качественной разметки датасетов вопросов с множественным выбором для успешной генерации дистракторов. Дополнительная разметка уместности дистракторов позволила улучшить качество генерации дистракторов для англоязычных вопросов на заполнение пропусков, а использование переведённого датасета экзаменационного формата позволило добиться лучшего качества генерации на независимых входных данных, чем использование существующего русскоязычного датасета, включающего вопросы разных предметных областей. В связи с этим, одним из
направлений будущих исследований видится создание качественного размеченного большого русскоязычного датасета вопросов с множественным выбором.
Проведённые эксперименты показали возрастание качества генерации дистракторов на фоне использования более продвинутых методов, от классического машинного обучения к градиентному бустингу и от тонкой настройки большой общей языковой модели к промптингу большой диалоговой модели. Тем не менее, за рамками исследования остался вопрос интеграции подходов разных поколений, объединяющей их преимущества и позволяющей нивелировать недостатки. Данный вопрос представляет собой одно из возможных направлений для будущих работ. В рамках будущих работ также планируется использование более широкого арсенала моделей.
Описанные в настоящей работе эксперименты проводились на данных английского и русского языков. В будущих работах планируется расширить набор задействованных языков, а также провести межязыковые сравнения. В планы будущих исследований также входит расширение набора типов заданий (в настоящей работе включающего вопросы на заполнение пропусков и вопросы на понимание прочитанного текста), для которых будет производиться генерация дистракторов.
Результаты настоящей работы могут быть применены при создании новых механизмов генерации дистракторов на других языках. Проведённые эксперименты, показывающие преимущества и недостатки различных методов генерации и оценки дистракторов, могут служить ориентиром при выборе методов для проведения исследований по генерации дистракторов на новых данных. Результаты экспериментов могут быть масштабированы для повышения качества дистракторов, полученных при помощи других моделей классификации и генерации. Полученные в рамках настоящего исследования программные
Список литературы диссертационного исследования кандидат наук Логин Никита Вячеславович, 2026 год
Богданова Е. С. Критерии отбора текстов для составления контрольно-измерительных материалов ЕГЭ по русскому языку // Наука и школа. — 2021. — №4. — С. 57-66.
Буданова С. Г. Лакуны во вторичных учебных текстах ЕГЭ по русскому языку // Вестник ЧГПУ им. И.Я. Яковлева. — 2024. — №4 (125). — С. 26-32.
Галицына Д. И., Коренева А. В., Пунтус О. В. Текстовая деятельность в системе подготовки обучающихся к государственной итоговой аттестации по русскому языку // Педагогика и психология современного образования : монография / В. В. Вишневский, А. А. Верхутов, К. А. Новоселов [и др.]. - Чебоксары: ИД «Среда», 2025. - С. 102-112. - ISBN 978-5908083-14-0. - DOI 10.31483/a-10799.
Курочка К.С., Башаримов Ю.С. Нейросетевая модель автогенерации тестов для студентов в системе Moodle на основе анализа методических материалов. // Цифровая трансформация. — 2025 — Т. 31, № 3. — С. 66-75.
Харлан Ю. А. Корреляция метрик сложности текста в заданиях ЕГЭ по русскому языку и проверка их связи со средними оценками учащихся : дисс. магистр. : 45.04.03... / Харлан Юлия Александровна — Т., 2024. — 109 с.
Banerjee S., Lavie A. METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments // Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and/or Summarization / ed. J. Goldstein et al. — Ann Arbor, Michigan: Association for Computational Linguistics, 2005. — P. 65-72.
Belyanova M. A., Andreev A. M., Gapanyuk Y. E. Neural text question generation for Russian language using hybrid intelligent information systems approach // Advances in Neural Computation, Machine Learning, and Cognitive Research V / ed. B. Kryzhanovsky, W. Dunin-Barkowski, V. Redko, Y. Tiumentsev, V. V. Klimov. — Cham: Springer International Publishing, 2022. — Vol. 1008. — P. 217-223.
Bird S., Klein E., Loper E. Natural Language Processing with Python. 1 -st ed. — O'Reilly Media, Inc., 2009. — 509 p.
Bitew S. K., Deleu J., Develder C., Demeester T. Distractor Generation for Multiple-Choice Questions with Predictive Prompting and Large Language Models // Proceedings of Machine Learning
and Principles and Practice of Knowledge Discovery in Databases / ed. R. Meo, F. Silvestri. — Cham: Springer Nature Switzerland, 2025. — P. 48-63.
Bitew S. K., Hadifar A., Sterckx L., Deleu J., Develder C., Demeester T. Learning to reuse distractors to support multiple-choice question generation in education // IEEE Transactions on Learning Technologies. — 2024. — Vol. 17. — P. 375-390.
Brown T. B., Mann B., Ryder N., Subbiah M et al. Language Models are Few-Shot Learners // Advances in Neural Information Processing Systems / ed. H. Larochelle et al. — Curran Associates, Inc., 2020. — Vol. 33. — P. 1877-1901.
Chen T., Guestrin C. XGBoost: A Scalable Tree Boosting System // Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. — New York, NY, USA: Association for Computing Machinery, 2016. — P. 785-794.
Chung H.-L., Chan Y.-H., Fan Y.-C. A BERT-based Distractor Generation Scheme with Multitasking and Negative Answer Training Strategies. // Findings of the Association for Computational Linguistics: EMNLP 2020. / ed. T. Cohn, Y. He, Y. Liu. — Association for Computational Linguistics, 2020. — P. 4390-4400.
DeepSeek-AI, Liu A., Feng B., Xue B. DeepSeek-V3 Technical Report. // arXiv preprint arXiv:2412.19437. — 2025.
De-Fitero-Dominguez D., Garcia-Lopez E., Garcia-Cabot A., Del-Hoyo-Gabaldon J.-A., Moreno-Cediel A. Distractor Generation Through Text-to-Text Transformer Models // IEEE Access. — 2024. — Vol. 12. — P. 25580-25589.
Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers) / ed. J. Burstein, C. Doran, T. Solorio. — Minneapolis, Minnesota: Association for Computational Linguistics, 2019. — P. 4171—4186.
Efimov P., Chertok A., Boytsov L., Braslavski P. SberQuAD - Russian reading comprehension dataset: Description and analysis // Experimental IR Meets Multilinguality, Multimodality, and Interaction / ed. A. Arampatzis et al. — Cham: Springer International Publishing, 2020. — Vol. 12260. — P. 3-15.
Fares M., Kutuzov A., Oepen S., Velldal E. Word vectors, reuse, and replicability: Towards a community repository of large-text resources // Proceedings of the 21st Nordic Conference on
Computational Linguistics / ed. J. Tiedemann, N. Tahmasebi — Gothenburg, Sweden: Association for Computational Linguistics, 2017. — P. 271-276.
Fenogenova A., Mikhailov V., Shevelev D. Read and Reason with MuSeRC and RuCoS: Datasets for Machine Reading Comprehension for Russian // Proceedings of the 28th International Conference on Computational Linguistics. — Barcelona, Spain: International Committee on Computational Linguistics, 2020. — P. 6481-6497.
Francis W.N., Kucera H. Brown Corpus Manual. — Department of Linguistics, Brown University, 1979.
Gao Y., Bing L., Li P., King I., Lyu M. R. Generating distractors for reading comprehension questions from real examinations // Proceedings of the Thirty-Third AAAI Conference on Artificial Intelligence and Thirty-First Innovative Applications of Artificial Intelligence Conference and Ninth AAAI Symposium on Educational Advances in Artificial Intelligence. — Honolulu, Hawaii, USA: AAAI Press, 2019.
Ghanem B., Fyshe, A. DISTO: Textual Distractors for Multiple Choice Reading Comprehension Questions using Negative Sampling. // Proceedings of the 17th International Conference on Educational Data Mining / ed. M. Marras, M. Ueno. — International Data Mining Society, 2024. — P. 23-34.
Glushkova T., Machnev A., Fenogenova A., Shavrina T., Artemova E., Ignatov D. I. DaNetQA: A yes/no Question answering dataset for the Russian language // Analysis of Images, Social Networks and Texts / ed. W. M. P. Van Der Aalst et al. — Cham: Springer International Publishing, 2021. — Vol. 12602. — P. 57-68.
Gorgun G., Bulut O. Exploring quality criteria and evaluation methods in automated question generation: A comprehensive survey // Education and Information Technologies. — 2024. — Vol. 29, No. 18. — P. 24111-24142.
Granger S. Learner Corpora // Corpus Linguistics. An International Handbook / ed. A. Ludeling, M. Kyto. — Walter de Gruyter, 2008. — Vol. 1. — P. 259-275.
Grevisse C. Comparative Quality Analysis of GPT-Based Multiple Choice Question Generation // Applied Informatics. — Springer Nature Switzerland, 2023. — P. 435-447.
Hadifar A., Bitew S. K., Deleu J., Develder C., Demeester T. EduQG: A Multi-Format Multiple-Choice Dataset for the Educational Domain // IEEE Access. — 2023. — Vol. 11. — P. 20885-20896.
Huang L., Le Bras R., Bhagavatula C., Choi Y. Cosmos QA: Machine Reading Comprehension with Contextual Commonsense Reasoning // Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing and the 9th International Joint Conference on Natural Language Processing (EMNLP-IJCNLP) / ed. K. Inui et al. — Hong Kong, China: Association for Computational Linguistics, 2019. — P. 2391-2401.
Jiang S., Lee J. Distractor Generation for Chinese Fill-in-the-blank Items // Proceedings of the 12th Workshop on Innovative Use of NLP for Building Educational Applications. — Association for Computational Linguistics, 2017. — P. 143-148.
Ke G. et al. LightGBM: a highly efficient gradient boosting decision tree // Proceedings of the 31st International Conference on Neural Information Processing Systems. — Red Hook, NY, USA: Curran Associates Inc., 2017. — P. 3149-3157.
Klykova E. Syntactic complexity of written text in Russian and English as foreign languages: дисс. магистр. : 45.04.03... / Клыкова Елизавета Александровна — М., 2024. — 62 с.
Kumar G., Banchs R.E., D'Haro L.F. Automatic fill-the-blank question generator for student self-assessment // 2015 IEEE Frontiers in Education Conference (FIE). — IEEE, 2015. — P. 1-3.
Kurdi G., Leo J., Parsia B., Sattler U., Al-Emari S. A. Systematic Review of Automatic Question Generation for Educational Purposes // International Journal of Artifical Intelligence in Education. — 2020. — Vol. 30, No. 1. — P. 121-204.
Lai G., Xie Q., Liu H., Yang Y., Hovy E. RACE: Large-scale ReAding Comprehension Dataset From Examinations // Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing. — Copenhagen, Denmark: Association for Computational Linguistics, 2017. — P. 785-794.
Liang C., Yang X., Wham D., Pursel B., Passonneaur R., Giles C. L. Distractor Generation for Multiple Choice Questions Using Learning to Rank // Proceedings of the Thirteenth Workshop on Innovative Use of NLP for Building Educational Applications. — Association for Computational Linguistics, 2018. — P. 284-290.
Lin C.-Y. ROUGE: A Package for Automatic Evaluation of Summaries // Text Summarization Branches Out. — Barcelona, Spain: Association for Computational Linguistics, 2004. — P. 74-81.
Login N. Distractor Generation for Lexical Questions Using Learner Corpus Data // Journal of Linguistics/Jazykovedny casopis. — 2023. — Vol. 74, No. 1. — P. 345-356.
Login N. Wrong Answers Only: Distractor Generation for Russian Reading Comprehension Questions Using a Translated Dataset // Journal of Language and Education. — 2024. — Vol. 10, No. 4. — P.56-70.
Login N., Baranov A., Braslavski P. Jokingbird: Funny Headline Generation for News // Lecture Notes in Computer Science (including subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics). — 2022. — Volume: 13217 LNCS. — P. 97-109.
Lyashevskaya O., Vinogradova O., Scherbakova A. Accuracy, syntactic complexity and task type at play in examination writing: A corpus-based study // Complexity, Accuracy and Fluency in Learner Corpus Research / ed. A. Lenko-Szymanska, S. Götz — John Benjamins Publishing Company, 2022. — P. 241-272.
Maity S., Deroy A., Sarkar S. A Novel Multi-Stage Prompting Approach for Language Agnostic MCQ Generation using GPT // Advances in Information Retrieval: 46th European Conference on Information Retrieval, ECIR 2024, Glasgow, UK, March 24-28, 2024, Proceedings, Part III / ed. N. Goharyan et al. — Cham: Springer Nature Switzerland, 2024. — P. 268-277.
Makhnytkina O., Matveev A., Svischev A., Korobova P., Zubok D., Mamaev N., Tchirkovskii A. Conversational question generation in Russian // 2020 27th Conference of Open Innovations Association (FRUCT). — Trento, Italy: IEEE, 2020. — P. 1-8.
Mikolov T., Chen K., Corrado G., Dean J. Efficient Estimation of Word Representations in Vector Space. // arXiv preprint arXiv:1301.3781. — 2013.
Mitkov R., Ha L. A., Varga A., Rello R. Semantic Similarity of Distractors in Multiple-Choice Tests: Extrinsic Evaluation // Proceedings of the Workshop on Geometrical Models of Natural Language Semantics / ed. R. Basili, M. Pennacchiotti — Athens, Greece: Association for Computational Linguistics, 2009. — P. 49-56.
Moore S., Costello E., Nguyen H. A., Stamper J. An Automatic Question Usability Evaluation Toolkit // Artificial Intelligence in Education. — Springer Nature Switzerland, 2024. — P. 31-46.
Moore S., Nguyen H. A., Chen T., Stamper J. Assessing the Quality of Multiple-Choice Questions Using GPT-4 and Rule-Based Methods // Responsive and Sustainable Educational Futures — Springer Nature Switzerland, 2023. — P. 229-245.
Ouyang L. et al. Training language models to follow instructions with human feedback // Proceedings of the 36th International Conference on Neural Information Processing Systems. — Red Hook, NY, USA: Curran Associates Inc., — 2022.
Papineni K., Roukos S., Ward T., Zhu W.-J. BLEU: a method for automatic evaluation of machine translation // Proceedings of the 40th Annual Meeting on Association for Computational Linguistics ACL '02. — Philadelphia, Pennsylvania: Association for Computational Linguistics, 2001. — P. 311.
Paris A., Paris S. Assessing Narrative Comprehension in Young Children // Reading Research Quarterly. — 2003. — Vol. 38. — P. 36-76.
Pedregosa F., Varoquaux G., Gramfort A., Michel V., Thirion B., Grisel O., Blondel M., Prettenhofer P., Weiss R., Dubourg V., Vanderplas J., Passos A., Cournapeau D., Brucher M., Perrot M., Duchesnay. Scikit-learn: Machine Learning in Python // Journal of Machine Learning Research — 2011. — Vol. 12. — P. 2825-2830.
Prokhorenkova L. et al. CatBoost: unbiased boosting with categorical features // Proceedings of the 32nd International Conference on Neural Information Processing Systems. — Red Hook, NY, USA: Curran Associates Inc., 2018. — P. 6639-6649.
Qiu Z., Wu X., Fan W. Automatic Distractor Generation for Multiple Choice Questions in Standard Tests // Proceedings of the 28th International Conference on Computational Linguistics / ed. Scott D., Bel N., Zong C. — Barcelona, Spain: International Committee on Computational Linguistics, 2020. — P. 2096-2106.
Radford A., Wu J., Child R., Luan D., Amodei D., Sutskever I. Language Models are Unsupervised Multitask Learners // OpenAI. 2019.
Raffel C., Shazeer N., Roberts A., Lee K., Narang S., Matena M., Zhou Y., Li W., Liu P. J.. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer // Journal of Machine Learning Research. — 2020. — Vol. 21, No. 1.
Raina V., Liusie A., Gales M. Assessing Distractors in Multiple-Choice Tests // Proceedings of the 4th Workshop on Evaluation and Comparison of NLP Systems / ed. D. Deutsch, R. Dror, S. Eger, Y. Gao, C. Leiter, J. Opitz, A. Rückle. — Bali, Indonesia: Association for Computational Linguistics, 2023. — P. 12—22.
Reddy S., Chen D., Manning C. D. CoQA: A Conversational Question Answering Challenge // Transactions of the Association for Computational Linguistics / ed. L. Lee et al. — Cambridge, MA: MIT Press, 2019. — Vol. 7. — P. 249-266.
Rehurek R., Sojka P. Software Framework for Topic Modelling with Large Corpora // Proceedings of the LREC 2010 Workshop on New Challenges for NLP Frameworks. — 2010. — P. 4650.
Rush B. R., Rankin D. C., White B. J. The impact of item-writing flaws and item complexity on examination item difficulty and discrimination value // BMC Medical Education. — 2016. — Vol. 16, article 250.
Rybin I., Korablinov V., Efimov P., Braslavski P. RuBQ 2.0: An innovated Russian question answering dataset // The Semantic Web / ed. R. Verborgh et al. — Cham: Springer International Publishing, 2021. — Vol. 12731. — P. 532-547.
Sakaguchi K., Arase Y., Komachi M. Discriminative Approach to Fill-in-the-Blank Quiz Generation for Language Learners // Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) / ed. H. Schuetze, P. Fung, M. Poesio — Sofia, Bulgaria: Association for Computational Linguistics, 2013. — P. 238-242.
Seabold S., Perktold J. statsmodels: Econometric and statistical modeling with python // Proceedings of the 9th Python in Science Conference / ed. S. van der Walt, J. Millman. — Austin, Texas, USA: SciPy, 2010. — P. 92-103.
Shavrina T., Emelyanov A., Fenogenova A., Fomin V., Mikhailov V., Evlampiev A., Malykh V., Larin V., Natekin A., Vatulin A., Romov P., Anastasiev D., Zinov N., Chertok A. Humans Keep It One Hundred: an Overview of AI Journey // Proceedings of the Twelfth Language Resources and Evaluation Conference / ed. N. Calzolari et al. — Marseille, France: European Language Resources Association, 2020. — P. 2276-2284.
Shwe L. L., Matayong S., Witosurapot S. The unified difficulty ranking mechanism for automatic multiple choice question generation in digital storytelling domain // Education and Information Technologies. — Springer Science and Business Media LLC, 2024. — Vol. 29, No. 15. — P. 2031720350.
Stenetorp P., Pyysalo S., Topic G. brat: a Web-based Tool for NLP-Assisted Text Annotation // Proceedings of the Demonstrations at the 13 th Conference of the European Chapter of the Association for Computational Linguistics / ed. F. Segond. — Avignon, France: Association for Computational Linguistics, 2012. — P. 102-107.
Tiedemann J., Thottingal S. OPUS-MT - Building open translation services for the World // Proceedings of the 22nd Annual Conference of the European Association for Machine Translation / ed.
A. Martins et al. — Lisboa, Portugal: European Association for Machine Translation, 2020. — P. 479480.
Vinogradova O. To automated generation of test questions on the basis of error annotations in EFL essays: A time-saving tool? // Learner Corpora and Language Teaching / ed. S. Götz, J. Mukherjee. — Johnn Benjamins Publishing Company, 2019. — P. 29-48.
Wang Z., Tu Y., Rosset C., Craswell N., Wu M., Ai Q. Zero-shot Clarifying Question Generation for Conversational Search // Proceedings of the ACM Web Conference 2023. — ACM, 2023. — P. 3288-3298.
Welbl J., Liu N. F., Gardner M. Crowdsourcing Multiple Choice Science Questions // Proceedings of the 3rd Workshop on Noisy User-generated Text. — Copenhagen, Denmark: Association for Computational Linguistics, 2017. — P. 94-106.
Wolf T., Debut L., Sanh V., Chaumond J., Delangue C., Moi A., Cistac P., Rault T., Louf R., Funtowicz M., Davison J., Shleifer S., von Platen P., Ma C., Jernite Y., Plu J., Xu C., Le Scao T., Gugger S., Drame M., Lhoest Q., Rush A. Transformers: State-of-the-Art Natural Language Processing // Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations / ed. Q. Liu, D. Schlangen — Association for Computational Linguistics, 2020. — P. 38-45.
Xu Y., Wang D., Yu M., Ritchie D., Yao B., Wu T., Zhang Z., Li T. J.-J., Bradford N., Sun B., Hoang T. B., Sang Y., Hou Y., Ma X., Yang D., Peng N., Yu Z., Warschauer M. Fantastic Questions and Where to Find Them: FairytaleQA — An Authentic Dataset for Narrative Comprehension // Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) / ed. S. Muresan, P. Nakov, A. Villavicencio. — Dublin, Ireland: Association for Computational Linguistics, 2022. — P. 447—460.
Xue L., Constant N., Roberts A., Kale M., Al-Rfou R., Siddhant A., Barua A., Raffel C. mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer // Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies / ed. K. Toutanova. et al. — Association for Computational Linguistics, 2021. — P. 483498.
Yeo I. K., Johnson R. A. A new family of power transformations to improve normality or symmetry. — Biometrika. — 2000. — Vol. 87, No. 4. — P. 954-959.
Zaiontz C. MANOVA Assumptions | Real Statistics Using Excel [Электронный ресурс], 2025. URL: https://real-statistics.com/multivariate-statistics/multivariate-analysis-of-variance-
manova/manova-assumptions/ (дата обращения: 31.08.2025).
Zaiontz C. MANOVA Basic Concepts | Real Statistics Using Excel [Электронный ресурс], 2025. URL: https://real-statistics.com/multivariate-statistics/multivariate-analysis-of-variance-manova/manova-basic-concepts/ (дата обращения: 31.08.2025).
Zhang T., Kishore V., Wu F., Weinberger K. Q., Artzi Y. BERTScore: Evaluating Text Generation with BERT // Proceedings of 8th International Conference on Learning Representations, ICLR 2020, Addis Ababa, Ethiopia, April 26-30, 2020. — OpenReview.net, 2020.
Zhang Z., Mita M., Komachi M. Cloze Quality Estimation for Language Assessment // Findings of the Association for Computational Linguistics: EACL 2023 / ed. Vlachos A., Augenstein I. — Dubrovnik, Croatia: Association for Computational Linguistics, 2023. — P.540-550.
Zhu J., Liu D., Chen S. Multiple-choice question generation and difficulty calculations based on semantic similarity // Neural Computing and Applications. — Springer Science and Business Media LLC, 2024. — Vol. 37, No. 19. — P. 13295-13307.
Zmitrovich D., Abramov A., Kalmykov A., Kadulin V., Tikhonova M., Taktasheva E., Astafurov D., Baushenko M., Snegirev A., Shavrina T., Markov S. S., Mikhailov V., Fenogenova A. A Family of Pretrained Transformer Language Models for Russian // Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) / ed. N. Calzolari et al. — Torino, Italia: ELRA and ICCL, 2024. — P. 507-524.
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.