Методы активного обучения в задаче нейросетевого машинного перевода тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Карпачёв Николай Евгеньевич
- Специальность ВАК РФ00.00.00
- Количество страниц 122
Оглавление диссертации кандидат наук Карпачёв Николай Евгеньевич
Введение
Глава 1. Обзор литературы
1.1. Машинный перевод
1.2. Авторегрессионные модели
1.3. Рекуррентные модели
1.4. Трансформерные модели
1.5. LLM-модели для перевода
1.6. Активное обучение
1.6.1. Стратегии активного обучения
1.6.2. Методы активного обучения для задач генерации текста
Глава 2. Активное обучение для исправления систематических ошибок перевода
2.1. Ошибки перевода
2.2. Систематические проблемы нейросетевых MT-систем
2.3. Исправление ошибок перевода
2.4. Targeted Contrastive Learning для исправления ошибок
2.4.1. Общая схема дообучения
2.4.2. Генерация обучающих данных
2.5. Исправление тавтологий в переводе
2.5.1. Оракул
2.5.2. Эксперименты с дообучением модели
2.5.3. Результаты
Глава 3. Методы обучения с расписанием для низкоресурсных и зашумлен-
ных выборок
3.1. Данные для обучения моделей машинного перевода
3.2. Фильтрация данных для обучения
3.3. Обучение с расписанием
3.3.1. Доменная адаптация в машинном переводе
3.4. Динамическая фильтрация обучающих данных
3.4.1. Метрика сложности
3.4.2. Метрика зашумленности
3.5. Эксперименты
3.5.1. Данные
3.5.2. Модель
3.5.3. Расписание по зашумленности (Denoising curriculum)
3.5.4. Баланс точности и полноты (Precision-Recall Tradeoff)
3.5.5. Динамика обучения с расписанием: влияние периода разогрева и краевых порогов
3.6. Расписание по сложности примера (difficulty curriculum)
3.6.1. Совместное расписание по сложности и зашумленности
Глава 4. Эффективные методы специализации LLM для перевода
4.1. Большие языковые модели
4.2. Адаптация LLM к задаче перевода
4.3. Перевод на уровне документов
4.3.1. Неоднозначность при переводе указания (deixis)
4.3.2. Эллипсис
4.3.3. Лексическая когезия
4.4. Эффективное дообучение базовой LLM-модели для документного перевода
4.5. Базовое обучение LLM под данные предложений
4.5.1. Эксперименты с параметро-эффективным обучением в SFT
4.5.2. Эксперименты с алгоритмом контрастного дообучения на данных предложений
4.6. Построение пайплайна обучения для перевода документов
4.6.1. Обучение с расписанием для документной адаптации в алайнменте
4.7. Итоговый пайплайн обучения специализированной для перевода LLM
Заключение
Список сокращений и условных обозначений
Список иллюстраций
Список таблиц
Список литературы
Введение
Нейросетевые системы машинного перевода представляют собой глубокие модели с большим количеством параметров, обучаемые на огромных массивах данных. Качество и объем обучающих примеров имеют определяющее значение для построения систем с высоким уровнем перевода. Современные модели сильно восприимчивы к ошибкам в обучающих данных, а также теряют качество при низкоресурсном обучении. В текущей работе рассматривается применение методов активного обучения для ряда сценариев построения систем машинного перевода в условиях ограничений в качестве обучающих примеров и размере внутридоменных выборок.
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Нейросетевые модели на основе механизма внимания с памятью для решения задач обработки естественного языка2024 год, кандидат наук Сагирова Алсу Рафаэлевна
Применение глубоких нейросетевых моделей, учитывающих структурную лингвистическую информацию, в прикладных задачах анализа текстовых данных2025 год, кандидат наук Чернявский Александр Сергеевич
Модели и методы автоматического обнаружения, верификации и анализа недостоверной, искаженной и манипулятивной информации в текстовых данных2025 год, кандидат наук Чернявский Антон Сергеевич
Обучение и оценивание мультиязычных нейросетевых моделей семантического векторного представления научных текстов2025 год, кандидат наук Ватолин Алексей Сергеевич
Специализация языковых моделей для применения к задачам обработки естественного языка2020 год, кандидат наук Куратов Юрий Михайлович
Введение диссертации (часть автореферата) на тему «Методы активного обучения в задаче нейросетевого машинного перевода»
Актуальность темы
Современные системы машинного перевода основаны на нейросетевых моделях. Распространение архитектуры Transformer и предобученных больших языковых моделей (LLM) существенно улучшило качество переводческих систем и сократило количество допускаемых ошибок. Однако, при высоком среднем качестве, практическое применение современных алгоритмов все еще ограничено - на данных узких и сложных доменов автоматические системы все еще заметно хуже перевода человека, а сами модели остаются чувствительными к ошибкам в обучающей выборке. Методы активного обучения позволяют эффективно использовать имеющиеся обучающие данные, а также адаптивно отбирать наиболее полезные примеры для дальнейшей адаптации модели. В текущей работе исследуется применение техник активного обучения и обучения с расписанием к ряду актуальных проблем перевода в сценариях, когда качество базового обучения с учителем является недостаточным.
Цели работы
1. Разработка эффективного алгоритма исправления систематических паттернов ошибок базовой модели перевода.
2. Исследование методов обучения моделей перевода на зашумленных и низкоресурсных выборках. Улучшение качества фильтрации данных и низкоресурсного обучения за счет методов обучения с расписанием.
3. Разработка технологии эффективной адаптации базовой языковой модели общего назначения к задаче перевода.
Методы исследования
Методологической основой исследования выступают методы вероятностного анализа результатов научных экспериментов, в частности, методы оценки статистической значимости. Эмпирический анализ экспериментов проведен на основании актуальных в настоящее время методик оценки систем машинного перевода, в частности, автоматических метрик (BLEU, BLEURT, COMET), а также оценки асессорами-профессионалами (side-by-side evaluation). Информационной и эмпирической базой исследования послужили открытые наборы эталонных переводов для оценки моделей перевода (WMT). Для предобработки данных использовались методы классической обработки естественного языка: пословная токенизация, фильтрация на основе правил, токенизация по n-граммам (BPE, SentencePiece). При построении процедуры обучения нейросете-вых моделей использовались классические методы градиентной оптимизации: стохастический градиентный спуск, Adam; для получения более стабильных моделей применялись техники усреднения чекпоинтов.
Основные положения, выносимые на защиту
1. Разработан новый алгоритм дообучения модели с целью исправления систематических паттернов ошибок перевода (Targeted Contrastive Learning). При использовании предложенного метода были получены значимые улучшения сравнительно сильного базового решения в виде реран-жирования гипотез при большей вычислительной эффективности нового алгоритма.
2. Проведено подробное исследование различных методов обучения с расписанием для зашумленных выборок. Предложен новый способ ранжирования данных по чистоте обучающего примера, достигнуто улучшение качества относительно актуального метода в виде статической фильтрации.
3. Проведено абляционное исследование вариантов построения процесса дообучения больших языковых моделей для задачи перевода. Показаны практические проблемы обучения алгоритма DPO, предложены модификации метода, увеличивающие стабильность обучения и качество результирующей модели перевода.
4. На основании предложенных наработок построена специализированная
система для машинного перевода на основе большой языковой модели. В рамках международного соревнования по качеству перевода система достигла качества на уровне флагманских LLM-моделей общего назначения (Claude, DeepSeek, Gemini), представляя собой более эффективную архитектуру с гораздо меньшим числом параметров.
Научная новизна
1. Разработан новый алгоритм активного обучения модели для исправления систематических ошибок перевода (Targeted Contrastive Learning).
2. Предложена новая схема быстрой адаптации большой языковой модели к задаче документного перевода в ситуации несбалансированных источников предложенческих и документных данных.
3. Проведено систематическое сравнение качества различных алгоритмов базового дообучения LLM (PEFT и contrastive learning) в задаче машинного перевода.
4. Предложен метод динамической фильтрации данных на основе обучения с расписанием и метрики DCCE.
Теоретическая значимость
1. Разработан новый алгоритм активного обучения модели для исправления систематических ошибок перевода, обоснована его применимость к произвольному паттерну ошибок, для которого возможно построение оракула-детектора ошибки.
2. Предложен метод динамической фильтрации данных на основе обучения с расписанием, проведено абляционное исследование, получена интерпретируемость влияния гиперпараметров обучения.
3. Проведены исследования применимости алгоритмов PEFT и contrastive learning в сценарии дообучения большой языковой модели для задачи перевода. Полученные эмпирические результаты свидетельствуют о достаточности параметро-эффективных техник (PEFT) для этапа дообучения с учителем в рамках пайплайна адаптации LLM.
Практическая значимость
1. Получена схема эффективной адаптации большой языковой модели общего назначения к задаче перевода. Получена система с качеством на уровне ведущих мировых аналогов при большей эффективности за счет меньшего размера модели.
2. Предложен метод исправления систематических ошибок перевода на основе активного обучения, требующий минимального участия человека-асессора для пост-валидации и не требующий сбора человеческих переводов.
3. Разработанная схема динамической фильтрации на основе обучения с расписанием продемонстрировала улучшение качества относительно статической фильтрации - стандартного способа обучения на зашумленных выборках.
Степень достоверности и апробация работы
Достоверность полученных результатов подтверждается экспериментальной проверкой предложенных алгоритмов в различных сценариях обучения систем машинного перевода и оценкой с помощью принятых в области метрик качества. Результаты работы докладывались и обсуждались на научных конференциях:
1. The Ninth Conference on Machine Translation (WMT24), 2024, Miami, Florida, USA
2. The 35th Conference of Open Innovations Association (FRUCT), 2024, Tampere, Finland
3. The Tenth Conference on Machine Translation (WMT25), 2025, Suzhou, China
Публикации по теме диссертации
Основные результаты по теме диссертации изложены в 3 печатных изданиях в журналах, входящих в собственный перечень журналов МФТИ, 2 из которых индексируются Scopus и/или WoS.
1. Karpachev N., Enikeeva E., Popov D., Bulgakov A., Panteleev D., Ulianov D., KryukovA., Mekhraliev A. Yandex Submission to the WMT25 General Translation Task. //In Proceedings of the Tenth Conference on Machine Translation — 2025 — С. 740-752.
2. Elshin D., Karpachev N., GruzdevB., Golovanov I., Ivanov G., AntonovA., Skachkov N., Latypova E ., Layner V., Enikeeva E., Popov D., Chekashev A., Negodin V., Frantsuzova V., Chernyshev A., Denisov K. From General LLM to Translation: How We Dramatically Improve Translation Quality Using Human Evaluation Data for LLM Finetuning. //In Proceedings of the Ninth Conference on Machine Translation — 2024 — С. 247-252.
3. Карпачёв Н.Е. Обучение с расписанием для фильтрации данных и доменной адаптации в нейросетевом машинном переводе // Труды МФТИ — 2025. — Т. 17, №. 3 — С. 30-39.
Личный вклад
Все приведенные результаты, кроме отдельно оговоренных случаев, получены диссертантом лично.
Структура и объем работы
Диссертация состоит из оглавления, введения, четырёх глав, заключения, списка иллюстраций, списка таблиц, перечня основных обозначений и списка литературы из 88 наименований. Основной текст занимает 122 страницы.
Краткое содержание работы по главам
В главе 1 приведён обзор современных технологий машинного перевода, алгоритмов активного обучения, а также описаны основные проблемы современных систем.
В главе 2 рассматривается задача исправления систематических проблем перевода с помощью методов активного обучения. Предложен и описан новый алгоритм для эффективного дообучения - Targeted Contrastive Learning, эмпирически продемонстрирована эффективность нового метода в сравнении с сильными бейзлайнами.
В главе 3 проведено исследование методов обучения с расписанием для динамической фильтрации и ранжирования по сложности обучающих примеров. Описаны эмпирические результаты и обоснована эффективность динамической фильтрации в сравнении со статической. Проведены абляционные эксперименты для качественной оценки влияния гиперпараметров расписания на сходимость и интерпретации динамики обучения.
В главе 4 рассмотрена задача эффективной адаптации большой языковой
модели к задаче перевода. Проведены подробные исследования технического построения различных этапов пайплайна (SFT, alignment), в рамках которых был применен метод обучения с расписанием для эффективной адаптации под низкоресурсную документную выборку. Полученные эмпирические результаты говорят о высоком уровне системы, сравнимом с ведущими мировыми аналогами.
Глава 1 Обзор литературы
1.1. Машинный перевод
Задача машинного перевода состоит в автоматическом преобразовании текста на некотором исходном языке в эквивалентный по смыслу текст на другом, целевом, языке.
Язык представляет собой множество последовательностей символов произвольной длины, где символ - это элемент алфавита данного языка.
Более формально,
f : X ^ Y - алгоритм перевода
X - исходный язык, Y - целевой язык X е Y е
Алгоритм перевода, тем самым, формирует правило отображения текстов на исходном языке в эквивалентные им по смыслу переводы. Существует несколько типов алгоритмов машинного перевода:
1. Машинный перевод на основе правил (Rule-based MT) [1]
Исторически первым подходом к задаче перевода стали методы на основе правил.
Действительно, в простейшем случае задачу перевода можно решить на основе словарей, попарно сопоставляющих слова исходного языка в их переводы.
Ограничения такого подхода понятны - невозможно записать в словарь все возможные словоформы всех слов языка, поэтому часто будет возникать ситуация невхождения слова в словарь (OOV, Out of Vocabulary). Перевод этих редких слов в случае такого простого алгоритма будет сводиться к копированию, что понятным образом сильно ухудшает читаемость переводов и общее качество системы.
Практические системы перевода XX века [2] использовали более продвинутые системы правил: разбиение слов на начальную форму и суффикс (стем-минг, лемматизация) и учет локального контекста соседних слов при переводе. Тем не менее, общее качество подобного рода систем принципиально ограничено количеством правил, размером словаря и проблемой небуквальности задачи
перевода.
На практике такие системы давно заменили более вычислительно мощные и моделирующие сложные зависимости неявно статистические и нейросетевые методы.
2. Статистический машинный перевод (Statistical MT) [3]
Строение текстов на естественном языке является слишком сложным для моделирования вручную подобранной системой правил. Следующий класс алгоритмов вместо правил использует построение вероятностной статистической модели перевода, где параметры этой модели оптимизируются на основе обучающей выборки с примерами правильных переводов.
Статистические модели перевода являются классической задачей обучения с учителем (supervised learning). Множество объектов здесь - это пространство текстов на исходном языке, множество ответов - аналогично, тексты на языке переводов. Обучающая выборка - набор текстов с правильными переводами, такие выборки принято называть параллельными данными.
Среди ранних статистических моделей перевода наибольшую популярность и применение получили модели пословного статистического перевода (word-based machine translation [4]) и фразового статистического перевода (phrase-based machine translation [3]).
В них используется порождающая вероятностная модель, которая описывает процесс построения перевода. В зависимости от типа алгоритма, эта вероятностная модель работает на уровне отдельных слов или фраз (непрерывных последовательностей из n слов). На Рисунке 1.1 изображена вероятностная модель пословного статистического перевода.
Вероятностная модель перевода состоит из двух частей: лексическая модель (lexical model) и модель выравнивания (alignment model). Лексическая модель оценивает вероятностное распределение возможных переводов заданного слова t(ei\fi), а модель выравнивания - в каком порядке располагаются переводы слов для заданной длины запроса и перевода a(i\j, le, lf).
1 2 3 4 5
natürlich ist das haus Wein
/\ \ \ \ l
of course is the house small
I i X I
of course the house is small
12 3 4 5 6
lexical translation step
alignment step
Рисунок 1.1 - Вероятностная модель пословного SMT (IBM Model 2). [4]
Два явно выделенных таким образом этапа составляют общую вероятностную модель перевода (IBM Model 2):
p(e,a|/) = enj=i t(ej|fa(j))a(a(j)|j,le,lf)
Существуют и другие более сложные модификации порождающей модели IBM - IBM Model 3, 4, 5 [4]. Также на практике гораздо чаще используется статистическая модель на основе фраз (PBMT) [5, 3]. В ней единицей моделирования вероятностей перевода является последовательность из n слов вместо одного слова.
Обучение подобных несколько-компонентных моделей производится путем применения EM (Expectation Maximization) алгоритма [6] с итеративным обновлением вероятностных моделей.
Качество WBMT и PBMT гораздо выше, чем у исторических предшественников на основе правил, но, тем не менее, по построению такие модели имеют сильную склонность к буквальному переводу - PBMT редко делает сильную перефразировку текста, плохо моделирует идиомы и литературные обороты [7]. Кроме того, общий пайплайн из нескольких независимых моделей вносит индуктивное смещение (inductive bias), который ограничивает множество зависимостей, доступных для моделирования PBMT.
3. Нейросетевой машинный перевод (Neural MT, NMT) [8, 9]
Нейросетевые модели перевода напрямую моделируют вероятностное распределение на множестве возможных переводов при условии исходного текста:
Р(У|х) = f (х,в)
Здесь f - функция, которую представляет собой нейросеть, в - обучаемые
параметры нейросети.
Задача обучения переводу тем самым сводится к нахождению оптимальных значений параметров в, где оптимальность определяется с точки зрения минимизации функции потерь (loss function) на обучающей выборке правильных переводов.
1 N
в = argmine Ь(Уг, f (Хг' в))
i=1
хг и уг - i-й пример обучающей выборки, исходный текст и перевод, соответственно, L - функция потерь.
На практике, как правило, параметры в ищут как локальный оптимум функции потерь по причине более высокой эффективности методов оптимизации с поиском локального минимума. Например, градиентные методы оптимизации [10, 11] итеративно обновляют множество параметров в, сходясь к точке локального оптимума L.
По сравнению с фразовыми статистическими моделями, нейросетевой перевод обладает рядом преимуществ:
• Единая end-to-end модель перевода
Фразовые переводчики оптимизируют каждый компонент (модель перевода фраз, модель выравнивания, языковая модель сглаживания) независимо. Это накладывает ограничения на множество возможных функций перевода, которые может моделировать PBMT-система. Нейросеть в NMT решает задачу напрямую и может выразить более сложные зависимости.
• Гибкость в определении функции потерь
Функцией потерь в NMT может служить любая дифференцируемая функция. Это позволяет менять её в зависимости от требований задачи, например, делать больший акцент на терминах или на стиле сгенерированного перевода.
• Инженерная сложность системы
PBMT требует явного сохранения фразовых (или пословных) таблиц переводов. На практике это - сотни тысяч (или миллионы) отображений слов в возможные их переводы. Для инженерной поддержки такого рода системы необходимо большое количество дисковых ресурсов и обеспечение сихнронизации разнообразных компонент. С точки зрения встраивания
модели в продуктовую систему end-to-end модели нейроперевода существенно проще.
По причинам, указанным выше, нейросетевые модели достигли существенно более высокого качества в задаче перевода, чем фразовые. В настоящий момент подавляющее большинство продуктовых и исследовательских систем построено на NMT. В дальнейшем, и в текущей работе будут рассматриваться модели перевода на основе нейросетей.
1.2. Авторегрессионные модели
Предсказание перевода заданного текста р(еЦ) - задача классификации. Представление этой задачи в самой естественной форме (е - множество всех текстов на языке перевода) делает число классов экспоненциально большим и на практике не используется.
С другой стороны, если разбить текст на последовательность слов е = (е1,е2,е3,..., еп), то совместную вероятность можно представить следующим образом:
Р(е11) = РЫ/) Х Р(е2|еЪ /) X Р(е31 е2, ) X ... X р(еп|еп-1, e1, /)
Авторегрессионная модель представляет вероятность последовательности событий в виде произведения условной вероятности каждого следующего события при условии всех предыдущих. В случае предсказания текстовой последовательности событием является генерация одного следующего токена.
В описанной постановке задача классификации становится решаемой - ней-росетевая модель предсказывает один токен, соответственно, число классов равно числу токенов, а не всех возможных текстов в языке.
Остается определить, что такое токен. В простейшем случае токен - это одно слово в тексте. Тогда словарь (набор всех возможных токенов) будет множеством всех слов данного языка.
Однако все слова в языке все равно порождают очень большое количество классов. Часть из них при этом будут очень разреженными - для слов частоты один будет доступен только один обучающий пример (и одно обновление параметров градиентным спуском), на основании которого крайне тяжело извлечь закономерность в переводе данного слова.
По этой причине на практике гораздо чаще используют методы токениза-ции с разбиением на подслова. Например, стандартный алгоритм BPE (byte-pair encoding) [12] выделяет подслова для словаря токенов автоматически на основании выборки текстов.
Изначально в словаре BPE содержатся все символы алфавита - их называют bpe-юнитами (BPE units). Далее, словарь итеративно пополняется наиболее частотной парой соседних юнитов. Эту процедуру пополнения словаря частой парой продолжают до тех пор, пока размер словаря не станет равным заранее заданному гиперпараметру, например, 8 тысячам токенов.
На момент написания этой работы все state-of-the-art системы машинного перевода используют токенизацию на подслова - BPE, SentencePiece [13], либо другие способы.
Далее в описании алгоритмов под "токен" будет подразумеваться именно единица подсловного разбиения, если явно не указано иное.
1.3. Рекуррентные модели
Классической архитектурой нейросетей для работы с данными в виде последовательностей являются рекуррентные нейронные сети (Recurrent Neural Network, RNN) [14].
RNN обрабатывает последовательность поэлементно и на каждом шаге обновляет скрытое состояние - вектор, в котором содержится информация о прочитанной к данному моменту части последовательности. В зависимости от типа задачи (предсказание одного ответа на всю последовательность, классфикация каждого входного элемента, либо предсказание другой последовательности), RNN может генерировать предсказание на каждой итерации, в конце, либо по-
давать вектор состояния на вход другой модели (Рисунок 1.2).
Рисунок 1.2 - Рекуррентная нейронная сеть.
Математически обновление скрытого состояния RNN и предсказание ответа на каждом шаге осуществляются с помощью применения линейной операции над текущим скрытым состоянием и вектором следующего элемента с обучаемыми параметрами Whh и Wxh.
ht = tank(Whhht-1 + WxhXt) ot = Why kt
В машинном переводе используется парадигма sequence-to-sequence рекуррентных моделей (seq2seq), или encoder-decoder, предложенная в 2014 году в работе [8]. Seq2seq представляет собой две рекуррентные нейросети, encoder и decoder, первая из которых обрабатывает текст запроса и формирует скрытое представление текста в виде вектора (hidden state); этот вектор подается на вход модулю decoder, который последовательно предсказывает токены перевода по одному при условии уже сгенерированного префикса. Принцип работы архитектуры encoder-decoder схематично изображен на Рисунке 1.3.
Рисунок 1.3 - Архитектура seq2seq.
Обучение. Процедура обучения модели seq2seq (и других авторегрессионных моделей) сводится к решению задачи классификации следующего токена при условии токенов префикса. Оптимизируется функция потерь мультиклас-совой классификации, например, категориальная кросс-энтропия.
(x1,x2, x3) = "I saw a cat" (У1,У2,Уз) = "Я видел кошку"
h = encoder (x1,x2, x3) L = xent(y1,dec(y1)) + xent(y2, dec(y2^1) + xent(ys,dec(ys\yi,y2))
N
xent(ref,pred) = — ^^ refi * log(predi)
i=1
Декодинг. Модель sequence-to-sequence предсказывает распределение вероятностей над множеством возможных следующих токенов p(yn\yi,..n—1, x). Существует несколько стратегий генерации ответа:
• Greedy decoding (жадный алгоритм).
Первым вариантом является предсказание самого вероятного токена на каждом шаге: yi = argmax p(yi\y1,.i—1,x). Такой способ часто является неоптимальным вследствие жадности выбора отдельных токенов. Не всегда самый вероятный первый токен приведет к наибольшей суммарной вероятности всей последовательности перевода.
• Sampling.
Аналогично жадному выбору максимума по вероятности, следующий то-кен может быть сэмплирован из вероятностного распределения: yi ~ p{yi\y1,..,i—1, x). Сэмплирование часто применяют для получения разнообразных гипотез, однако само качество гипотез может быть низким из-за
возникновения в ответе зашумленных токенов с низкой вероятностью -для длинных последовательностей вероятность сгенерировать хоть один маловероятный токен значительно растет.
• Beam Search.
Beam search (или лучевой поиск) - алгоритм приближенного поиска самой вероятной цепочки токенов. Честный поиск перевода с лучшей вероятностью требует полного перебора всех последовательностей, что вычислительно нереализуемо. Beam search рассматривает не все переводы, а эвристически определенный "луч" (beam).
Луч содержит k (k - гиперпараметр, ширина луча) частичных последовательностей длины N с наибольшей суммарной вероятностью. В момент предсказания следующего токена для каждой из них генерируется по k лучших продолжений. Из полученных k2 гипотез k наиболее вероятных формируют луч на новом шаге.
Практическое качество моделей seq2seq не самое высокое - из-за последовательного обновления скрытого состояния, а также проблемы с затуханием градиентов seq2seq плохо справляется с переводом длинных фрагментов текста. Этим проблемам не подвержена более новая архитектура Transformer, на основании нее и работает подавляющее большинство современных систем перевода.
1.4. Трансформерные модели
Модель Transformer, предложенная в 2017 году в работе [15], работает на основе механизма внимания.
Идея внимания (attention) состоит в том, что сжатие всей информации о входном тексте в один вектор скрытого состояния - неоптимально. Вместо этого в Transformer используется несколько векторов скрытых состояний - по одному на каждый токен текста. Каждый подобный вектор строит контекстное представление токена с соответствующей позицией внутри данного предложения.
Для построения контекстных представлений применяют операцию self-attention.
Self-attention строит эмбеддинг токена на следующем слое в виде взвешенного среднего эмбеддингов всех токенов на текущем слое.
Более детально, пусть X - это эмбеддинг текущего токена на текущем слое.
Из этого эмбеддинга attention строит три новых эмбеддинга для данного токена: эмбеддинги Q (Query), K (Key) и V (Value). Каждый из новых эмбеддингов получен применением обучаемого линейного преобразования к вектору эмбеддинга X.
Q = XWq k = XWk V = XWv
Выше X - это матрица размера nxd, состоящая из эмбеддингов всех токенов, где строка с номером i представляет собой эмбеддинг токена под номером i. Соответственно, Q - матрица размера n х di, где строка под номером i - это query-эмбеддинг i-го токена.
Далее, вектора q, k и v используются для получения весов внимания: вес внимания для токена i от токена j равен нормированному скалярному произведению запроса токена i (Qi) и ключа токена j (Kj). Нормировка производится с помощью операции softmax, соответственно, итоговые веса attention для токена i от всех остальных токенов последовательности суммируются в 1.
Наконец, финальный контекстный вектор для токена i получают как сумму всех эмбеддингов Vi с полученными способом выше весами.
Описанный выше примитив self-attention является основной операцией внутри Transformer. Вся же модель работает в парадигме encoder-decoder и представляет собой две части:
1. Encoder
Encoder - часть трансформера, обрабатывающая входной текст. На входе получает эмбеддинги токенов, на выходе строит эмбеддинги тех же токенов с учетом контекста. Топологически encoder - это последовательное применение нескольких идентичных блоков, каждый из которых состоит из линейного слоя, слоя внимания и нормализации.
2. Decoder
Decoder же генерирует результат перевода по эмбеддингам от encoder. Аналогичным образом весь decoder - это последовательность нескольких трансфор-мерных блоков, а каждый блок идентичен блокам из encoder с добавлением дополнительной операции attention на эмбеддинги encoder вдобавок к стандартному self-attention на соседние эмбеддинги.
На Рисунке 1.4 представлена схема модели Transformer.
Рисунок 1.4 - Архитектура Transformer. [15]
Качество переводов моделями Transformer оказалось значительно выше, чем у семества RNN sequence-to-sequence. Уже в исходной реализации из статьи [15] Transformer показал заметные улучшения относительно сверточных и рекуррентных моделей, при этом за счет параллелизуемости потокенных операций
forward- и back-propagation затраты на обучение Transformer оказались меньше (Таблица 1.1).
Таблица 1.1 - Результаты модели Transformer. BLEU, тестовый набор
newstest-2014 [15].
BLEU Training Cost (FLOPs)
Model EN-DE EN-FR EN-DE EN-FR
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Многозадачный перенос знаний для диалоговых задач2023 год, кандидат наук Карпов Дмитрий Александрович
Исследование нейросетевых архитектур с памятью2025 год, кандидат наук Булатов Айдар Салаватович
Моделирование исправления ошибок в английских текстах с использованием синтетических и концентрированных наборов данных2025 год, кандидат наук Старченко Владимир Миронович
Методы машинного обучения для сквозных систем автоматического распознавания речи2023 год, кандидат наук Лаптев Александр Алексеевич
Список литературы диссертационного исследования кандидат наук Карпачёв Николай Евгеньевич, 2025 год
Список литературы
1. Hutchins John. Reflections on the history and present state of MT // Proceedings of Machine Translation Summit V, MTSummit 1995, Luxembourg, July 10-13, 1995. — 1995. https://aclanthology.org/1995.mtsummit-1.6.
2. Wilss Wolfram. Machine translation: Past, present, future: Hutchins, Wiliam John. New York: Ellis Horwood, 1986, 382 pp. // System. — 1990. — Vol. 18.
— C. 119-120. https://api.semanticscholar.org/CorpusID:60306559.
3. Koehn Philipp, Och Franz Josef, Marcu Daniel. Statistical Phrase-Based Translation // Human Language Technology Conference of the North American Chapter of the Association for Computational Linguistics, HLT-NAACL 2003, Edmonton, Canada, May 27 - June 1, 2003 / Ed. by Marti A. Hearst, Mari Ostendorf. — The Association for Computational Linguistics, 2003. https://aclanthology.org/N03-1017/.
4. The Mathematics of Statistical Machine Translation: Parameter Estimation / Peter F. Brown, Stephen Della Pietra, Vincent J. Della Pietra, Robert L. Mercer // Comput. Linguistics. — 1993. — Vol. 19, no. 2. — C. 263-311.
5. Och Franz Josef, Ney Hermann. Discriminative Training and Maximum Entropy Models for Statistical Machine Translation // Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, July 612, 2002, Philadelphia, PA, USA. — ACL, 2002. — C. 295-302. https: //aclanthology.org/P02-1038/.
6. Dempster Arthur P., Laird Nan M, Rubin Donald B. Maximum likelihood from incomplete data via the EM - algorithm plus discussions on the paper. — 1977. https://api.semanticscholar.org/CorpusID:4193919.
7. Chiang David. Hierarchical Phrase-Based Translation // Comput. Linguistics.
— 2007. — Vol. 33, no. 2. — C. 201-228. https://doi.org/10.1162/coli. 2007.33.2.201.
8. Sutskever Ilya, Vinyals Oriol, Le Quoc V. Sequence to Sequence Learning with Neural Networks // Advances in Neural Information Processing Systems 27: Annual Conference on Neural Information Processing Systems 2014, December 8-13 2014, Montreal, Quebec, Canada / Ed. by Zoubin Ghahramani, Max Welling, Corinna Cortes et al. — 2014. — C. 3104-3112. https://proceedings.neurips.cc/paper/2014/hash/ a14ac55a4f27472c5d894ec1c3c743d2-Abstract.html.
9. Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation / Kyunghyun Cho, Bart van Merrienboer, Caglar Gülcehre et al. // Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing, EMNLP 2014, October 25-29, 2014, Doha, Qatar, A meeting of SIGDAT, a Special Interest Group of the ACL / Ed. by Alessan-dro Moschitti, Bo Pang, Walter Daelemans. — ACL, 2014. — C. 1724-1734. https://doi.org/10.3115/v1/d14-1179.
10. Robbins Herbert E. A Stochastic Approximation Method // Annals of Mathematical Statistics. — 1951. — Vol. 22. — C. 400-407. https://api. semanticscholar.org/CorpusID:16945044.
11. Kingma Diederik P., Ba Jimmy. Adam: A Method for Stochastic Optimization // 3rd International Conference on Learning Representations, ICLR 2015, San Diego, CA, USA, May 7-9, 2015, Conference Track Proceedings / Ed. by Yoshua Bengio, Yann LeCun. — 2015. http://arxiv.org/abs/1412.6980.
12. Sennrich Rico, Haddow Barry, Birch Alexandra. Neural Machine Translation of Rare Words with Subword Units // Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics, ACL 2016, August 7-12, 2016, Berlin, Germany, Volume 1: Long Papers. — The Association for Computer Linguistics, 2016. https://doi.org/10.18653/v1/p16-1162.
13. Kudo Taku, Richardson John. SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing // Proceedings of the 2018 Conference on Empirical Methods in Natural Language
Processing, EMNLP 2018: System Demonstrations, Brussels, Belgium, October 31 - November 4, 2018 / Ed. by Eduardo Blanco, Wei Lu. — Association for Computational Linguistics, 2018. — C. 66-71. https://doi.org/10.18653/ v1/d18-2012.
14. Elman Jeffrey L. Finding Structure in Time // Cogn. Sci. — 1990. — Vol. 14, no. 2. — C. 179-211. https://doi.org/10.1207/s15516709cog1402_1.
15. Attention is All you Need / Ashish Vaswani, Noam Shazeer, Niki Parmar et al. // Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017, December 4-9, 2017, Long Beach, CA, USA / Ed. by Isabelle Guyon, Ulrike von Luxburg, Samy Bengio et al. — 2017. — C. 5998-6008. https://proceedings.neurips.cc/paper/ 2017/hash/3f5ee243547dee91fbd053c1c4a845aa-Abstract.html.
16. Language Models are Few-Shot Learners / Tom B. Brown, Benjamin Mann, Nick Ryder et al. // Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6-12, 2020, virtual / Ed. by Hugo Larochelle, Marc'Aurelio Ranzato, Raia Hadsell et al. — 2020. https://proceedings.neurips.cc/paper/2020/ hash/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html.
17. OpenAI. GPT-4 Technical Report // CoRR. — 2023. — Vol. abs/2303.08774. https://doi.org/10.48550/arXiv.2303.08774.
18. Prompting PaLM for Translation: Assessing Strategies and Performance / David Vilar, Markus Freitag, Colin Cherry et al. // Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2023, Toronto, Canada, July 9-14, 2023 / Ed. by Anna Rogers, Jordan L. Boyd-Graber, Naoaki Okazaki. — Association for Computational Linguistics, 2023. — C. 15406-15427. https://doi.org/10.18653/v1/2023. acl-long.859.
19. Machine Translation with Large Language Models: Prompting, Few-shot Learning, and Fine-tuning with QLoRA / Xuan Zhang, Navid Rajabi, Kevin Duh,
Philipp Koehn // Proceedings of the Eighth Conference on Machine Translation, WMT 2023, Singapore, December 6-7, 2023 / Ed. by Philipp Koehn, Barry Haddon, Tom Kocmi, Christof Monz. — Association for Computational Linguistics, 2023. — C. 468-481. https://doi.org/10.18653/v1/2023. wmt-1.43.
20. QLoRA: Efficient Finetuning of Quantized LLMs / Tim Dettmers, Ar-tidoro Pagnoni, Ari Holtzman, Luke Zettlemoyer // Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023 / Ed. by Alice Oh, Tristan Naumann, Amir Globerson et al. — 2023. http://papers.nips.cc/paper_files/paper/2023/hash/ 1feb87871436031bdc0f2beaa62a049b-Abstract-Conference.html.
21. Findings of the 2023 Conference on Machine Translation (WMT23): LLMs Are Here but Not Quite There Yet / Tom Kocmi, Eleftherios Avramidis, Rachel Bawden et al. // Proceedings of the Eighth Conference on Machine Translation, WMT 2023, Singapore, December 6-7, 2023 / Ed. by Philipp Koehn, Barry Haddon, Tom Kocmi, Christof Monz. — Association for Computational Linguistics, 2023. — C. 1-42. https://doi.org/10.18653/ v1/2023.wmt-1.1.
22. Findings of the WMT24 General Machine Translation Shared Task: The LLM Era Is Here but MT Is Not Solved Yet / Tom Kocmi, Eleftherios Avramidis, Rachel Bawden et al. // Proceedings of the Ninth Conference on Machine Translation, WMT 2024, Miami, FL, USA, November 15-16, 2024 / Ed. by Barry Haddow, Tom Kocmi, Philipp Koehn, Christof Monz. — Association for Computational Linguistics, 2024. — C. 1-46. https://doi.org/10.18653/ v1/2024.wmt-1.1.
23. Scaling Laws for Neural Language Models / Jared Kaplan, Sam McCandlish, Tom Henighan et al. // CoRR. — 2020. — Vol. abs/2001.08361. https:// arxiv.org/abs/2001.08361.
24. Settles Burr. Active Learning. Synthesis Lectures on Artificial Intelligence and Machine Learning. — Morgan & Claypool Publishers, 2012. https: //doi.org/ 10.2200/S00429ED1V01Y201207AIM018.
25. Lewis David D., Gale William A. A Sequential Algorithm for Training Text Classifiers // Proceedings of the 17th Annual International ACM-SIGIR Conference on Research and Development in Information Retrieval. Dublin, Ireland, 3-6 July 1994 (Special Issue of the SIGIR Forum) / Ed. by W. Bruce Croft, C. J. van Rijsbergen. — ACM/Springer, 1994. — C. 3-12. https://doi.org/ 10.1007/978-1-4471-2099-5_1.
26. Bayesian Active Learning for Classification and Preference Learning / Neil Houlsby, Ferenc Huszar, Zoubin Ghahramani, Mate Lengyel // CoRR.
— 2011. — Vol. abs/1112.5745. http://arxiv.org/abs/1112.5745.
27. Shannon Claude E. A mathematical theory of communication // ACM SIG-MOBILE Mob. Comput. Commun. Rev. — 2001. — Vol. 5, no. 1. — C. 3-55. https://doi.org/10.1145/584091.584093.
28. Seung H. Sebastian, Opper Manfred, Sompolinsky Haim. Query by Committee // Proceedings of the Fifth Annual ACM Conference on Computational Learning Theory, COLT 1992, Pittsburgh, PA, USA, July 27-29, 1992 / Ed. by David Haussler. — ACM, 1992. — C. 287-294. https://doi.org/10.1145/ 130385.130417.
29. Dagan Ido, Engelson Sean P. Committee-Based Sampling For Training Probabilistic Classifiers // Machine Learning, Proceedings of the Twelfth International Conference on Machine Learning, Tahoe City, California, USA, July 9-12, 1995 / Ed. by Armand Prieditis, Stuart Russell. — Morgan Kaufmann, 1995.
— C. 150-157. https://doi.org/10.1016/b978-1-55860-377-6.50027-x.
30. McCallum Andrew Kachites, Nigam Kamal. Employing EM and Pool-Based Active Learning for Text Classification // Proceedings of the Fifteenth International Conference on Machine Learning (ICML 1998), Madison, Wisconsin,
USA, July 24-27, 1998 / Ed. by Jude W. Shavlik. — Morgan Kaufmann, 1998.
— C. 350-358.
31. Kullback Solomon, Leibler R. A. On Information and Sufficiency // Annals of Mathematical Statistics. — 1951. — Vol. 22. — C. 79-86. https://api. semanticscholar.org/CorpusID:120349231.
32. Gal Yarin, Ghahramani Zoubin. Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning // Proceedings of the 33nd International Conference on Machine Learning, ICML 2016, New York City, NY, USA, June 19-24, 2016 / Ed. by Maria-Florina Balcan, Kilian Q. Weinberger.
— Vol. 48 of JMLR Workshop and Conference Proceedings. — JMLR.org, 2016.
— C. 1050-1059. http://proceedings.mlr.press/v48/gal16.html.
33. Snapshot Ensembles: Train 1, Get M for Free / Gao Huang, Yixuan Li, Geoff Pleiss et al. // 5th International Conference on Learning Representations, ICLR 2017, Toulon, France, April 24-26, 2017, Conference Track Proceedings.
— OpenReview.net, 2017. https://openreview.net/forum?id=BJYwwY9ll.
34. Dropout: a simple way to prevent neural networks from overfitting / Nitish Sri-vastava, Geoffrey E. Hinton, Alex Krizhevsky et al. // J. Mach. Learn. Res. — 2014. — Vol. 15, no. 1. — C. 1929-1958. https://dl.acm.org/doi/10.5555/ 2627435.2670313.
35. Deep Active Learning for Named Entity Recognition / Yanyao Shen, Hyokun Yun, Zachary Chase Lipton et al. // Proceedings of the 2nd Workshop on Representation Learning for NLP, Rep4NLP@ACL 2017, Vancouver, Canada, August 3, 2017 / Ed. by Phil Blunsom, Antoine Bordes, Kyunghyun Cho et al. — Association for Computational Linguistics, 2017. — C. 252-256. https://doi.org/10.18653/v1/w17-2630.
36. Active Learning for Abstractive Text Summarization / Akim Tsvigun, Ivan Ly-senko, Danila Sedashov et al. // Findings of the Association for Computational Linguistics: EMNLP 2022, Abu Dhabi, United Arab Emirates, December 7-11, 2022 / Ed. by Yoav Goldberg, Zornitsa Kozareva, Yue Zhang. —
Association for Computational Linguistics, 2022. — C. 5128-5152. https: //doi.org/10.18653/v1/2022.findings-emnlp.377.
37. You Cannot Feed Two Birds with One Score: the Accuracy-Naturalness Tradeoff in Translation / Gergely Flamich, David Vilar, Jan-Thorsten Peter, Markus Freitag // CoRR. — 2025. — Vol. abs/2503.24013. https://doi.org/10.48550/ arXiv.2503.24013.
38. Experts, Errors, and Context: A Large-Scale Study of Human Evaluation for Machine Translation / Markus Freitag, George F. Foster, David Grangier et al. // Trans. Assoc. Comput. Linguistics. — 2021. — Vol. 9. — C. 1460-1474. https://doi.org/10-1162/tacl_a_00437.
39. Maruf Sameen, Saleh Fahimeh, Haffari Gholamreza. A Survey on Document-level Neural Machine Translation: Methods and Evaluation // ACM Comput. Surv. — 2022. — Vol. 54, no. 2. — C. 45:1-45:36. https://doi.org/10.1145/ 3441691.
40. A Large-Scale Test Set for the Evaluation of Context-Aware Pronoun Translation in Neural Machine Translation / Mathias Müller, Annette Rios, Elena Voita, Rico Sennrich // WMT 2018. — Brussels, Belgium: Association for Computational Linguistics, 2018.
41. Chu Chenhui, Wang Rui. A Survey of Domain Adaptation for Neural Machine Translation // Proceedings of the 27th International Conference on Computational Linguistics, COLING 2018, Santa Fe, New Mexico, USA, August 20-26, 2018 / Ed. by Emily M. Bender, Leon Derczynski, Pierre Isabelle. — Association for Computational Linguistics, 2018. — C. 1304-1319. https://aclanthology.org/C18-1111/.
42. Hadsell Raia, Chopra Sumit, LeCun Yann. Dimensionality Reduction by Learning an Invariant Mapping // 2006 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2006), 17-22 June 2006, New York, NY, USA. — IEEE Computer Society, 2006. — C. 1735-1742. https://doi.org/10-1109/CVPR.2006.100.
43. Schroff Florian, Kalenichenko Dmitry, Philbin James. FaceNet: A unified embedding for face recognition and clustering // IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2015, Boston, MA, USA, June 7-12,
2015. — IEEE Computer Society, 2015. — C. 815-823. https://doi.org/10. 1109/CVPR.2015.7298682.
44. Yandex. YandexGPT-5-Lite-8B-pretrain. — 2025. — Accessed: 2025-10-06. https://huggingface.co/yandex/YandexGPT-5-Lite-8B-pretrain.
45. ParaCrawl: Web-scale parallel corpora for the languages of the EU / Miquel Es-pla-Gomis, Mikel L. Forcada, Gema Ramirez-Sanchez, Hieu Hoang // Proceedings of Machine Translation Summit XVII Volume 2: Translator, Project and User Tracks, MTSummit 2019, Dublin, Ireland, August 19-23, 2019 / Ed. by Mikel L. Forcada, Andy Way, John Tinsley et al. — European Association for Machine Translation, 2019. — C. 118-119. https://aclanthology.org/ W19-6721/.
46. CCMatrix: Mining Billions of High-Quality Parallel Sentences on the Web / Holger Schwenk, Guillaume Wenzek, Sergey Edunov et al. // Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing, ACL/IJCNLP 2021, (Volume 1: Long Papers), Virtual Event, August 1-6, 2021 / Ed. by Chengqing Zong, Fei Xia, Wenjie Li, Roberto Nav-igli. — Association for Computational Linguistics, 2021. — C. 6490-6500. https://doi.org/10.18653/v1/2021.acl-long.507.
47. Tiedemann Jorg. OPUS - parallel corpora for everyone // Proceedings of the 19th Annual Conference of the European Association for Machine Translation: Projects/Products, EAMT 2016, Riga, Latvia, May 30 - June 1, 2016. — Baltic Journal of Modern Computing, 2016. https://aclanthology.org/
2016.eamt-2.8/.
48. Sennrich Rico, Haddow Barry, Birch Alexandra. Improving Neural Machine Translation Models with Monolingual Data // Proceedings of the 54th Annual
Meeting of the Association for Computational Linguistics, ACL 2016, August 7-12, 2016, Berlin, Germany, Volume 1: Long Papers. — The Association for Computer Linguistics, 2016. https://doi.org/10.18653/v1/p16-1009.
49. Provilkov Ivan, Malinin Andrey. Multi-Sentence Resampling: A Simple Approach to Alleviate Dataset Length Bias and Beam-Search Degradation // Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, EMNLP 2021, Virtual Event / Punta Cana, Dominican Republic, 7-11 November, 2021 / Ed. by Marie-Francine Moens, Xuanjing Huang, Lucia Specia, Scott Wen-tau Yih. — Association for Computational Linguistics, 2021. — C. 8612-8621. https://doi.org/10.18653/v1/2021.emnlp-main. 677.
50. Findings of the WMT 2019 Shared Task on Parallel Corpus Filtering for Low-Resource Conditions / Philipp Koehn, Francisco Guzman, Vishrav Chaudhary, Juan Miguel Pino // Proceedings of the Fourth Conference on Machine Translation, WMT 2019, Florence, Italy, August 1-2, 2019 - Volume 3: Shared Task Papers, Day 2 / Ed. by Ondrej Bojar, Rajen Chatterjee, Christian Federmann et al. — Association for Computational Linguistics, 2019. — C. 54-72. https://doi.org/10.18653/v1/w19-5404.
51. Findings of the 2022 Conference on Machine Translation (WMT22) / Tom Koc-mi, Rachel Bawden, Ondrej Bojar et al. // Proceedings of the Seventh Conference on Machine Translation, WMT 2022, Abu Dhabi, United Arab Emirates (Hybrid), December 7-8, 2022 / Ed. by Philipp Koehn, Loic Barrault, Ondrej Bojar et al. — Association for Computational Linguistics, 2022. — C. 1-45. https://aclanthology.org/2022.wmt-1.1.
52. Koehn Philipp. Europarl: A Parallel Corpus for Statistical Machine Translation // Proceedings of Machine Translation Summit X: Papers, MTSum-mit 2005, Phuket, Thailand, September 13-15, 2005. — 2005. — C. 79-86. https://aclanthology.org/2005.mtsummit-papers.11.
53. News Commentary parallel corpus. — http://www.statmt.org/wmt23/ translation-task.html. — 2007-2023. — A parallel corpus of news editorials released annually as part of the WMT shared task. Versioning (e.g., v16) is important.
54. Ziemski Michal, Junczys-Dowmunt Marcin, Pouliquen Bruno. The United Nations Parallel Corpus v1.0 // Proceedings of the Tenth International Conference on Language Resources and Evaluation LREC 2016, Portoroz, Slovenia, May 23-28, 2016 / Ed. by Nicoletta Calzolari, Khalid Choukri, Thierry Decler-ck et al. — European Language Resources Association (ELRA), 2016. http: //www.lrec-conf.org/proceedings/lrec2016/summaries/1195.html.
55. Axelrod Amittai, He Xiaodong, Gao Jianfeng. Domain Adaptation via Pseudo In-Domain Data Selection // Proceedings of the 2011 Conference on Empirical Methods in Natural Language Processing, EMNLP 2011, 27-31 July 2011, John McIntyre Conference Centre, Edinburgh, UK, A meeting of SIG-DAT, a Special Interest Group of the ACL. — ACL, 2011. — C. 355-362. https://aclanthology.org/D11-1033/.
56. Artetxe Mikel, Schwenk Holger. Massively Multilingual Sentence Embeddings for Zero-Shot Cross-Lingual Transfer and Beyond // Trans. Assoc. Comput. Linguistics. — 2019. — Vol. 7. — C. 597-610. https://doi.org/10.1162/ tacl_a_00288.
57. Language-agnostic BERT Sentence Embedding / Fangxiaoyu Feng, Yin-fei Yang, Daniel Cer et al. // Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), ACL 2022, Dublin, Ireland, May 22-27, 2022 / Ed. by Smaranda Muresan, Preslav Nakov, Aline Villavicencio. — Association for Computational Linguistics, 2022. — C. 878-891. https://doi.org/10.18653/v1/2022.acl-long.62.
58. Junczys-Dowmunt Marcin. Dual Conditional Cross-Entropy Filtering of Noisy Parallel Corpora // Proceedings of the Third Conference on Machine Translation: Shared Task Papers, WMT 2018, Belgium, Brussels, October 31 - Novem-
ber 1, 2018 / Ed. by Ondrej Bojar, Rajen Chatterjee, Christian Federmann et al. — Association for Computational Linguistics, 2018. — С. 888-895. https://doi.org/10.18653/v1/w18-6478.
59. Curriculum learning / Yoshua Bengio, Jerome Louradour, Ronan Collobert, Jason Weston // Proceedings of the 26th Annual International Conference on Machine Learning, ICML 2009, Montreal, Quebec, Canada, June 14-18, 2009 / Ed. by Andrea Pohoreckyj Danyluk, Leon Bottou, Michael L. Littman. — Vol. 382 of ACM International Conference Proceeding Series. — ACM, 2009. — С. 4148. https://doi.org/10.1145/1553374.1553380.
60. van der Wees Marlies, Bisazza Arianna, Monz Christof. Dynamic Data Selection for Neural Machine Translation // Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, EMNLP 2017, Copenhagen, Denmark, September 9-11, 2017 / Ed. by Martha Palmer, Rebecca Hwa, Sebastian Riedel. — Association for Computational Linguistics, 2017.
— С. 1400-1410. https://doi.org/10.18653/v1/d17-1147.
61. Competence-based Curriculum Learning for Neural Machine Translation / Em-manouil Antonios Platanios, Otilia Stretcu, Graham Neubig et al. // Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, NAACL-HLT 2019, Minneapolis, MN, USA, June 2-7, 2019, Volume 1 (Long and Short Papers) / Ed. by Jill Burstein, Christy Doran, Thamar Solorio. — Association for Computational Linguistics, 2019. — С. 1162-1172. https: //doi.org/10.18653/v1/n19-1119.
62. An Empirical Exploration of Curriculum Learning for Neural Machine Translation / Xuan Zhang, Gaurav Kumar, Huda Khayrallah et al. // CoRR. — 2018.
— Vol. abs/1811.00739. http://arxiv.org/abs/1811.00739.
63. Карпачёв Н.Е. Обучение с расписанием для фильтрации данных и доменной адаптации в нейросетевом машинном переводе // Труды МФТИ, Т. 17, №. 3. — 2025. — С. 30-39.
64. Lui Marco, Baldwin Timothy. langid.py: An Off-the-shelf Language Identification Tool // The 50th Annual Meeting of the Association for Computational Linguistics, Proceedings of the System Demonstrations, July 10, 2012, Jeju Island, Korea. — The Association for Computer Linguistics, 2012. — C. 25-30. https://aclanthology.org/P12-3005/.
65. Findings of the 2019 Conference on Machine Translation (WMT19) / Loïc Bar-rault, Ondrej Bojar, Marta R. Costa-jussa et al. // Proceedings of the Fourth Conference on Machine Translation, WMT 2019, Florence, Italy, August 1-2, 2019 - Volume 2: Shared Task Papers, Day 1 / Ed. by Ondrej Bojar, Rajen Chatterjee, Christian Federmann et al. — Association for Computational Linguistics, 2019. — C. 1-61. https://doi.org/10.18653/v1/w19-5301.
66. Rethinking the Inception Architecture for Computer Vision / Christian Szegedy, Vincent Vanhoucke, Sergey Ioffe et al. // 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27-30, 2016. — IEEE Computer Society, 2016. — C. 2818-2826. https://doi.org/10-1109/CVPR.2016.308.
67. Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation / Yonghui Wu, Mike Schuster, Zhifeng Chen et al. // CoRR. — 2016. — Vol. abs/1609.08144. http://arxiv.org/abs/ 1609.08144.
68. Denoising Neural Machine Translation Training with Trusted Data and Online Data Selection / Wei Wang, Taro Watanabe, Macduff Hughes et al. // Proceedings of the Third Conference on Machine Translation: Research Papers, WMT 2018, Belgium, Brussels, October 31 - November 1, 2018 / Ed. by Ondrej Bojar, Rajen Chatterjee, Christian Federmann et al. — Association for Computational Linguistics, 2018. — C. 133-143. https://doi.org/10.18653/v1/w18-6314.
69. Emergent Abilities of Large Language Models / Jason Wei, Yi Tay, Rishi Bom-masani et al. // Trans. Mach. Learn. Res. — 2022. — Vol. 2022. https: //openreview.net/forum?id=yzkSU5zdwD.
70. How Good Are GPT Models at Machine Translation? A Comprehensive Evaluation / Amr Hendy, Mohamed Abdelrehim, Amr Sharaf et al. // CoRR. — 2023.
— Vol. abs/2302.09210. https://doi.org/10.48550/arXiv.2302.09210.
71. Is ChatGPT A Good Translator? A Preliminary Study / Wenxiang Jiao, Wenx-uan Wang, Jen-tse Huang et al. // CoRR. — 2023. — Vol. abs/2301.08745. https://doi.org/10.48550/arXiv.2301.08745.
72. Anil Rohan, Dai Andrew M, Firat Orhan et al. PaLM 2 Technical Report. — 2023. https://arxiv.org/abs/2305.10403.
73. LLaMA: Open and Efficient Foundation Language Models / Hugo Touvron, Thibaut Lavril, Gautier Izacard et al. // CoRR. — 2023. — Vol. abs/2302.13971. https://doi.org/10.48550/arXiv.2302.13971.
74. Mistral 7B / Albert Q. Jiang, Alexandre Sablayrolles, Arthur Mensch et al. // CoRR. — 2023. — Vol. abs/2310.06825. https://doi.org/10.48550/arXiv. 2310.06825.
75. GPT Understands, Too / Xiao Liu, Yanan Zheng, Zhengxiao Du et al. // CoRR.
— 2021. — Vol. abs/2103.10385. https://arxiv.org/abs/2103.10385.
76. LoRA: Low-Rank Adaptation of Large Language Models / Edward J. Hu, Ye-long Shen, Phillip Wallis et al. // The Tenth International Conference on Learning Representations, ICLR 2022, Virtual Event, April 25-29, 2022. — OpenRe-view.net, 2022. https://openreview.net/forum?id=nZeVKeeFYf9.
77. Training language models to follow instructions with human feedback / Long Ouyang, Jeffrey Wu, Xu Jiang et al. // Advances in Neural Information Processing Systems 35: Annual Conference on Neural Information Processing Systems 2022, NeurIPS 2022, New Orleans, LA, USA, November 28 - December 9, 2022 / Ed. by Sanmi Koyejo, S. Mohamed, A. Agarwal et al. — 2022. http://papers.nips.cc/paper_files/paper/2022/hash/ b1efde53be364a73914f58805a001731-Abstract-Conference.html.
78. Voita Elena, Sennrich Rico, Titov Ivan. When a Good Translation is Wrong in Context: Context-Aware Machine Translation Improves on Deixis, Ellipsis,
and Lexical Cohesion // Proceedings of the 57th Conference of the Association for Computational Linguistics, ACL 2019, Florence, Italy, July 28- August 2, 2019, Volume 1: Long Papers / Ed. by Anna Korhonen, David R. Traum, Lluis Marquez. — Association for Computational Linguistics, 2019. — C. 11981212. https://doi.org/10.18653/v1/p19-1116.
79. SLiC-HF: Sequence Likelihood Calibration with Human Feedback / Yao Zhao, Rishabh Joshi, Tianqi Liu et al. // CoRR. — 2023. — Vol. abs/2305.10425. https://doi.org/10.48550/arXiv.2305.10425.
80. Sellam Thibault, Das Dipanjan, Parikh Ankur P. BLEURT: Learning Robust Metrics for Text Generation // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, ACL 2020, Online, July 5-10, 2020 / Ed. by Dan Jurafsky, Joyce Chai, Natalie Schluter, Joel R. Tetreault.
— Association for Computational Linguistics, 2020. — C. 7881-7892. https: //doi.org/10.18653/v1/2020.acl-main.704.
81. COMET: A Neural Framework for MT Evaluation / Ricardo Rei, Craig Stewart, Ana C. Farinha, Alon Lavie // Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing, EMNLP 2020, Online, November 16-20, 2020 / Ed. by Bonnie Webber, Trevor Cohn, Yulan He, Yang Liu. — Association for Computational Linguistics, 2020. — C. 26852702. https://doi.org/10.18653/v1/2020.emnlp-main.213.
82. P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks / Xiao Liu, Kaixuan Ji, Yicheng Fu et al. // CoRR.
— 2021. — Vol. abs/2110.07602. https://arxiv.org/abs/2110.07602.
83. Proximal Policy Optimization Algorithms / John Schulman, Filip Wolski, Pra-fulla Dhariwal et al. // CoRR. — 2017. — Vol. abs/1707.06347. http: //arxiv.org/abs/1707.06347.
84. Direct Preference Optimization: Your Language Model is Secretly a Reward Model / Rafael Rafailov, Archit Sharma, Eric Mitchell et al. // Advances in
Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023 / Ed. by Alice Oh, Tristan Naumann, Amir Glober-son et al. — 2023. http://papers.nips.cc/paper_files/paper/2023/hash/ a85b405ed65c6477a4fe8302b5e06ce7-Abstract-Conference.html.
85. Be Your Own Teacher: Improve the Performance of Convolutional Neural Networks via Self Distillation / Linfeng Zhang, Jiebo Song, Anni Gao et al. // 2019 IEEE/CVF International Conference on Computer Vision, ICCV 2019, Seoul, Korea (South), October 27 - November 2, 2019. — IEEE, 2019. — C. 3712-3721. https://doi.org/10.1109/ICCV.2019.00381.
86. From General LLM to Translation: How We Dramatically Improve Translation Quality Using Human Evaluation Data for LLM Finetuning / Denis Elshin, Nikolay Karpachev, Boris Gruzdev et al. // Proceedings of the Ninth Conference on Machine Translation, WMT 2024, Miami, FL, USA, November 15-16, 2024 / Ed. by Barry Haddow, Tom Kocmi, Philipp Koehn, Christof Monz. — Association for Computational Linguistics, 2024. — C. 247-252. https: //doi.org/10.18653/v1/2024.wmt-1.17.
87. Yandex Submission to the WMT25 General Machine Translation Task / Nikolay Karpachev, Ekaterina Enikeeva, Dmitry Popov et al. // Proceedings of the Tenth Conference on Machine Translation (WMT 2025). — Suzhou, China: Association for Computational Linguistics, 2025. — November. — C. 740-752. https://aclanthology.org/2025.wmt-1.50.
88. Findings of the WMT25 General Machine Translation Shared Task: Time to Stop Evaluating on Easy Test Sets / Tom Kocmi, Ekaterina Artemova, Eleft-herios Avramidis et al. // Proceedings of the Tenth Conference on Machine Translation (WMT 2025). — Suzhou, China: Association for Computational Linguistics, 2025. — November. — C. 355-413. https://aclanthology.org/ 2025.wmt-1.22.
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.