Методы повышения быстродействия и точности распознавания ключевых слов для сквозных систем автоматического распознавания речи тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Андрусенко Андрей Юрьевич
- Специальность ВАК РФ00.00.00
- Количество страниц 117
Оглавление диссертации кандидат наук Андрусенко Андрей Юрьевич
Введение
ГЛАВА 1. Введение в область автоматического распознавания
речи
1.1 Постановка задачи
1.2 Оценка результатов распознавания речи
1.3 Классические гибридные системы распознавания речи
1.3.1 Структура классической системы автоматического распознавания речи
1.3.2 Обработка входного речевого сигнала и извлечение акустических признаков
1.3.3 Акустическое моделирование
1.3.4 Языковое моделирование
1.3.5 Декодирование
1.3.6 Критерий разделения последовательностей
1.3.7 Недостатки классических систем распознавания речи
1.4 Сквозные системы распознавания речи
1.4.1 Коннекционная временная классификация (Connectionist Temporal Classification)
1.4.2 Рекуррентный нейросетевой преобразователь (Recurrent Neural Network transducer)
1.4.3 Энкодер-декодер модель на основе механизма внимания (Attention-based encoder-decoder)
1.4.4 Сравнение основных типов сквозных систем распознавания речи
1.4.5 Комбинация сквозных систем распознавания речи
1.5 Сравнение классических гибридных и сквозных систем
распознавания речи
1.6 Выводы
42
ГЛАВА 2. Метод повышения быстродействия сквозных систем
распознавания речи
2.1 Обзор проблемы повышения быстродействия сквозных систем распознавания речи
2.2 Описание предложенного метода
2.2.1 Изменение временной размерности
2.2.2 Промежуточная функция потерь
2.2.3 Языковые единицы
2.3 Исследование эффективности предложенного метода
2.3.1 Используемые архитектуры сквозных моделей распознавания речи
2.3.2 Параметры экспериментальных исследований
2.3.3 Результаты экспериментальных исследований
2.4 Выводы
ГЛАВА 3. Метод повышения быстродействия и точности
распознавания заранее известных ключевых слов
для сквозных систем распознавания речи
3.1 Обзор проблемы смещения контекста
3.2 Описание предложенного метода
3.2.1 Детектор ключевых слов
3.2.2 Объединение гипотез распознавания
3.2.3 Альтернативные транскрипции для слов контекста
3.2.4 Рекуррентный нейронный преобразователь
3.3 Исследование эффективности предложенного метода
3.3.1 Сквозная модель распознавания речи
3.3.2 Данные для тестирования
3.3.3 Список смещения контекста
3.3.4 Метрики оценки точности
3.3.5 Базовые методы смещения контекста
3.3.6 Результаты экспериментальных исследований
3.4 Выводы
ГЛАВА 4. Метод повышения точности распознавания заранее неизвестных внесловарных слов для сквозных систем распознавания речи
4.1 Обзор проблемы распознавания внесловарных слов
4.2 Описание предложенного метода
4.2.1 Модификация графа распознавания
4.2.2 Дообучение сквозной модели распознавания речи на
основе критерия разделения последовательностей
4.3 Исследование эффективности предложенного метода
4.3.1 Данные для обучения и тестирования
4.3.2 Параметры экспериментальных исследований
4.3.3 Результаты экспериментальных исследований
4.4 Выводы
Заключение
Список сокращений и условных обозначений
Список литературы
Список иллюстрированного материала
Приложение А. Акт о внедрении
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы, алгоритмы и программные средства распознавания русской телефонной спонтанной речи2016 год, кандидат наук Меденников Иван Павлович
Информационный поиск речевых документов на основе модели с фонемным представлением содержания2019 год, кандидат наук Татаринова Александра Геннадьевна
Методы, алгоритмы и устройства распознавания речи в ассоциативной осцилляторной среде2015 год, кандидат наук Парамонов Павел Александрович
Исследование методов и разработка алгоритмов обработки сигналов для систем автоматического распознавания телефонной речи в республике Йемен2019 год, кандидат наук Аль-Дайбани Абдулгани Мохаммед Салех
Методы и программные средства фонетико-языкового моделирования в системах автоматического распознавания русской речи2011 год, кандидат технических наук Кипяткова, Ирина Сергеевна
Введение диссертации (часть автореферата) на тему «Методы повышения быстродействия и точности распознавания ключевых слов для сквозных систем автоматического распознавания речи»
Введение
Актуальность темы исследования и степень ее разработанности.
Активное развитие современных технологий и внедрение их в нашу повседневную жизнь способствовали появлению большого спроса на разработку человеко-машинных интерфейсов, упрощающих процесс взаимодействия человека с различными видами «умных» устройств. На данный момент все большую популярность приобретает речевой интерфейс, поскольку именно речь является наиболее простым и удобным способом коммуникации для человека. Одним из основных компонентов речевого интерфейса является система автоматического распознавания речи (Automatic Speech Recognition, ASR), задача которой состоит в преобразовании входного речевого сигнала в последовательность произнесенных слов. ASR системы также используются для обработки речевых данных при решении таких задач, как повышение качества обслуживания в контакт-центрах, генерирование автоматических транскрипций для аудио и видео, автоматическое транскрибирование записей совещаний и так далее.
Долгое время ASR системы строились на основе классического гибридного подхода, где акустическая и языковая модели решали отдельные подзадачи. Однако раздельная оптимизация компонентов не полностью соответствует конечной цели — повышению точности распознавания речи. Кроме того, такая разработка требует длительной настройки отдельных модулей, что замедляет создание новых ASR систем.
Стремительное развитие глубоких нейронных сетей и наличие явных недостатков у классических гибридных ASR систем послужили толчком к развитию сквозных (end-to-end) подходов к моделированию систем автоматического распознавания речи. Такие методы подразумевают объединение компонентов ASR системы в одну целостную искусственную нейронную сеть, оптимизация которой осуществляется по критериям, напрямую связанным с повышением точности распознавания речи. Это также позволяет сократить число операций для получения новых ASR систем, что существенно упрощает и ускоряет про-
цесс разработки. Все это привело к тому, что основной вектор развития ASR сдвинулся в сторону сквозных подходов.
С развитием сквозных методов обучения ASR систем возникла неформальная битва между классическими и сквозными подходами (C. Lüscher [1]). Однако в случае наличия большого количества обучающих данных (тысячи часов транскрибированных речевых аудиозаписей) и соответствующих вычислительных ресурсов, сквозные методы позволяют достигнуть большей точности распознавания речи в общих сценариях использования. Об этом свидетельствуют работы от ведущих технологических компаний, таких как Google (T. Sainath [2] - одно из первых внедрений сквозной ASR системы в продуктовое решение, переместив распознавание речи непосредственно на вычислительные мощности смартфона, что значительно ускорило процесс получения результатов распознавания и сократило нагрузку на облачные сервисы), Amazon (Y. Wang [3]), Microsoft (J. Li [4]) и другие. Развитием данной технологии также заинтересованы различные высшие учебные заведения по всему миру, такие как Стэнфорд, университет Джона Хопкинса, Кембриджский университет, университет Аалто и другие. Из российских исследователей, развивающих ASR системы, можно выделить А. Карпова, И. Кипяткову, Н. Томашенко, М. Кореневского, Ю. Хохлова, И. Меденникова, А. Романенко, А. Савченко, Н. Карпова, Н. Михайловского, Н. Шмырева и других.
Несмотря на активное развитие сквозных ASR систем, они все еще имеют недостатки в ряде задач. К ним можно отнести проблему повышения быстродействия ASR систем, решение которой позволяет сократить объем вычислительных ресурсов, требуемых в процессе обучения и работы. Также стоит выделить проблему смещения контекста - распознавание редких и внесловар-ных слов (ключевых слов), которые могут быть даже неизвестны заранее. Данная задача особенно актуальна в условиях постоянного развития языков.
Целью диссертационной работы является разработка методов повышения быстродействия, а также повышения точности распознавания ключевых слов для сквозных систем автоматического распознавания речи.
Для достижения поставленной цели были сформулированы и решены следующие задачи:
1. Разработка методов повышения быстродействия сквозных ЛБИ, систем.
2. Разработка методов смещения контекста для повышения точности распознавания ключевых слов.
3. Подготовка тестовых наборов данных и определение списка ключевых слов для оценки методов смещения контекста.
4. Оценка эффективности разработанных методов для сквозных ЛБИ, систем на основе экспериментальных исследований и сравнения полученных результатов с показателями существующих решений.
5. Внедрение предложенных методов для корпоративного и открытого использования, а также участия в международных соревнованиях по распознаванию речи.
Объектом исследования данной работы являются сквозные системы автоматического распознавания речи.
Предмет исследования. Методы и инструментальные средства, обеспечивающие реализацию сквозных систем автоматического распознавания речи.
Методология и методы исследования. Для решения поставленных задач в данной диссертационной работе использовались методы и подходы цифровой обработки сигналов, машинного обучения, теории вероятностей и математической статистики, а также методы оценки точности результатов распознавания ЛБИ, систем.
Научная новизна:
1. Разработан метод повышения быстродействия сквозных ЛБИ, систем, отличающийся использованием новой архитектуры глубокой нейронной сети исопу-Соп£огшег с блоками понижения и повышения входной размерности, связанных пропускными соединениями и дополнительной функцией ошибки. Данный метод позволяет уменьшить число вычислительных операций внутри блока энкодера с помощью прогрессивного сжатия акустического сигнала во временной последовательности без существенной потери информации.
2. Разработан метод повышения быстродействия и точности распознавания заранее известных ключевых слов, отличающийся использованием акустического детектора слов на основе графа контекста с альтернативными транскрипциями. Данный метод позволяет детектировать ключевые слова параллельно с основным процессом декодирования с последующим исправлением ошибок распознавания.
3. Разработан метод повышения точности распознавания заранее неизвестных внесловарных слов, отличающийся объединением модифицированного графа декодирования и сквозного блока энкодера, дообученного с помощью функции максимальной взаимной информации. Данный метод позволяет декодировать произвольные последовательности языковых единиц, сглаживая их пиковое распределение вероятностей, что увеличивает вариативность гипотез распознавания.
Теоретическая значимость работы.
Теоретическая значимость работы заключается в разработке новых и модернизации существующих методов повышения быстродействия, а также повышения точности распознавания ключевых слов для сквозных систем автоматического распознавания речи.
Практическая значимость работы.
Материалы диссертационной работы используются группой компаний ООО «ЦРТ», выдавшей акт внедрения, для повышения эффективности работы корпоративных решений на основе сквозных ЛБИ, систем, повышая точность распознавания речи и снижая затраты на вычислительные ресурсы. Предложенные методы также использовались компанией при участии в международных соревнованиях по распознаванию речи СШМЕ-7/8, что в совокупности позволило занять призовые места.
Основные положения, выносимые на защиту:
1. Метод повышения быстродействия сквозных ЛБИ, систем, отличающийся использованием новой архитектуры глубокой нейронной сети Исопу-Сопйгшег с блоками понижения и повышения входной размерности,
связанных пропускными соединениями и дополнительной функцией ошибки.
2. Метод повышения быстродействия и точности распознавания заранее известных ключевых слов для сквозных ASR систем, отличающийся использованием акустического детектора слов на основе графа контекста с альтернативными транскрипциями.
3. Метод повышения точности распознавания заранее неизвестных внесло-варных слов для сквозных ASR систем, отличающийся объединением модифицированного графа декодирования и сквозного блока энкодера, дообученного с помощью функции максимальной взаимной информации.
Достоверность и апробация результатов работы.
Достоверность данной работы обеспечивается результатами сравнения оценки эффективности предложенных методов с методами других авторов, а также корректностью работы предложенных методов в составе программных продуктов компании ООО «ЦРТ» и их использованию в международных соревнованиях по распознаванию речи.
Результаты, полученные в ходе выполнения данной работы, докладывались на следующих международных и российских конференциях: ICASSP (Греция, 2023), INTERSPEECH (Китай, 2020; Греция, 2024), SPECOM (Россия, 2020), XLIX научная и учебно-методическая конференция Университета ИТМО (Россия, 2020), IX Всероссийский конгресс молодых ученых (Россия, 2020).
Публикации. По материалам диссертационной работы опубликовано 7 статей, в их числе 5 статей, индексируемых в международных базах Scopus и Web of Science и 2 статьи в журналах из перечня ВАК.
Личный вклад автора. Результаты диссертации, описанные в научной новизне, теоретической и практической значимости, полностью принадлежат автору. Автором лично решены все задачи диссертации.
Внедрение результатов работы. Результаты, полученные в ходе выполнения данной диссертационной работы, были использованы в трех прикладных научных исследованиях: НИР 718574 (участник), НИР 321315 (участник), НИР 620173 (руководитель проекта).
Предложенные методы были внедрены в продуктовые и исследовательские решения компании ООО «ЦРТ», что позволило повысить быстродействие и общую точность распознавания речи ЛБИ, систем.
Предложенные методы также были опубликованы в виде готового программного кода на базе открытых инструментов разработки сквозных ЛБИ, систем ЕБРпе! и КеМо.
Соответствие паспорту специальности. Полученные результаты соответствуют п. 7 «Модели, методы, архитектуры, алгоритмы, форматы, протоколы и программные средства человеко-машинных интерфейсов, компьютерной графики, визуализации, обработки изображений и видеоданных, систем виртуальной реальности, многомодального взаимодействия в социокиберфизических системах» паспорта специальности 2.3.5 - «Математическое и программное обеспечение вычислительных систем, комплексов и компьютерных сетей».
Объем и структура работы. Диссертация состоит из введения, четырех глав и заключения. Полный объем диссертации составляет 117 страниц с 23 рисунками и 12 таблицами. Список литературы содержит 107 наименований.
ГЛАВА 1. Введение в область автоматического распознавания речи
1.1 Постановка задачи
Автоматическое распознавание речи (Automatic Speech Recognition, ASR) представляет собой процесс преобразования произнесенной речи в соответствующий ей текст - рисунок 1.1. На данный момент ASR системы широко используются в различных «умных» устройствах, значительно упрощая процесс человеко-машинного взаимодействия и делая его более натуральным для пользователей.
Рисунок 1.1 — Структурная схема ASR системы.
Первые ASR системы были способны распознавать только произнесения отдельных цифр. Для этого использовалось сравнение входного произнесения с уже имеющимися в базе предзаписанными шаблонами посредством применения алгоритма динамического программирования DTW (Dynamic Time Warping ) [5]. Однако данный подход имеет ряд проблем, связанных со сложностью подбора метрик вычисления дистанции между шаблонами и входным произнесением, а также неопределенностью с выбором таких шаблонов и отсутствием статистических и вероятностных основ. Поэтому вскоре был сформулирован вероятностный подход по преобразованию входного акустического сигнала в выходную последовательность слов.
Статистическое распознавание последовательностей фокусируется на оценке максимальной апостериорной вероятности. Задача данного подхода заключается в преобразовании входной последовательности акустических признаков сигнала длиной Т: X = {xt Е Rd\t = 1 ,...,Т} в выходную последовательность
слов }У = {п)п Е V\п = 1,..., N}, где (I и V это размерность акустических признаков и размер словаря слов, соответственно. Наиболее вероятная последовательность слов \¥* может быть оценена посредством максимизации условной вероятности Р(IV\Х) для всех возможных последовательностей слов из словаря V *:
IV * = агдтахР (Ж\Х) (1.1)
ш ЕУ *
Решение данного выражения является основной задачей ЛБЯ.
Классические гибридные подходы используют факторизацию выражения 1.1 с помощью теоремы Байеса:
р (Ж|Х) = (1.2)
где Р(X\\¥) представляет собой акустическую модель, а Р(Ж) - языковую модель (вероятность последовательности слов W). Р(X) в данном случае можно пренебречь, поскольку входная последовательность акустических признаков X уже дана. В результате получается следующее выражение:
W * = агдтахР (X |W )Р (W) (1.3)
WeV *
1.2 Оценка результатов распознавания речи
Общепринятым способом оценки точности распознавания ASR систем является вычисление словной ошибки распознавания (Word Error Rate, WER). WER описывает количество элементарных действий редактирования ( I - вставка, D - удаление и S - замена слова), необходимых для преобразования эталонной транскрипции (длиной N) в гипотезу, полученную в результате распознавания, согласно расстоянию Левенштейна. В конечном итоге WER вычисляется как:
WER = I + D' + S« 100
(1.4)
При сравнении результатов двух ASR систем можно использовать отличие значения WER одной системы, относительно другой - WERR (WER relative), которое вычисляется в соответствии с формулой:
WER-t - WERo
WERR = W-W *100 (L5>
Одним из недостатков вычисления метрики WER является тот факт, что ошибки в распознавании только одной буквы в коротком и длинном слове имеют один и тот же вес для финального значения WER. Ошибка лишь в одной букве окончания слова также приведет к ошибке распознавания всего слова, хотя смысл слова останется понятным. В подобных случаях может быть полезным оценить еще и символьную ошибку распознавания (Character Error Rate, CER). CER вычисляется по той же формуле, что и WER, только с условием, что все элементарные операции редактирования осуществляются на уровне символов, а не слов.
Помимо WER и CER существуют и другие метрики точности распознавания речи, связанные с семантикой и общей информацией, которые могут быть более полезными для повышения точности работы систем, использующих результаты ASR распознавания [6,7].
1.3 Классические гибридные системы распознавания речи
Автоматическое распознавание речи традиционно использует скрытые марковские модели (Hidden Markov Models, HMM), описывающие временную изменчивость, в сочетании с моделями гауссовых смесей (Gaussian Mixture Models, GMM), задача которых состоит в вычислении вероятности эмиссии состояний HMM для моделирования акустических характеристик фонем. Появление глубоких нейронных сетей (Deep Neural Network, DNN) в составе ASR систем в качестве акустической модели привело к отказу от GMM как финальной акустической модели и показало значительной скачок в повышении
точности распознавания речи. Однако создание и обучение таких систем требует большое количество промежуточных шагов моделирования, некоторые из которых все еще требуют использование СММ.
1.3.1 Структура классической системы автоматического
распознавания речи
Структурную схему классической ЛБИ, системы можно представить следующим образом (рисунок 1.2).
Рисунок 1.2 — Структурная схема классической ЛБИ, системы
На первом шаге входная речь поступает на блок обработки сигнала и извлечения акустических признаков. Здесь осуществляется предварительная шумоочистка сигнала, сегментирование его на небольшие отрезки (кадры) и извлечение информативных акустических признаков, которые позволяют уменьшить размерность обрабатываемого сигнала без существенной потери информации.
Акустические признаки подаются на акустическую модель, задача которой определить плотность распределения вероятностей акустических классов (например, фонем) для каждого кадра входного сигнала. Правила преобразования
слов в последовательность таких акустических классов задаются лексиконом (таблицей транскрипций). Языковая модель, в свою очередь, описывает вероятностные зависимости целевого языка и определяет вероятность конкретного слова в контексте предыдущих слов.
На основе полученных акустических вероятностей и статистики от языковой модели декодер генерирует наиболее вероятную последовательность слов, которая будет являться результатом распознавания всей системы.
Для обучения акустической модели используются базы данных на основе аудиозаписей речи с их текстовыми транскрипциями. Языковая модель может использовать те же текстовые транскрипции в совокупности с любым текстом на целевом языке.
1.3.2 Обработка входного речевого сигнала и извлечение
акустических признаков
Обработка оцифрованного речевого сигнала во временной шкале является достаточно русурсоемким процессом, поскольку только одна его секунда содержит 8000, 22050 или 44100 отсчетов, в соответствии с широко распространнеными частотами дискретизации 8 КГц, 22.05 КГц и 44.1 КГц. Большинство ASR систем используют компактные информативные признаки, извлекаемые из звукового сигнала, для уменьшения числа отсчетов и дополнительной фильтрации лишней информации.
Одними из наиболее широко используемых видов акустических признаков являются Мел-частотные кепстральные коэффициенты (Mel-Frequency Cepstral Coefficients , MFCC) [8]. Их эффективность заключается в использовании фильтрации, коррелирующей с человеческой системой восприятия звука, и большом снижении конечной размерности сигнала. Процесс получения MFCC признаков представлен на рисунке 1.3.
Log-frequency power spectrog
-У
Звуковой сигнал
MFCC признаки
Сегментация на кадры сигнала
Быстрое преобразование Фурье (FFT)
Рисунок 1.3 — Процесс получения MFCC признаков
Предыскажение (pre-emphasis) усиливает амплитуду высоких частот и уменьшает амплитуды более низких, приводя их к балансному состоянию, что улучшает детектирование звуковых фонем.
Далее звуковой сигнал разбивается на временные отрезки (framing) — кадры сигнала длиной 20-30 мс в пределах которых считается, что сигнал является стационарным и неизменным. Такие кадры берутся обычно каждые 10 мс, что создает перекрытия между соседними кадрами в 10-20 мс. Таким образом для 1 секунды звукового сигнала получается 100 отдельных кадров.
Каждый кадр аудио записи попадает на блок быстрого преобразования Фурье (Fast Fourier Transform, FFT) для перехода в спектральное представление сигнала. Для имитации слуховой системы человека используется дополнительный переход от частоты в Мел-кепстральную размерность с последующим применением Мел-частотных банков треугольных фильтров, задача которых отфильтровать наиболее значимые компоненты сигнала для человеческого восприятия. Число фильтров зависит от частоты дискретизации входного сигнала. Для 8 КГц обычно используют 40 фильтров, для 16 КГц и более используют 80 фильтров. В результате получаются так называемые FBANK (Mel-frequency filterbank log energies) признаки размерностью 40 или 80 отсчетов.
Следующим шагом является применение логарифмического дискретного косинусного преобразования (Discrete Cosine Transform, DCT) для полученных
FBANK признаков. Оно преобразует признаки из мел-кепстрального представления сигнала во временное. DCT осуществляет декорреляцию признаков, что позволяет использовать меньшее число коэффициентов (например, 13 вместо 40 для частоты дискретизации сигнала 8 КГц).
Для снижения вариативности между произнесениями используется нормализация полученных акустических признаков по среднему значению (Cepstral Mean Normalization, CMN) и дисперсии (Variance Normalization, VN ) [9].
1.3.3 Акустическое моделирование
Для удобства моделирования акустического представления слов используют их составные части - акустические классы. Для классических подходов принято использовать фонемы - отдельные звуковые единицы речи. Так слово «кот» состоит из последовательности фонем «k o t». Правила разбиения слов на фонемы задаются с помощью лексикона (таблицы транскрипций), который определяется специалистами в области фонетики или программными средствами, построенными на основе фонетических правил целевого языка. Таким образом, каждое слово можно разбить на последовательность акустических классов (в данном случае - фонем). В связи с наличием коартикуляции (изменение звучания звука в зависимости от предшествующего или последующего звука) в качестве акустических классов более точно использовать фонемы в контексте других фонем - трифоны. Так, слов «кот» будет состоять из трифонов «_ko kot ot_».
Временная вариативность произнесений описывается с помощью HMM. Для моделирования одного акустического класса (трифона) обычно используется HMM модель, состоящая из трех состояний. В качестве наблюдения используются входные акустические признаки, а вероятность эмиссии конкретного состояния трифона вычисляется с помощью GMM.
Обучение GMM-HMM модели осуществляется с помощью алгоритма максимизации правдоподобия (Expectation Maximization, EM), в процессе которого
корректируются границы выравнивания акустических классов с акустическими признаками сигнала (на нулевом шаге границы размечаются равномерно) для улучшения обобщения ОМЫ. Параметры НММ далее пересчитываются согласно алгоритму Баум-Велша. Структурная схема такого обучения представлена на рисунке 1.4.
Рисунок 1.4 — Получение выравнивания путем обучения HMM-GMM модели. SIL (silence) является вспомогательным акустическим классом для тишины
В результате работы EM-алгоритма получается GMM-HMM модель, с помощью которой формируется выравнивание данных на условно точные границы по нарезанным кадрам с соответствующими им акустическими классами. Эта информация используется для обучения классификатора акустических классов на основе глубокой нейронной сети (Deep Neural Network, DNN), которая далее заменит GMM модель.
1.3.4 Языковое моделирование
В качестве языковой модели в классических ASR системах используется статистическая n-грамм модель (n-gram language model) [10]. Ее основным свойством является предположение о том, что вероятность текущего слова зависит только от п — 1 предыдущих слов.
Обучение n-gram языковой модели осуществляется с помощью текстовых корпусов, где вероятность каждой n-граммы оценивается по критерию максимального правдоподобия как количество вхождений текущей n-граммы, разделенных на количество вхождений контекста данной n-граммы (п—1 предыдущих слов):
U( I А С {Wi—n+i...Wi) ( , Р (Wi\Wi—n+i...Wi — i) = —-т (1.6)
С (wl—n+i...wl—i)
Для оценки вероятностей n-грамм, которые не встретились в обучающем текстовом корпусе, используют вероятности существующих n-грамм более низкого порядка. Это выполняется с помощью алгоритмов сглаживания, основными из которых являются сглаживания Гуда-Тьюринга и Кнесера-Нея, сравнение которых представлено в [11].
Качество полученной языковой модели определяется с помощью оценки коэффициента неопределенности (perplexity, PPL) для тестового корпуса:
PPL(T) = 2Н(Т) = Р (Т)—^ (1.7)
Значение PPL имеет корреляцию с WER [12], следовательно, языковая модель с меньшим значением PPL должна показывать лучшую точность распознавания в составе ASR системы.
1.3.5 Декодирование
Декодер решает задачу поиска наиболее вероятной цепочки слов на основе вероятностей, полученных от акустической и языковой моделей:
Р (x|u>)P (w)
W = argmaxP (w|x) = argmax-——-= argmaxP (x|u>)P (w) (1.8)
W W i (x) w
Объединение всех элементов системы в одну структуру для декодирования осуществляется с помощью взвешенного конечного преобразователя (Weighted
Finite State Transducer, WFST) [13], структурная схема которого представлена на рисунке 1.5.
Рисунок 1.5 — Структурная схема декодера на основе WFST графа
Такой WFST граф декодирования осуществляет поэтапное преобразование выходной последовательности от акустической модели в итоговый результат декодирования. Граф декодирования представляет собой композицию четырех отдельных WFST графов:
— Н - отображение связанных состояний НММ (выходы акустической модели) в контекстно зависимые фонемы (трифоны).
— С - отображение трифонов в фонемы.
— Ь - отображение последовательности фонем в соответствующие им слова согласно правилам, указанным в лексиконе.
— С - языковая модель, определяющая вероятность полученного слова в контексте предыдущих предсказаний.
В результате получается НСЮ граф распознавания:
HCLG = min(det(Я о min(det(C о min(det(L о G)))))) (1.9)
где min и det это операции минимизации и детерминизации на графах, соответственно.
Декодирование по полученному WFST графу осуществляется с помощью алгоритма Витерби [14], задача которого заключается в поиске наиболее вероятной гипотезы распознавания. Для ускорения процесса декодирования используется лучевой поиск с ограниченным пространством поиска и различными методиками прореживания гипотез [15].
1.3.6 Критерий разделения последовательностей
Стандартное обучение акустической модели на основе DNN с помощью функции ошибки Cross Entropy (CE) подразумевает, что предсказания на каждом кадре сигнала независимы друг от друга. Однако это противоречит природе нашей речи. Использование в обучении критерия разделения последовательностей (Sequence-Discriminative Training, SDT) [16] позволяет сократить это дисбаланс, что улучшает итоговую точность распознавания ASR системы.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы и модели автоматического распознавания речи на внедоменных данных2025 год, кандидат наук Митрофанов Антон Андреевич
Разработка и исследование методов и алгоритмов для анализа устной речи с использованием дифонов на основе априорной сегментации2017 год, кандидат наук Ниценко, Артём Владимирович
Разработка средств исследования и повышения помехоустойчивости систем автоматического распознавания голосовых команд в телефонии2014 год, доктор наук Левин Евгений Калманович
Алгоритмы и программные средства автоматического текстонезависимого распознавания личностей по голосу2015 год, кандидат наук Шулипа Андрей Константинович
Распознавание звучащей русской речи в теоретическом и экспериментальном освещении: семейные, возрастные и гендерные аспекты лингвистической идентификации личности2013 год, кандидат наук Грачев, Александр Михайлович
Список литературы диссертационного исследования кандидат наук Андрусенко Андрей Юрьевич, 2025 год
Список литературы
1. RWTH ASR Systems for LibriSpeech: Hybrid vs Attention / Christoph Liischer, Eugen Beck, Kazuki Irie et al. // Interspeech 2019.
— ISCA, 2019. — Pp. 231-235.
2. Streaming End-to-end Speech Recognition for Mobile Devices / Yanzhang He, Tara N. Sainath, Rohit Prabhavalkar et al. // ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP).
— 2018. — Pp. 6381-6385.
3. End-to-end Anchored Speech Recognition / Yiming Wang, Xing Fan, I-Fan Chen et al. // ICASSP 2019. — 2019.
4. On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition / Jinyu Li, Yu Wu, Yashesh Gaur et al. — 2020.
5. Sakoe Hiroaki, Seibi Chiba. Dynamic programming algorithm optimization for spoken word recognition. — IEEE transactions on acoustics, speech, and signal processing 26, no. 1 (1978): 43-49.
6. Roy Somnath. Semantic-WER: A Unified Metric for the Evaluation of ASR Transcript for End Usability // ArXiv. — 2021. — Vol. abs/2106.02016.
7. Semantic Distance: A New Metric for ASR Performance Analysis Towards Spoken Language Understanding / Suyoun Kim, Abhinav Arora, Duc Le et al. // Interspeech. — 2021.
8. Muda Lindasalwa, Begam Mumtaj, Elamvazuthi Irraivan. Voice Recognition Algorithms using Mel Frequency Cepstral Coefficient (MFCC) and Dynamic Time Warping (DTW) Techniques // ArXiv. — 2010. — Vol. abs/1003.4083.
9. "Efficient Cepstral Normalization for Robust speech Recognition-/ Fu-Hua "Liu, Richard Stern, Xuedong Huang, Alejandro-Acero // Proc. of ARPA Workshop on Human Language Technology. — 1993. — Pp. 69-74.
10. Jelinek F. Continuous speech recognition by statistical methods // Proceedings of the IEEE. — 1976. — Vol. 64, no. 4. — Pp. 532-556.
11. Chen Stanley F., Goodman Joshua. An empirical study of smoothing techniques for language modeling // Computer Speech Language. — 1999. — Vol. 13, no. 4. — Pp. 359-394.
12. S. Chen D. Beeferman R. Rosenfeld. Evaluation metrics for language models // DARPA Broadcast News Transcription and Understanding Workshop. — 1998.
13. Mohri Mehryar, Pereira Fernando, Riley Michael. Weighted finite-state transducers in speech recognition // Computer Speech Language. — 2002. — Vol. 16, no. 1. — Pp. 69-88.
14. Rabiner L.R. A tutorial on hidden Markov models and selected applications in speech recognition // Proceedings of the IEEE. — 1989. — Vol. 77, no. 2. — Pp. 257-286.
15. Look-ahead techniques for fast beam search / S. Ortmanns, A. Eiden, H. Ney, N. Coenen // 1997 IEEE International Conference on Acoustics, Speech, and Signal Processing. — Vol. 3. — 1997. — Pp. 1783-1786 vol.3.
16. Povey Daniel, Woodland Philip C. Minimum Phone Error and I-smoothing for improved discriminative training // ICASSP. — 2002. — Vol. 1. — Pp. I-105-I-108.
17. Maximum mutual information estimation of hidden Markov model parameters for speech recognition / Lalit R. Bahl, Peter F. Brown, Peter V. de Souza, Robert L. Mercer // ICASSP. — 1986. — Vol. 11. — Pp. 49-52.
18. End-to-end Speech Recognition Using Lattice-free MMI / Hossein Hadian, Hossein Sameti, Daniel Povey, Sanjeev Khudanpur // Interspeech. — 2018.
19. Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks / Alex Graves, Santiago Fernández, Faustino Gomez, Jürgen Schmidhuber // Proc. ICML. — 2006.
20. Chorowski Jan, Jaitly Navdeep. Towards Better Decoding and Language Model Integration in Sequence to Sequence Models // Interspeech. — 2016.
21. Graves Alex. Sequence Transduction with Recurrent Neural Networks // Proceedings of the 29th International Conference on Machine Learning. — 2012.
22. Hochreiter Sepp, Schmidhuber Jürgen. Long Short-Term Memory // Neural Computation. — 1997. — Vol. 9. — Pp. 1735-1780. — URL: https://api. semanticscholar.org/CorpusID:1915014.
23. Recurrent Neural Aligner: An Encoder-Decoder Neural Network Model for Sequence to Sequence Mapping / Hasim Sak, Matt Shannon, Kanishka Rao, Francoise Beaufays // Interspeech. — 2017.
24. Sutskever Ilya, Vinyals Oriol, Le Quoc V. Sequence to Sequence Learning with Neural Networks // NIPS. — 2014.
25. Bahdanau Dzmitry, Cho Kyunghyun, Bengio Yoshua. Neural Machine Translation by Jointly Learning to Align and Translate // CoRR. — 2014. — Vol. abs/1409.0473.
26. Listen, attend and spell: A neural network for large vocabulary conversational speech recognition / William Chan, Navdeep Jaitly, Quoc V. Le, Oriol Vinyals // ICASSP. — 2016. — Pp. 4960-4964.
27. Online and Linear-Time Attention by Enforcing Monotonic Alignments / Colin Raffel, Minh-Thang Luong, Peter J. Liu et al. // PMLR. — 2017.
28. Chiu Chung-Cheng, Raffel Colin. Monotonic Chunkwise Attention // International Conference on Learning Representations. — 2017.
29. Monotonic Infinite Lookback Attention for Simultaneous Machine Translation / N. Arivazhagan, Colin Cherry, Wolfgang Macherey et al. // Annual Meeting of the Association for Computational Linguistics. — 2019.
30. Wang Dong, Wang Xiaodong, Lv Shaohe. An Overview of End-to-End Automatic Speech Recognition // Symmetry. — 2019. — Vol. 11, no. 8.
31. A Comparison of Sequence-to-Sequence Models for Speech Recognition / Ro-hit Prabhavalkar, Kanishka Rao, Tara N. Sainath et al. // Interspeech. — 2017.
32. Kim Suyoun, Hori Takaaki, Watanabe Shinji. Joint CTC-attention based end-to-end speech recognition using multi-task learning // ICASSP. — 2017. — Pp. 4835-4839.
33. The Kaldi speech recognition toolkit / Daniel Povey, Arnab Ghoshal, Gilles Boulianne et al. // IEEE Workshop on Automatic Speech Recognition and Understanding. — 2011. — . — URL: https://github.com/kaldi-asr/kaldi.
34. Improving Acoustic Models For Russian Spontaneous Speech Recognition / Alexey Prudnikov, Ivan Medennikov, Valentin Mendelev et al. // International Conference on Speech and Computer. — Springer International Publishing, 2015. — . — Pp. 234-242.
35. Kipyatkova Irina, Karpov Alexey. DNN-Based Acoustic Modeling for Russian Speech Recognition Using Kaldi // International Conference on Speech and Computer. — Springer International Publishing, 2016. — . — Pp. 246-253.
36. Deep Neural Networks in Russian Speech Recognition / Nikita Markovnikov, Irina Kipyatkova, Alexey Karpov, Andrey Filchenkov // Artificial Intelligence and Natural Language. — Springer International Publishing, 2017. — . — Pp. 54-67.
37. LibriSpeech: an ASR corpus based on public domain audio books / V. Panay-otov, G. Chen, D. Povey, S. Khudanpur // ICASSP. — 2015.
38. Hybrid CTC/Attention Architecture for End-to-End Speech Recognition / Shinji Watanabe, Takaaki Hori, Suyoun Kim et al. // IEEE Journal of Selected Topics in Signal Processing. — 2017. — Vol. 11. — Pp. 1240-1253.
39. Listen, attend and spell: A neural network for large vocabulary conversational speech recognition / William Chan, Navdeep Jaitly, Quoc V. Le, Oriol Vinyals // IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — IEEE, 2016. — Pp. 4960-4964.
40. Attention is All You Need / Ashish Vaswani, Noam Shazeer, Niki Parmar et al.
— NIPS'17. — Red Hook, NY, USA: Curran Associates Inc., 2017.
41. Conformer: Convolution-augmented Transformer for Speech Recognition / An-mol Gulati, James Qin, Chung-Cheng Chiu et al. // Proc. Interspeech 2020.
— 2020. — Pp. 5036-5040.
42. Purely sequence-trained neural networks for ASR based on lattice-free MMI / Daniel Povey, Vijayaditya Peddinti, Daniel Galvez et al. — 2016. — 09. — Pp. 2751-2755.
43. A Pruned Rnnlm Lattice-Rescoring Algorithm for Automatic Speech Recognition / Hainan Xu, Tongfei Chen, Dongji Gao et al. // 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2018. — Pp. 5929-5933.
44. Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability / Jinyu Li, Rui Zhao, Zhong Meng et al. // ArXiv.
— 2020. — Vol. abs/2007.15188.
45. A Streaming On-Device End-To-End Model Surpassing Server-Side Conventional Model Quality and Latency / Tara N. Sainath, Yanzhang He, Bo Li et al. // ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2020. — Pp. 6059-6063.
46. Recent Developments on Espnet Toolkit Boosted By Conformer / Pengcheng Guo, Florian Boyer, Xuankai Chang et al. // ICASSP 2021.
47. Conv-Transformer Transducer: Low Latency, Low Frame Rate, Streamable End-to-End Speech Recognition / Wenyong Huang, Wenchao Hu, Yu Ting Ye-ung et al. // Proc. Interspeech 2020. — 2020. — Pp. 5001-5005.
48. Burchi Maxime, Vielzeuf Valentin. Efficient Conformer: Progressive Downsam-pling and Grouped Attention for Automatic Speech Recognition // 2021 IEEE ASRU. — 2021. — Pp. 8-15.
49. Andrusenko Andrei, Laptev Aleksandr, Medennikov Ivan. Exploration of End-to-End ASR for OpenSTT - Russian Open Speech-to-Text Dataset. — SPECOM: 2020.
50. Irina Kipyatkova, Markovnikov Nikita. Experimenting with attention mechanisms in joint CTC-attention models for Russian speech recognition. — SPECOM: 2020.
51. Irina Kipyatkova. End-to-End Russian Speech Recognition Models with Multi-head Attention. — SPECOM: 2021.
52. The USTC-iFlytek systems for CHiME-5 Challenge / Jun Du, Tian Gao, Lei Sun et al. // 5th International Workshop on Speech Processing in Everyday Environments (CHiME 2018). — 2018.
53. Dalmia Siddharth, Kim Suyoun, Metze Florian. Situation informed end-to-end ASR for noisy environments // CHiME 2018 Workshop on Speech Processing in Everyday Environments. — ISCA, 2018. — . — Pp. 49-52.
54. CNN-based multichannel end-to-end speech recognition for everyday home environments / Nelson Yalta, Shinji Watanabe, Takaaki Hori et al. // 27th European Signal Processing Conference (EUSIPCO). — IEEE, 2019. — . — Pp. 1-5.
55. Braun Rudolf A, Madikeri Srikanth, Motlicek Petr. A Comparison of Methods for OOV-Word Recognition on a New Public Dataset // Proc. ICASSP 2021. — 2021. — Pp. 5979-5983.
56. Jasper: An End-to-End Convolutional Neural Acoustic Model / Jason Li, Vi-taly Lavrukhin, Boris Ginsburg et al. // Proc. Interspeech 2019. — 2019.
57. Quartznet: Deep Automatic Speech Recognition with 1D Time-Channel Separable Convolutions / Samuel Kriman, Stanislav Beliaev, Boris Ginsburg et al. // Proc. ICASSP. — 2020.
58. Improving the Training Recipe for a Robust Conformer-based Hybrid Model / Mohammad Zeineldeen, Jingjing Xu, Christoph Lüscher et al. // Proc. Interspeech. — 2022. — URL: http://arxiv.org/abs/2206.12955.
59. Efficient Transformers: A Survey / Yi Tay, Mostafa Dehghani, Dara Bahri, Donald Metzler // ACM Comput. Surv. — 2022. — URL: https://doi.org/10. 1145/3530811.
60. Beltagy Iz, Peters Matthew E., Cohan Arman. Longformer: The Long-Document Transformer // arXiv:2004.05150. — 2020.
61. Big bird: Transformers for longer sequences / Manzil Zaheer, Guru Guru-ganesh, Kumar Avinava Dubey et al. // Advances in Neural Information Processing Systems. — 2020.
62. Branchformer: Parallel MLP-Attention Architectures to Capture Local and Global Context for Speech Recognition and Understanding / Yifan Peng, Sid-dharth Dalmia, Ian Lane, Shinji Watanabe // Proc. PMLR. — 2022.
63. Fastformer: Additive Attention Can Be All You Need / Chuhan Wu, Fangzhao Wu, Tao Qi et al. // arXiv preprint arXiv:2108.09084. — 2021.
64. Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention / A. Katharopoulos, A. Vyas, N. Pappas, F. Fleuret // Proc. ICML. — 2020.
65. Sennrich Rico, Haddow Barry, Birch Alexandra. Neural Machine Translation of Rare Words with Subword Units // Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics. — 2016. — URL: https: //aclanthology.org/P16-1162.
66. Ronneberger Olaf, Fischer Philipp, Brox Thomas. U-Net: Convolutional Networks for Biomedical Image Segmentation // MICCAI. — 2015.
67. Agarap Abien Fred. Deep Learning using Rectified Linear Units (ReLU) // ArXiv. — 2018. — Vol. abs/1803.08375.
68. Lee Jaesong, Watanabe Shinji. Intermediate Loss Regularization for CTC-Based Speech Recognition // ICASSP 2021. — 2021.
69. ESPnet: End-to-End Speech Processing Toolkit / Shinji Watanabe, Takaa-ki Hori, Shigeki Karita et al. // Proc. of Interspeech. — 2018. — URL: http://dx.doi.org/10.21437/Interspeech.2018-1456.
70. SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition / Daniel S. Park, William Chan, Yu Zhang et al. // Interspeech. — 2019.
71. Kudo Taku, Richardson John. SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing // in Proc. EMNLP. — Brussels, Belgium: 2018.
72. Kingma Diederik P., Ba Jimmy. Adam: A Method for Stochastic Optimization // CoRR. — 2014. — Vol. abs/1412.6980.
73. Squeezeformer: An Efficient Transformer for Automatic Speech Recognition / Sehoon Kim, Amir Gholami, Albert Shaw et al. // NeurIPS. — 2022.
74. Pasad Ankita, Shi Bowen, Livescu Karen. Comparative Layer-Wise Analysis of Self-Supervised Speech Models // ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2022. — Pp. 1-5.
75. STCON System for the CHiME-7 Challenge / Tatiana Prisyach, Yuri Khokhlov, Maxim Korenevsky et al. // 7th International Workshop on Speech Processing in Everyday Environments (CHiME 2023). — 2023.
76. STCON System for the CHiME-8 Challenge / Anton Mitrofanov, Tatiana Prisyach, Tatiana Timofeeva et al. // 8th International Workshop on Speech Processing in Everyday Environments (CHiME 2024). — 2024.
77. Deep Context: End-to-end Contextual Speech Recognition / Golan Pundak, Tara N. Sainath, Rohit Prabhavalkar et al. // IEEE Spoken Language Technology Workshop (SLT). — 2018.
78. Contextual RNN-T For Open Domain ASR / Mahaveer Jain, Gil Keren, Jay Mahadeokar, Yatharth Saraf // Interspeech. — 2020.
79. PromptASR for contextualized ASR with controllable style / Xiaoyu Yang, Wei Kang, Zengwei Yao et al. // ICASSP. — 2024.
80. Contextualized Streaming End-to-End Speech Recognition with Trie-Based Deep Biasing and Shallow Fusion / Duc Le, Mahaveer Jain, Gil Keren et al. // Interspeech. — 2021.
81. Harding Philip, Tong Sibo, Wiesler Simon. Selective Biasing with Trie-based Contextual Adapters for Personalised Speech Recognition using Neural Transducers // INTERSPEECH 2023. — 2023.
82. SLM: Bridge the thin gap between speech and text foundation models / Mingqiu Wang, Wei Han, Izhak Shafran et al. // ASRU. — 2023.
83. SALM: Speech-augmented Language Model with In-context Learning for Speech Recognition and Translation / Zhehuai Chen, He Huang, Andrei Yu. An-drusenko et al. // ICASSP. — 2024.
84. Dixon Paul R., Hori Chiori, Kashioka Hideki. A Specialized WFST Approach for Class Models and Dynamic Vocabulary // Interspeech. — 2012.
85. Composition-based on-the-fly rescoring for salient n-gram biasing / Keith B. Hall, Eunjoon Cho, Cyril Allauzen et al. // Interspeech. — 2015.
86. Shallow-Fusion End-to-End Contextual Biasing / Ding Zhao, Tara N. Sainath, David Rybach et al. // Interspeech. — 2019.
87. Jung Namkyu, min Kim Geon, Chung Joon Son. Spell My Name: Keyword Boosted Speech Recognition // ICASSP. — 2022. — Pp. 6642-6646.
88. Galvez Daniel, Kaldewey Tim. GPU-Accelerated WFST Beam Search Decoder for CTC-based Speech Recognition // ASRU. — 2023.
89. Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks / Alex Graves, Santiago Fernandez, Faustino Gomez, Jürgen Schmidhuber // Proceedings of the 23rd international conference on Machine learning - ICML. — ACM Press, 2006. — Pp. 369-376.
90. Stateful Conformer with Cache-based Inference for Streaming Automatic Speech Recognition / Vahid Noroozi, Somshubra Majumdar, Ankur Kumar et al. // ArXiv. — 2024.
91. The STC Keyword Search System for OpenKWS 2016 Evaluation / Yuri Khokhlov, Ivan Medennikov, Aleksei Romanenko et al. — 2017. — Pp. 3602-3606.
92. Berg Axel, O'Connor Mark, Cruz Miguel Tairum. Keyword Transformer: A Self-Attention Model for Keyword Spotting // Interspeech. — 2021.
93. CB-Whisper: Contextual Biasing Whisper Using Open-Vocabulary Keyword-Spotting / Yuang Li, Yinglu Li, Min Zhang et al. // International Conference on Language Resources and Evaluation. — 2024.
94. Laptev Aleksandr, Majumdar Somshubra, Ginsburg Boris. CTC Variations Through New WFST Topologies // Proc. INTERSPEECH 2022. — 2022.
95. Nolden David, Schluter Ralf, Ney Hermann. Acoustic Look-Ahead for More Efficient Decoding in LVCSR // Interspeech. — 2011.
96. Zhang Yuekai, Sun Sining, Ma Long. Tiny Transducer: A Highly-Efficient Speech Recognition Model on Edge Devices // ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2021. — Pp. 6024-6028.
97. Fox Jennifer Drexler, Delworth Natalie. Improving Contextual Recognition of Rare Words with an Alternate Spelling Prediction Model // Interspeech. — 2022. — Vol. abs/2209.01250.
98. Dynamic Acoustic Unit Augmentation with BPE-Dropout for Low-Resource End-to-End Speech Recognition / Aleksandr Laptev, Andrei Andrusenko, Ivan Podluzhny et al. // Sensors. — 2021. — Vol. 21, no. 9.
99. Fast Conformer with Linearly Scalable Attention for Efficient Speech Recognition / Dima Rekesh, Samuel Kriman, Somshubra Majumdar et al. // ASRU. — 2023.
100. CTC-Segmentation of Large Corpora for German End-to-End Speech Recognition / Ludwig Kürzinger, Dominik Winkelbauer, Lujun Li et al. // Speech and Computer / Ed. by Alexey Karpov, Rodmonga Potapova. — Cham: Springer International Publishing, 2020. — Pp. 267-278.
101. Kim Juntae, Lee Yoonhan, Kim Eesung. Accelerating RNN Transducer Inference via Adaptive Expansion Search // IEEE Signal Processing Letters. — 2020. — Vol. 27. — Pp. 2019-2023.
102. Fast and Accurate OOV Decoder on High-Level Features / Yuri Khokhlov, Natalia Tomashenko, Ivan Medennikov, Aleksei Romanenko // Proc. Interspeech 2017. — ISCA, 2017. — Pp. 2884-2888. — URL: http://dx.doi.org/10.21437/ Interspeech.2017-1367.
103. Alumae Tanel, Tilk Ottokar, Asadullah. Advanced Rich Transcription System for Estonian Speech // arXiv e-prints. — 2019. — P. arXiv:1901.03601.
104. An Keyu, Xiang Hongyu, Ou Zhjian. CAT: A CTC-CRF based ASR toolkit bridging the hybrid and the end-to-end approaches towards data efficiency and low latency // Proc. INTERSPEECH 2021. — 2020. — P. 566-570.
105. Zeyer Albert, Schluter Ralf, Ney Hermann. Why does CTC result in peaky behavior? — 2021.
106. Common Voice: A Massively-Multilingual Speech Corpus / Rosana Ardila, Megan Branson, Kelly Davis et al. // International Conference on Language Resources and Evaluation. — 2019.
107. Dynamic Acoustic Unit Augmentation with BPE-Dropout for Low-Resource End-to-End Speech Recognition / A. Laptev, A. Andrusenko, I. Podluzhny et al. // Sensors. — 2021. — Vol. 21, no. 9.
Список иллюстрированного материала
1.1 Структурная схема ASR системы..........................................11
1.2 Структурная схема классической ASR системы ........................14
1.3 Процесс получения MFCC признаков....................................16
1.4 Получение выравнивания путем обучения HMM-GMM модели. SIL (silence) является вспомогательным акустическим классом для тишины......................................................................18
1.5 Структурная схема декодера на основе WFST графа..................20
1.6 Структурная схема сквозной ASR системы ..............................24
1.7 Пример жестких выравниваний для транскрипции «кот»..............26
1.8 Структурная схема CTC модели..........................................27
1.9 Работа жадного поиска CTC модели......................................29
1.10 Структурная схема RNN-T модели ......................................31
1.11 Правила переходов выравнивания RNN-T модели для слова «кот» . 32
1.12 Решение задачи машинного перевода с помощью модели энкодер-декодер............................................................34
1.13 Структурная схема AED модели..........................................36
2.1 Структурная схема Исопу-СопЮгтег модели со значениями
глубины и финального прореживания х16 и х4, соответственно. Синими стрелками обозначены пропускные соединения. Красными пунктирными стрелками изображены выходы промежуточных слоев модели, используемые для подсчета промежуточной функции
потерь CTC (inter CTC).......................... 47
2.2 Структурная схема блока понижения размерности в два раза (Downsampling x2) на основе слоев одномерно свертки Conv1d .... 48
2.3 Относительное изменение WER (%) для модели Uconv_D16-F8_v1 после применения во время обучения функции потерь inter CTC в случаях разного размера обучающего множества ........... 58
3.1 Структурная схема предложенного метода смещения контекста с помощью CTC-WS............................. 64
3.2 Граф контекста на основе композиции префиксного дерева с CTC топологией переходов для слов контекста gpu и geforce........ 65
3.3 Пример работы предложенного метода в случае CTC модели .... 68
3.4 Precision, Recall и WER в зависимости от значения веса смещения контекста (context biasing weight, ctcw) ................. 75
4.1 Структурная схема CTC-WFST ASR модели и ее модификация (желтая стрелка) на основе предложенного метода повышения точности распознавания OOV слов.................... 84
4.2 Сравнение вероятностей распределения акустических классов (языковых единиц) сквозной модели для двух вариантов обучения: только с СТС функцией потерь и с использованием 10 эпох ММ1 дообучения. Пунктиром обозначена вероятность вспомогательного символа «бланк». Остальные цвета отвечают за все остальные акустические классы............................ 87
4.3 Распределение числа правильно распознанных ООУ слов в зависимости от расстояния Левенштейна до ближайшего ШУ слова. 93
114
Список таблиц
1 Сравнение характеристик сквозных ASR систем ............ 38
2 Описание параметров Conformer_L и Conformer_S моделей...... 51
3 Параметры рассматриваемых моделей .................. 53
4 Результаты экспериментов при использовании обучающего множества LibriSpeech 100 часов. Изменение скорости работы указано в процентом соотношении при сравнении с базовой моделью Conformer_S, а ошибка распознавания (WER, %) указана
для двух тестовых множеств набора данных Librispeech........ 55
5 Результаты (WER, %) для лучших моделей, обученных с помощью LibriSpeech (LS) 460 и 960 часов ..................... 57
6 Результаты для CTC и RNN-T декодирования на тестовом наборе данных. СК - наличие активированного смещения контекста. Время - общее время декодирования без учета энкодера. P -Precision. R - Recall............................. 76
7 Работа предложенного CTC-WS метода в зависимости от использования альтернативных транскрипций и изменения размера списка смещения контекста. ....................... 78
8 Параметры использованных блоков энкодера и декодера ....... 88
9 Декодирование сквозной модели с помощью лучевого поиска для разных языковых единиц ......................... 90
10 Результаты предложенного метода декодирования сквозной ASR системы с применением TLG и TG графов ............... 90
11 Сравнение предложенного метода CTC+MMI+TG* с другими рассмотренными методами распознавания CTC ASR систем, использующих один и тот же энкодер .................. 91
12 Пример правильно распознанных ООУ слов и ближайших к ним ШУ слов согласно расстоянию Левенштейна. Жирным шрифтом выделены буквенные различия...................... 93
Приложение А. Акт о внедрении
Общество с ограниченной ответственностью «ЦРТ»
УТВЕРЖДАЮ Генеральный директор ООО «ЦРТ» Д.В. Дырмовский
15 " мая 2025 г
АКТ
о внедрении математических методов, описанных в диссертационной работе Андрусенко Андрея Юрьевича «Методы повышения быстродействия и точности распознавания ключевых слов для сквозных систем автоматического распознавания речи»
Описанные в диссертационной работе Андрусенко Андрея Юрьевича «Методы повышения быстродействия и точности распознавания ключевых слов для сквозных систем автоматического распознавания речи» математические методы и комплекс программных средств повышения производительности для сквозных систем автоматического распознавания речи были разработаны Андрусенко Андреем Юрьевичем в рамках выполнения своих должностных обязанностей и используются в продуктах общества с ограниченной ответственностью «ЦРТ».
Исключительные права на вышеуказанные результаты интеллектуальной деятельности (математические методы, алгоритмы, программное обеспечение и т. д.) принадлежат обществу с ограниченной ответственностью «ЦРТ».
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.