Методы и модели автоматического распознавания речи на внедоменных данных тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Митрофанов Антон Андреевич

  • Митрофанов Антон Андреевич
  • кандидат науккандидат наук
  • 2025, «Национальный исследовательский университет ИТМО»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 246
Митрофанов Антон Андреевич. Методы и модели автоматического распознавания речи на внедоменных данных: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет ИТМО». 2025. 246 с.

Оглавление диссертации кандидат наук Митрофанов Антон Андреевич

Содержание

Стр.

Реферат

Synopsis

Введение

Глава 1. Автоматическое распознавание речи на внедоменных данных

1.1 Постановка задачи машинного обучения в контексте распознавания речи

1.1.1 Постановка задачи обучения с учителем

1.1.2 Понятие домена данных

1.2 Архитектуры современных систем распознавания речи

1.2.1 Гибридные подходы

1.2.2 Сквозные подходы

1.2.3 Улучшение результатов распознавания речи с помощью языковых моделей

1.3 Особенности внедоменных данных для распознавания речи

1.3.1 Акустические смещения

1.3.2 Фонетические смещения

1.3.3 Лингвистические смещения

1.3.4 Концептуальные смещения

1.4 Методы адаптации к доменным смещениям

1.4.1 Дообучение акустических компонентов

1.4.2 Модуль предобработки речевого сигнала

1.4.3 Модуль ранжирования гипотез распознавания речи

1.4.4 Иные методы адаптации гибридных АРР

1.4.5 Адаптация сквозных систем

1.5 Методы оценки систем распознавания речи

1.5.1 Оценка качества распознавания

1.5.2 Оценка вычислительной эффективности

1.6 Выводы по главе

Стр.

Глава 2. Метод адаптивной аугментации речевых данных для

адаптации к акустическому смещению

2.1 Источники акустического смещения

2.2 Моделирование акустического смещения

2.3 Множества импульсных характеристик помещения

2.3.1 Измерение импульсных характеристик в реальных помещениях

2.3.2 Синтетическая генерация ИХП методом источников-изображений

2.4 Классификация и автоматический выбор импульсных характеристик помещения

2.5 Метод адаптации на основе классификации ИХП

2.6 Экспериментальная валидация метода

2.6.1 Описание экспериментальной установки

2.6.2 Результаты обучения модели распознавания речи

2.6.3 Интеграция метода адаптивного выбора ИХП в систему распознавания многодикторной речи

2.6.4 Практическая значимость результатов

2.7 Выводы по главе

Глава 3. Адаптация автоматического распознавания речи к

лингвистическому смещению

3.1 Введение

3.2 Переранжирование как метод адаптации к лингвистическому смещению

3.3 Структуры результатов распознавания

3.3.1 N-best списки

3.3.2 Решетки распознавания

3.4 Архитектура Lattice Transformer Language Model (LTLM)

3.4.1 Позиционное кодирование

3.4.2 Целевые значения и функция потерь

3.4.3 Одноэтапное переранжирование для адаптации к лингвистическому смещению

Стр.

3.5 Синтетическая генерация решеток для адаптации к лингвистическому смещению

3.6 Экспериментальная оценка адаптации к лингвистическому смещению

3.6.1 Экспериментальная установка и базовые модели

3.6.2 Обучение LT-LM

3.6.3 Эффективность предлагаемого подхода

3.6.4 Анализ вычислительной эффективности

3.6.5 Интеграция Ш-^М в промышленную систему распознавания русской речи

3.7 Заключение

Заключение

Словарь терминов

Список литературы

Список рисунков

Список таблиц

Приложение А. ПУБЛИКАЦИИ АВТОРА ПО ТЕМЕ ДИССЕРТАЦИИ

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Методы и модели автоматического распознавания речи на внедоменных данных»

Реферат

Актуальность темы. Автоматическое распознавание речи (АРР, Automatic Speech Recognition, ASR) является одной из ключевых технологий в современном мире, находящей широкое применение в различных областях - от голосовых помощников и систем диктовки до транскрибации деловых встреч и обработки телефонных разговоров. Несмотря на значительный прогресс в этой области за последние годы, существует ряд нерешенных проблем, особенно актуальных при работе с внедоменными данными.

Внедоменные данные - это данные, которые существенно отличаются от данных, использованных при обучении модели, по одному или нескольким параметрам. Современные системы распознавания речи демонстрируют высокую эффективность при работе с данными, соответствующими домену обучения, однако их производительность значительно снижается при обработке внедомен-ных данных, например, речь, содержащая специфические термины, акустические условия или лингвистические конструкции, отсутствовавшие в обучающей выборке.

Одной из основных проблем является существенное снижение качества распознавания речи при работе с аудиозаписями, сделанными в акустических условиях, отличных от обучающих данных. Это явление, известное как проблема акустического несоответствия доменов, проявляется при наличии реверберации, фонового шума, различных типов микрофонов или при записи в помещениях с разной акустикой. Традиционные методы аугментации данных, использующие случайный выбор импульсных характеристик помещения, не всегда эффективны в таких сценариях, особенно когда характеристики целевой среды заранее неизвестны или сильно варьируются.

Другой важной проблемой является несоответствие между результатами распознавания речи и текстовыми данными, используемыми для обучения языковых моделей. Системы ASR часто генерируют выходные данные, содержащие ошибки, пропуски или искажения, которые существенно отличаются от «чистых» текстовых корпусов, применяемых при обучении языковых моделей. Это несоответствие приводит к снижению эффективности ранжирования гипотез распознавания речи и ограничивает возможности по исправлению ошибок распознавания с помощью языковых моделей.

Существующие методы ранжирования гипотез, основанные на авторегрессионных языковых моделях, хотя и обеспечивают высокую точность, требуют значительных вычислительных ресурсов и времени, что затрудняет их применение в промышленных системах.

Решение этих проблем требует разработки новых методов построения акустических и языковых моделей, способных эффективно обрабатывать внедо-менные данные и преодолевать разрыв между «зашумленными» результатами распознавания и «чистыми» текстовыми данными. Это особенно важно для разработки универсальных систем ASR, способных работать в различных условиях без необходимости переобучения или сложной адаптации под каждый конкретный сценарий использования.

Актуальность данной работы обусловлена растущим спросом на надежные системы распознавания речи, способные эффективно функционировать в разнообразных акустических условиях и корректно обрабатывать результаты распознавания с помощью языковых моделей, что имеет важное практическое значение для широкого спектра приложений - от систем голосового управления и виртуальных ассистентов до решений для автоматизации бизнес-процессов и обеспечения доступности информации.

Степень разработанности темы. При обработке внедоменных данных производительность современных систем распознавания речи значительно снижается вследствие различных типов доменных смещений: акустических (изменения условий записи и характеристик сигнала), лингвистических (изменения распределения целевых последовательностей слов) и концептуальных (изменение связи между устной речью и письменной транскрипцией). Существует множество методов адаптации систем распознавания речи к внедоменным данным, включающих дообучение моделей на целевых данных, применение модулей предобработки речевого сигнала, использование внешних языковых моделей и аугментацию обучающих данных. [1] В данной диссертационной работе основное внимание уделяется двум ключевым направлениям: методам аугментации речевых данных для адаптации акустических моделей к внедоменным условиям записи и методам построения языковых моделей для эффективного ранжирования множества гипотез распознавания речи.

Для повышения робастности систем распознавания речи к акустическим смещениям доменов наиболее широко применяются методы аугментации частотно-временных признаков, такие как SpecAugment [2], осуществляющие

маскирование частотных и временных областей спектрограммы, и временные преобразования, включающие изменение скорости речи (Speed Perturbation). Эффективным подходом к имитации различных акустических условий среды является пространственная аугментация на основе импульсных характеристик помещений (Room Impulse Response, RIR), позволяющая модулировать параметры реверберации через свертку исходного сигнала с импульсными характеристиками целевого помещения. Современные системы [3] часто комбинируют различные методы аугментации для максимальной эффективности. Однако существующие подходы основаны на случайном выборе аугментирующих параметров и импульсных характеристик помещения из предопределённого множества, что не гарантирует соответствие целевым акустическим условиям, особенно когда характеристики целевой среды заранее неизвестны или сильно варьируются.

В области построения языковых моделей для ранжирования множества гипотез распознавания речи доминируют традиционные N-граммные языковые модели, обеспечивающие ограниченный контекст, и рекуррентные нейронные языковые модели (RNNLM), которые применяются для ранжирования множества гипотез распознавания речи с помощью сокращенного через объеденения памяти схожих гипотез поиска (Pruned RNNLM Lattice rescoring) [4]. Современные языковые модели на базе архитектуры трансформер демонстрируют высокую точность за счет механизмов внимания, моделирующих долгосрочные зависимости, однако требуют последовательной авторегрессионной обработки каждой гипотезы распознавания речи, что приводит к высокой вычислительной сложности. Использование авторегрессионных моделей для ранжирования множества гипотез распознавания речи требует линейного по количеству гипотез числа обращений к модели, причем сходство между гипотезами не учитывается, что существенно ограничивает применимость трансформеров в задачах ранжирования. Кроме того, рекуррентные модели ограничены в способности к запоминанию долгосрочных зависимостей, а архитектуры трансформеров не адаптированы для обработки множества схожих текстовых последовательностей, которыми являются гипотезы распознавания речи.

Разработкой технологий автоматического распознавания речи активно занимаются ведущие научные центры и исследовательские группы по всему миру, включая Санкт-Петербургский политехнический университет Петра Великого, Ульмский университет, Университет Джона Хопкинса, Технический университет в Брно, а также промышленные лаборатории крупных технологических компа-

ний, таких как Яндекс, Сбербанк, МТС, Alibaba Group, Google и Microsoft. Среди российских исследователей, внесших значительный вклад в развитие систем автоматического распознавания речи, следует отметить работы Ю. Н. Матвеева, А. А. Карпова, Д. В. Иванько, Н. А. Томашенко, И. П. Меденникова, В. А. Ба-таева, М. Л. Кореневского, А. Н. Романенко, А. Ю. Андрусенко, Ю. Ю. Хохлова, А. А. Лаптева, Н. В. Мальковского, Н. В. Шмырева.

Целью данной работы является повышение точности и снижение вычислительных затрат автоматического распознавания устной речи за счёт разработки методов обучения акустических моделей на внедоменных данных, разработки нейросетевой архитектуры языковой модели и метода ранжирования множества гипотез распознавания речи.

Для достижения поставленной цели были поставлены следующие задачи:

1. Анализ и исследование современных методов аугментации речевых данных, методов построения языковых моделей, а так же методов ранжирования множества гипотез распознавания речи.

2. Разработка метода аугментации речевых данных для системы распознавания речи с целью адаптации акустической модели к внедоменным данным.

3. Разработка метода построения языковой модели на основе предложенной нейро сетевой архитектуры сеточный трансформер, адаптированной для ранжирования множества гипотез.

4. Разработка вычислительно-эффективного метода ранжирования множества гипотез распознавания речи на основе сеточного трансформера.

5. Экспериментальное исследование разработанных методов на стандартных корпусах и в международных соревнованиях по распознаванию речи.

Научная новизна:

1. Предложен метод адаптивной аугментации речевых данных с автоматическим выбором импульсных характеристик помещений на основе разработанной нейросетевой модели классификации. В отличие от традиционных подходов, требующих замера импульсных характеристик или измерения параметров целевых помещений, предложенный метод адаптирует обучающую выборку к целевым акустическим условиям без априорных знаний о них, что обеспечивает адаптацию акустической модели к акустическому смещению.

2. Разработан сеточный трансформер — неавторегрессионная архитектура языковой модели, и метод ранжирования гипотез распознавания речи на основе этой модели. В отличие от существующих подходов, требующих последовательной обработки каждой гипотезы распознавания речи, предложенная архитектура обеспечивает ранжирование всего множества гипотез за единственное обращение к модели, что существенно снижает вычислительные затраты системы распознавания речи.

Теоретическая и практическая значимость. Практическая значимость подтверждается интеграцией методов в промышленную систему распознавания русской речи группы компаний «ЦРТ» демонстрирует улучшение качества распознавания в различных доменах. Разработанный метод ранжирования множества гипотез распознавания речи с помощью сеточного трансформера обеспечивает ускорение ранжирования гипотез на порядки по сравнению с авторегрессионными языковыми моделями при сохранении качества распознавания. Предложенные решения позволяют адаптировать существующие системы АРР к новым акустическим и лингвистическим доменам без полного переобучения моделей.

Теоретическая значимость состоит в разработке метода адаптации акустических моделей, для работы с внедоменными данными, что расширяет понимание принципов построения устойчивых систем распознавания речи и вносит вклад в развитие теории АРР и обработки естественного языка.

Методология и методы исследования. В работе использованы методы машинного обучения, глубокого обучения, цифровой обработки сигналов, математической статистики и теории вероятностей. Для построения акустической модели применялись методы аугментации данных и нейронные сети. Для построения языковой модели использовались архитектуры трансформеров и сеточного трансформера. Экспериментальные исследования проводились с использованием стандартных наборов данных для распознавания речи и метрик качества, принятых в научном сообществе.

Основные положения, выносимые на защиту:

1. Метод аугментации речевых данных, отличающийся тем, что с целью адаптации систем распознавания речи к целевому домену без априорного знания параметров помещения использует адаптивную стратегию преобразования обучающей выборки с автоматическим выбором акустических характеристик среды на основе нейросетевого классификатора импульсных характеристик помещений.

2. Метод ранжирования множества гипотез распознавания речи на основе нейросетевых языковых моделей, отличающийся использованием предложенной языковой модели архитектуры сеточный трансформер с целью повышения скорости ранжирования множества гипотез распознавания речи при сохранении точности распознавания на уровне существующих решений.

Достоверность полученных результатов обеспечивается комплексной экспериментальной валидацией и независимым контролем.

Методологическая достоверность подтверждается использованием общепризнанных стандартных наборов данных, широко применяемых в международном научном сообществе. Корпус LibriSpeech [5] представляет собой эталонный набор для оценки систем распознавания речи на английском языке и используется в качестве базового корпуса в подавляющем большинстве современных исследований. Однако данный корпус не содержит сложных акустических условий, которые характерны для реальных акустических сред, поэтому для комплексной оценки методов его не достаточно. Для эксперементальной оценки робастности предложенных методов адаптации к изменению акустических условий используется многокорпусный набор данных CHiME-8 [6], специально разработанный для оценки систем распознавания речи в сложных акустических условиях с удаленными микрофонами, множественными дикторами и разнообразными акустическими средами.

Объективность полученных результатов подтверждается независимой экспертной оценкой в рамках престижного международного соревнования «CHiME-8. Distant Automatic Speech Recognition with Multiple Devices in Diverse Scenarios» [6], где предложенные методы были включены в состав системы «STCON» [7] и продемонстрировали лучшие результаты среди всех участников, включая ведущие исследовательские центры и промышленные лаборатории мирового уровня. Оценка в соревновании проводилась организаторами на закрытых тестовых данных, что исключает возможность фальсификации результатов и подтверждает способность методов к обобщению на новые данные.

Для количественной оценки качества распознавания применялись стандартизированные метрики Word Error Rate и time-constrained minimum permutation Word Error Rate (TCP-WER) [8], являющиеся общепринятыми в области автоматического распознавания речи и обеспечивающие сопоставимость результатов с работами других исследователей.

Воспроизводимость результатов обеспечивается детальным описанием архитектур моделей, гиперпараметров обучения и процедур предобработки данных. Экспериментальные измерения проводились с усреднением по нескольким независимым запускам для учета стохастической природы процесса обучения нейронных сетей. Все сравнения с существующими методами выполнялись в идентичных условиях на одних и тех же тестовых выборках данных.

Научная достоверность результатов обеспечена прохождением процедуры независимого рецензирования при публикации в высокорейтинговых международных научных изданиях, индексируемых в базах данных Scopus и Web of Science, а также представлением результатов на авторитетных международных конференциях с процедурой строгого отбора работ.

Апробация работы. Основные результаты работы докладывались на:

1. Пятьдесят вторая (LII) научная и учебно-методическая конференция Университета ИТМО (31 янв. - 3 февр. 2023, Санкт-Петербург, Россия)

2. XII Конгресс молодых ученых ИТМО (03-06 апр. 2023, Санкт-Петербург, Россия)

3. Пятьдесят третья (LIII) научная и учебно-методическая конференция Университета ИТМО (29 янв. - 02 февр. 2024, Санкт-Петербург, Россия)

4. Международной конференции «25th INTERSPEECH Conference» (1-5 сент. 2024, Кос, Греция)

5. Международной конференции «22nd INTERSPEECH Conference» (31 авг. - 3 сент. 2022, Брно, Чехия)

6. Международной конференции «CHiME-8 Workshop» (1-2 сент. 2024, Кос, Греция)

7. Пятьдесят четвертая (LIV) научная и учебно-методическая конференция Университета ИТМО (27 янв. - 30 янв. 2025, Санкт-Петербург, Россия)

8. XIV Конгресс молодых ученых ИТМО (07-11 апр. 2025, Санкт-Петербург, Россия)

Личный вклад. Автор участвовал в постановке задач исследования, разработке теоретических основ предложенных методов, проведении экспериментальных исследований и анализе полученных результатов. Диссертантом реализованы и адаптированы: метод адаптивной аугментации речевых данных с автоматическим выбором импульсных характеристик помещений на основе нейросетевой классификации; неавторегрессионная архитектура сеточного трансформера для построения языковой модели на основе множества гипотез распознавания речи;

метод генерации множества гипотез распознавания речи из текстовых данных для обучения языковой модели; метод ранжирования множества гипотез распознавания речи на основе сеточного трансформера. Публикации по теме диссертации осуществлялись совместно с соавторами, вклад в каждую из которых представлен ниже.

Публикация «LT-LM: a novel non-autoregressive language model for singleshot lattice rescoring» [9] основана на разработке архитектуры сеточного трансформера для языковой модели (LT-LM) и нового метода ранжирования гипоетз распознавания речи, которые являются результатом личной работы автора диссертации. Автор разработал концепцию и архитектуру модели LT-LM, а также реализовал её в открытом фреймворке для построения систем АРР Kaldi1.

В статье «Accurate speaker counting, diarization and separation for advanced recognition of multichannel multispeaker conversations» [10] автором были проведены исследования по адаптации модели распознавания речи к акустическому смещению с помощью предобработки речевого сигнала и с помощью адаптивной аугментации речевых данных с использованием отобранных импульсных характеристик помещений, а так же по построению языковой модели для ранжирования множества гипотез распознавания речи.

Работа «Classification of Room Impulse Responses and its application for channel verification and diarization» [11] направлена на построение и исследование свойств нейросетевого классификатора импульсных характеристик помещений. Диссертантом проведены исследования влияния поздней реверберации на качество классификации ИХП, а также выполнена подготовка комплексного сравнения диаризационных свойств эмбеддингов ИХП.

В рамках статьи «Dynamic Acoustic Unit Augmentation with BPE-Dropout for Low-Resource End-to-End Speech Recognition» [12] выполнено исследование способов адаптации сквозных систем АРР к лексическому смещению без использования нейросетевых языковых моделей для оценки гипотез распознавания речи.

Публикации. Основные результаты по теме диссертации изложены в 4 печатных изданиях включенных в международные базы данных Scopus и Web of Science:

- A. Mitrofanov, T. Prisyach, T. Timofeeva, S. Novoselov, M. Korenevsky, Y. Khokhlov, A. Akulov, A. Anikin, R. Khalili, I. Lezhenin, A. Melnikov, D. Miroshnichenko, N. Mamaev, I. Odegov, O. Rudnitskaya,

1https://github.com/kaldi-asr/kaldi

A. Romanenko. Accurate speaker counting, diarization and separation for advanced recognition of multichannel multispeaker conversations.

// Computer Speech & Language, 2025, Vol. 92, pp. 101780, doi: 10.1016/j.csl.2025.101780

- Y. Khokhlov, T. Prisyach, A. Mitrofanov, D. Dutov, I. Agafonov, T. Timofeeva, A. Romanenko, M. Korenevsky. Classification of Room Impulse Responses and its Application for Channel Verification and Diarization. // Proc. Interspeech 2024, 3250-3254

- A. Laptev, A. Andrusenko, I. Podluzhny, A. Mitrofanov, I. Medennikov, Y. Matveev. Dynamic Acoustic Unit Augmentation with BPE-Dropout for Low-Resource End-to-End Speech Recognition. // Sensors, 2021, Vol. 21, No. 9, pp. 3063, doi: 10.3390/s21093063

- A. Mitrofanov, M. Korenevskaya, I. Podluzhny, Y. Khokhlov, A. Laptev, A. Andrusenko, A. Ilin, M. Korenevsky, I. Medennikov, A. Romanenko. LT-LM: a novel non-autoregressive language model for single-shot lattice rescoring. // Proc. Interspeech 2021, 4039-4043

Объем и структура работы. Диссертация состоит из введения, трех глав,

заключения и приложения. Полный объем диссертации составляет 197 страниц текста с 18 рисунками и 33 таблицами. Список литературы содержит 119 наименований.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Заключение диссертации по теме «Другие cпециальности», Митрофанов Антон Андреевич

Заключение

В результате выполнения диссертационной работы решена научная задача повышения точности и снижения вычислительных затрат автоматического распознавания устной речи за счёт разработки новых методов построения акустических и языковых моделей для работы с внедоменными данными. Получены следующие основные результаты:

1. Проведен комплексный анализ проблемы внедоменных данных в системах автоматического распознавания речи. Формализованы четыре основных типа доменных смещений: акустические (изменения импульсной характеристики канала и аддитивного шума), фонетические (изменения исходного речевого сигнала), лингвистические (изменения распределения выходных последовательностей) и концептуальные (изменения условного распределения вероятностей выходных последовательностей при условии определенного речевого сигнала). Показано, что каждый тип смещения требует специфических подходов к адаптации, при этом гибридные и сквозные архитектуры имеют различные возможности адаптации.

2. Разработан метод адаптивной аугментации речевых данных на основе классификации импульсных характеристик помещений, отличающийся тем, что с целью адаптации систем распознавания речи к целевому домену без априорного знания параметров помещения использует адаптивную стратегию преобразования обучающей выборки с автоматическим выбором акустических характеристик среды. Метод включает нейросетевой классификатор ИХП и алгоритм отбора релевантных характеристик на основе минимизации расхождения между распределениями ИХП.

3. Предложен метод ранжирования гипотез распознавания речи на основе нейросетевых языковых моделей, отличающийся использованием неавторегрессионной архитектуры сеточного трансформера (Lattice Transformer, LT-LM) для языковой модели с целью повышения скорости ранжирования гипотез распознавания речи при сохранении точности распознавания на уровне существующих решений. Разработан алгоритм синтетической генерации решеток из текстовых данных, позволяющий

преодолеть проблему недостатка размеченных аудиоданных при обучении LT-LM.

4. Экспериментально подтверждена эффективность разработанных методов на стандартных корпусах и в международных соревнованиях. На корпусе LibriSpeech метод LT-LM обеспечил значительное улучшение качества распознавания: WER снижается с 3.90% до 3.01% на test-clean и с 9.25% до 7.74% на test-other при ускорении вычислений на порядки по сравнению с авторегрессионными подходами. Система STCON с интегрированным методом адаптивной аугментации заняла первое место в международном соревновании CHiME-8 DASR, обеспечив среднее значение tcpWER 19.9% и относительное улучшение до 69.0% по сравнению с базовыми системами.

5. Продемонстрирована универсальность разработанных методов через их успешную адаптацию к различным языкам и доменам применения. Метод LT-LM показал стабильное превосходство при интеграции в промышленную систему распознавания русской речи на четырех различных доменах (телефония, колл-центр, офис, совещания), обеспечив среднее снижение WER на 2.95 процентных пункта. Метод адаптивной аугментации к акустическим условиям продемонстрировал эффективность в разнообразных акустических условиях, включая домашние обстановки, формальные интервью и офисные переговорные комнаты.

6. Показано практическое значение результатов для создания ро-бастных систем автоматического распознавания речи. Одноэтапный метод переранжирования LT-LM обеспечивает применимость в реальных промышленных системах, работающих в условиях ограниченных вычислительных ресурсов. Метод адаптивной аугментации позволяет эффективно адаптировать системы к изменяющимся акустическим условиям без значительных затрат на сбор и разметку целевых данных.

Перспективы дальнейшей разработки темы:

1. Исследование возможностей применения методов ранжирования гипотез к современным сквозным архитектурам на основе трансформеров и больших языковых моделей.

2. Разработка мультиязычных и мультидоменных версий предложенных методов для одновременной адаптации к нескольким типам смещений.

3. Исследование применимости разработанных подходов к другим задачам обработки речи, таким как распознавание эмоций и идентификация говорящего.

4. Разработка метода адаптивного выбора аддитивного шума для аугментации обучающей выборки.

5. Разработка специализированных методов для адаптации к концептуальным смещениям, включая изменения правил транскрибирования и обработки мультидикторных записей.

Полученные результаты вносят значительный вклад в развитие теории и практики автоматического распознавания речи, открывая новые возможности для создания более робастных и эффективных систем, способных адаптироваться к изменяющимся условиям эксплуатации.

Словарь терминов

АРР : Автоматическое распознавание речи — технология преобразования устной речи в текст

Акустическая модель : Компонент системы распознавания речи, который моделирует связь между акустическими признаками речевого сигнала и фонемами

Авторегрессионная модель : Модель, в которой предсказание следующего элемента последовательности основано на всех предыдущих элементах

Адаптивная аугментация : Метод расширения обучающих данных с использованием целенаправленно отобранных преобразований, соответствующих характеристикам целевого домена

Акустическое смещение : Различия в акустических условиях записи между обучающими и тестовыми данными, включающие реверберацию, шумы и характеристики микрофонов

Архитектура Conformer : Нейросетевая архитектура, объединяющая механизмы внимания трансформера со сверточными слоями для обработки речевых данных

Архитектура EfficientNet : Семейство сверточных нейронных сетей, оптимизированных для эффективного использования вычислительных ресурсов

Архитектура Трансформер : Нейросетевая архитектура, основанная исключительно на механизме внимания без рекуррентных или сверточных слоев

Бимформинг : Метод формирования диаграммы направленности микрофонной решетки

Внедоменные данные : Данные, которые отличаются по своим характеристикам от данных, использованных для обучения модели

Диаризация дикторов : Процесс определения временных интервалов, в которые говорит каждый из участников многодикторного разговора

Доменное смещение : Различия в распределении данных между обучающей и целевой выборками, приводящие к снижению качества модели

ИХП: Импульсная характеристика помещения - функция, описывающая акустические свойства помещения и характеризующая реверберацию

Кодировщик-декодировщик : Архитектура нейронной сети, состоящая из энкодера для извлечения признаков и декодера для генерации выходной последовательности

Кросс-энтропия : Функция потерь, широко используемая в задачах классификации для измерения различия между предсказанным и истинным распределениями

Лексическое смещение : Различия в словарном составе, грамматических конструкциях и стиле речи между обучающими и целевыми данными

Лингвистическое смещение : Различия в языковых характеристиках между обучающими и тестовыми данными, включая лексику, грамматику и стиль

Логарифмические мел-спектрограммы (log-mel filterbanks) : Акустические признаки, полученные применением логарифма к выходам банка мел-фильтров

Механизм внимания (attention) : Механизм в нейронных сетях, позволяющий модели фокусироваться на наиболее релевантных частях входных данных Многоголовое внимание (multi-head attention) : Расширение механизма внимания с использованием нескольких параллельных головок внимания

Неавторегрессионная модель : Модель, которая может генерировать все элементы выходной последовательности параллельно, без зависимости от порядка

Переранжирование (rescoring) : Процесс переоценки гипотез распознавания с использованием более сложных моделей для улучшения качества

Позиционное кодирование : Метод внедрения информации о позиции элементов в последовательность для моделей без рекуррентных связей

Постобработка результатов распознавания : Этап обработки выходных данных системы АРР для улучшения качества итоговой транскрипции

Разделение источников : Процесс извлечения речевых сигналов отдельных дикторов из многоканальной записи

Реверберация : Акустическое явление, возникающее из-за отражений звуковых волн от поверхностей в помещении

Решетка распознавания : Направленный ациклический граф, представляющий альтернативные гипотезы распознавания речи

Самовнимание (self-attention) : Разновидность механизма внимания, где запросы, ключи и значения получаются из одной и той же входной последовательности

Сквозная модель (end-to-end): Архитектура системы, обучаемая целиком от входных данных до финального результата без промежуточных этапов

Токенизация BPE (Byte Pair Encoding) : Алгоритм разбиения текста на подслова, основанный на частоте встречаемости пар символов

Управляемое разделение источников (GSS) : Метод разделения речевых источников с использованием дополнительной информации о дикторах

Эмбеддинги : Векторные представления объектов в многомерном пространстве, полученные в результате обучения нейронной сети

Языковая модель (ЯМ): Статистическая или нейросетевая модель, оценивающая вероятность текстовой последовательности

Список литературы диссертационного исследования кандидат наук Митрофанов Антон Андреевич, 2025 год

Список литературы

1. Raissi, T. Analysis of Domain Shift across ASR Architectures via TTS-Enabled Separation of Target Domain and Acoustic Conditions [Текст] / T. Raissi, N. Rossenbach, R. Schlüter //. — 2025. — arXiv: 2508.09868 [cs.SD]. — URL: https://arxiv.org/abs/2508.09868.

2. SpecAugment: A simple data augmentation method for automatic speech recognition [Text] / D. S. Park [et al.] //. — ISCA, 09/2019. — P. 2613—2617.

3. Data Augmenting Contrastive Learning of Speech Representations in the Time Domain [Text] / E. Kharitonov [et al.] // arXiv preprint arXiv:2007.00991. — 2020.

4. A Pruned RNNLM Lattice-Rescoring Algorithm for Automatic Speech Recognition [Text] / H. Xu [et al.] //. — IEEE, 2018. - P. 5929—5933.

5. Librispeech: An ASR corpus based on public domain audio books [Text] / V. Panayotov [et al.] // 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP). — 2015. — P. 5206—5210.

6. The CHiME-8 DASR Challenge for Generalizable and Array Agnostic Distant Automatic Speech Recognition and Diarization [Text] / S. Cornell [et al.] //. — 2024. — P. 1—6.

7. STCON System for the CHiME-8 Challenge [Text] / A. Mitrofanov [et al.] //. — 2024. — P. 13—17.

8. Meeteval: A toolkit for computation of word error rates for meeting transcription systems [Текст] / T. von Neumann [и др.] // arXiv preprint arXiv:2307.11394. — 2023.

9. LT-LM: a novel non-autoregressive language model for single-shot lattice rescoring [Текст] / A. Mitrofanov [и др.] // Proc. Interspeech 2021. — 2021. — С. 4039—4043.

10. Accurate speaker counting, diarization and separation for advanced recognition of multichannel multispeaker conversations [Text] / A. Mitrofanov [et al.] // Computer Speech & Language. — 2025. — Vol. 92. — P. 101780.

11. Classification of Room Impulse Responses and its Application for Channel Verification and Diarization [Text] / Y. Khokhlov [et al.] //. — 2024. — P. 3250—3254.

12. Dynamic Acoustic Unit Augmentation with BPE-Dropout for Low-Resource End-to-End Speech Recognition [Text] / A. Laptev [et al.] // Sensors. — 2021. — Vol. 21, no. 9. — P. 3063.

13. Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks [Text] / A. Graves [et al.] //. Vol. 2006. — 01/2006. — P. 369—376.

14. Graves, A. Sequence Transduction with Recurrent Neural Networks [Text] / A. Graves. — 2012. — arXiv: 1211.3711 [cs.NE].

15. Listen, attend and spell: A neural network for large vocabulary conversational speech recognition [Text] / W. Chan [et al.] //. — 2016. — P. 4960—4964.

16. Diaz-Guerra, D. gpuRIR: A python library for room impulse response simulation with GPU acceleration. [Текст] / D. Diaz-Guerra, A. Miguel, J. Beltran // Multimedia Tools and Applications. — 2021. — Т. 80. — С. 5653—5671.

17. Building and evaluation of a real room impulse response dataset [Текст] / I. Szöke [и др.] // IEEE Journal of Selected Topics in Signal Processing. — 2019. — Т. 13, № 4. — С. 863—876.

18. The LibriCSS dataset for meeting diarization [Text] / Z. Chen [et al.] // arXiv preprint arXiv:2001.11482. — 2020.

19. Speaker diarization with LSTM [Text] / Q. Wang [et al.] //. — IEEE. 2018. — P. 5239—5243.

20. S0rensen, T. A method of establishing groups of equal amplitude in plant sociology based on similarity of species content and its application to analyses of the vegetation on Danish commons [Text] / T. S0rensen // Biologiske skrifter. — 1948. — Vol. 5. — P. 1—34.

21. NTT Multi-Speaker ASR System for the DASR Task of CHiME-8 Challenge [Текст] / N. Kamo [и др.] // arXiv preprint arXiv:2409.05554. — 2024.

22. Van der Maaten, L. Visualizing data using t-SNE. [Текст] / L. Van der Maaten, G. Hinton // Journal of machine learning research. — 2008. — Т. 9, № 11.

23. Wolf, M. Channel Selection Measures for Multi-microphone Speech Recognition [Text] / M. Wolf, C. Nadeu // Speech Communication. — 2014. — Feb. — Vol. 57. — P. 170—180.

24. Yen, H. Efficient Long-Form Speech Recognition for General Speech In-Context Learning [Text] / H. Yen, S. Ling, G. Ye //. — 2025. — P. 1—5.

25. The STC System for the CHiME-6 Challenge [Text] /1. Medennikov [et al.] //. — 2020.

26. The STC ASR System for the VOiCES from a Distance Challenge 2019 [Text] / I. Medennikov [et al.] //. — 2019. — P. 2453—2457.

27. CHiME-6 Challenge: Tackling Multispeaker Speech Recognition for Unseg-mented Recordings [Text] / S. Watanabe [et al.] //. — 2020. — P. 1—7.

28. The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios [Text] / S. Cornell [et al.] //. — 2023. — P. 1—6.

29. Conformer: Convolution-augmented Transformer for Speech Recognition [Текст] / A. Gulati [и др.] //. — ISCA, 2020. — С. 5036—5040. — URL: http://dx.doi.org/10.21437/Interspeech.2020-3015.

30. Recent Developments on ESPnet Toolkit Boosted by Conformer [Текст] / P. Guo [и др.] // arXiv preprint arXiv:2010.13956. — 2020.

31. Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks [Текст] / A. Graves [и др.] //. — ACM Press, 2006. — С. 369-376.

32. OWSM-CTC: An open encoder-only speech foundation model for speech recognition, translation, and language identification [Текст] / Y. Peng [и др.] // arXiv preprint arXiv:2402.12654. — 2024.

33. Quartznet: Deep Automatic Speech Recognition with 1D Time-Channel Separable Convolutions [Текст] / S. Kriman [и др.] //. — IEEE, 05.2020. — С. 6124—6128.

34. Graves, A. Sequence Transduction with Recurrent Neural Networks [Текст] / A. Graves //. — Workshop on Representation Learning, 2012. — URL: https: //arxiv.org/abs/1211.3711.

35. Developing RNN-T Models Surpassing High-Performance Hybrid Models with Customization Capability [Текст] / J. Li [и др.] //. — ISCA, 2020. — С. 3590—3594. — URL: http://dx.doi.org/10.21437/Interspeech.2020-3016.

36. Andrusenko, A. Towards a Competitive End-to-End Speech Recognition for CHiME-6 Dinner Party Transcription [Текст] / A. Andrusenko, A. Laptev, I. Medennikov //. — ISCA, 10.2020. — С. 319—323. — URL: http://dx.doi. org/10.21437/Interspeech.2020-1074.

37. Listen, attend and spell: A neural network for large vocabulary conversational speech recognition [Текст] / W. Chan [и др.] //. — IEEE, 2016. — С. 4960—4964.

38. Hwang, D. FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information [Текст] / D. Hwang // arXiv preprint arXiv:2405.12807. — 2024.

39. Owsm v3. 1: Better and faster open whisper-style speech models based on e-branchformer [Текст] / Y. Peng [и др.] // arXiv preprint arXiv:2401.16658. — 2024.

40. OWSM v4: Improving open whisper-style speech models via data scaling and cleaning [Текст] / Y. Peng [и др.] // arXiv preprint arXiv:2506.00338. — 2025.

41. Kim, S. Joint CTC-attention based end-to-end speech recognition using multitask learning [Текст] / S. Kim, T. Hori, S. Watanabe //. — IEEE, 03.2017. — С. 4835—4839.

42. Attention is All you Need [Текст] / A. Vaswani [и др.] //. Т. 30. — Curran Associates, Inc., 2017. — С. 5998—6008. — URL: https://proceedings.neurips. cc/paper/2017/file/3f5ee243547dee91fbd053c1c4a845aa-Paper.pdf.

43. Andrusenko, A. Exploration of End-to-End ASR for OpenSTT - Russian Open Speech-to-Text Dataset [Текст] / A. Andrusenko, A. Laptev, I. Medennikov //. — Cham : Springer International Publishing, 10.2020. — С. 35—44.

44. You Do Not Need More Data: Improving End-To-End Speech Recognition by Text-To-Speech Data Augmentation [Текст] / A. Laptev [и др.] //. — IEEE, 10.2020. — С. 439—444.

45. Robust Speech Recognition via Large-Scale Weak Supervision [Text] / A. Radford [et al.] //. — Honolulu, Hawaii, USA : JMLR.org, 2023. — (ICML23).

46. Can generative large language models perform asr error correction? [Text] / R. Ma [et al.] // arXiv preprint arXiv:2307.04172. — 2023.

47. Investigating asr error correction with large language model and multilingual 1-best hypotheses [Text] / S. Li [et al.] //. — 2024. — P. 1315—1319.

48. Qian, Y. Layer-wise fast adaptation for end-to-end multi-accent speech recognition [Text] / Y. Qian, X. Gong, H. Huang // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2022. — Vol. 30. — P. 2842—2853.

49. Enhancing Standard and Dialectal Frisian ASR: Multilingual Fine-tuning and Language Identification for Improved Low-resource Performance [Text] / R. Amooie [et al.] //. — IEEE. 2025. — P. 1—5.

50. Ouzerrout, S. Connecting Voices: LoReSpeech as a Low-Resource Speech Parallel Corpus [Text] / S. Ouzerrout // arXiv preprint arXiv:2502.18215. — 2025.

51. A Multi-Dialectal Dataset for German Dialect ASR and Dialect-to-Standard Speech Translation [Text] / V. Blaschke [et al.] // arXiv preprint arXiv:2506.02894. — 2025.

52. Gabdrakhmanov, L. Ruslan: Russian spoken language corpus for speech synthesis [Text] / L. Gabdrakhmanov, R. Garaev, E. Razinkov //. — Springer. 2019. — P. 113—121.

53. Shavrina, T. To the methodology of corpus construction for machine learn-ing:"Taiga" syntax tree corpus and parser [Text] / T. Shavrina, O. Shapoval-ova //. — 2017. — P. 78—84.

54. Speech and Language Recognition with Low-rank Adaptation of Pretrained Models [Text] / A. Prasad [et al.] //. — 2024. — P. 2825—2829.

55. Adapting Whisper for Regional Dialects: Enhancing Public Services for Vulnerable Populations in the United Kingdom [Text] / M. Torgbi [et al.] // arXiv preprint arXiv:2501.08502. — 2025.

56. Continuous speech separation with conformer [Текст] / S. Chen [и др.] // ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — IEEE. 2021. — С. 5749—5753.

57. But/jhu system description for chime-8 notsofar-1 challenge [Text] / A. Polok [et al.] //. — 2024. — P. 18—22.

58. Silero Team. Silero VAD: pre-trained enterprise-grade Voice Activity Detector (VAD), Number Detector and Language Classifier [Text] / Silero Team. — 2021. — GitHub repository. https://github.com/snakers4/silero-vad.

59. NeMo: a toolkit for Conversational AI and Large Language Models [Text] /

E. Harper [et al.]. — 2024. — GitHub repository: https://github.com/NVIDIA/NeMo. https://nvidia.github.io/NeMo/.

60. Single-Channel Distance-Based Source Separation for Mobile GPU in Outdoor and Indoor Environments [Text] / H. Bae [et al.] //. — IEEE. 2025. — P. 1—5.

61. NOTSOFAR-1 Challenge: New Datasets, Baseline, and Tasks for Distant Meeting Transcription [Text] / A. Vinnikov [et al.] //. — 2024. — P. 5003—5007.

62. Front-end Processing for the CHiME-5 Dinner Party Scenario [Text] / C. Boed-decker [et al.] //. — 2018. — P. 35—40.

63. NARA-WPE: A Python Package for Weighted Prediction Error Dereverberation in Numpy and Tensorflow for Online and Offline Processing [Text] / L. Drude [et al.] //. — 2018. — P. 1—5.

64. Sparsely shared lora on whisper for child speech recognition [Text] / W. Liu [et al.] //. — IEEE. 2024. — P. 11751—11755.

65. Acoustic model fusion for end-to-end speech recognition [Text] / Z. Lei [et al.] //. — IEEE. 2023. — P. 1—7.

66. Cold fusion: Training seq2seq models together with language models [Text] / A. Sriram [et al.] // arXiv preprint arXiv:1708.06426. — 2017.

67. Hori, T. End-to-end speech recognition with word-based RNN language models [Text] / T. Hori, J. Cho, S. Watanabe //. — IEEE. 2018. — P. 389—396.

68. Федеральное агентство по техническому регулированию и метрологии. Акустика. Экспериментальные методы определения условий свободного звукового поля (ГОСТ Р ИСО 26101—2014) [Текст] / Федеральное агентство по техническому регулированию и метрологии. — Москва, 2014. — URL: https://docs.cntd.ru/document/1200119832 ; ISO 26101:2012 Acoustics — Test methods for the qualification of free-field environments (IDT). Издание официальное.

69. Зверев, А. А. Радиосвязь и радиодоступ: Учебник для вузов [Текст]. Т. 2 / А. А. Зверев. — Москва : Горячая линия - Телеком, 2010.

70. Новиков, Г. В. Нелинейные искажения в усилителе с разрешением составляющих однополосного сигнала [Текст] / Г. В. Новиков. — 1984.

71. Морозов, А. Д. Методы определения и противодействия источникам искажения сигнала в радиосвязи [Текст] / А. Д. Морозов // Дневник науки. — 2019. — № 4. — С. 63—63.

72. Джазовский, Н. Б. Радиоканалы передачи информации [Текст] / Н. Б. Джа-зовский, Л. В. Орлова. — Пенза : Пенз. политехн. ин-т, 1988. — С. 64. — 11 ил., 2 табл., библиогр. 30 назв.

73. International Telecommunication Union. Pulse code modulation (PCM) of voice frequencies [Text] / International Telecommunication Union. — ITU-T, 1988. — (Recommendation G.711). — URL: https://www.itu.int/rec/T-REC-G.711/en ; Стандарт кодека G.711 для телефонии.

74. Proakis, J. G. Digital Communications [Text] / J. G. Proakis, M. Salehi. — 5th. — McGraw-Hill, 2008. — Глава 8: Цифровая передача речи. Описывает влияние кодеков с потерями и адаптацию битрейта.

75. Mullis, J. Telecommunication Systems [Text] / J. Mullis, I. Foster. — Cambridge University Press, 2011. — Разделы по эхо и джиттеру в телефонных сетях.

76. The Adaptive Multirate Wideband Speech Codec (AMR-WB) [Text] / B. Bessette [et al.] // IEEE Transactions on Speech and Audio Processing. — 2002. — Vol. 10, no. 8. — P. 620—636. — Описание алгоритмов адаптации и влияния на качество передачи речи.

77. Valin, J.-M. Definition of the Opus Audio Codec [Text] / J.-M. Valin, K. Vos, T. B. Terriberry // RFC 6716, IETF. — 2012. — URL: https://datatracker.ietf. org/doc/html/rfc6716 ; Официальная спецификация кодека Opus, включая адаптацию битрейта и влияние на качество.

78. Snyder, D. Musan: A music, speech, and noise corpus [Текст] / D. Snyder, G. Chen, D. Povey // arXiv preprint arXiv:1510.08484. — 2015.

79. Thiemann, J. The diverse environments multichannel acoustic noise database (DEMAND): A database of multichannel environmental noise recordings [Text] / J. Thiemann, N. Ito, E. Vincent //. Vol. 19. — Acoustical Society of America. 2013. — P. 035081.

80. R-Vectors: New Technique for Adaptation to Room Acoustics. [Текст] / Y. Y. Khokhlov [и др.] //. — 2019. — С. 1243—1247.

81. The STC ASR System for the VOiCES from a Distance Challenge 2019 [Текст] / I. Medennikov [и др.] //. — 2019. — С. 2453—2457.

82. Raj, D. SURT 2.0: Advances in Transducer-based Multi-talker Speech Recognition [Текст] / D. Raj, D. Povey, S. Khudanpur // arXiv preprint arXiv:2306.10559. — 2023.

83. Imperio: Robust over-the-air adversarial examples for automatic speech recognition systems [Текст] / L. Schonherr [и др.] // Annual Computer Security Applications Conference. — 2020. — С. 843—855.

84. A study on data augmentation of reverberant speech for robust speech recognition [Текст] / T. Ko [и др.] // 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2017. — С. 5220—5224.

85. Shao, Y. RIR-SF: Room Impulse Response Based Spatial Feature for Multichannel Multi-talker ASR [Текст] / Y. Shao, S.-X. Zhang, D. Yu // arXiv preprint arXiv:2311.00146. — 2023.

86. Шанин, А. В. Метод последовательностей максимальной длины в дифракционном эксперименте [Текст] / А. В. Шанин, В. Ю. Валяев // Акустический журнал. — 2011. — Т. 57, № 3. — С. 420—425.

87. Ihlenburg, F. Finite element analysis of acoustic scattering [Text]. Vol. 132 / F. Ihlenburg. — Springer Science & Business Media, 1998. — (Applied Mathematical Sciences).

88. Ratnarajah, A. IR-GAN: Room Impulse Response Generator for Speech Augmentation [Текст] / A. Ratnarajah, Z. Tang, D. Manocha // ArXiv. — 2020. — Т. abs/2010.13219.

89. Allen, J. B. Image method for efficiently simulating small-room acoustics [Текст] / J. B. Allen, D. A. Berkley // The Journal of the Acoustical Society of America. — 1979. — Т. 65, № 4. — С. 943—950.

90. Scheibler, R. Pyroomacoustics: A Python package for audio room simulations and array processing algorithms [Текст] / R. Scheibler, E. Bezzam, I. Dokmanic //. — Calgary, CA : IEEE, 2018. — С. 351—355.

91. A study on data augmentation of reverberant speech for robust speech recognition [Текст] / T. Ko [и др.] // 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2017. — С. 5220—5224.

92. Tan, M. Efficientnet: Rethinking model scaling for convolutional neural networks [Текст] / M. Tan, Q. Le // International conference on machine learning. — 2019. — С. 6105—6114.

93. Nagrani, A. Voxceleb: a large-scale speaker identification dataset [Текст] / A. Nagrani, J. S. Chung, A. Zisserman // arXiv preprint arXiv:1706.08612. —

2017.

94. X-vectors: Robust DNN embeddings for speaker recognition [Text] / D. Snyder [et al.] // 2018 IEEE international conference on acoustics, speech and signal processing (ICASSP). — 2018. — P. 5329—5333.

95. Pushing the limits of semi-supervised learning for automatic speech recognition [Text] / Y. Zhang [et al.] // arXiv preprint arXiv:2010.10504. — 2020.

96. Conformer: Convolution-augmented Transformer for Speech Recognition [Text] / A. Gulati [et al.] //. — 2020. — P. 5036—5040.

97. WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing [Text] / S. Chen [et al.] // IEEE Journal of Selected Topics in Signal Processing. — 2022. — Vol. 16, no. 6. — P. 1505—1518.

98. ESPnet: End-to-End Speech Processing Toolkit [Text] / S. Watanabe [et al.] //. —

2018. — P. 2207—2211.

99. Librispeech: An ASR Corpus Based on Public Domain Audio Books [Text] / V. Panayotov [et al.] //. — 2015. — P. 5206—5210.

100. Target-speaker voice activity detection: a novel approach for multi-speaker diarization in a dinner party scenario [Текст] /1. Medennikov [и др.] // arXiv preprint arXiv:2005.07272. — 2020.

101. Raj, D. GPU-accelerated Guided Source Separation for Meeting Transcription [Text] / D. Raj, D. Povey, S. Khudanpur //. — 2023. — P. 3507—3511.

102. Neural target speech extraction: An overview [Текст] / K. Zmolikova [и др.] // IEEE Signal Processing Magazine. — 2023. — Т. 40, № 3. — С. 8—29.

103. Multi-Level Speaker Representation for Target Speaker Extraction [Текст] / K. Zhang [и др.] // arXiv preprint arXiv:2410.16059. — 2024.

104. TF-GridNet: Making time-frequency domain models great again for monaural speaker separation [Текст] / Z.-Q. Wang [и др.] // ICASSP 2023-2023 IEEE international conference on acoustics, speech and signal processing (ICASSP). — IEEE. 2023. — С. 1—5.

105. TF-GridNet: Integrating full-and sub-band modeling for speech separation [Текст] / Z.-Q. Wang [и др.] // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2023.

106. Combining TF-GridNet And Mixture Encoder For Continuous Speech Separation For Meeting Transcription [Текст] / P. Vieting [и др.] // 2024 IEEE Spoken Language Technology Workshop (SLT). — IEEE. 2024. — С. 155—162.

107. The ustc-nercslip systems for the chime-8 notsofar-1 challenge [Текст] / S. Niu [и др.] // arXiv preprint arXiv:2409.02041. — 2024.

108. The NPU-TEA System for the CHiME-8 NOTSOFAR-1 Challenge [Текст] / K. Huang [и др.] // Proc. CHiME 2024. — 2024. — С. 45—48.

109. Provilkov, I. BPE-Dropout: Simple and Effective Subword Regularization [Текст] / I. Provilkov, D. Emelianenko, E. Voita //. — Online : Association for Computational Linguistics, 07.2020. — С. 1882—1892. — URL: https : //www.aclweb.org/anthology/2020.acl- main.170.

110. Self-Attentional Models for Lattice Inputs [Text] / M. Sperber [et al.] //. —

2019. — P. 1185—1197.

111. Attention is All you Need [Text] / A. Vaswani [et al.] //. Vol. 30 / ed. by I. Guyon [et al.]. — Curran Associates, Inc., 2017.

112. Language Models are Unsupervised Multitask Learners [Text] / A. Radford [et al.]. — 2019.

113. Shiv, V. L. Novel positional encodings to enable tree-based transformers [Text] / V. L. Shiv, C. Quirk //. — 2019.

114. FLAT: Chinese NER Using Flat-Lattice Transformer [Text] / X. Li [et al.] //. —

2020. — P. 6836—6842.

115. Neural Lattice Search for Speech Recognition [Text] / R. Ma [et al.] //. — IEEE, 2020. — P. 7794—7798.

116. Convolutional Sequence to Sequence Learning [Text] / J. Gehring [et al.] //. Vol. 70. — 2017. — P. 1243—1252.

117. fairseq: a Fast, Extensible Toolkit for Sequence Modeling [Text] / M. Ott [et al.] //. - 2019.

118. Kingma, D. P. Adam: A method for stochastic optimization [Текст] / D. P. Kingma, J. Ba // arXiv preprint arXiv:1412.6980. — 2014.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.