Методы и средства выделения шепота в полилоге и конверсии шепотной речи в нормальную тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Авдеева Анастасия Сергеевна

  • Авдеева Анастасия Сергеевна
  • кандидат науккандидат наук
  • 2025, «Национальный исследовательский университет ИТМО»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 212
Авдеева Анастасия Сергеевна. Методы и средства выделения шепота в полилоге и конверсии шепотной речи в нормальную: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет ИТМО». 2025. 212 с.

Оглавление диссертации кандидат наук Авдеева Анастасия Сергеевна

Оглавление

Реферат

Synopsis

Введение

Глава 1. Аналитический обзор методов идентификации

диктора и диаризации

1.1 Задача верификации и идентификации диктора по голосу

1.2 Аналитический обзор методов голосовой биометрии

1.3 Голосовая биометрия в условиях шепотной речи

1.4 Задача диаризации и выделения голоса целевого диктора

1.5 Аналитический обзор методов диаризации в режиме реального времени

1.6 Выводы

Глава 2. Аналитический обзор систем конверсии голоса

2.1 Основные определения и классификация методов конверсии голоса

2.2 Аналитический обзор существующих методов конверсии голоса

2.3 Применение методов конверсии голоса к задаче преобразования шепотной речи в нормальную

2.4 Выводы

Глава 3. Метод детектирования шепотной речи

3.1 Постановка задачи и мотивация исследований

3.2 Метод детектирования шепотной речи

3.2.1 Общее описание метода

3.2.2 Применение метода детектирования шепота для сбора данных из крупных речевых корпусов

3.2.3 Применение собранных шепотных данных для обучения биометрических моделей

3.3 Выводы

Глава 4. Метод выделения шепотной речи в полилоге

109

4.1 Исследование влияния модели дикторского экстрактора на качество метода диаризации ШЗ-ИКК

4.2 Применение диаризационной системы на основе метода

ШЗ-ИКК для выделения голоса целевого диктора

4.3 Метод принятия решений биометрической системой, работающий в условиях смешанной шепотной и нормальной речи

4.4 Метод выделения шепотной и нормальной речи целевого

диктора в условиях полилога

4.5 Выводы

Глава 5. Метод конверсии из шепотной речи в нормальную

5.1 Общая архитектура каскадной системы голосовой конверсии

5.2 Описание баз данных для обучения и тестирования системы голосовой конверсии

5.3 Метрики для тестирования системы голосовой конверсии

5.4 Методика адаптации блока извлечения лингвистической информации к потоковому режиму

5.4.1 Описание основных блоков используемой системы конверсии

5.4.2 Базовая архитектура блока извлечения лингвистической информации

5.5 Адаптация системы голосовой конверсии к условиям шепотной

речи

5.6 Потоковый метод голосовой конверсии из шепотной речи в нормальную с возможностью копирования голоса целевого диктора

5.6.1 Схема предложенного метода голосовой конверсии БреакегУС

5.6.2 Архитектура и метод обучения блока декодера

5.6.3 Оценка качества предложенной системы голосовой конверсии

5.6.4 Сравнение предложенного подхода с существующими решениями

5.7 Выводы

Глава 6. Комплекс программных средств для выделения шепота в полилоге и конверсии шепотной речи в нормальную

6.1 Реализация метода детектирования шепотной речи

6.2 Реализация метода выделения шепотной и нормальной речи целевого диктора

6.3 Реализация метода голосовой конверсии речи

6.4 Библиотека для тестирования качества систем голосовой конверсии

Заключение

Словарь терминов

Список рисунков

Список таблиц

Список литературы

Приложение А. Основные публикации автора по теме

диссертации

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Методы и средства выделения шепота в полилоге и конверсии шепотной речи в нормальную»

Реферат

Общая характеристика диссертации

Актуальность. Задача голосовой конверсии заключается в преобразовании голоса на входной аудиозаписи в голос другого диктора. Таким образом, необходимо сохранить лингвистическую информацию и точно воспроизвести то, что было сказано на входной аудиозаписи, изменив при этом дикторскую информацию, то есть голос, которым был озвучен текст. Методы голосовой конверсии широко применяются в различных практических задачах из таких областей как защита конфиденциальности, игровая индустрия, а также для увеличения доступности для людей с ограниченными возможностями. Так, актуальность задача создания инклюзивной среды сильно возросла в последние годы. Применительно к области речевых технологий - это разработка и адаптация моделей обработки речевых сигналов для корректной работы с различными типами нестандартной речи, такими как: атипичная речь, заикание, шепот. Так, для людей, перенесших серьезные заболевания речевого тракта, шепот может быть единственным способом вербальной коммуникации [1]. Кроме того, такой тип речи используется людьми с заиканием: некоторый процент людей перестает заикаться, используя шепот [2]. Шепотная речь часто используется и в обычной жизни: для передачи конфиденциальной информации, а также в случаях, когда важно не потревожить окружающих людей. Современные голосовые помощники также способны как воспринимать шепотную речь, так и отвечать в подобном режиме, что также подчеркивает востребованность подобной технологии. Однако шепотная речь тяжела для восприятия другими людьми, особенно в условиях наличия постороннего шума и неблагоприятной акустической обстановки, и неуместна в ситуациях рабочих онлайн-звонков. В таком случае возникает необходимость в системах конверсии голоса, которые работают в условиях шепотной речи и решают задачу конверсии шепота в обычную речь. К подобной системе можно выдвинуть следующие требования:

1. Высокое качество работы системы как в режиме оффлайн, так и в режиме работы в реальном времени, что критически важно для он-лайн-звонков.

2. Высокое качество переноса голоса диктора: необходимо обеспечивать высокое качество схожести целевого и синтезируемого голоса.

3. Стабильная работа в условиях вариативной акустической обстановки: в реальности не всегда возможно обеспечить микрофон хорошего качества, а также наличие благоприятной акустической среды. Таким образом, система должна быть устойчива к фоновым шумам различной интенсивности.

4. Стабильная работа в условиях полилога, то есть одновременной речи нескольких дикторов. Система должна обеспечивать детектирование речи и шепота целевого диктора, при этом игнорируя как речь, так и шепот остальных дикторов.

Однако разработка подобной системы сопряжена с рядом трудностей:

1. Условия шепотной речи. Необходимость работы в условиях смешанной шепотной и нормальной речи влечёт за собой ряд проблем:

а) Отсутствие публично доступных баз данных шепотной речи, а также трудоемкость сбора большого количества данных, достаточного для обучения нейросетевых моделей.

б) Специфика шепотной речи - отсутствие в речевом сигнале частоты основного тона накладывает ограничения на различные блоки системы конверсии. Так, при преобразовании сигнала системой голосовой конверсии информация об изменении частоты основного тона обычно используется для восстановления интонационного контура. Тогда как в случае шепотной речи подобную информацию необходимо извлекать при помощи дополнительных алгоритмов из имеющейся лингвистической информации.

2. Существующие методы голосовой конверсии не позволяют обеспечить хорошее качество восстановления голоса целевого диктора, не присутствующего в обучающей выборке.

3. Существующие методы голосовой конверсии не адаптированы к условиям работы в неблагоприятной акустической обстановке.

4. Существующие методы голосовой конверсии не способны корректно работать в условиях полилога и осуществляют преобразование всего речевого сигнала, приходящего на вход системе, без учета информации о целевом дикторе.

Таким образом, существующие решения не соответствуют обозначенным требованиям.

Степень разработанности темы. В настоящее время задача голосовой конверсии является предметом активного исследования в ряде научных работ. Несмотря на то, что развитие в данной области происходит медленнее, чем в тесно связанной с ней области синтеза речи, интерес к проблеме голосовой конверсии продолжает возрастать. Однако существующие методы голосовой конверсии не могут быть напрямую применены к шепотной речи в силу разницы в спектральных характеристиках сигналов. В то же время количество исследований, направленных на решение задачи конверсии шепота в нормальную речь, существенно ограничено, что обусловлено узкой спецификой данной проблемы.

Многие из существующих решений являются устаревшими [3—7]. Несмотря на интересные подходы, предложенные в этих работах для восстановления частоты основного тона [6; 7], ограниченные возможности применяемых ней-росетевых архитектур не позволяют им соответствовать современному уровню развития технологий и конкурировать с крупными нейросетевыми моделями, обученными на больших объёмах данных. В исследовании [8] применяются современные архитектурные решения; однако в данной работе отсутствует акцент на задаче восстановления идентичности голоса диктора, а также не рассматриваются вопросы реализации системы в потоковом режиме. Наконец, ни в одном из упомянутых решений не исследуется возможность выделения речи и шепота целевого диктора, что могло бы обеспечить устойчивость системы к условиям полилога и наличию посторонних голосов.

Таким образом, можно заключить, что существующие методы решают лишь частные аспекты задачи, а разработанные на их основе системы голосовой конверсии из шепотной речи в нормальную не соответствуют ранее сформулированным требованиям.

Цель исследования. Целью данной диссертационной работы является разработка новых методов и программных средств потоковой конверсии шепотной речи в нормальную в реальных условиях полилога, позволяющих восстанавливать идентификационные характеристики голоса целевого диктора и повысить комфортность общения для людей с особенностями речи.

Научные задачи. Для достижения поставленной цели были сформулированы и решены следующие задачи:

1. Аналитический обзор существующих методов голосовой идентификации личности и сегментации (диаризации) речи дикторов в полилоге, а также исследование возможности их применения в условиях шепотной речи.

2. Аналитический обзор существующих систем голосовой конверсии, а также систем конверсии из шепота в нормальную речь.

3. Разработка метода детектирования шепота с целью обеспечения сбора корпуса шепотной речи для адаптации системы диаризации к условиям шепотной речи.

4. Разработка метода выделения шепота целевого диктора в полилоге с использованием адаптированной к шепоту системы распознавания дикторов по голосу в условиях смешанной нормальной и шепотной речи.

5. Разработка потокового метода голосовой конверсии шепотной речи в нормальную, устойчивого к неблагоприятным акустическим условиям и условиям полилога, с возможностью восстановления идентичности голоса целевого диктора.

6. Разработка программных средств для выделения шепота в полилоге и конверсии шепотной речи в нормальную, а также количественное оценивание качества автоматической конвертации шепотной речи в нормальную.

Методы исследования. Для достижения поставленных целей применялись методы цифровой обработки сигналов, методы математической статистики, алгоритмы машинного обучения.

Основные положения, выносимые на защиту:

1. Метод детектирования шепотной речи, отличающийся использованием биометрического экстрактора дикторских представлений, позволяющий осуществлять высокоточный автоматический поиск шепотной речи в речевых корпусах.

2. Метод выделения речи целевого диктора, в том числе шепотной, отличающийся применением адаптированной к шепотной речи биометрической системы, а также использованием нормализации выходных

биометрических оценок, осуществляемой с помощью детектора шепотной речи, позволяющий выделять речь целевого диктора в полилоге в потоковом режиме.

3. Метод конверсии из шепотной речи в нормальную, отличающийся применением адаптированной к шепотной речи системы выделения голоса целевого диктора, обеспечивающий возможность работы системы конверсии в потоковом режиме в условиях полилога в неблагоприятных условиях, а также возможность восстановления идентичности голоса целевого диктора.

Научная новизна диссертационной работы состоит в следующем:

1. Разработан нейросетевой метод детектирования шепотной речи на основе биометрического экстрактора дикторских представлений, позволяющий осуществлять автоматический поиск шепотной речи в речевых корпусах.

2. Разработан метод выделения шепота, позволяющий выделять шепотную речь целевого диктора в полилоге в потоковом режиме.

3. Разработан метод голосовой конверсии, отличающийся устойчивостью к условиям смешанной шепотной и нормальной речи, возможностью работы в потоковом режиме, а также возможностью восстановления идентичности голоса целевого диктора.

Теоретическая значимость. Теоретическая значимость диссертационной работы заключается в исследовании, разработке новых и усовершенствовании существующих методов автоматической сегментации речевых сигналов, методов выделения речи целевого диктора, а также методов конверсии речевых сигналов.

Практическая значимость. Практическая значимость диссертационной работы определяется возможностью применения разработанных методов в системах голосовой конверсии в реальных условиях в потоковом режиме в условиях смешанной шепотной и нормальной речи, что подтверждается успешным внедрением в продукты компании ТОО БреесЬТесЬ. Программные средства конверсии голоса, реализованные с помощью предложенных методов, могут быть

использованы в приложениях видео-конференц связи для конвертации шепотной речи людей с нарушениями речи, что позволит повысить комфортность общения и качество жизни людей с такими особенностями.

Достоверность. Достоверность полученных результатов обеспечивается использованием признанных научным сообществом методов цифровой обработки речевых сигналов, методов машинного обучения и статистического анализа, репрезентативным набором тестовых данных и подтверждается апробацией на международных конференциях и успешным внедрением.

Аппробация работы. Основные результаты работы докладывались и обсуждались на следующих международных конференциях: "SPECOM -2022"(Индия, Гуруграм, 2022), "ICASSP - 2024"(Южная Корея, Сеул, 2024), "INTERSPEECH - 2024"(Греция, Кос 2024).

Личный вклад автора. Автором лично был проведен анализ существующих решений в области голосовой биометрии, диаризации, голосовой конверсии, а также возможностей их применения в условиях смешанной шепотной и обычной речи. На основе проведенного анализа были разработаны методы адаптации систем к условиям шепотной речи, а также предложены методы усовершенствования потоковой голосовой конверсии, позволяющие получить высокое качество переноса голоса целевого диктора. Подготовка основных публикаций проводилась с соавторами.

1. В работе "Avdeeva A., Novoselov S. Deep Speaker Embeddings based Online Diarization // Lecture Notes in Computer Science (including subseries Lecture Notes in Artificial Intelligence and Lecture Notes in Bioinformatics) - 2022, Vol. 13721, pp. 24-32" Avdeeva A. проводила эксперименты с диаризационными алгоритмами, занималась подготовкой тестовых данных и написанием текста публикации; Novoselov S. занимался разработкой используемой биометрической системы и проводил консультирование.

2. В работе "Avdeeva A., Gusev A., Andzhukaev T., Ivanov A. Streaming ASR Encoder for Whisper-to-Speech Online Voice Conversion // IEEE Open Journal of Signal Processing - 2023, Vol. 5, pp. 160-167" Gusev A. занимался обучением ASR энкодера и написанием текста; Avdeeva A.

занималась обучением моделей декодера и вокодера, написанием текста; Andzhukaev T., Ivanov A. проводили консультирование.

3. В работе "Avdeeva A., Gusev A. Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech // Proceedings of the Annual Conference of the International Speech Communication Association, INTERSPEECH - 2024, pp. 2735-2739" Avdeeva A. занималась обучением систем конверсии, подготовкой тестовых протоколов, проведением тестирования и написанием текста; Gusev A. занимался обучением систем конверсии, написанием текста.

4. В работе "Novoselov S., Lavrentyeva G., Avdeeva A., Volokhov V., Khmelev N., Akulov A., Leonteva P. On the robustness of wav2vec 2.0 based speaker recognition systems // Proceedings of the Annual Conference of the International Speech Communication Association, INTERSPEECH - 2023, pp. 3177-3181" Novoselov S., Lavrentyeva G., Avdeeva A. занимались обучением биометрических моделей; Volokhov V. занимался написанием текста и проведением тестирования; Khmelev N., Akulov A., Leonteva P. проводили консультирование.

5. В работе "Khmelev N., Avdeeva A., Novoselov S., Chirkovskiy A., Volkova M. Robust Speaker Recognition for Whispered Speech // Proceedings of the Digital Signal Processing and Its Applications — DSPA-2025, pp. 1-5" Khmelev N. занимался обучением биометрических моделей; Avdeeva A. занималась подготовкой тестовых протоколов, тестированием, подготовкой аналитического обзора и написанием текста; Novoselov S. проводил консультирование; Chirkovskiy A. и Volkova M. занимались подготовкой данных и написанием текста.

Внедрение результатов работы. Результаты диссертационной работы были успешно внедрены в программные продукты компании ТОО SpeechTech, что подтверждено соответствующим актом внедрения.

Публикации. По материалам диссертационного исследования опубликовано 5 работ в международных рецензируемых изданиях, индексируемых в базах данных Web of Science и Scopus.

Соответствие паспорту специальности. Диссертация соответствует двум пунктам паспорта специальности 2.3.8. «Информатика и информационные процессы (технические науки)».

Четвертый пункт паспорта специальности: «Разработка методов и технологий цифровой обработки аудиовизуальной информации с целью обнаружения закономерностей в данных, включая обработку текстовых и иных изображений, видео контента. Разработка методов и моделей распознавания, понимания и синтеза речи, принципов и методов извлечения требуемой информации из текстов». Был разработан, обоснован и протестирован метод, позволяющий осуществлять конверсию из шепотной речи в нормальную, с возможностью сохранения идентификационных характеристик голоса диктора. Данный метод может быть использован для реализации системы голосовой конверсии для людей, страдающих различными заболеваниями голосового тракта. Такая система может значительно повысить комфортность общения для людей с особенностями речи.

Седьмой пункт паспорта специальности: «Разработка методов обработки, группировки и аннотирования информации, в том числе, извлеченной из сети интернет, для систем поддержки принятия решений, интеллектуального поиска, анализа». Был разработан, обоснован и протестирован метод, предназначенный для детектирования шепотной речи. Предложенный детектор может использоваться для автоматизированного сбора корпуса шепотных записей, что, в свою очередь, способствует эффективной адаптации нейросетевых моделей к условиям шепотной речи.

Объём и структура работы. Диссертация состоит из введения, 6 глав, заключения и 1 приложения. Полный объём диссертации составляет 208 страниц, включая 16 рисунков и 23 таблицы. Список литературы содержит 107 наименований.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Заключение диссертации по теме «Другие cпециальности», Авдеева Анастасия Сергеевна

Заключение

В данной работе предлагаются новые методы и средства выделения шепота в полилоге и конверсии шепотной речи в нормальную. Наряду с этим также получены следующие результаты:

1. Разработан нейросетевой метод детектирования шепотной речи на основе биометрического экстрактора дикторских представлений, позволяющий осуществлять автоматический поиск шепотной речи в речевых корпусах.

2. Разработан метод выделения шепота, позволяющий выделять речь целевого диктора, в том числе шепотную, в полилоге в потоковом режиме.

3. Разработан метод голосовой конверсии, отличающийся устойчивостью к условиям смешанной шепотной и нормальной речи, возможностью работы в потоковом режиме, а также возможностью восстановления идентичности голоса целевого диктора. Разработанный метод демонстрирует высокое качество восстановления идентификационных характеристик голоса диктора по метрикам EER и Sim-o. Так, использование предложенной дополнительной функции потерь, а также интеграция дикторской информации позволяет увеличить качество по метрике EER Ц) по сравнению с базовой моделью более чем в 10 раз. Кроме того, предложенная система SpeakerVC, превосходит по метрике Sim-o (t) современные системы синтеза и голосовой конверсии, достигая значения 0.710, тогда как, например, система Voicebox [105] демонстрирует значение 0.662. Также, согласно результатам MOS оценки (t), проводимой с участием независимых экспертов, можно сделать вывод, что предложенная система показывает сравнимое качество с современными система конверсии на голосовых данных, но также дем-нострирует высокий уровень качества в шепотных условиях, в отличии от существующих систем. Так, обработанные системой Pheme [107] шепотные данные получили среднюю оценку 2.31, тогда как обрабоатнные предложенной системой 3.75.

4. Разработан комплекс программных средств для выделения шепота в полилоге и конверсии шепотной речи в нормальную.

На основании сформулированных задач и полученных по ним результатов цель диссертационной работы можно считать достигнутой.

Перспективы дальнейшей работы

К перспективам развития можно отнести следующее:

1. Дальнейшее увеличение точности детектора шепотной речи, особенно в условиях наличия посторонних шумов, с целью формирования более крупного корпуса шепотной речи для обучения нейросетевых моделей. Существующие большие корпуса речевых данных собраны автоматически, поэтому содержат высоко вариативные данные, в том числе пение, детскую речь. Таким образом, для выделения конкретного домена необходим классификатор высокой точности, при обучении которого учтены все особенности обрабатываемого речевого корпуса.

2. Улучшение качества восстановления идентичности голоса диктора при осуществлении голосовой конверсии. Несмотря на то, что разработанная система показывает высокое качество согласно объективным метрикам: EER, WER; по субъективной оценке экспертов (MOS оценке) качество сгенерированных аудиозаписей отстает от качества реальных записей.

Список литературы диссертационного исследования кандидат наук Авдеева Анастасия Сергеевна, 2025 год

Список литературы

1. Jovicic S. T, Saric Z. Acoustic analysis of consonants in whispered speech. // Journal of voice : official journal of the Voice Foundation. — 2008. — Т. 22 3. — С. 263—74.

2. Measurement of speech effort during fluency-inducing conditions in adults who do and do not stutter. / R. J. Ingham, A. K. Bothe, E. M. Jang, L. Yates, J. Cotton, I. Seybold // Journal of speech, language, and hearing research : JSLHR. — 2009. — Т. 52 5. — С. 1286—301.

3. Toda T, Shikano K. NAM-to-speech conversion with Gaussian mixture models // Interspeech. — 2005.

4. Meenakshi N., Ghosh P. K. Whispered Speech to Neutral Speech Conversion Using Bidirectional LSTMs // Interspeech. — 2018.

5. Learning to Discover Cross-Domain Relations with Generative Adversarial Networks / T. Kim, M. Cha, H. Kim, J. K. Lee, J. Kim // International Conference on Machine Learning. — 2017.

6. Effectiveness of Cross-Domain Architectures for Whisper-to-Normal Speech Conversion / M. Parmar, S. Doshi, N. J. Shah, M. Patel, H. A. Patil // 2019 27th European Signal Processing Conference (EUSIPCO). — 2019. — С. 1—5.

7. CinC-GAN for Effective F0 prediction for Whisper-to-Normal Speech Conversion / M. Patel, M. Purohit, J. Shah, H. A. Patil // 2020 28th European Signal Processing Conference (EUSIPCO). — 2020. — С. 411—415.

8. Rekimoto J. WESPER: Zero-Shot and Realtime Whisper to Normal Voice Conversion for Whisper-Based Speech Interactions // Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems. — 2023. — (CHI '23).

9. The chains corpus: Characterizing individual speakers / F. Cummins, M. Grimaldi, T. Leonard, J. Simko // Proc. SPECOM. — 2006. — Янв. — С. 431—435.

10. Lim B. P. Computational differences between whispered and non-whispered speech : дис. ... канд. / Lim Boon Pang. — USA, 2011. — AAI3479149.

11. Desplanques B., Thienpondt J., Demuynck K. ECAPA-TDNN: Emphasized Channel Attention, propagation and aggregation in TDNN based speaker verification // Interspeech 2020. — 2020. — С. 3830—3834.

12. WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing / S. Chen, C. Wang, Z. Chen, Y. Wu, S. Liu, Z. Chen, J. Li, N. Kanda, T. Yoshioka, X. Xiao, J. Wu, L. Zhou, S. Ren, Y. Qian, Y. Qian, J. Wu, M. Zeng, X. Yu, F. Wei // IEEE Journal of Selected Topics in Signal Processing. — 2022. — T. 16, № 6. — C. 1505—1518.

13. LSTM-Based Whisper Detection / Z. Raeesy, K. Gillespie, C. Ma, T. Drugman, J. Gu, R. Maas, A. Rastrow, B. Hoffmeister // 2018 IEEE Spoken Language Technology Workshop (SLT). — 2018. — C. 139—144.

14. Zarazaga P. P., Eje Henter G., Malisz Z. A Processing Framework to Access Large Quantities of Whispered Speech Found in ASMR // ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2023. — C. 1—5.

15. RASTA-PLP speech analysis technique / H. Hermansky, N. Morgan, A. Bayya, P. Kohn // [Proceedings] ICASSP-92: 1992 IEEE International Conference on Acoustics, Speech, and Signal Processing. T. 1. — 1992. — 121—124 vol.1.

16. Voxblink: A Large Scale Speaker Verification Dataset on Camera / Y. Lin, X. Qin, G. Zhao, M. Cheng, N. Jiang, H. Wu, M. Li // ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2024. — C. 10271—10275.

17. VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark / Y. Lin, M. Cheng, F. Zhang, Y. Gao, S. Zhang, M. Li //. — 09.2024. — C. 4263—4267.

18. Fully Supervised Speaker Diarization / A. Zhang, Q. Wang, Z. Zhu, J. W. Paisley, C. Wang // ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2019. — C. 6301—6305.

19. Fini E., Brutti A. Supervised Online Diarization with Sample Mean Loss for Multi-Domain Data // ICASSP 2020 - 2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2020. — C. 7134— 7138.

20. Repvgg: Making vgg-style convnets great again / X. Ding, X. Zhang, N. Ma, J. Han, G. Ding, J. Sun // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2021. — C. 13733—13742.

21. State-of-the-art speaker recognition with neural network embeddings in NIST SRE18 and Speakers in the Wild evaluations / J. Villalba, N. Chen, D. Snyder,

D. Garcia-Romero, A. McCree, G. Sell, J. Borgstrom, L. P. Garcia-Perera, F. Richardson, R. Dehak, P. A. Torres-Carrasquillo, N. Dehak // Computer Speech Language. — 2020. — T. 60. — C. 101026.

22. wav2vec 2.0: a framework for self-supervised learning of speech representations / A. Baevski, H. Zhou, A. Mohamed, M. Auli // Proceedings of the 34th International Conference on Neural Information Processing Systems. — 2020. — (NIPS '20).

23. On the robustness of wav2vec 2.0 based speaker recognition systems / S. Novoselov, G. Lavrentyeva, A. Avdeeva, V. Volokhov, N. Khmelev, A. Akulov, P. Leonteva // Proc. Interspeech. — 2023. — C. 3177—3181.

24. Librispeech: An ASR corpus based on public domain audio books / V. Panayotov, G. Chen, D. Povey, S. Khudanpur // 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2015. — C. 5206—5210.

25. Common Voice: A Massively-Multilingual Speech Corpus / R. Ardila, M. Branson, K. Davis, M. Henretty, M. Kohler, J. Meyer, R. Morais, L. Saunders, F. M. Tyers, G. Weber // Proceedings of the 12th Conference on Language Resources and Evaluation (LREC 2020). — 2020. — C. 4211—4215.

26. NISP: A Multi-lingual Multi-accent Dataset for Speaker Profiling / S. B. Kalluri, D. Vijayasenan, S. Ganapathy, R. R. M, P. Krishnan // ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2021. — C. 6953—6957.

27. al D. G. et. The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage // CoRR. — 2021. — T. abs/2111.09344. — arXiv: 2111.09344. — URL: https://arxiv.org/abs/ 2111.09344.

28. LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech / H. Zen, V. Dang, R. Clark, Y. Zhang, R. J. Weiss, Y. Jia, Z. Chen, Y. Wu // Proc. Interspeech. — 09.2019.

29. Yamagishi J., Veaux C, MacDonald K. CSTR VCTK Corpus: English Multispeaker Corpus for CSTR Voice Cloning Toolkit (version 0.92) //. — 2019.

30. VoxTube: a multilingual speaker recognition dataset / I. Yakovlev, A. Okhotnikov, N. Torgashov, R. Makarov, Y. Voevodin, K. Simonchik // Proc. INTERSPEECH 2023. — 2023. — C. 2238—2242.

31. Natural TTS Synthesis by Conditioning Wavenet on MEL Spectrogram Predictions / J. Shen, R. Pang, R. J. Weiss, M. Schuster, N. Jaitly, Z. Yang, Z. Chen, Y. Zhang, Y. Wang, R. Skerrv-Ryan, R. A. Saurous, Y. Agiomvrgiannakis, Y. Wu // 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2018. — C. 4779— 4783.

32. FastSpeech 2: Fast and High-Quality End-to-End Text to Speech / Y. Ren, C. Hu, X. Tan, T. Qin, S. Zhao, Z. Zhao, T.-Y. Liu // International Conference on Learning Representations. — 2021.

33. Any-to-Many Voice Conversion With Location-Relative Sequence-to-Sequence Modeling / S. Liu, Y. Cao, D. Wang, X. Wu, X. Liu, H. M. Meng // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2020. — T. 29. — C. 1717—1728.

34. al. H. W.-N. et. HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2021. — T. 29. — C. 3451—3460.

35. Robust Speech Recognition via Large-Scale Weak Supervision / A. Radford, J. W. Kim, T. Xu, G. Brockman, C. Mcleavey, I. Sutskever // Proceedings of the 40th International Conference on Machine Learning. — PMLR, 23-29 Jul.2023. — C. 28492—28518.

36. al. G. A. et. Conformer: Convolution-augmented Transformer for Speech Recognition // Proc. Interspeech 2020. — 2020. — C. 5036—5040.

37. Generative Models for Improved Naturalness, Intelligibility, and Voicing of Whispered Speech / D. Wagner, S. Bayerl, H. A. C. Maruri, T. Bocklet // 2022 IEEE Spoken Language Technology Workshop (SLT). — 2022. — C. 943— 948.

38. al. K. K. et. MelGAN: Generative Adversarial Networks for Conditional Waveform Synthesis // Neural Information Processing Systems. — 2019.

39. Pruzansky S., Mathews M. V., Britner P. B. Talker-Recognition Procedure Based on Analysis of Variance // Journal of the Acoustical Society of America. — 1963. — T. 35. — C. 1877—1877.

40. Sambur M. R. Speaker Recognition and Verification using Linear Prediction Analysis // Journal of the Acoustical Society of America. — 1973. — T. 53. — C. 354—354. — URL: https : //api . semanticscholar . org/CorpusID : 119581594.

41. Markel J. D., Oshika B. T., Gray A. H. Long-term feature averaging for speaker recognition // IEEE Transactions on Acoustics, Speech, and Signal Processing. — 1977. — T. 25. — C. 330—337. — URL: https : / / api . semanticscholar.org/CorpusID:122632848.

42. Furui S. Cepstral analysis technique for automatic speaker verification // IEEE Transactions on Acoustics, Speech, and Signal Processing. — 1981. — T. 29. — C. 254—272. — URL: https : / / api . semanticscholar . org/ CorpusID:62219893.

43. A vector quantization approach to speaker recognition / F. K. Soong, A. E. Rosenberg, L. R. Rabiner, B.-H. Juang // ICASSP '85. IEEE International Conference on Acoustics, Speech, and Signal Processing. — 1985. — T. 10. — C. 387—390. — URL: https : / /api . semanticscholar . org/CorpusID : 273404735.

44. Rose R., Reynolds D. Text independent speaker identification using automatic acoustic segmentation //. T. 1. — 05.1990. — 293—296 vol.1.

45. Reynolds D. A., Quatieri T. F., Dunn R. B. Speaker Verification Using Adapted Gaussian Mixture Models // Digit. Signal Process. — 2000. — T. 10. — C. 19—41.

46. Kinnunen T. H., Li H. An overview of text-independent speaker recognition: From features to supervectors // Speech Commun. — 2010. — T. 52. — C. 12— 40. — URL: https://api.semanticscholar.org/CorpusID:17574321.

47. A Study of Interspeaker Variability in Speaker Verification / P. Kenny, P. Ouellet, N. Dehak, V. Gupta, P. Dumouchel // IEEE Transactions on Audio, Speech, and Language Processing. — 2008. — T. 16, № 5. — C. 980—988.

48. Joint Factor Analysis for Text-Dependent Speaker Verification / P. Kenny, T. Stafylakis, A. Jahangir, P. Ouellet, M. Kockmann // The Speaker and Language Recognition Workshop (Odyssey 2014). — 2014. — C. 200—207.

49. Front-End Factor Analysis for Speaker Verification / N. Dehak, P. Kenny, R. Dehak, P. Dumouchel, P. Ouellet // IEEE Transactions on Audio, Speech, and Language Processing. — 2011. — T. 19. — C. 788—798. — URL: https: //api.semanticscholar.org/CorpusID:41754.

50. Preliminary investigation of Boltzmann machine classifiers for speaker recognition / T. Stafylakis, P. Kenny, M. Senoussaoui, P. Dumouchel // The Speaker and Language Recognition Workshop (Odyssey 2012). — 2012. — C. 109—116.

51. Ghahabi O, Hernando J. Deep belief networks for i-vector based speaker recognition // 2014 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2014. — C. 1700—1704.

52. X-Vectors: Robust DNN Embeddings for Speaker Recognition / D. Snyder, D. Garcia-Romero, G. Sell, D. Povey, S. Khudanpur // 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2018. — C. 5329—5333.

53. Utterance-level Aggregation for Speaker Recognition in the Wild / W. Xie, A. Nagrani, J. S. Chung, A. Zisserman // ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2019. — C. 5791—5795.

54. Fan X., Hansen J. Speaker identification for whispered speech using modified temporal patterns and MFCCs // Interspeech 2009. — 09.2009. — C. 896— 899.

55. Fan X., Hansen J. H. L. Speaker identification for whispered speech using a training feature transformation from neutral to whisper // Interspeech 2011. — 2011. — C. 2425—2428.

56. Fan X., Godin K. W, Hansen J. H. L. Acoustic analysis of whispered speech for phoneme and speaker dependency // Interspeech 2011. — 2011. — C. 181— 184.

57. Xu J., Zhao H. Speaker identification with whispered speech using unvoiced-consonant phonemes // 2012 International Conference on Image Analysis and Signal Processing. — 2012. — C. 1—4.

58. wTIMIT2mix: A Cocktail Party Mixtures Database to Study Target Speaker Extraction for Normal and Whispered Speech / M. Borsdorf, Z. Pan, H. Li, T. Schultz // Interspeech 2024. — 2024. — C. 5038—5042.

59. RECOGNITION OF CONTINUOUS BROADCAST NEWS WITH MULTIPLE UNKNOWN SPEAKERS AND ENVIRONMENTS / U. Jain, M. A. Siegler, S.-j. Doh, E. B. Gouvea, J. M. Huerta, P. J. Moreno, B. Raj, R. M. Stern //. — 1995.

60. Gauvain J.-L, Lamel L, Adda G. Partitioning and transcription of broadcast news data // 5th International Conference on Spoken Language Processing (ICSLP 1998). — 1998.

61. Liu D., Kubala F. Fast speaker change detection for broadcast news transcription and indexing // 6th European Conference on Speech Communication and Technology (Eurospeech 1999). — 1999.

62. Gish H, Siu M, Rohlicek J. R. Segregation of speakers for speech recognition and speaker identification // [Proceedings] ICASSP 91: 1991 International Conference on Acoustics, Speech, and Signal Processing. — 1991. — 873—876 vol.2.

63. Speaker clustering and transformation for speaker adaptation in large-vocabulary speech recognition systems / M. Padmanabhan, L. R. Bahl, D. Nahamoo, M. Picheny // 1996 IEEE International Conference on Acoustics, Speech, and Signal Processing Conference Proceedings. — 1996. — Т. 2. — 701—704 vol. 2.

64. Markov K., Nakamura S. Never-ending learning system for on-line speaker diarization // 2007 IEEE Workshop on Automatic Speech Recognition & Understanding (ASRU). — 2007. — С. 699—704.

65. Markov K., Nakamura S. Never-ending learning with dynamic hidden Markov network // INTERSPEECH. — 2007.

66. Sato M.-a., Ishii S. On-line EM Algorithm for the Normalized Gaussian Network // Neural Computation. — 2000. — Т. 12. — С. 407—432.

67. Geiger J. T, Wallhoff F, Rigoll G. GMM-UBM based open-set online speaker diarization // INTERSPEECH. — 2010.

68. Soldi G., Beaugeant C, Evans N. W. D. Adaptive and online speaker diarization for meeting data // 2015 23rd European Signal Processing Conference (EUSIPCO). — 2015. — С. 2112—2116.

69. Blei D. M, Frazier P. Distance dependent Chinese restaurant processes // J. Mach. Learn. Res. — 2010. — Т. 12. — С. 2461—2488.

70. End-to-End Neural Speaker Diarization with Permutation-Free Objectives / Y. Fujita, N. Kanda, S. Horiguchi, K. Nagamatsu, S. Watanabe // INTERSPEECH. — 2019.

71. End-to-End Neural Speaker Diarization with Self-Attention / Y. Fujita, N. Kanda, S. Horiguchi, Y. Xue, K. Nagamatsu, S. Watanabe // 2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU). — 2019. — С. 296—303.

72. Multitalker Speech Separation With Utterance-Level Permutation Invariant Training of Deep Recurrent Neural Networks / M. Kolbaek, D. Yu, Z. Tan,

J. H. Jensen // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2017. — T. 25. — C. 1901—1913.

73. Luo Y, Chen Z, Mesgarani N. Speaker-Independent Speech Separation With Deep Attractor Network // IEEE/ACM Transactions on Audio, Speech, and Language Processing. — 2018. — T. 26. — C. 787—796.

74. End-to-End Speaker Diarization for an Unknown Number of Speakers with Encoder-Decoder Based Attractors / S. Horiguchi, Y. Fujita, S. Watanabe, Y. Xue, K. Nagamatsu // ArXiv. — 2020. — T. abs/2005.09921.

75. Online End-To-End Neural Diarization with Speaker-Tracing Buffer / Y. Xue, S. Horiguchi, Y. Fujita, S. Watanabe, K. Nagamatsu // 2021 IEEE Spoken Language Technology Workshop (SLT). — 2021. — C. 841—848.

76. Online Neural Diarization of Unlimited Numbers of Speakers / S. Horiguchi, S. Watanabe, P. Garcia, Y. Takashima, Y. Kawaguchi // ArXiv. — 2022. — T. abs/2206.02432.

77. End-to-end Neural Diarization: From Transformer to Conformer / Y. C. Liu, E. Han, C. Lee, A. Stolcke // Interspeech. — 2021.

78. Multi-Channel End-To-End Neural Diarization with Distributed Microphones / S. Horiguchi, Y. Takashima, P. Garcia, S. Watanabe, Y. Kawaguchi // ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2022. — C. 7332— 7336.

79. Interrelate Training and Searching: A Unified Online Clustering Framework for Speaker Diarization / Y. Chen, Y. Guo, Q. Li, G. Cheng, P. Zhang, Y. Yan // INTERSPEECH. — 2022.

80. Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario / I. Medennikov, M. Korenevsky, T. Prisyach, Y. Y. Khokhlov, M. Korenevskaya, I. Sorokin, T. Timofeeva, A. Mitrofanov, A. Andrusenko, I. Podluzhny, A. Laptev, A. Romanenko // ArXiv. — 2020. — T. abs/2005.07272.

81. Wang W, Lin Q, Li M. Online Target Speaker Voice Activity Detection for Speaker Diarization // ArXiv. — 2022. — T. abs/2207.05920.

82. Stylianou Y, Cappe O, Moulines E. Continuous probabilistic transform for voice conversion // IEEE Trans. Speech Audio Process. — 1998. — T. 6. — C. 131—142.

83. Voice Conversion Using Partial Least Squares Regression / E. Helander, T. Virtanen, J. Nurminen, M. Gabbouj // IEEE Transactions on Audio, Speech, and Language Processing. — 2010. — T. 18. — C. 912—921.

84. Voice Conversion Using Dynamic Kernel Partial Least Squares Regression / E. Helander, H. Silen, T. Virtanen, M. Gabbouj // IEEE Transactions on Audio, Speech, and Language Processing. — 2012. — T. 20. — C. 806—817.

85. Erro D., Moreno A., Bonafonte A. Voice Conversion Based on Weighted Frequency Warping // IEEE Transactions on Audio, Speech, and Language Processing. — 2010. — T. 18. — C. 922—931.

86. Correlation-based frequency warping for voice conversion / X. Tian, Z. Wu, S. W. Lee, C. E. Siong // The 9th International Symposium on Chinese Spoken Language Processing. — 2014. — C. 211—215.

87. StarGAN-VC: non-parallel many-to-many Voice Conversion Using Star Generative Adversarial Networks / H. Kameoka, T. Kaneko, K. Tanaka, N. Hojo // 2018 IEEE Spoken Language Technology Workshop (SLT). — 2018. — C. 266—273.

88. A Comparison of Discrete and Soft Speech Units for Improved Voice Conversion / B. van Niekerk, M.-A. Carbonneau, J. Zaidi, M. Baas, H. Seute, H. Kamper // ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2021. — C. 6562— 6566.

89. Promptvc: Flexible Stylistic Voice Conversion in Latent Space Driven by Natural Language Prompts / J. Yao, Y. Yang, Y. Lei, Z. Ning, Y. Hu, Y. Pan, J. Yin, H. Zhou, H. Lu, L. Xie // ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2023. — C. 10571—10575.

90. Whisper to Normal Speech Conversion Using Sequence-to-Sequence Mapping Model With Auditory Attention / H. Lian, Y. Hu, W. Yu, J. Zhou, W. Zheng // IEEE Access. — 2019. — T. 7. — C. 130495—130504.

91. Oord A. van den, Vinyals O, Kavukcuoglu K. Neural Discrete Representation Learning // NIPS. — 2017.

92. Kong J., Kim J., Bae J. HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis // Advances in Neural Information Processing Systems. T. 33. — Curran Associates, Inc., 2020. — C. 17022—17033.

93. Nagrani A., Chung J. S., Zisserman A. VoxCeleb: A Large-Scale Speaker Identification Dataset // Interspeech 2017. — 2017. — C. 2616—2620.

94. Koluguri N. R., Park T, Ginsburg B. TitaNet: Neural Model for Speaker Representation with 1D Depth-Wise Separable Convolutions and Global Context // ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2022. — C. 8102—8106.

95. Advancing speaker embedding learning: Wespeaker toolkit for research and production / S. Wang, Z. Chen, B. Han, H. Wang, C. Liang, B. Zhang, X. Xiang, W. Ding, J. Rohdin, A. Silnova [h gp.] // Speech Communication. — 2024. — T. 162. — C. 103104.

96. Wespeaker: A research and production oriented speaker embedding learning toolkit / H. Wang, C. Liang, S. Wang, Z. Chen, B. Zhang, X. Xiang, Y. Deng, Y. Qian // IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — IEEE. 2023. — C. 1—5.

97. Snyder D, Chen G, Povey D. MUSAN: A Music, Speech, and Noise Corpus // ArXiv. — 2015. — T. abs/1510.08484.

98. Voices obscured in complex environmental settings (voices) corpus / C. Richey, M. A. Barrios, Z. Armstrong, C. Bartels, H. Franco, M. Graciarena, A. Lawson, M. K. Nandwana, A. Stauffer, J. van Hout [h gp.] // arXiv arXiv:1804.05053. — 2018.

99. KodaliRadha, Mohansansal. Non-Native Children English Speech (NNCES) Corpus. — 2022. — URL: https://www.kaggle.com/dsv/4416485.

100. Black D. A., Li M., Tian M. Automatic identification of emotional cues in Chinese opera singing // ICMPC, Seoul, South Korea. — 2014. — C. 250— 255.

101. Faghih B., Timoney J. Annotated-VocalSet: A Singing Voice Dataset // Applied Sciences. — 2022. — T. 12, № 18. — URL: https : / /www . mdpi . com/2076-3417/12/18/9257.

102. QuickVC: Any-to-many Voice Conversion Using Inverse Short-time Fourier Transform for Faster Conversion / H. Guo, C. Liu, C. T. Ishi, H. Ishiguro // ArXiv. — 2023. — T. abs/2302.08296v4. — URL: https : //api.semanticscholar.org/CorpusID:256900862.

103. StyleTTS 2: towards human-level text-to-speech through style diffusion and adversarial training with large speech language models / Y. A. Li, C. Han, V. S. Raghavan, G. Mischler, N. Mesgarani // Proceedings of the

37th International Conference on Neural Information Processing Systems. — 2023. — (NIPS '23).

104. ISTFTNET: Fast and Lightweight Mel-Spectrogram Vocoder Incorporating Inverse Short-Time Fourier Transform / T. Kaneko, K. Tanaka, H. Kameoka, S. Seki // ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — 2022. — C. 6207—6211.

105. Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale / M. Le, A. Vyas, B. Shi, B. Karrer, L. Sari, R. Moritz, M. Williamson, V. Manohar, Y. Adi, J. Mahadeokar, W.-N. Hsu. — 2023. — arXiv: 2306.15687 [eess.AS].

106. Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone / E. Casanova, J. Weber, C. D. Shulby, A. C. Junior, E. Golge, M. A. Ponti // International Conference on Machine Learning. — PMLR. 2022. — C. 2709—2720.

107. Pheme: Efficient and Conversational Speech Generation / P. Budzianowski, T. Sereda, T. Cichy, I. Vuli'c // ArXiv. — 2024. — T. abs/2401.02839.

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.