Методика оценки защищенности акустической речевой информации от утечки по техническим каналам с применением сверточных нейронных сетей тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Волков Никита Андреевич
- Специальность ВАК РФ00.00.00
- Количество страниц 172
Оглавление диссертации кандидат наук Волков Никита Андреевич
Введение
1 Анализ современного состояния исследований в области оценки защищенности акустической речевой информации
1.1. Анализ каналов утечки акустической речевой информации
1.2. Обзор существующих методов и средств оценки защищенности речевой информации
1.2.1 Субъективные методы оценки разборчивости акустической речевой информации
1.2.2 Объективные методы оценки разборчивости акустической речевой информации
1.3. Виды акустических помех, влияющих на разборчивость речи
1.4. Обоснование необходимости разработки новой методики оценки защищенности акустической речевой информации на основе нейронных сетей
1.4.1 Описание форматов представления данных акустических сигналов для использования сверточных нейронных сетей
1.4.2 Выбор наиболее подходящей архитектуры сверточной нейронной сети для реализации программно-аппаратного комплекса оценки защищенности акустической речевой информации
Выводы по главе
2 Разработка методики предобработки данных для оценки разборчивости акустической речевой информации
2.1. Формирование набора данных
2.2 Артикуляционные испытания
2.3. Генерация спектрограмм и графиков МРСС
2.3.1 Длительность аудиозаписи
2.3.2 База быстрого преобразования Фурье и параметры спектральной огибающей
2.3.3 Размер изображения
2.3.4 Тип масштабирования изображения
2.3.5 Оценка устойчивости спектрограмм к сжатию при различных базах быстрого преобразования Фурье
2.4 Обоснование выбора архитектуры сверточной нейронной сети
2.5. Обучение сверточной нейронной сети и оценка её параметров
2.6. Анализ результатов обучения модели сверточной нейронной сети .. 73 Выводы по главе
3 Разработка модели оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей
3.1. Модель оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей
3.2. Преимущества предложенной модели оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей
Выводы по главе
4 Разработка методики оценки защищенности акустической речевой информации на основе анализа распределения энергии речевого и маскирующего сигнала в акустическом спектре
Выводы по главе
5 Структура и интерфейс разработанного программно-аппаратного комплекса оценки защищенности акустической речевой информации на основе многоканальной системы сверточных нейронных сетей
Выводы по главе
6 Апробация методики оценки защищенности акустической речевой информации на основе анализа распределения энергии речевого и маскирующего сигнала в акустическом спектре в реальных условиях
6.1. Калибровка акустического излучателя
6.2. Проведение оценки разборчивости акустической речевой информации при помощи субъективной методики, инструментально-расчетной методики и разработанной методики
6.3. Анализ достоверности оценки защищенности акустической речевой информации при помощи разработанной методики
Выводы по главе
Заключение
Список сокращений и условных обозначений
Список используемой литературы
ПРИЛОЖЕНИЕ 1. Программный код на языке программирования Python для обучения архитектуры сверточной нейронной сети ResNet на наборе данных, состоящий из спектрограмм зашумленных аудиозаписей речи
ПРИЛОЖЕНИЕ 2. Программный код на языке программирования Python для обучения архитектуры сверточной нейронной сети ResNet на наборе данных, состоящий из графиков MFCC зашумленных аудиозаписей речи
ПРИЛОЖЕНИЕ 3. Программный код на языке программирования Python для обучения архитектуры сверточной нейронной сети ResNet на наборе данных, состоящий из спектрограмм помех, применяемых при зашумлении тестового речевого сигнала
ПРИЛОЖЕНИЕ 4. Статистическая обработка результатов измерений разборчивости речи для каждого типа помехи и каждой из рассматриваемых методик оценки разборчивости речи
ПРИЛОЖЕНИЕ 5. Акты о внедрении научных результатов
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методика оценки защищенности речевой информации от утечки по техническим каналам с учетом форсирования речи2015 год, кандидат наук Иванов Андрей Валерьевич
Модели и методы обработки аудиосигналов телекоммуникационных систем в сложной помеховой обстановке0 год, доктор технических наук Кропотов, Юрий Анатольевич
Усовершенствованная методика оценки защищенности речевой информации от утечки по техническим каналам2012 год, кандидат технических наук Рева, Иван Леонидович
Цифровая обработка изображений динамических сонограмм для нейтрализации спектральных искажений речевой информации2014 год, кандидат наук Алюшин, Виктор Михайлович
Обоснование комплекса электроакустических характеристик речевых гарнитурных микрофонов для условий повышенных акустических шумов2013 год, кандидат наук Повинский, Юрий Владимирович
Введение диссертации (часть автореферата) на тему «Методика оценки защищенности акустической речевой информации от утечки по техническим каналам с применением сверточных нейронных сетей»
Введение
Актуальность темы исследования. Одной из ключевых задач в области обеспечения информационной безопасности является защита акустической речевой информации при проведении переговоров. Защищаемая информация может быть получена вследствие утечки информации по техническим каналам. Технический канал утечки информации (ТКУИ) представляет собой совокупность источника информации (диктора), физической среды распространения сигнала и технических средств перехвата информации (приёмника) [1]. Среди различных видов ТКУИ, в данной работе рассматриваются акустические каналы утечки информации в помещении, где в качестве передаваемого сигнала выступает акустическая речевая информация.
Для оценки защищенности информации от утечки по техническим каналам в помещении, которое предназначено для проведения закрытых переговоров, чаще всего используется общепринятая инструментально-расчетная методика, предложенная Хоревым А.А., Железняком В.К. и Макаровым Ю.К. [2], основанная на результатах экспериментальных исследований Н.Б. Покровского, называемых формантным методом [3]. Критерием оценки защищенности акустической речевой информации является значение разборчивости речи (Ж). В данном случае под оценкой разборчивости речи понимается определение доли речевой информации, которая может быть воспринята злоумышленником за пределами помещения, где ведутся закрытые переговоры.
Общепринятая инструментально-расчетная методика, по сути, является частным случаем методики Н.Б. Покровского, а именно:
1) рассматривается только словесная разборчивость Ш;
2) измерение сигналов производится в октавных полосах частот;
3) сигнал измеряется на расстоянии 1 м от микрофона (в исследованиях Н.Б. Покровского - 8 см).
Однако условия проведения экспериментов в исследованиях Н.Б. Покровского (оценивалось качество телефонных линий связи) существенно отличались от современных условий защиты информации, а также от современных возможностей средств измерительной техники и обработки сигналов. Поскольку общепринятая инструментально-расчетная методика является частным случаем методики Покровского Н.Б., она также сталкивается с рядом ограничений при применении в современных условиях. Основные из этих ограничений:
1) не рассматривались условия с высоким уровнем маскирующих помех, при этом не учитывалось, что восприятие речи зависит от множества факторов и сводится не только к отношению сигнал/шум в октавных полосах;
2) не учитывались различия в спектрах речи дикторов, все основывалось на усредненном спектре речи;
3) маскировка речи учитывалась только с помощью помех на основе белого шума (с изменением спектра путем применения фильтров), исключая возможность оценки защищенности с помощью помех типа «речевой хор» (помеха, состоящая из смеси звуков речи, формируемая по определенным правилам, описанным в работах Авдеева В.Б., Зельманского О.Б., Трушина В.А. и др).
Учесть перечисленные недостатки становится возможным при использовании для оценки защищенности акустической речевой информации методики на основе многоканальной системы сверточных нейронных сетей. В связи с этим была сформулирована научная задача, заключающаяся в разработке и обосновании методики оценки защищенности акустической речевой информации при помощи многоканальной системы сверточных нейронных сетей в помещениях, предназначенных для проведения закрытых переговоров, с учетом высокого уровня маскирующих помех, различия в спектрах речи дикторов, различных спектров помех на основе белого шума, а также помехи типа «речевой хор».
Стоит отметить, что в работе рассматривается случай с проведением оценки защищенности акустической речевой информации только с применением средств активной защиты (САЗ), генерирующих маскирующие помехи.
Проведенные в ходе работы исследования показали, что предложенная методика оценки защищенности акустической речевой информации является полноценным решением поставленной научной задачи.
Степень проработки темы исследования. Вопросам оценки защищенности акустической речевой информации посвящены работы таких отечественных и зарубежных исследователей, как: Хорев А.А., Железняк В.К., Макаров Ю.К., Покровский Н.Б., Авдеев В.Б., Дворянкин С.В., Иванов А.В., Козлачков С.Б., Трушин В.А., Тупота В.И., Claudio S., Hasegawa-Johnson M., Houtgast T., Killion M., Lu L., Mueller G., Shifas M., Steeneken H., Stylianou Y., Verhave J. и многих других. Для применения общепринятой методики на практике используют инструментальный подход, основанный на измерении интегральных уровней в октавных полосах тестовых сигналов, фоновых шумов и шумов от САЗ, создающих маскирующие помехи, а также акустического сигнала за ограждающей конструкцией в виде смеси тестового сигнала и шума. В соответствии с зависимостями, полученными экспериментальным путем Покровским Н.Б., производится расчет разборчивости речи. Использование методов искусственного интеллекта позволяет перейти от указанной методики с измерением уровней сигнала и шума к методам соответствия разборчивости речи распределению энергии речевого и маскирующего сигналов в акустическом спектре сигнала.
Существующие обученные алгоритмы распознавания речи для решения поставленной задачи не подходят по причине того, что они не предназначены для работы в условиях высоких уровней шумов (отношение сигнал/шум меньше -10 дБ).
Целью исследования является повышение достоверности оценки защищенности акустической речевой информации за счет учета реальных
условий, а именно высокого уровня маскирующих помех, различия в спектрах речи дикторов, различных спектров помех на основе белого шума, а также помехи типа «речевой хор» с использованием методики, основанной на многоканальной системе сверточных нейронных сетей.
Для достижения поставленной цели необходимо решить следующие задачи:
1. Провести анализ современного состояния исследований в области оценки защищенности акустической речевой информации;
2. Разработать методику предобработки данных для оценки разборчивости акустической речевой информации с применением многоканальной системы сверточных нейронных сетей;
3. Разработать модель оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей;
4. Разработать методику оценки защищенности акустической речевой информации на основе анализа распределения энергии речевого и маскирующего сигнала в акустическом спектре;
5. Разработать структуру программно-аппаратного комплекса оценки защищенности акустической речевой информации на основе многоканальной системы сверточных нейронных сетей.
Объектом исследования является акустическая речевая информация.
Предметом исследования являются методики оценки защищенности акустической речевой информации на основе спектрограмм и графиков мел-частотных кепстральных коэффициентов с использованием сверточных нейронных сетей.
Методы исследования. Применялись положения теории разборчивости речи, теории измерений, методы обработки речевых сигналов, классификации и идентификации образов, глубокого обучения, теории вероятностей и математической статистики, распознавания образов, аппарат искусственных нейронных сетей (ИНС).
Достоверность и обоснованность работы подтверждается корректной постановкой задач и выбором известных методов, успешно применяемых в других областях, практическим применением системы, построенной в соответствии с разработанными методиками и моделью, а также апробацией на научных конференциях, публикацией результатов в научных изданиях, в том числе из Перечня ВАК, актами о внедрении результатов работы в образовательную и производственную сферы.
Научную новизну работы составляют:
1. Методика предобработки данных для оценки разборчивости акустической речевой информации, отличающаяся созданием зашумленных аудиозаписей речи со множеством незначительных стохастических вариаций в амплитуде шумового сигнала, а также классификацией аудиозаписей по уровням разборчивости речи на основе распределения энергии речевого и маскирующего сигнала в акустическом спектре, что позволяет сформировать наборы данных для обучения многоканальной системы сверточных нейронных сетей при оценке защищенности акустической речевой информации от утечки по техническим каналам.
2. Модель оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей, которая, в отличие от традиционных подходов, использует раздельные каналы обработки спектрограмм и графиков мел-частотных кепстральных коэффициентов, позволяя учитывать высокий уровень маскирующих помех, различные спектры помех на основе белого шума, помехи типа «речевой хор» и различия в спектрах речи дикторов при определении уровня разборчивости речи на основе мажорантной оценки.
3. Методика оценки защищенности акустической речевой информации, отличающаяся от общепринятой инструментально-расчетной методики переходом от измерения интегральных уровней в октавных полосах акустических сигналов к анализу распределения энергии речевого и маскирующего сигнала в акустическом спектре, а также наличием тестового
сигнала в виде последовательности аудиозаписей речи дикторов, что обеспечивает повышение достоверности оценки в наиболее значимом диапазоне показателя защищенности акустической речевой информации.
Теоретическая значимость диссертационной работы заключается в методике предобработки данных для оценки разборчивости акустической речевой информации, разработке модели оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей, разработке методики оценки защищенности акустической речевой информации.
Практическая значимость работы заключается в разработке программно-аппаратного комплекса, позволяющего проводить оценку защищенности помещений при проведении закрытых переговоров в условиях высокого уровня маскирующих помех, воздействия различных спектров помех на основе белого шума и помехи типа «речевой хор», а также учета различия в спектрах речи дикторов. Проведённые испытания подтвердили точность распознавания программно-аппаратным комплексом словесной разборчивости речи (более 90%) и достоверность предложенной методики в реальных условиях эксплуатации. Разработанный комплекс может использоваться как в учебном процессе при подготовке специалистов по защите информации, так и в практической деятельности - организациями -лицензиатами ФСТЭК России, профессионально занимающимися оценкой защищенности информации, разработкой методик, созданием программно-аппаратных комплексов оценки защищенности акустической речевой информации, а также организациями, занимающимися проектированием переговорных комнат.
Положения, выносимые на защиту:
1. Методика предобработки данных для оценки разборчивости акустической речевой информации, позволяющая сформировать наборы данных для обучения многоканальной системы сверточных нейронных сетей
при оценке защищенности акустической речевой информации от утечки по техническим каналам (пп. 10, 11 паспорта специальности 2.3.6).
2. Модель оценки разборчивости акустической речевой информации на основе многоканальной системы сверточных нейронных сетей, позволяющая учитывать высокий уровень маскирующих помех, различные спектры помех на основе белого шума, помехи типа «речевой хор» и различия в спектрах речи дикторов при определении уровня разборчивости речи на основе мажорантной оценки (пп. 10, 11 паспорта специальности 2.3.6).
3. Методика оценки защищенности акустической речевой информации, позволяющая повысить достоверность оценки защищенности и обеспечить отклонение значения защищенности от истинного значения (результаты субъективных испытаний) не более 4% в наиболее значимом диапазоне значений показателя оценки защищенности. Возможность учета помехи типа «речевой хор» при оценке защищенности позволяет расширить область применения данной методики (пп. 10, 11 паспорта специальности 2.3.6).
Личный вклад. Все результаты, изложенные в диссертации, включая программные реализации предложенных в работе методик, получены автором самостоятельно. Проработка цели и задач, способов их решения и вариантов представления результатов осуществлены автором совместно с научным руководителем.
Апробация результатов работы. О полученных результатах работы докладывалось на следующих конференциях:
1) XIV Всероссийская научная конференция молодых ученых «Наука. Технологии. Инновации-2020» (г. Новосибирск);
2) XXI всероссийский конкурс-конференция студентов и аспирантов по информационной безопасности <^ШШЕО-2021» (г. Томск);
3) XV Международная научно-техническая конференция "Динамика систем, механизмов и машин" (г. Омск);
4) XV Всероссийская научная конференция молодых ученых «Наука. Технологии. Инновации-2021» (г. Новосибирск);
5) 10-ая Всероссийская молодежная школа-семинар по проблемам информационной безопасности «ПЕРСПЕКТИВА - 2023» (г. Красноярск);
6) XXIV Всероссийский конкурс-конференция студентов и аспирантов по информационной безопасности «SIBINFO-2024» (г. Томск);
7) VII Всероссийская молодежная научно-практическая конференция с международным участием «Информационные технологии обеспечения комплексной безопасности в цифровом обществе» (г. Уфа);
8) AISMA-2024: International Workshop on Advanced in Information Security Management and Applications (г. Ставрополь).
Соответствие паспорту специальности. Тема и содержание диссертации соответствуют паспорту специальности 2.3.6. Методы и системы защиты информации, информационная безопасность, пункту 10: «Модели и методы оценки защищенности информации и информационной безопасности объекта», а также пункту 11: «Модели и методы оценки эффективности систем (комплексов), средств и мер обеспечения информационной безопасности объектов защиты».
Публикации. По теме диссертации лично и в соавторстве опубликовано 11 печатных работ, 4 из которых изданы в журналах, рекомендованных ВАК; 2 научные публикации индексированы в международной информационно-аналитической системе научного цитирования Scopus.
Объем и структура работы. Диссертация состоит из введения, 6 глав, заключения, списка литературы (123 наименования) и 5 приложений. Общий объем диссертации составляет 1 72 страницы, включающих в себя 21 таблицу и 27 рисунков.
1 Анализ современного состояния исследований в области оценки защищенности акустической речевой информации
1.1. Анализ каналов утечки акустической речевой информации
В современных условиях информационной безопасности особое внимание уделяется проблеме утечки акустической речевой информации. Эта категория информации, передающаяся в форме акустических сигналов, представляет собой одну из наиболее уязвимых форм передачи закрытых данных, особенно в условиях переговорных помещений и закрытых совещаний.
Технические каналы утечки информации (ТКУИ) включают в себя широкий спектр физических сред и механизмов, через которые потенциально возможна компрометация речевой информации. Среди них выделяются: виброакустические каналы (передача колебаний через стены, окна, инженерные конструкции), электромагнитные (наводки в кабелях и микрофонных цепях), оптические (съем отражений с вибрирующих поверхностей), а также акустические — передача сигнала непосредственно через воздушную среду за пределы охраняемого помещения [4].
Наиболее значимым из них, как показывает анализ инцидентов и практики специальных исследований [5-8], является акустический канал утечки, в котором непосредственным носителем информации выступает речевой сигнал. Этот канал обладает высокой эффективностью передачи, особенно при наличии конструктивных особенностей помещения, таких как щели в оконных проемах, недостаточная звукоизоляция стен, вентиляционные шахты и др.
В таблице 1 представлены основные элементы утечки речевой информации, степень риска утечки, характеристика и типичные методы защиты:
Таблица 1. Основные элементы утечки речевой информации
№ п/п Элементы утечки Степень риска Характеристика Типичные методы защиты
1 Через строительные конструкции Высокая Передача вибраций и акустических волн через стены, потолок, пол Установка звукопоглощающих панелей, виброизоляция
2 Через оконные проемы Высокая Утечка звуков через щели, стеклопакеты с низкой звукоизоляцией Двойные стеклопакеты, маскирующие устройства в проемах
3 Через дверные проемы Средняя Щели и зазоры в притворах дверей, плохо прилегающие уплотнители Герметизация, автоматические звуковые завесы
4 Через вентиляционные каналы Средняя Передача звука по каналам систем вентиляции и кондиционирования Акустические фильтры, шумовые генераторы
5 Через инженерные сети Средняя Эмиссия звука через кабельные шахты, трубы, вводы Экранирование, акустические ловушки
6 Путем внедрения акустических закладок Очень высокая Использование скрытых микрофонов или акустических преобразователей Сканирование при помощи специальных технических мероприятий, экранирование, активный контроль
На сегодняшний день наибольшее распространение получили активные средства защиты информации. Принцип их работы заключается в создании маскирующего акустического фона, который должен затруднять или полностью блокировать возможность различения речи при перехвате акустического сигнала [9].
Типичные решения включают в себя следующие:
1) Генераторы белого шума — шум с равномерной плотностью мощности по всему частотному диапазону;
2) Психоакустические маскирующие сигналы — специально сформированные шумы, нацеленные на заглушение формантной структуры речи;
3) Шумовые завесы по периметру — акустические колонки, формирующие шумовое поле в зоне потенциальной утечки.
Таким образом, анализ технических каналов утечки акустической речевой информации показывает, что, несмотря на наличие организационных и технических мер защиты, реальная эффективность противодействия во многом зависит от точности оценки уровня защищенности, что требует современных методик анализа акустических сигналов, особенно в условиях сложных шумовых и архитектурных факторов.
1.2. Обзор существующих методов и средств оценки защищенности речевой информации
Оценка защищенности акустической речевой информации представляет собой важный этап при проектировании систем обеспечения информационной безопасности. Целью подобных оценок является определение вероятности несанкционированного перехвата или утечки речевой информации через акустические или виброакустические каналы. Для этих целей в настоящее время используется широкий спектр методов оценки разборчивости акустической речевой информации — как отечественных, так и зарубежных. Они разделяются на субъективные и объективные методы [10-12].
На рисунке 1 представлены существующие методы оценки разборчивости акустической речевой информации.
Рисунок 1. Существующие методы оценки разборчивости акустической
речевой информации
1.2.1 Субъективные методы оценки разборчивости акустической речевой информации
Субъективные методы оценки разборчивости акустической речевой информации основаны на восприятии речи человеком и предполагают участие экспертов или неподготовленных слушателей. Несмотря на развитие формализованных инструментальных подходов, субъективные методы остаются важным элементом практики, особенно при тестировании новых систем речевой передачи, акустической защиты или в условиях, где сложно количественно формализовать параметры сигнала. Существуют следующие субъективные методы оценки разборчивости акустической речевой информации:
1) Чисто субъективный подход;
2) Метод артикуляции;
3) Тональный метод.
Чисто субъективный подход заключается в том, что испытуемым предъявляется речевой сигнал (чистый или зашумленный), после чего они оценивают уровень его разборчивости. Результаты фиксируются в процентах либо по шкале — например, пятибалльной. Такой подход закреплён в отечественном стандарте ГОСТ Р 50840-95 [13], ГОСТ 16600-72 [14] а также в международных рекомендациях ITU-T P.800 [15].
Он прост в реализации, не требует специализированного оборудования, но обладает высоким уровнем субъективности: результаты зависят от слуха, усталости и опыта эксперта. Подходит в тех случаях, когда требуется быстрая первичная оценка или проверка эффективности акустических средств защиты информации на слух.
Метод артикуляции представляет собой формализованный субъективный способ оценки разборчивости речи, при котором испытуемым предъявляются фонетически сбалансированные слова или слоги, а затем подсчитывается доля правильно воспроизведённых единиц. Обычно используются односложные слова, подобранные по принципу равномерного распределения звуков. Испытуемые воспроизводят услышанное (устно или письменно), после чего определяется процент верно воспринятых речевых единиц. Метод широко применялся в 1940-1960-х годах для оценки качества каналов телефонной связи, громкоговорящих систем, а также при разработке речевых стандартов. Он стал основой для формализации индекса артикуляции (AI или Articulation Index) — количественного показателя, отражающего качество передачи речи в условиях зашумления [16, 17].
Тональный метод используется для оценки слышимости синусоидальных или узкополосных сигналов в присутствии акустической помехи. Цель — определить, может ли испытуемый различить представленный тон или шум в заданных условиях. Применяется, в частности, для тестирования эффективности маскирующих устройств и акустических завес [18, 19].
Метод не позволяет оценить смысловую разборчивость речи, но даёт информацию о слышимости отдельных частотных компонентов. Может применяться совместно с другими подходами в испытательных лабораториях.
1.2.2 Объективные методы оценки разборчивости акустической речевой информации
Концептуально объективные методы оценки разборчивости речи отличаются от субъективных тем, что лишены человеческого фактора. Объективные методы оценки разборчивости речи разбиваются на формантные методы и модуляционные методы [3, 20-24].
Формантные методы оценки разборчивости речи базируются на разбиении речевого спектра на частотные полосы, которые могут иметь различную ширину — октавную, третьоктавную, равноартикуляционную и другие. В пределах каждой из таких полос плотность вероятностей распределения формант принимается постоянной, а сама разборчивость определяется в зависимости от отношения «сигнал/шум».
Модуляционные методы оценки разборчивости речи основаны на представлении речевого сигнала как свёртки импульсной характеристики источника звука с импульсной характеристикой голосового тракта. При этом для гласных звуков источник описывается импульсной последовательностью с почти гармоническим спектром, а для согласных — шумовым сигналом различной формы [25].
В отечественной практике наибольшее распространение получил формантный метод оценки разборчивости речи. Зарубежные исследователи чаще используют аналогичный подход, известный как индекс артикуляции (AI). В Российской Федерации применяется модифицированный вариант метода Н.Б. Покровского, доработанный Я.И. Железняком, Ю.К. Макаровым и А.А. Хоревым (редакция 2000 года) [2].
Метод Н.Б. Покровского основан на разбиении всего диапазона частот на ряд смежных полос [3]. Индекс артикуляции речи R принимается равным
сумме разборчивостей формант каждой из этих полос [26], что отражено в формулах (1) и (2)
Я ^МР;, (1)
Ь = Л(/в.£.) - К/н.О, (2)
где N - количество смежных полос; ^ - весовой коэффициент ¿-й частотной полосы, характеризующий вероятность наличия формант речи в данной полосе частот; &(/Вд.) и &(/н.О - значения весового коэффициента для верхней /Вд. и нижней (/нд.) частот ¿-й частотной полосы спектра речевого сигнала; р; - коэффициент восприятия формант слуховым аппаратом человека. Значения &(/Вд.) и &(/Нд.), определяются при условиях / = /в.^. и / = /н.^. по графику функции распределения формант, характеризующей вероятность встречаемости формант в различных участках речевого спектра. В свою очередь, р; определяется по графику зависимости коэффициента восприятия от эффективного уровня ощущения формант.
Итоговая словесная разборчивость речи Ш по данной методике рассчитывается с помощью формулы (3) [26].
1,54 * Я0'25 * [1 - ехр(—11 * Я)], если Я < 0,15;
Ж = { ( 11* Я \ , (3)
1 — ехр ( - --——-), если Я > 0,15. (3)
1 + 0,7* Я/'
За рубежом для оценки разборчивости речи применяется метод Л! разработанный Г. Флетчером в 1940 году [27]. Этот подход во многом аналогичен методу Н. Б. Покровского и основан на использовании двадцати равноартикуляционных полос.
Принципиально иной объективный метод был предложен в 1970 году Т. Хогастом и Г. Стинекеном. Авторы разработали систему, в которой в качестве тестового сигнала использовался шум, модулированный по амплитуде сигналом фиксированной частоты с прямоугольной огибающей. Спектр несущего шума при этом приближен к спектру долговременной речи. Такой модуляционный подход позволил определить индекс передачи речи STI
(Speech Transmission Index), характеризующий влияние канала передачи на разборчивость речи. Значения STI напрямую связаны с функцией передачи модуляции MTF [28] (Modulation Transfer Function), выражаемой формулой (4)
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Моделирование процессов управления речевой разборчивостью в многоканальных системах конфиденциальной голосовой связи2012 год, кандидат технических наук Мишуков, Андрей Андреевич
Алгоритмы обработки речевых сигналов телекоммуникационных систем в условиях помех2022 год, кандидат наук Холкина Наталья Евгеньевна
Алгоритмы повышения эффективности передачи речевой информации в корабельных оперативно-командных системах громокоговорящей связи2010 год, кандидат технических наук Быков, Артем Александрович
Модель и алгоритм активной защиты конфиденциальной информации от утечки по акустовибрационному каналу на основе адаптивной речеподобной помехи2025 год, кандидат наук Волчихина Мария Владимировна
Исследование тонального метода оценки разборчивости речи при бинауральном прослушивании2006 год, кандидат технических наук Мохд Мохсин
Список литературы диссертационного исследования кандидат наук Волков Никита Андреевич, 2026 год
Список используемой литературы
1. Соколов, А. И. Технические средства защиты информации: технические каналы утечки информации : учеб. пособие / А. И. Соколов, М. Ю. Монахов ; Владим. гос. ун-т. - Владимир : Изд-во Владим. гос. ун-та, 2006. - 71 с.
2. Железняк В. К., Макаров Ю. К., Хорев А. А. Некоторые методические подходы к оценке эффективности защиты речевой информации // Специальная техника. 2000. № 4. С. 39-45.
3. Покровский Н.Б. Расчет и измерение разборчивости речи. М.: Связьиздат, 1962. 392 с.
4. Основы кибербезопасности в деятельности сотрудников правоохранительных органов: учебное пособие / А. Н. Прокопенко [и др.]. -Белгород : Белгородский юридический институт МВД России имени И.Д. Путилина, 2023. - 153 с.
5. Ложкова А.А. Оценка защищенности речевого сигнала от утечки по акустическим и виброакустическим каналам // Молодой учёный. 2023. №40 (487). С. 1-5.
6. Лютиков, В. С. Методика оценки влияния искажения акустической системы активных средств защиты речевой информации на характеристики маскирующего сигнала / В. С. Лютиков, В. И. Тупота // Телекоммуникации. -2006. - № 2. - С. 16-19.
7. Бурлаков М.Е. Акустические и виброакустические каналы утечки информации. Теоретические основы и базовый практикум: учебное пособие / М.Е. Бурлаков, М.Н. Осипов. - Самара: Издательство Самарского университета, 2021. - 96 с.
8. Козлачков, С. Б. Проблемы и перспективы защиты акустической речевой информации / С. Б. Козлачков, С. В. Дворянкин, А. М. Бонч-Бруевич // Специальная техника. - 2016. - № 6. - С. 15-21.
9. Хорев, А. А. Техническая защита информации / А. А. Хорев. - М.: НПЦ «Аналитика», 2008. - 436 с.
10. Козлачков С. Б. Методические аспекты оценки защищенности речевой информации / Спецтехника и связь. 2011. № 2. С. 44—47.
11. Шашкова О.В., Гришачев В.В., Калинина Ю.Д., Тарасов А.А. Оценка эффективности технического канала утечки речевой информации через волоконно-оптические коммуникации / Вестник МФЮА. 2015. №4/2015. С. 35-43.
12. Маргарян Т.А., Воинов О.А. Анализ методов оценки разборчивости речи / Микроэлектроника и информатика - 2018 : Материалы научно-технической конференции. Сборник статей, Москва, 18-19 апреля 2018 года. - Москва: Национальный исследовательский университет "Московский институт электронной техники", 2018. - С. 143-148.
13. ГОСТ Р 50840-95. Передача речи по трактам связи. Методы оценки качества, разборчивости и узнаваемости. М.: Госстандарт России, 1995. 249 с.
14. ГОСТ 16600-72. Межгосударственный стандарт. Передача речи по трактам радиотелефонной связи. Требования к разборчивости речи и методы артикуляционных измерений // М.: Стандарт Информ. 2007. 74 с.
15. ITU-T Recommendation P.800. Methods for subjective determination of transmission quality. Geneva: ITU, 1996.
16. French, N.R., & Steinberg, J.C. (1947). Factors governing the intelligibility of speech sounds. The Journal of the Acoustical Society of America, 19(1), pp. 90119.
17. Kryter, K.D. (1962). Methods for the calculation and use of the articulation index. The Journal of the Acoustical Society of America, 34(11), pp. 1689-1697.
18. Ткаченко А.Д. Тональный метод определения разборчивости речи, передаваемой трактами связи / Акустический журнал. 1955. Том I, Вып. 2. С. 171-180.
19. Железняк, В. К. Тональный метод измерения защищенности речевых акустических сигналов / В. К. Железняк // Информатика и вычислительная техника. - 1994. - № 2-3. - С. 85-89.
20. Давыдов Г.В., Каван Д.М., Шамгин Ю.В. Оценка разборчивости речи в зашумленном помещении / Доклады БГУИР. 2012. №4 (66). С. 99-104.
21. Рашевский Я.И., Каргашин В.Л. Обзор зарубежных методов определения разборчивости речи. - Специальная техника, № 3-6, 2002.; № 1 2003.
22. Сапожков М.А. Речевой сигнал в кибернетике и связи. - М.: Связьиздат, 1963. - 472 с.
23. Быков Ю.С. Теория разборчивости и повышения эффективности радиотелефонной связи / Ю.С. Быков. - М.: Госэнергоиздат, 1959. - 352 с.
24. Алдошина И. Субъективные и объективные методы оценки разборчивости речи / Архив журнала «Звукорежиссер». 2002. №5. С. 1-8.
25. Козлачков, С. Б. Исследование свойств модуляционных параметров речевых сигналов / С. Б. Козлачков, А. М. Бонч-Бруевич, С. В. Дворянкин // Речевые технологии. - 2013. - № 3-4. - С. 135-142.
26. Хорев А.А. Техническая защита информации: учеб. пособие для студентов вузов. В 3 т. Т. 1. Технические каналы утечки информации. - М.: НПЦ «Аналитика», 2008. - 404 с.
27. French N., Steinberg J. Factors Governing the Intelligibility of Speech Sounds // J.Acoust. Soc. Am. - 1947. - Vol. 19, No 1.
28. Houtgast T., Steeneken H.J.M. The modulation transfer function in room acoustics as a predictor of speech intelligibility // Acustica. - 1973. - № 28. - pp. 66
- 73.
29. Теоретические основы построения и применения научно-исследовательского комплекса мониторинга характеристик защищенности конфиденциальной информации : монография / В. В. Алексеев, В. А. Гриднев, М. В. Моисеева, А. П. Рыжков, А. В. Яковлев ; под общ. ред. В. В. Алексеева.
- Тамбов : Издательский центр ФГБОУ ВО «ТГТУ», 2022. - 100 с.
30. Умняшкин С. В. Основы теории цифровой обработки сигналов: учебное пособие. М.: Техносфера, 2016. 528 с.
31. What is Pink Noise Used For in Audio Testing? // Learning about Electronics [Электронный ресурс]. URL:
https://www.learningaboutelectronics.com/Articles/What-is-pink-noise-used-for-in-an-audio-lab/ (дата обращения 01.09.2025 г.).
32. Рева И.Л., Трушин В.А., Иванов А.В. Реализация оптимальной помехи при защите речевой информации от утечки по акустическому и виброакустическому каналу // Научный вестник НГТУ. - 2011. - №2 4 (45). - С. 140-145.
33. Авдеев В.Б., Трушин В.А., Кунгуров М.А. Унифицированная речеподобная помеха для средств активной защиты речевой информации // Труды СПИИРАН. 2020. Т. 5б № 19. С. 991-1017.
34. Сагдеев К. М., Петренко В. И. Методика оценки технической защищенности речевой информации в выделенных помещениях // Известия ЮФУ. Технические науки. 2012. № 12 (137). С. 121-129.
35. Li J., Deng L., Haeb-Umbach R., Gong Y. Robust automatic speech recognition. A bridge to practical applications, 2016. 286 p.
36. Fang Z., Yin B., Du Z. et al. Fast environmental sound classification based on resource adaptive convolutional neural network // Scientific Reports. 2022. №12, pp. 1-18.
37. Madhu A., Kumaraswamy S. EnvGAN: a GAN-based augmentation to improve environmental sound classification // Artificial Intelligence Review. 2022. №255, pp. 6301-6320.
38. Kim B., Kim J., Ye J. C. Task-Agnostic Vision Transformer for Distributed Learning of Image Processing // Transactions on Image Processing. 2023. № 32, pp. 203-218.
39. Ullah R., Asif M., Shah W. A., Anjam F., Ullah I., Khurshaid T., Wuttisittikulkij L., Shah S., Ali S. M., Alibakhshikenari M. Speech Emotion Recognition Using Convolution Neural Networks and Multi-Head Convolutional Transformer // Sensors 23. 2023. № 13, pp. 1-20.
40. Porkodi S. P., Sarada V., Maik V. et al. Generic image application using GANs (Generative Ad-versarial Networks): A Review // Evolving Systems 14. 2023. pp. 903-917.
41. Song Q., Sun B., Li S. Multimodal Sparse Transformer Network for AudioVisual Speech Recognition // IEEE Transactions on Neural Networks and Learning Systems. 2023. V. 34, № 12, P. 10028-10038.
42. Vision Transformer: What It Is & How It Works (2024 Guide) // V7 Labs [Электронный ресурс]. URL: https://www.v7labs.com/blog/vision-transformer-guide/ (дата обращения 13.08.2025 г.)
43. Tay Y., Dehghani M., Gupta J., Bahri D., Aribandi V., Qin Z., Metzler D. Are Pre-trained Con-volutions Better than Pre-trained Transformers? 2022. arXiv: 2105.03322 [cs.CL].
44. Sanford C., Hsu D., Telgarsky M. Representational Strengths and Limitations of Transformers. 2023. arXiv:2306.02896 [cs.LG].
45. Abdel-Hamid O., Mohamed A.-R., Jiang H., Penn G. Applying convolutional neural networks concepts to hybrid NN-HMM model for speech recognition // Proc. IEEE Int. Conf. Acoust., Speech Signal Process. (ICASSP). 2012. pp. 4277-4280.
46. Сикорский О. С. Обзор свёрточных нейронных сетей для задачи классификации изображений // Новые информационные технологии в автоматизированных системах. 2017. №20, С. 1-8.
47. Ciretan D.C., Giusti A., Gambardella L. M., Schmidhuber J. Deep neural networks segment neuronal membranes in electron microscopy images // Proc. NIPS. 2012. pp. 1-9.
48. Ciretan D. C., Meier U., Gambardella L. M., Schmidhuber J. Deep, Big, Simple Neural Nets for Handwritten Digit Recognition // MIT Press. 2010. V. 22, № 12, pp. 3207-3220.
49. Что такое свёрточная нейронная сеть / Хабр [Электронный ресурс]. URL: https://habr.com/ru/articles/309508/ (дата обращения 13.08.2025 г.)
50. ImageNet classification with deep convolutional neural networks / A. Krizhevsky, I. Sutskever, G.E. Hinton // Communications of the ACM. - 2012. -№60. - P.84 - 90.
51. Nagrani A., Chung J.S., Zisserman A. VoxCeleb: A large-scale speaker identification dataset // INTERSPEECH, 2017. pp. 1-6.
52. Дворянкин, С. В. Быстрый синтез аудиосигналов по изображениям спектрограмм в задачах защиты речевой информации / С. В. Дворянкин, Н. С. Дворянкин, А. М. Алюшин // Вопросы кибербезопасности. - 2024. - № 5(63). - С. 34-46. - DOI 10.21681/2311-3456-2024-5-34-46.
53. Logan B. Mel Frequency Cepstral Coefficients for Music Modeling // ISMIR, 2000. pp. 1-11.
54. Волков Н.А., Иванов А.В. Подход к оценке защищенности речевой акустической информации с применением нейронных сетей // Вестник СибГУТИ. 2024. Т. 18, № 2 - С.43-56.
55. Tyagi V., Wellekens C. On desensitizing the Mel-cepstrum to spurious spectral components for robust speech recognition // Proceedings (ICASSP '05). IEEE International Conference on Acoustics, Speech, and Signal Processing. 2005. pp. 121.
56. Volkov N.A., Ivanov A.V. On the use of convolutional neural networks in the tasks of assessing the security of speech acoustic information // AISMA-2024: International Workshop on Advanced in Information Security Management and Applications. Stavropol, 2024. pp. 320-327.
57. Gradient-based learning applied to document recognition / Y. Lecun, L. Bottou, Y. Bengio, P. Haffner // ProceedingsoftheIEEE. -1998. - V. 86, №11. - pp. 22782324.
58. Sarraf S., Tofighi G. Classification of Alzheimer's Disease Structural MRI Data by Deep Learning Convolutional Neural Networks / Computer Vision and Pattern Recognition. 2016. pp. 1-14.
59. Zhang J., Yu X., Lei X., Wu C. A novel deep LeNet-5 convolutional neural network model for image recognition / Computer Science and Information Systems. №19(3). Pp. 1463-1480.
60. Tang W., Sun J., Wang S., Zhang Y. Review of AlexNet for Medical Image Classification / EAI Endorsed Transactions. 2023. pp. 1-13.
61. Challenges with alexnet: Navigating the complexities of an early deep learning milestone / BytePlus [Электронный ресурс]. URL:
https://www.byteplus.com/en/topic/401660?title=challenges-with-alexnet-navigating-the-complexities-of-an-early-deep-learning-milestone/ (дата
обращения 18.08.2025 г.).
62. Simonyan K. Very Deep Convolutional Networks for Large-Scale Image Recognition / K. Simonyan, A. Zisserman //3rd International Conference on Learning Representations (ICLR 2015), Computational and Biological Learning Society. - 2015. - pp. 1-14.
63. Very Deep Convolutional Networks (VGG) Essential Guid / Viso.ai [Электронный ресурс]. URL: https://viso.ai/deep-learning/vgg-very-deep-convolutional-networks/ (дата обращения 05.09.2025 г.).
64. Zhou Y., Chang H., Lu Y., Lu X., Zhou R. Improving the Performance of VGG Through Different Granularity Feature Combinations. IEEE Access. pp. 1-13.
65. Going deeper with convolutions / Szegedy C., [et al.] // 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Boston, MA, USA, 2015. -pp. 1-9.
66. GoogLeNet Explained: The Inception Model that Won ImageNet / Viso.ai [Электронный ресурс]. URL: https://viso.ai/deep-learning/googlenet-explained-the-inception-model-that-won-imagenet/ (дата обращения 05.09.2025 г.).
67. Review of Inception from V1 to V4 / Tech Hive [Электронный ресурс]. URL: https://sheng-fang.github.io/2020-05-05-review-googlenet-v1-v4/ (дата обращения 05.09.2025 г.).
68. Deep Residual Learning for Image Recognition [Электронный ресурс] URL: https://arxiv.org/pdf/1512.03385.pdf (Дата обращения: 15.08.2025 г.).
69. Shafiq, M., Gu, Z. Deep Residual Learning for Image Recognition: A Survey / Appl. Sci. 2022, №12 (18), pp. 1-43.
70. ResNet: Residual Neural Networks - easily explained! / Data Base Camp [Электронный ресурс]. URL: https://databasecamp.de/en/ml/resnet-en/ (дата обращения 05.09.2025 г.).
71. Mingxing Tan, Quoc V. Le. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks. 2019. arXiv:1905.11946 [cs.LG].
72. Romario Sameh Samir Anwar. EfficientNet Algorithm for Classification of Different Types of Cancer. Journal of Computer Science and Technology. 2023. arXiv:2304.08715v3 [eess.IV].
73. Oluwatosin S.O., Akinkunmi R.A., Idoko P.I., Akeem B., Onuh M.I., Olugesun A., Comfort I.M. Enhancing breast cancer detection accuracy through transfer learning: A case study using efficient net. World Journal of Advanced Engineering Technology and Sciences, 2024, 13(01), pp. 285-318.
74. Huang G. et al. Densely connected convolutional networks //Proceedings of the IEEE conference on computer vision and pattern recognition. - 2017. - С. 47004708.
75. Hou, Y., Wu, Z., Cai, X. et al. The application of improved densenet algorithm in accurate image recognition. Sci Rep 14, 8645 (2024).
76. Saleh A. Albelwi. Deep Architecture based on DenseNet-121 Model for Weather Image Recognition. International Journal of Advanced Computer Science and Applications, Vol. 13, No. 10, 2022. pp. 559-565.
77. Z. Liu, H. Mao, C.-Y. Wu, C. Feichtenhofer, T. Darrell, S. Xie. A ConvNet for the 2020s. 2022. arXiv:2201.03545 [cs.CV].
78. Lamiaa Abdel-Hamid. ConvNeXt for Breast Cancer HER2 Scoring Using Different Types of Histopathological Stained Images. Journal of Advances in Information Technology, Vol. 16, No. 7, 2025. pp. 966-972.
79. Mehmood, Ya. Brain tumor grade classification using the ConvNext architecture / Ya. Mehmood, U. I. Bajwa // Digital Health. - 2024. - Vol. 10. - DOI 10.1177/20552076241284920.
80. Герасимов С. М., Жаринов О. О. Исследование методов анализа речевых сигналов // Сборник докладов семьдесят третьей международной студенческой научной конференции ГУАП. 2020. Ч. 3, С. 36-41.
81. Многоканальные системы сбора данных. LTR24. Руководство программиста / Л-Кард [Электронный ресурс]. URL: https://www.lcard.ru/download/ltr24api.pdf (дата обращения 13.08.2025 г.).
82. Схема простой звуковой карты (ЦАП) / Радио Лоцман [Электронный ресурс]. URL: https://www.rlocman.ru/shem/schematics.html?di=660639 (дата обращения 13.08.2025 г.).
83. Adobe Audition. A professional audio workstation [Электронный ресурс]. URL: https://www.adobe.eom/products/audition.html# (дата обращения 17.08.2025 г.).
84. Зельманский О.Б. Методика синтеза речеподобных сигналов на разных языках для систем защиты информации / Информационные системы и технологии. 2012. № 4. С. 122-133.
85. Воробьев В.И., Давыдов А.Г., Давыдов Г.В. Речеподобные сигналы: разновидности, основные параметры, способы формирования, области применения // Доклады Белорусского государственного университета информатики и радиоэлектроники. 2009. № 3. С. 9-16.
86. Дворянкин, С. В. Системный подход к моделированию речеподобных сигналов / С. В. Дворянкин, Р. А. Устинов, Н. С. Дворянкин // Информационная безопасность в банковско-финансовой сфере, Москва, 28 ноября 2019 года / Под ред. С.И. Козьминых. - Москва: Общество с ограниченной ответственностью "Издательство "КноРус", 2020. - С. 20-30.
87. Трушин В.А. Исследование воздействия речеподобной помехи на психоэмоциональное состояние человека / Динамика систем, механизмов и машин. 2020. Т. 8, № 2. С. 138-144.
88. Паршин С.Е. Исследование параметров алгоритмов распознавания лиц // Сборник научных трудов НГТУ. - 2019. - № 1 (94). - С. 55-70.
89. Simple MNIST convnet / KERAS [Электронный ресурс]. URL: https://keras.io/examples/vision/mnist_convnet/ (дата обращения 09.08.2025 г.).
90. Гафаров Ф.М Искусственные нейронные сети и приложения: учеб. пособие / Ф.М. Гафаров, А.Ф. Галимянов. - Казань: Изд-во Казан. ун-та, 2018. - 121 с.
91. Муромцев Д.И., Шилин И.А., Исаев И.В., Структурирование, разметка и обогащение данных- СПб: Университет ИТМО, 2024. - 72 с.
92. Novoselov S., Volokhov V. and Lavrentyeva G., "Universal Speaker Recognition Encoders for Different Speech Segments Duration," ICASSP 2023 -2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Rhodes Island, Greece, 2023, pp. 1-5
93. Анализ аудиоданных с помощью глубокого обучения и Python (часть 1) / NP [Электронный ресурс]. URL: https://https://nuancesprog.ru/p/6713/ (дата обращения 19.08.2025 г.).
94. Христофоров А.В. Методы анализа спектра сигнала. Учебно-методическое пособие к специальному лабораторному практикуму для студентов старших курсов и магистрантов кафедр радиофизического направления. Казань 2004, 21 с.
95. Функции оконного сглаживания / DSPLIB.org [Электронный ресурс]. URL: https://ru.dsplib.org/content/windows/windows.html (дата обращения 19.08.2025 г.).
96. Лукин А. Введение в цифровую обработку сигналов (математические основы). Учебно-методическое пособие. Лаборатория компьютерной графики и мультимедиа, МГУ, 2007. 54 с.
97. Adavanne S., Virtanen T. A report on sound event detection with different binaural features 2017. arXiv:1710.02997 [cs.SD].
98. Guide to Audio Classification Using Deep Learning / Analytics Vidhya [Электронный ресурс]. URL: https://www.analyticsvidhya.com/blog/2022/04/guide-to-audio-classification-using-deep-learning/ (дата обращения 25.08.2025 г.).
99. Осипов О.В. Итерационные алгоритмы БПФ с высоким частотным разрешением // Вычислительные методы и программирование. 2021.22, No 2. С. 123-137.
100. Первичный анализ речевых сигналов / Альфацефей [Электронный ресурс]. URL: https://alphacephei.com/ru/lecture 1 .pdf (дата обращения 17.08.2025 г.).
101. Ахмад Х.М. Введение в цифровую обработку речевых сигналов: учебное пособие / Х. М. Ахмад, В. Ф. Жирков ; Владим. гос. ун-т. - Владимир : Изд-во Владим. гос. ун-та, 2007. - 192 с.
102. Волков Н.А., Иванов А.В. К вопросу оценки защищенности речевой акустической информации с применением сверточной нейронной сети / Перспектива-2023: материалы X Всероссийской молодежной школы семинара по проблемам информационной безопасности, Красноярск, 28 сентября - 01 октября 2023 года. - М.: Издательский дом Академии Естествознания. - 2023. - С. 40-45.
103. Wijnands, Jasper & Nice, Kerry & Thompson, Jason & Zhao, Haifeng & Stevenson, Mark. (2019). Streetscape augmentation using generative adversarial networks: Insights related to health and wellbeing. Sustainable Cities and Society. 49. 10.1016/j.scs.2019.101602.
104. Sara, Umme & Akter, Morium & Uddin, Mohammad Shorif. (2019). Image Quality Assessment through FSIM, SSIM, MSE and PSNR—A Comparative Study. Journal of Computer and Communications. 07. 8-18. 10.4236/jcc.2019.73002.
105. R. Gunawan, Y. Tran, J. Zheng, H. Nguyen and R. Chai, "Implementing Natural Image Quality Evaluator for Performance Indicator on Noise Artefacts Recovery in CT Scan," 2023 45th Annual International Conference of the IEEE Engineering in Medicine & Biology Society (EMBC), Sydney, Australia, 2023, pp. 1-4, doi: 10.1109/EMBC40787.2023.10340822.
106. Al-Najjar, Yusra. (2024). Comparative Analysis of Image Quality Assessment Metrics: MSE, PSNR, SSIM and FSIM. International Journal of Science and Research (IJSR). 13. 110-114. 10.21275/SR24302013533.
107. Эрин Ф. А., Вебер В. И., Куприц В. Ю., Нетесов А. А. Метрики оценки качества работы классификатора малоразмерных объектов на радиолокационном изображении, полученном с помощью радиолокатора с синтезированной апертурой / Инфокоммуникационные и радиоэлектронные технологии. 2022. Т. 5, № 4. С. 436-444.
108. Самойлова, Т. А. Исследование влияния искажения изображений на качество систем верификации лиц / Т. А. Самойлова // Системы компьютерной математики и их приложения. - 2021. - № 22. - С. 158-165.
109. Syed S., Morseth B., Hopstock L., Horsch A. A novel algorithm to detect non-wear time from raw accelerometer data using deep convolutional neural networks / Scientific Reports. 2021. 11:8832. pp. 1-13.
110. Rainio O., Teuho J., Klen, R. Evaluation metrics and statistical tests for machine learning / Sci Rep 14, 6086 (2024). pp. 1-14.
111. Горельчик, М. Р. Современные методы анализа нейросетевых моделей / М. Р. Горельчик, В. П. Жданович // Прикладная математика и информатика: современные исследования в области естественных и технических наук : VII Международная научно-практическая конференция (школа-семинар) молодых ученых: сборник материалов, Тольятти, 22-24 апреля 2021 года. С. 23-27.
112. Ханова, Ю. А. Повышение точности поиска аномалий в данных на основе ансамбля моделей / Ю. А. Ханова, Н. В. Шевская // Инженерный вестник Дона. - 2021. - № 6(78). - С. 214-222.
113. Wu M.T. Confusion matrix and minimum cross-entropy metrics based motion recognition system in the classroom / Sci Rep 12, 3095 (2022). pp. 1-10.
114. Хорев А.А. К оценке эффективности защиты акустической (речевой) информации / Хорев А.А., Макаров Ю.К. // Специальная техника. - 2000. - № 5. - С. 1-14.
115. Python Docs / Pyhton [Электронный ресурс]. URL: https://www.python.org/doc/ (дата обращения 02.09.2025 г.).
116. Дураковский А.П., Куницын И.В. Оценка защищенности речевой информации. Часть 1. Выявление акустических и вибрационных каналов утечки речевой информации. (Серия «Учебная книга факультета «Кибернетика и Информационная безопасность» НИЯУ МИФИ».Учебно-методическая разработка для проведения лабораторного практикума. В помощь преподавателям и студентам). — М.: НИЯУ МИФИ, 2015. — 52 с.
117. ГОСТ ISO 3745—2014. Акустика. Определение уровней звуковой мощности и звуковой энергии источников шума по звуковому давлению. Точные методы для заглушенных и полузаглушенных камер // М.: Стандартинформ. 2015. 59 с.
118. Морозов, В. В. Методы обработки результатов физического эксперимента // В. В. Морозов, Б. Е. Соботковский, И. Л. Шейнман. - С. 63.
119. Коэффициенты Стьюдента / Академическая гимназия имени Д.К. Фадеева СпбГУ [Электронный ресурс]. URL: https://agym.spbu.ru/docs/phys oshib 3.pdf (дата обращения 26.10.2025 г.).
120. Козлачков С.Б. Ограничения формантной теории разборчивости речи в приложениях защиты речевой информации / С. Б. Козлачков, А. М. Бонч-Бруевич, С. В. Дворянкин // Вопросы кибербезопасности. - 2016. - №5 (18). -С. 28-35.
121. Бацула А.П. О достоверности оценки защищенности речевой информации от утечки по техническим каналам / А.П. Бацула, А.А. Иванов, И.Л. Рева, В.А. Трушин // Доклады ТУСУРа. - 2010. - №1 (21), ч. 1. - С.89-92.
122. Трушин В.А. Информационно-измерительный подход к оценке защищенности речевой информации от утечки по техническим каналам / В. А. Трушин // Международный конгресс по информатике: информационные системы и технологии = Nternational congress on computer science: inform. systems and technologies : материалы междунар. науч. конгр., Минск, 31 окт. -3 нояб. 2011 г. - Минск, 2011. - С. 149-153.
123. Гаврилов, И. В. Алгоритм оценивания словесной разборчивости речи на основе функции когерентности / И.В. Гаврилов // Труды СПИИРАН - 2016. -№5(48). - С. 88-106.
ПРИЛОЖЕНИЕ 1. Программный код на языке программирования Python для обучения архитектуры сверточной нейронной сети ResNet на наборе данных, состоящий из спектрограмм зашумленных аудиозаписей
речи
import os
import random
import csv
import warnings
import pathlib
import pylab
import pandas as pd
import numpy as np
from numpy import argmax
import matplotlib.pyplot as plt
from PIL import Image
import librosa
import librosa.display
import IPython.display
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score,
recall_score, confusion_matrix
import tensorflow as tf
import keras
from keras import layers
from keras.models import Sequential
from keras.preprocessing.image import ImageDataGenerator from tensorflow.keras.optimizers import SGD
from keras.layers import Activation, Dense, Dropout, Conv2D, Flatten, MaxPooling2D, GlobalMaxPooling2D,
GlobalAveragePooling1D, GlobalAveragePooling2D, AveragePooling2D, Input, Add
from keras.callbacks import Callback, LambdaCallback warnings.filterwarnings('ignore')
for gpu in tf.config.list_physical_devices('GPU'): try:
tf.config.experimental.set_memory_growth(gpu, True) except: pass
genres = '0 0.05 0.10 0.15 0.20 0.25 0.30 0.35 0.40 0.45 0.50 0.60 0.70 0.80 0.90 1'.split() for g in genres:
pathlib.Path(f'img_data/{g}').mkdir(parents=True, exist_ok=True)
for filename in os.listdir(f'./Set/genres/{g}'): songname = f'./Set/genres/{g}/{filename}' y, sr = librosa.load(songname, duration=15)
fig, ax = plt.subplots(nrows=1, figsize=(6.0,6.0), sharex=True)
pylab.axis('off') # no axis
pylab.axes([0., 0., 1., 1.], frameon=False, xticks=[], yticks=[])
librosa.fft_frequencies(sr=19531, n_fft=2048) spectre = librosa.stft(y=y, hop_length=512) s_db = librosa.amplitude_to_db(np.abs(spectre),
ref=np.max)
img = librosa.display.specshow(s_db, y_axis='log') plt.savefig(f'img_data/{g}/{filename[:-3].replace(".", "")}.png')
plt.clf() IMG_SIZE = (600, 600) BATCH = 2 VAL_SPLIT = 0.2 SEED = 42
datagen = ImageDataGenerator(rescale=1./255,
validation_split=VAL_SPLIT)
training_set = datagen.flow_from_directory( './img_data', target_size=IMG_SIZE, batch_size=BATCH, class_mode='categorical', subset='training', shuffle=True, seed=SEED
)
validation_set = datagen.flow_from_directory( './img_data', target_size=IMG_SIZE, batch_size=BATCH, class_mode='categorical', subset='validation', shuffle=False, seed=SEED
)
model = Sequential()
input_shape=(IMG_SIZE[0], IMG_SIZE[1], 3)
# 1-й скрытый слой
model.add(Conv2D(600, (3, 3), strides=(2, 2),
input_shape=input_shape))
model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 2-й скрытый слой
model.add(Conv2D(300, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 3-й скрытый слой
model.add(Conv2D(200, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2)))
model.add(Activation('relu'))
# 4-й скрытый слой
model.add(Conv2D(150, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
model.add(GlobalAveragePooling2D()) # <— ЗАМЕНА Flatten() model.add(Dropout(rate=0.5))
# полносвязный слой model.add(Dense(64)) model.add(Activation('relu')) model.add(Dropout(rate=0.5))
# выходной слой model.add(Dense(16)) model.add(Activation('softmax')) model.summary()
epochs = 140
learning_rate = 0.01
decay_rate = learning_rate / epochs
momentum = 0.9
sgd = SGD(learning_rate=learning_rate, momentum=momentum, decay=decay_rate, nesterov=False)
model.compile(optimizer="sgd", loss="categorical_crossentropy", metrics=['accuracy'])
# === Метрики по эпохам (накопление для графиков) === f1_history, precision_history, recall_history = [], [], [] from keras.callbacks import LambdaCallback
from tensorflow.keras.callbacks import EarlyStopping,
ReduceLROnPlateau, ModelCheckpoint import numpy as np def custom_metrics(epoch, logs): validation_set.reset() y_true = validation_set.classes
y_pred = np.argmax(model.predict(validation_set, verbose=0), axis=1)
f1 = f1_score(y_true, y_pred, average='weighted') pre = precision_score(y_true, y_pred, average='weighted') rec = recall_score(y_true, y_pred, average='weighted') cm = confusion_matrix(y_true, y_pred)
f1_history.append(f1); precision_history.append(pre);
recall_history.append(rec)
print(f"\nEpoch {epoch + 1}:")
print(f"F1 Score: {f1:.4f} Precision: {pre:.4f} Recall: {rec:.4f}")
print("Confusion Matrix:\n", cm) metrics_callback = LambdaCallback(on_epoch_end=lambda epoch, logs: custom_metrics(epoch, logs)) early_stop = EarlyStopping( monitor='val_loss', patience=10,
restore_best_weights=True, verbose=1
)
reduce lr = ReduceLROnPlateau(
monitor='val_loss', factor=0.5, patience=3, min_lr=1e-5, verbose=1 )
ckpt = ModelCheckpoint('best_model.h5', monitor='val_loss', save_best_only=True, verbose=1)
import math
full_train_steps = math.ceil(training_set.samples /
training_set.batch_size)
full_val_steps = math.ceil(validation_set.samples /
validation_set.batch_size) steps_per_epoch = full_train_steps validation_steps = full_val_steps history = model.fit( training_set, epochs=epochs,
validation_data=validation_set,
steps_per_epoch=steps_per_epoch,
validation_steps=validation_steps,
callbacks=[metrics_callback, early_stop, reduce_lr, ckpt],
verbose=1,
workers=0,
use_multiprocessing=False, max_queue_size=1
)
val_loss, val_acc = model.evaluate(validation_set, verbose=0) print(f"Final Val Acc: {val_acc:.4f}") validation_set.reset()
pred = model.predict(validation_set, verbose=1) predicted_class_indices = np.argmax(pred, axis=1) labels = (training_set.class_indices) labels = dict((v,k) for k,v in labels.items()) predictions = [labels[k] for k in predicted_class_indices] filenames = validation_set.filenames print(len(filenames), len(predictions))
results = pd.DataFrame({"Filename": filenames, "Predictions": predictions})
results.to_csv("prediction_results.csv", index=False) model.save('Mniz_Spec_WN.h5')
ПРИЛОЖЕНИЕ 2. Программный код на языке программирования Python для обучения архитектуры сверточной нейронной сети ResNet на наборе данных, состоящий из графиков MFCC зашумленных
аудиозаписей речи
import os
import random
import csv
import warnings
import pathlib
import pylab
import pandas as pd
import numpy as np
from numpy import argmax
import matplotlib.pyplot as plt
from PIL import Image
import librosa
import librosa.display
import IPython.display
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score,
recall_score, confusion_matrix
import tensorflow as tf
import keras
from keras import layers
from keras.models import Sequential
from keras.preprocessing.image import ImageDataGenerator from tensorflow.keras.optimizers import SGD
from keras.layers import Activation, Dense, Dropout, Conv2D, Flatten, MaxPooling2D, GlobalMaxPooling2D,
GlobalAveragePooling1D, GlobalAveragePooling2D, AveragePooling2D, Input, Add
from keras.callbacks import Callback, LambdaCallback warnings.filterwarnings('ignore')
for gpu in tf.config.list_physical_devices('GPU'): try:
tf.config.experimental.set_memory_growth(gpu, True) except: pass
genres = '0 0.05 0.10 0.15 0.20 0.25 0.30 0.35 0.40 0.45 0.50 0.60 0.70 0.80 0.90 1'.split() for g in genres:
pathlib.Path(f'img_data/{g}').mkdir(parents=True, exist_ok=True)
for filename in os.listdir(f'./Set/{g}'): songname = f'./Set/{g}/{filename}' x, sr = librosa.load(songname, duration=10) sr = 19531
mfccs = librosa.feature.mfcc(x, sr=sr) print(mfccs.shape) (20, 97)
# Отображение MFCC:
fig, ax = plt.subplots(figsize=(6.0,6.0), frameon=False)
ax = fig.add_axes([0, 0, 1, 1])
ax.axis('off')
ax.set_xlabel("x")
ax.set_ylabel("y")
ax.set_xlim(0,10)
ax.set_ylim(0, 10000)
librosa.display.specshow(mfccs, sr=sr, x_axis='time', y_axis='log')
plt.savefig(f'img_data/{g}/{filename[:-3].replace(".", "")}.png')
plt.clf()
IMG_SIZE = (600, 600) BATCH = 2 VAL_SPLIT = 0.2 SEED = 42
datagen = ImageDataGenerator(rescale=1./255,
validation_split=VAL_SPLIT)
training_set = datagen.flow_from_directory( './img_data', target_size=IMG_SIZE, batch_size=BATCH, class_mode='categorical', subset='training', shuffle=True, seed=SEED
)
validation_set = datagen.flow_from_directory( './img_data', target_size=IMG_SIZE, batch_size=BATCH, class_mode='categorical', subset='validation', shuffle=False, seed=SEED
)
model = Sequential()
input_shape=(IMG_SIZE[0], IMG_SIZE[1], 3)
# 1-й скрытый слой
model.add(Conv2D(600, (3, 3), strides=(2, 2),
input_shape=input_shape))
model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 2-й скрытый слой
model.add(Conv2D(300, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2)))
model.add(Activation('relu'))
# 3-й скрытый слой
model.add(Conv2D(200, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 4-й скрытый слой
model.add(Conv2D(150, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
model.add(GlobalAveragePooling2D()) # <— ЗАМЕНА Flatten() model.add(Dropout(rate=0.5))
# полносвязный слой model.add(Dense(64)) model.add(Activation('relu')) model.add(Dropout(rate=0.5))
# выходной слой model.add(Dense(16)) model.add(Activation('softmax')) model.summary()
epochs = 140
learning_rate = 0.01
decay_rate = learning_rate / epochs
momentum = 0.9
sgd = SGD(learning_rate=learning_rate, momentum=momentum, decay=decay_rate, nesterov=False)
model.compile(optimizer="sgd", loss="categorical_crossentropy", metrics=['accuracy'])
# === Метрики по эпохам (накопление для графиков) === f1_history, precision_history, recall_history = [], [], [] from keras.callbacks import LambdaCallback
from tensorflow.keras.callbacks import EarlyStopping,
ReduceLROnPlateau, ModelCheckpoint import numpy as np def custom_metrics(epoch, logs): validation_set.reset() y_true = validation_set.classes
y_pred = np.argmax(model.predict(validation_set, verbose=0), axis=1)
f1 = f1_score(y_true, y_pred, average='weighted') pre = precision_score(y_true, y_pred, average='weighted') rec = recall_score(y_true, y_pred, average='weighted') cm = confusion_matrix(y_true, y_pred)
f1_history.append(f1); precision_history.append(pre);
recall_history.append(rec)
print(f"\nEpoch {epoch + 1}:")
print(f"F1 Score: {f1:.4f} Precision: {pre:.4f} Recall: {rec:.4f}")
print("Confusion Matrix:\n", cm) metrics_callback = LambdaCallback(on_epoch_end=lambda epoch, logs: custom_metrics(epoch, logs)) early_stop = EarlyStopping( monitor='val_loss', patience=10,
restore_best_weights=True, verbose=1
)
reduce_lr = ReduceLROnPlateau(
monitor='val_loss', factor=0.5, patience=3, min_lr=1e-5, verbose=1 )
ckpt = ModelCheckpoint('best_model.h5', monitor='val_loss', save_best_only=True, verbose=1)
import math
full_train_steps = math.ceil(training_set.samples /
training_set.batch_size)
full_val_steps = math.ceil(validation_set.samples /
validation_set.batch_size) steps_per_epoch = full_train_steps validation_steps = full_val_steps history = model.fit( training_set, epochs=epochs,
validation_data=validation_set,
steps_per_epoch=steps_per_epoch,
validation_steps=validation_steps,
callbacks=[metrics_callback, early_stop, reduce_lr, ckpt],
verbose=1,
workers=0,
use_multiprocessing=False, max_queue_size=1
)
val_loss, val_acc = model.evaluate(validation_set, verbose=0) print(f"Final Val Acc: {val_acc:.4f}") validation_set.reset()
pred = model.predict(validation_set, verbose=1) predicted_class_indices = np.argmax(pred, axis=1) labels = (training_set.class_indices) labels = dict((v,k) for k,v in labels.items()) predictions = [labels[k] for k in predicted_class_indices] filenames = validation_set.filenames print(len(filenames), len(predictions))
results = pd.DataFrame({"Filename": filenames, "Predictions": predictions})
results.to_csv("prediction_results.csv", index=False) model.save('Mniz MFCC WN.h5')
ПРИЛОЖЕНИЕ 3. Программный код на языке программирования Python для обучения архитектуры сверточной нейронной сети ResNet на наборе данных, состоящий из спектрограмм помех, применяемых при зашумлении тестового речевого сигнала
import os
import random
import csv
import warnings
import pathlib
import pylab
import pandas as pd
import numpy as np
from numpy import argmax
import matplotlib.pyplot as plt
from PIL import Image
import librosa
import librosa.display
import IPython.display
from sklearn.model_selection import train_test_split
from sklearn.metrics import f1_score, precision_score,
recall_score, confusion_matrix
import tensorflow as tf
import keras
from keras import layers
from keras.models import Sequential
from keras.preprocessing.image import ImageDataGenerator from tensorflow.keras.optimizers import SGD
from keras.layers import Activation, Dense, Dropout, Conv2D, Flatten, MaxPooling2D, GlobalMaxPooling2D,
GlobalAveragePooling1D, GlobalAveragePooling2D, AveragePooling2D, Input, Add
from keras.callbacks import Callback, LambdaCallback warnings.filterwarnings('ignore')
for gpu in tf.config.list_physical_devices('GPU'): try:
tf.config.experimental.set_memory_growth(gpu, True) except: pass
genres = 'WN PN FN SCN'.split() for g in genres:
pathlib.Path(f'img_data/{g}').mkdir(parents=True, exist_ok=True)
for filename in os.listdir(f'./Set/genres/{g}'): songname = f'./Set/genres/{g}/{filename}' y, sr = librosa.load(songname, duration=15) fig, ax = plt.subplots(nrows=1, figsize=(6.0,6.0), sharex=True)
pylab.axis('off') # no axis
pylab.axes([0., 0., 1., 1.], frameon=False, xticks=[], yticks=[])
librosa.fft_frequencies(sr=19531, n_fft=2048) spectre = librosa.stft(y=y, hop_length=512) s_db = librosa.amplitude_to_db(np.abs(spectre),
ref=np.max)
img = librosa.display.specshow(s_db, y_axis='log') plt.savefig(f'img_data/{g}/{filename[:-3].replace(".", "")}.png')
plt.clf() IMG_SIZE = (600, 600) BATCH = 2 VAL_SPLIT = 0.2 SEED = 42
datagen = ImageDataGenerator(rescale=1./255,
validation_split=VAL_SPLIT)
training_set = datagen.flow_from_directory( './img_data', target_size=IMG_SIZE, batch_size=BATCH, class_mode='categorical', subset='training', shuffle=True, seed=SEED
)
validation_set = datagen.flow_from_directory( './img_data', target_size=IMG_SIZE, batch_size=BATCH, class_mode='categorical', subset='validation', shuffle=False, seed=SEED
)
model = Sequential()
input_shape=(IMG_SIZE[0], IMG_SIZE[1], 3)
# 1-й скрытый слой
model.add(Conv2D(600, (3, 3), strides=(2, 2),
input_shape=input_shape))
model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 2-й скрытый слой
model.add(Conv2D(300, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 3-й скрытый слой
model.add(Conv2D(200, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
# 4-й скрытый слой
model.add(Conv2D(150, (3, 3), padding="same")) model.add(AveragePooling2D((2, 2), strides=(2,2))) model.add(Activation('relu'))
model.add(GlobalAveragePooling2D()) # <— ЗАМЕНА Flatten() model.add(Dropout(rate=0.5))
# полносвязный слой model.add(Dense(64)) model.add(Activation('relu')) model.add(Dropout(rate=0.5))
# выходной слой model.add(Dense(4)) model.add(Activation('softmax')) model.summary()
epochs = 140
learning_rate = 0.01
decay_rate = learning_rate / epochs
momentum = 0.9
sgd = SGD(learning_rate=learning_rate, momentum=momentum, decay=decay_rate, nesterov=False)
model.compile(optimizer="sgd", loss="categorical_crossentropy", metrics=['accuracy'])
# === Метрики по эпохам (накопление для графиков) === f1_history, precision_history, recall_history = [], [], [] from keras.callbacks import LambdaCallback
from tensorflow.keras.callbacks import EarlyStopping,
ReduceLROnPlateau, ModelCheckpoint import numpy as np def custom_metrics(epoch, logs): validation_set.reset() y_true = validation_set.classes
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.