Методы и средства распознавания языка жестов для людей с нарушениями слуха тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Данг Хань

  • Данг Хань
  • кандидат науккандидат наук
  • 2025, «Национальный исследовательский университет ИТМО»
  • Специальность ВАК РФ00.00.00
  • Количество страниц 278
Данг Хань. Методы и средства распознавания языка жестов для людей с нарушениями слуха: дис. кандидат наук: 00.00.00 - Другие cпециальности. «Национальный исследовательский университет ИТМО». 2025. 278 с.

Оглавление диссертации кандидат наук Данг Хань

ОГЛАВЛЕНИЕ

Реферат

Synopsis

Введение

ГЛАВА 1. Состояние проблемы и постановка задач исследования

1.1. Общая характеристика жестового языка

1.1.1. Основные особенности жестового языка

1.1.2. Грамматическая структура жестового языка

1.2. Существующие методы и технологии извлечение признаков жестов языка

1.2.1. Извлечение признаков жестов с использованием сенсорных технологий

1.2.2. Извлечение признаков жестов с использованием технологий компьютерного зрения

1.2.3. Существующие методы распознавания жестового языка

1.3. Ограничения и проблемы исследований в области распознавания жестового языка

1.4. Постановка цели и задач диссертации

1.5. Выводы

ГЛАВА 2. Разработка метода обогащения данных для обучения систем распознавания жестового языка

2.1. Обзор существующих методов обогащения наборов видеоданных

2.1.1. Некоторые известные видеодатасеты языков жестов

2.1.2. Методы обогащения видеоданных

2.2. Метод векторизации положения тела в пространстве и генерации координатных данных жестов

2.2.1. Извлечение характеристик жестового языка с помощью библиотеки MediaPipe

2.2.2. Определение границ жестов между словами в видеороликах на языке жестов

2.2.3. Методы классификации данных временных рядов

2.2.4. Распознавание языка жестов с использованием нейронной сети LSTM

2.2.5. Метод анализа и обобщения данных жестов языка знаков

на основе координат костного каркаса в 3D-пространстве

2.2.6. Алгоритм генерирования образцов данных языка жестов

из исходного стандартного образца

2.3. Выводы

ГЛАВА 3. Разработка метода формирования словаря жестового языка на вьетнамском языке

3.1. Требования к словарю вьетнамского жестового языка

3.2. Обогащение словаря синонимами с использованием

ресурса WordNet

3.3. Определение контекста синонимических групп на основе

модели BERT

3.3.1. Word Embedding

3.3.2. Модель BERT и расчет сходства между двумя предложениями155

3.4. Выводы

ГЛАВА 4. Разработка метода установления синонимических связей между группами слов в словаре жестового языка на вьетнамском языке

4.1. Обзор построения языковых моделей на основе n-грамм

4.1.1. n-граммные модели

4.1.2. Модель Маркова

4.1.3. Алгоритм для реализации n-грамм

4.1.4. Представление вероятностных отношений через матрицу цепей Маркова

4.1.5. Методы сглаживания при расчёте n-грамм

4.2. Анализ проблем построения моделей жестового языка

4.2.1. Проблема разреженности данных

4.2.2. Уникальный порядок грамматики

4.2.3. Определение контекста синонимичных групп

4.3. Построение матрицы семантических связей между словами

4.4. Выводы

ГЛАВА 5. Разработка алгоритма перевода вьетнамского текста в жестовый язык

5.1. Проблема перевода на язык жестов

5.2. Анализ проблем перевода текстов на жестовый язык

5.3. Машинный перевод на основе нейронных сетей

5.4. Метод дополнения меток частей речи и контекстных ключевых слов210

5.5. Реализация тонкой настройки моделей перевода текста на жестовый язык

5.6. Показатель BLEU для оценки качества машинного перевода

5.7. Выводы

ГЛАВА 6. Экспериментальное исследование разработанных методов и алгоритмов

6.1. Среда для реализации проекта и тестирования

6.2. Экспериментальные данные

6.3. Экспериментальные результаты метода обогащения данных для обучения систем распознавания жестового языка

6.3.1. Результат сегментации жестов слов на видео жестового языка219

6.3.2. Генерация набора данных на вьетнамском языке жестов

6.4. Экспериментальные результаты метода формирования словаря жестового языка на вьетнамском языке

6.5. Экспериментальные результаты метода установления синонимических связей между группами слов в словаре жестового языка на вьетнамском языке

6.6. Экспериментальные результаты алгоритма перевода вьетнамского текста в жестовый язык

6.7. Выводы

Заключение

Список литературы

Список сокращений

Приложение 1. Акты о внедрении результатов диссертационного исследования

Приложение 2. Тексты публикаций

Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Введение диссертации (часть автореферата) на тему «Методы и средства распознавания языка жестов для людей с нарушениями слуха»

Реферат

Общая характеристика диссертации

Актуальность темы исследования. Согласно статистике Всемирной организации здравоохранения (ВОЗ) [1], в 2024 году около 5% мирового населения, что эквивалентно 430 миллионам человек, страдают от потери слуха. Во Вьетнаме [2] этот показатель составляет 2,5% населения, что соответствует 2,5 миллионам человек. По прогнозам ВОЗ [1], к 2050 году число людей с нарушениями слуха во всем мире может достигнуть 2,5 миллиардов. Рост числа людей с нарушениями слуха окажет значительное влияние на социально-экономическое развитие и уровень счастья каждой страны. Люди с потерей слуха составляют значительную часть сообщества людей с ограниченными возможностями. Это люди, которые утратили частично или полностью способность слышать. Примечательно, что у большинства людей с потерей слуха также наблюдаются нарушения речи, что Табособенности, исследования истории возникновения и развития языка жестов подтверждают, что язык жестов является наиболее эффективным и подходящим средством общения для людей с нарушениями слуха [4 - 5]. Уделяя внимание людям с ограниченными возможностями в целом и людям с потерей слуха в частности, многие страны реализуют практические политики и мероприятия, направленные на улучшение качества жизни этих групп. К таким усилиям относятся создание образовательных центров для детей с ограниченными возможностями, разработка и производство инструментов для поддержки общения, а также обеспечение комфортных условий для жизни.

Особенно важны исследования методов и инструментов поддержки общения для людей с потерей слуха, поскольку они сокращают разрыв в общении между ними и обществом. Эта работа отражает глубокую гуманитарную и гуманистическую сущность, способствуя созданию инклюзивного и равноправного общества.

Общение людей с нарушениями слуха в повседневной жизни является процессом обмена информацией между людьми с потерей слуха или между ними и

людьми без нарушений в обществе. Для понимания содержания информации, передаваемой с помощью языка жестов, участники общения должны либо владеть языком жестов, либо использовать вспомогательный инструмент перевода. Для обычного человека, выбирающего между прохождением курса по изучению языка жестов или использованием переводческого инструмента, второй вариант является более удобным и эффективным. Обычный человек может передать своё сообщение через инструмент перевода, который преобразует его в язык жестов и передаст людям с нарушениями слуха. Аналогично, люди с нарушениями слуха могут передавать свою информацию через этот инструмент, облегчая общение с другими. Наличие идеального переводческого инструмента может значительно упростить процесс ухода за пациентами с нарушениями слуха, обучение детей с потерей слуха и трудоустройство таких людей, снижая нагрузки и сложности. Это также способствует развитию общества и повышению уровня счастья нации. Наше исследование направлено на достижение этой цели и является важной и необходимой задачей в современных условиях.

В последние годы благодаря значительному прогрессу в технологиях хранения и вычислительных мощностях обработка данных стала основой для взрывного роста и развития искусственного интеллекта (ИИ). Сегодня ИИ является популярным и ключевым направлением технологического развития во многих странах мира. ИИ — это общий термин, описывающий способность машин или компьютерных систем выполнять задачи, подобные тем, что выполняют люди [6]. Современные технологии ИИ успешно применяются в различных областях, включая создание экспертных систем, обработку естественного языка, распознавание образов и компьютерное зрение. Распознавание жестового языка — это задача, тесно связанная с обработкой естественного языка и компьютерным зрением. По уровням сложности задачи распознавания жестового языка можно разделить на две основные группы:

1. Распознавание жестового языка на статическом уровне: Эта группа задач связана с распознаванием жестов на статических изображениях, таких как

цифры, буквы и т.д. Для выполнения этих задач часто используются сверточные нейронные сети (CNN), которые выделяют характерные признаки жестов на изображении, а затем применяют алгоритмы машинного обучения (ML) для классификации и выдачи наиболее точного предсказания для входного изображения.

2. Распознавание жестового языка на динамическом уровне: Эта

группа задач включает распознавание жестов в непрерывной последовательности во времени, что обычно рассматривается как задача машинного перевода для жестового языка. Это более сложная задача, требующая продвинутых алгоритмов, больших объемов данных и высокой точности перевода. Эффективная модель перевода жестового языка сможет значительно сократить разрыв в общении между людьми с нарушениями слуха и обычными людьми.

Исследование методов распознавания жестового языка с целью создания модели перевода жестового языка является чрезвычайно важной и актуальной задачей. Однако на данный момент эта задача сталкивается с рядом сложностей и ограничений, среди которых:

1. Ограниченность словарного запаса и данных жестового языка: В настоящее время доступные данные по жестовому языку крайне ограничены. Например, во вьетнамском языке общий словарь жестового языка для трех регионов (Север, Центр, Юг) включает всего около 4332 слова. Существует лишь один словарь жестового языка, где каждое видео-жест соответствует одному слову. Это создает значительные трудности при обучении моделей ИИ в условиях дефицита данных.

2. Различия в грамматике между жестовым языком и естественным языком: Грамматика жестового языка значительно отличается от грамматики естественного языка. Во вьетнамском языке порядок слов может изменяться, а некоторые слова сокращаются по сравнению с устной речью. Поэтому стандартные языковые модели не могут быть напрямую применены для обработки жестового языка без адаптации.

3. Сложности в определении границ жестов в видео:

При переводе жестового языка из видео одной из главных трудностей является определение временных рамок жестов или границ между ними. Этот этап является ключевым, но чрезвычайно сложным, особенно в видеоматериалах с быстрыми и непрерывными движениями.

4. Передача слов, отсутствующих в словаре жестового языка: Когда встречается слово, которого нет в словаре, пользователь жестового языка может либо по буквам произнести это слово, либо использовать синоним для передачи смысла. Однако оба подхода имеют свои недостатки:

- Произношение по буквам: Для длинных слов этот метод усложняет передачу информации и снижает эффективность общения.

- Использование синонимов: Из-за полисемии (многозначности) во вьетнамском языке компьютеру трудно найти подходящий синоним, соответствующий контексту, что может привести к искажению смысла.

Эти вызовы подчеркивают необходимость разработки специализированных и оптимизированных методов и моделей для обработки жестового языка и его применения на практике. На данный момент нет исследований, демонстрирующих полностью удовлетворяющую эффективность систем машинного перевода жестового языка.

Целью исследования является разработка методов и алгоритмов для автоматического распознавания и перевода жестового языка на вьетнамском языке, направленных на повышение точности и эффективности обработки жестов в условиях ограниченных данных. В рамках исследования предлагаются новые подходы к обогащению данных, формированию словаря жестового языка и установлению семантических связей для улучшения качества машинного перевода вьетнамского текста в жестовый язык.

Для достижения цели в ходе исследования ставятся следующие задачи: 1. Анализ состояния проблемы и определение задач исследования.

- Провести обзор жестового языка, его особенностей и грамматической структуры.

- Изучить существующие методы извлечения признаков и распознавания жестового языка.

- Определить существующие ограничения и проблемы в области распознавания жестового языка.

- Сформулировать цели и задачи диссертации.

2. Разработка метода обогащения данных для обучения систем распознавания жестового языка.

- Изучить существующие методы обогащения видеоданных.

- Разработать метод векторизации положения тела и генерации координатных данных жестов.

- Исследовать классификацию временных рядов и применение нейронных сетей (как LSTM) для распознавания жестов.

- Создать алгоритм генерации дополнительных данных на основе 3D-координатного анализа.

3. Разработка метода формирования словаря жестового языка:

- Определить требования к словарю жестового языка.

- Провести обогащение словаря синонимами с использованием WordNet.

- Использовать модель BERT для определения контекста синонимических групп.

4. Разработка метода установления синонимических связей между группами слов в словаре жестового языка:

- Исследовать подходы построения языковых моделей (n-граммы, модель Маркова).

- Разработать матрицу семантических связей между словами для учета контекста и грамматики жестового языка.

5. Разработка алгоритма перевода вьетнамского текста в жестовый язык:

- Изучить проблемы и подходы перевода текстов на жестовый язык.

- Реализовать алгоритм машинного перевода с использованием нейронных сетей.

- Доработать модель перевода с учетом меток частей речи и контекстных ключевых слов.

- Оценить качество перевода с использованием показателя BLEU.

6. Экспериментальное исследование разработанных методов:

- Оценить метод сегментации жестов слов на видео жестового языка.

- Оценить метод обогащения данных для систем распознавания жестового языка.

- Оценить метод формирования словаря жестового языка на вьетнамском языке.

- Проверить точность метода установления семантических связей между словами.

- Провести оценку алгоритма перевода вьетнамского текста в жестовый язык.

Методы исследования: линейная алгебра, теория вероятностей и теория информации, в частности модели Маркова, машинная лингвистика, методы машинного обучения.

Объектом исследования являются информационные системы и технологии, направленные на автоматическое распознавание жестового языка, используемого людьми с нарушениями слуха.

Предметом исследования выступают методы и программные средства обработки, интерпретации и перевода жестового языка, направленные на повышение точности и эффективности распознавания жестов, включая моделирование, векторизацию, формирование словарей и применение нейросетевых алгоритмов.

Положения, выносимые на защиту, обладающие научной новизной:

1. Метод обогащения данных для обучения систем распознавания жестового языка, отличающийся использованием векторных преобразований положения тела в пространстве для генерации координатных данных жестов в видеозаписях жестового языка, позволяющий решить проблему переобучения моделей распознавания в условиях ограниченных ресурсов видеоданных жестового языка на вьетнамском языке.

2. Метод формирования словаря жестового языка на вьетнамском языке, отличающийся использованием синонимических данных из ресурса WordNet для расширения словаря жестового языка на вьетнамском языке и применением модели phoBERT для определения контекста синонимических групп в предложении, что позволяет проводить векторное представление (embedding) слов в условиях ограниченного набора данных.

3. Метод установления синонимических связей между группами слов в словаре жестового языка на вьетнамском языке, отличающийся созданием матрицы взаимодействия семантических связей с помощью Марковской модели, обеспечивающий улучшение передачи семантики фраз при переводе текста в жестовый язык.

4. Алгоритм перевода вьетнамского текста в жестовый язык,

отличающийся интеграцией контекстной информации и грамматических правил жестового языка, обеспечивающий повышение эффективности и точности процесса перевода жестового языка.

Научная новизна исследования заключается в приращении научного знания в области автоматического распознавания жестового языка, выраженном в разработке методов и алгоритмов, направленных на повышение эффективности обработки и интерпретации жестов на вьетнамском языке. В рамках исследования предложены новые подходы к обогащению обучающих данных, формированию словаря жестового языка, установлению семантических связей между лексическими группами, а также переводу текстов на жестовый язык с учетом лингвистических и контекстуальных особенностей.

Научно-техническая задача, решаемая в диссертации, заключается в разработке методов и программных средств для автоматического распознавания жестового языка на вьетнамском языке, обеспечивающих повышение точности обработки и интерпретации жестов в условиях ограниченных обучающих данных. Решение данной задачи предполагает создание инструментов обогащения данных, построения лексических структур и алгоритмов перевода, адаптированных к грамматике и семантике жестового языка.

Достоверность результатов обеспечивается корректным применением методов исследования, обоснованной постановкой задач и проведением экспериментальных работ, охватывающих разработанные технологии и алгоритмы. Результаты получили признание научного сообщества: они опубликованы в рецензируемых статьях и представлены на профильных конференциях.

Соответствие паспорту специальности. Работа соответствует пункту 4 паспорту специальности 1.2.1 - «Искусственный интеллект и машинное обучение»: Разработка методов, алгоритмов и создание систем ИИ и машинного обучения для обработки и анализа текстов на естественном языке, для изображений, речи, биомедицины и других специальных видов данных.

Теоретическая значимость. Исследование определения границ жестов в видеозаписях жестового языка рассматривается как частный случай задачи обработки действий объектов на видео. Метод генерации данных о координатах жестов в видеозаписях жестового языка может быть применен для обогащения данных в случаях, когда объекты имеют пропорции, аналогичные человеческим. Разработка вариации модели Маркова для вычисления семантических взаимодействий между словами в наборе данных. Дополнение грамматических правил, синонимов и контекстной информации для повышения эффективности перевода, особенно в условиях ограниченных обучающих данных.

Практическая значимость. Результаты исследования молгут использоваться для создания приложения машинного перевода жестового языка, которое поможет людям с нарушениями слуха в общении, улучшая их качество жизни. Результаты

исследования также могут быть расширены и применены в таких областях, как дистанционное взаимодействие с роботами, создание развлекательных приложений, связанных с генерацией действий, и выполнение аналогичных задач. Апробация работы. Основные результаты работы докладывались и обсуждались на следующих конференциях:

• XI Конгресс молодых ученых (04.04.2022 - 06.04.2022)

• Пятьдесят вторая (LII) научная и учебно-методическая конференция

Университета ИТМО (31.01.2023 - 03.02.2023)

• XII Конгресс молодых ученых (03.04.2023 - 06.04.2023)

• XIII Конгресс молодых ученых ИТМО (08.04.2024 - 11.04.2024)

• Conference of Young Researchers in Electrical and Electronic Engineering

(28.01.2025 - 30.01.2025)

Личный вклад автора. Тема исследования была предложена научным руководителем Бессмертным И.А. на основе глобальных тенденций развития науки и технологий, а также в соответствии с приоритетами исследований учебного заведения и Министерства науки России. Задачи, цели и направления исследования были сформированы совместно с научным руководителем. Реализация алгоритмов, разработка моделей, написание кода и планирование экспериментов выполнялись автором самостоятельно. Семенова В.О. участвовала в процессе оценки результатов в рамках исследований в конференции "Conference of Young Researchers in Electrical and Electronic Engineering".

Внедрение результатов работы. Результаты исследований, представленные в диссертации, были признаны Центром поддержки инклюзивного образования «Бинь Ан» (провинция Биньзыонг, Вьетнам) за их высокую практическую значимость и возможность применения в разработке коммуникационных приложений для людей с нарушением слуха как в настоящее время, так и в будущем.

Структура и объем диссертации. Диссертация состоит из введения, 6 глав и заключения. Полный объем диссертации 245 страницы текста с 41 рисунками и 6 таблицами. Список литературы содержит 125 наименования.

Введение диссертации обосновывает актуальность темы исследования «Методы и средства распознавания языка жестов для людей с нарушениями слуха». На этой основе формулируется цель работы и ставятся конкретные задачи, направленные на её достижение. Определяются объект и предмет исследования. Работа демонстрирует соответствие выбранной научной специальности 1.2.1, содержит постановку научных задач, а также описание полученных результатов, обладающих научной новизной и представляющих ценность как с теоретической, так и с практической точек зрения в области интеллектуальных систем и обработки естественного языка.

В первой главе рассматривается текущее состояние исследований в области автоматического распознавания жестового языка. Представлен обзор лингвистических особенностей жестового языка, его грамматической структуры, а также существующих методов извлечения признаков и распознавания жестов с использованием сенсорных и компьютерных технологий. Определены ключевые ограничения и проблемы в данной области, сформулированы цель и задачи исследования.

Во второй главе обоснована необходимость обогащения обучающих данных для повышения эффективности систем распознавания жестов. Разработан метод векторизации положения тела и генерации координатных данных жестов на основе анализа видеозаписей. Рассмотрены алгоритмы классификации временных рядов, включая использование нейронных сетей (LSTM), а также предложен алгоритм генерации новых образцов данных на основе 3D-моделей.

В третьей главе представлена методика формирования словаря вьетнамского жестового языка. Проведён анализ требований к структуре словаря, предложен метод его обогащения синонимами на базе ресурса WordNet, а также реализовано

определение контекста синонимических групп с использованием модели phoBERT и технологии векторного представления слов (word embedding).

В четвёртой главе разработан метод установления семантических связей между синонимическими группами слов в словаре жестового языка. Рассмотрены подходы к построению языковых моделей на основе n-грамм и Марковских цепей, предложена матрица взаимодействии для учёта грамматических и контекстуальных особенностей, что позволяет повысить точность передачи смысла при переводе на жестовый язык.

В пятой главе представлена методика автоматического перевода вьетнамского текста на жестовый язык. Проведён анализ проблем машинного перевода в данной области, реализован алгоритм нейросетевого перевода с учётом грамматических меток и ключевых слов, а также произведена оценка качества перевода с использованием метрики BLEU.

Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК

Заключение диссертации по теме «Другие cпециальности», Данг Хань

Обсуждение в заключение

В работе сегментированы на видес языковые жесты на основе опрвдетезшя времени паузы. Результаты сегзлекташти представлены зраф-нчестзг а режиме ра-альлтого времеЕПЕ. Выполнено сравнение методов для вьЕпозтнення постазлеЕ-Еноп задачи, тавдсх как: методов, нсдюльзуЕопшх модель глубокого об^-чення сверточкая ненроЕсная сеть и метода сегменташш жестов языка жестов в ЬЕСдео на основе порогового значение, вычисляемого по евклидов^' расстогнюо пт?и извлечении ззсординатньЕК объектов с нсполвзованпеы библиотеки MeJiaPipe. В результате получены следующие преимущества выбранного метода: простота внедрения п развертьдзанпа прилсссеЕши ншыц вычислительные затраты могут быть гарантированы для приложений, требуюппп; высокой скорости и реального зразгенп

Для видео с умеренной и медленной скоростью же-сгнзуЕзяпнн иетср сетмектаззни еидес с использованием бнблндгхекп m»i'ljjp'ij-e н на основе пороговых зндчее^ий показал высокие результаты. Основная езложкость гг/:1 г рагленызг лостаадеатвсй задачи аозннздщ. гзгда скорость жеста очень еьтсоезз. что утсложнило сетмезгтапию. так как паузы очень изротЕзне п нечатЕдте. Отмечено, что настрсвдка порота степени изменздня жестов

в видео таздке зависит от скорости жеста. В б(щущкх исследованиях бгПат оптимизирован посоеос сетмента-шпт жестов иа язы;:е жестов, для распознавания видео с очанъ высокой скорость» жеогакудшпш: Планируется ."vтп.р гл?рну — i^tra^: п г. у зггнлууз'пг/ факторов, рас-сматрпзаемьЕК как помехи при сбггенни на языка зке-сгов, такизс как ЗЕЕИзкентЕЯ. которые не дклжотся языком жестов. Коепд проблема сегментации жестов на. язьЕке жестов достигнет короюсх резулвтатов. лоипмание проблемы машинного перевара на язык жаотов будет значит алъно таитав

Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.