Персонализированные модели распознавания психоэмоционального состояния и вовлечённости лиц по видео тема диссертации и автореферата по ВАК РФ 00.00.00, кандидат наук Чураев Егор Николаевич
- Специальность ВАК РФ00.00.00
- Количество страниц 134
Оглавление диссертации кандидат наук Чураев Егор Николаевич
Введение
Глава 1. Обзор литературы
1.1 Определение психоэмоционального состояния человека
1.1.1 Представление эмоций
1.1.2 Общий алгоритм распознавания эмоций по изображению лица
1.1.3 Распознавания эмоций по видеоизображению лица
1.2 Определение вовлечённости
1.2.1 Представление вовлечённости
1.2.2 Распознавание вовлечённости по видеоизображению лиц
1.3 Выводы
Глава 2. Разработанные методы
2.1 Базовый алгоритм определения эмоций и вовлечённости по видео
2.1.1 Подготовка видео кадров
2.1.2 Извлечение визуальных признаков
2.1.3 Агрегация признаков
2.1.4 Классификация
2.1.5 Обучение и оценка качества классификатора
2.2 Персонализированные модели определения эмоций и вовлечённости по видео лиц
2.2.1 Идентификация пользователя
2.2.2 Метод персонализированного распознавания эмоций по видео
2.2.3 Набор данных для персонализированной оценки вовлечённости по видео
2.2.4 Метод персонализированного определения вовлечённости
по видео
2.2.5 Алгоритм создания персонализированных моделей на устройстве пользователя
Стр.
2.3 Выводы
Глава 3. Результаты экспериментальных исследований
3.1 Распознавание эмоций лиц на видео
3.1.1 Разбиение набора видеоданных для обучения и тестирования
3.1.2 Персонализированное распознавание эмоций по видео
3.2 Персонализированное определение вовлечённости по видеоизображению лица
3.3 Создание персонализированных моделей на устройстве пользователя
3.4 Выводы
Глава 4. Комплекс программ
4.1 Разработанный программный комплекс для распознавания
эмоций и вовлечённости участников онлайн конференции
4.1.1 Запуск моделей в конечном приложении
4.1.2 Программный комплекс для определения эмоций и вовлечённости
4.2 Программный комплекс для сбора и разметки пользовательских данных
4.3 Модуль распознавания эмоций и вовлеченности лиц на фото и видео
4.4 Библиотека Ешо^ЕйЫЬ
4.5 Выводы
Заключение
Список сокращений и условных обозначений
Список литературы
Список рисунков
Список таблиц
Рекомендованный список диссертаций по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Методы и алгоритмы автоматического распознавания атрибутов человека2021 год, кандидат наук Спижевой Алексей Сергеевич
Особенности регуляции эмоций и распознавания эмоций у лиц, употребляющих психоактивные вещества2024 год, кандидат наук Федюкович Екатерина Игоревна
Алгоритмы построения пространственно-временных дескрипторов признаков для обнаружения микролицевых движений2025 год, кандидат наук Черненко Анна Дмитриевна
Модели и алгоритмы эмоциональной целевой маршрутизации в системах обслуживания населения2024 год, кандидат наук Сома Гедеш Мануэл
Методы и алгоритмы аудиовизуального распознавания эмоционального состояния типично и атипично развивающихся детей2023 год, кандидат наук Матвеев Антон Юрьевич
Введение диссертации (часть автореферата) на тему «Персонализированные модели распознавания психоэмоционального состояния и вовлечённости лиц по видео»
Введение
В последние десятилетия наблюдается значительное усиление интереса к задачам автоматического распознавания эмоций и оценки вовлечённости человека. Эти технологии находят широкое применение в различных сферах: от образования и медицины до сферы обслуживания и систем безопасности [1; 2]. Способность точно и своевременно определять эмоциональное состояние человека и его вовлечённость в происходящее имеет ключевое значение для улучшения качества взаимодействия в цифровой среде и повышения эффективности процессов, связанных с обучением, трудовой деятельностью и другими социальными аспектами [3].
Одной из важнейших областей применения данных технологий является образование. В связи с СОУГО-19 произошла кардинальная перестройка образовательной среды: лекции, конференции и встречи перешли на онлайн-форматы в ответ на необходимость обеспечения здоровья и безопасности [4; 5]. Виртуальные классы стали новой нормой, и преподаватели столкнулись с проблемой необходимости оценивания психоэмоционального состояния студентов и их вовлечённости [6—8]. Известно, что качество освоения материала напрямую связано с уровнем вовлечённости студентов во время лекций [9]. Однако, в отличие от оффлайн-образования, где студенты начинают взаимодействовать и создавать шум, в онлайн-образовании преподавателю не так просто выявить потерю интереса у конкретного студента. Ряд исследований показывает, что вовлечённые студенты достигают более высоких академических результатов, лучше усваивают материал и активнее участвуют в учебных процессах [10].
Однако проблема определения вовлечённости и эмоционального состояния не ограничивается лишь образовательной сферой. В бизнесе, например, системы для оценки эмоционального состояния могут применяться для анализа реакции сотрудников во время рабочих встреч или собраний, что может повысить эффективность командной работы и принятия решений. Другим примером является определение реакции покупателей на рекламную компанию и улучшение эффективности маркетинговых кампаний за счёт автоматизированного получения обратной связи [11]. В медицине такие системы могут быть использованы для мониторинга эмоционального состояния пациентов, что особенно важно при лечении психоэмоциональных расстройств [12]. В сфере обслуживания пони-
мание настроения клиентов и их вовлечённости может существенно улучшить качество предоставляемых услуг и повысить уровень удовлетворённости [13]. В рекомендательных системах анализ эмоционального состояния пользователя может помочь в улучшении качества рекомендаций, учитывая предпочтения и настроение пользователя [14].
Современные методы оценки эмоционального состояния и вовлечённости обычно основаны на использовании глубокого обучения и компьютерного зрения, что позволяет анализировать невербальные сигналы, такие как мимика, движения глаз и жесты. Одним из наиболее перспективных направлений в этой области является использование свёрточных нейронных сетей (СНС), которые обеспечивают высокую точность распознавания эмоций и вовлечённости [15; 16]. Тем не менее, современные системы сталкиваются с рядом проблем: низкая точность классификации на реальных данных, требование к высокопроизводительному оборудованию и необходимость работы в условиях, когда недоступны облачные сервисы [17].
Одним из перспективных решений этих проблем является адаптация нейросетевых моделей под конкретного пользователя. Персонализированные модели, обученные на небольшом наборе данных конкретного человека, могут значительно повысить точность распознавания эмоций и вовлечённости, что особенно важно в условиях реальных приложений [18; 19]. Такой подход уже продемонстрировал свою эффективность в задачах распознавания речи и эмоций, а также в задачах оценки вовлечённости студентов [20—22].
Таким образом, задача автоматического распознавания эмоционального состояния и вовлечённости человека является актуальной и значимой для многих сфер жизни. Современные достижения в области компьютерного зрения и глубокого обучения открывают новые возможности для развития данных технологий, но для их эффективного применения в реальных условиях необходимы дальнейшие исследования и совершенствование моделей с учётом персонализа-ции и минимальных требований к ресурсам устройств.
Целью данной работы является повышение точности определения психоэмоционального состояния людей и их вовлечённости по видеоизображению лица на основе эффективных персонализированных моделей, которые могут быть реализованы на широком спектре различных устройств от бюджетного смартфона до высокопроизводительного сервера. Для достижения поставленной цели необходимо решить следующие задачи:
1. Провести аналитический обзор литературы современных методов и моделей распознавания эмоций и вовлеченности лиц на видео.
2. Разработать метод, позволяющий повысить точность распознавания лицевых эмоций за счёт персонализации модели под целевого пользователя.
3. Разработать метод создания высокоточных персонализированных моделей определения вовлечённости человека по видеоизображению лица на основе адаптации универсальной модели под поведенческие особенности пользователя.
4. Разработать вычислительный метод, позволяющий на устройстве эффективно создавать персонализированную модель под конкретного пользователя.
5. Провести численные экспериментальные исследования по определению необходимого числа видео для создания персонализированных моделей.
6. Реализовать разработанные методы в виде комплекса программ, позволяющего анализировать психоэмоциональное состояние и вовлечённость лиц на видео.
Научная новизна данного исследования заключается в разработке и применении методов персонализации моделей для распознавания эмоций и вовлечённости по видео лица, которые учитывают индивидуальные особенности пользователя. Получены следующие новые научные результаты:
1. Разработан новый метод распознавания эмоций человека по изображению лица, позволяющий значительно повысить точность в сравнении с известными аналогами за счёт создания персонализированной модели, адаптированной под эмоции целевого пользователя. Для повышения точности нет необходимости переобучать всю модель — достаточно адаптировать лишь классификатор, используя уже извлечённые эмоциональные признаки. Благодаря этому процесс персонализации становится быстрым и не требует большого объёма размеченных видеоданных.
2. Представлен метод определения вовлечённости участников онлайн-мероприятия, отличающийся от известных аналогов использованием высокоточных персонализированных классификаторов видео лиц для известных пользователей.
3. Предложен новый автоматизированный метод сбора размеченных видеоданных и создания с их помощью персонализированных моделей, адаптированных под поведенческие особенности пользователя, при этом благодаря использованию легковесных моделей дообучение универсального классификатора осуществляется непосредственно на конечном устройстве с ограниченными вычислительными ресурсами.
Практическая значимость данного исследования заключается в широком спектре применения разработанный персонализированных моделей для распознавания эмоций и вовлечённости, которые могут существенно повысить эффективность в различных сферах жизни:
1. Дистанционное обучение. Персонализированные модели распознавания эмоций и вовлечённости могут использоваться для улучшения образовательного процесса в онлайн-формате. Применение предложенной технологии позволит преподавателям оперативно отслеживать уровень вовлечённости студентов во время лекций и адаптировать подачу материала в зависимости от их состояния. Это особенно важно в условиях дистанционного образования, где традиционные методы наблюдения за вовлечённостью студентов невозможны. Разработанный программный продукт «Еп§а§етеп1Ез1лта1;ог» предназначен для решения данной задачи и предоставления преподавателю обратной связи по результатам анализа проведённого урока. Анализ может выполняться как в реальном времени, так и после проведения занятия.
2. Офисные и удалённые рабочие встречи. В условиях растущей популярности удалённой работы использование технологий распознавания эмоционального состояния и вовлечённости сотрудников может повысить продуктивность и качество взаимодействия. Персонализированные модели помогут руководителям отслеживать уровень вовлечённости сотрудников на совещаниях и вовремя принимать меры по повышению мотивации и улучшению рабочей атмосферы. Это также может снизить риск профессионального выгорания, улучшить командное взаимодействие и повысить эффективность рабочих процессов. В связи с тем, что дистанционное обучение довольно близко к рабочим встречам, то разработанное приложение Еп§а§етеп1Еэ11та1ог может успешно применяться для анализа онлайн встреч: https://www.hse.ru/news/edu/970866707.html.
3. Быстрый полуавтоматический сбор и разметка пользовательских данных. В рамках диссертационного исследования был разработан ряд методов, позволяющих быстро и полуавтоматически собрать необходимый набор пользовательских данных. Предложенные методы предназначены для разных сценариев использования. Для случая, когда необходимо отдельно собрать пользовательские данные, было разработано приложение «FER Data Collector», которое позволяет быстро собрать пользовательские данные для создания персонализированных моделей определения эмоций и вовлечённости пользователя.
Таким образом, практическая значимость исследования заключается в возможности улучшить и оптимизировать процессы в различных сферах, где важны точные и персонализированные оценки эмоционального состояния и вовлечённости человека. Предложенные решения способны повысить эффективность обучения, работы, безопасность на производстве и в других сферах жизни, а также оценить удовлетворённость пользователей в маркетинговых и медицинских приложениях.
Теоретическая значимость работы заключается в универсальности разработанных алгоритмов, которые позволяют существенно повысить точность предсказаний за счёт персонализации модели под конкретного пользователя. В исследовании показано, что такой подход значительно улучшает качество распознавания лицевых эмоций и уровня вовлечённости. При этом для создания персонализированных моделей не требуются мощные вычислительные ресурсы, так как персонализация сводится к дообучению классификатора, а основная модель, отвечающая за извлечение визуальных признаков, остаётся неизменной.
Методология и методы исследования. Для решения поставленных задач использованы методы теории распознавания образов и искусственных нейронных сетей, системного анализа, теории вероятностей и математической статистики.
Основные положения, выносимые на защиту:
1. Предложен новый метод, позволяющий повысить точность распознавания лицевых эмоций по видео за счёт создания персонализированной модели для целевого пользователя. Экспериментально продемонстрированы преимущества персонализированного подхода в сравнении с универсальными классификаторами: точность предсказания лицевых
эмоций увеличилась на 10-30% и в некоторых случаях достигла более 95%.
2. Разработан метод создания персонализированных моделей, позволяющий увеличить точность определения вовлечённости участника онлайн-мероприятия по видео лица на 10-15%, при этом для некоторых моделей была достигнута точность в 90+%.
3. Собран новый набор данных, предназначенный для проведения исследований персонализированных моделей определения вовлечённости пользователей по видеоизображению их лиц.
4. Предложен эффективный метод, позволяющий собирать пользовательские видеоданные и создавать с их помощью непосредственно на устройстве пользователя персонализированную модель.
5. Предложенные методы были реализованы в виде комплекса проблемно-ориентированных программ, который определяет психоэмоциональное состояние и вовлечённость участников онлайн-конференций в режиме реального времени, захватывая экран, на котором запущена программа для проведения онлайн-мероприятия. Комплекс использует программную библиотеку, предназначенную для эффективного извлечения лицевых признаков и проведения численного анализа.
Личный вклад. Личный вклад автора в данную работу заключается в разработке и обосновании персонализированного подхода к распознаванию эмоций и вовлечённости на основе нейросетевых моделей, которые адаптируются под индивидуальные особенности пользователей. В ходе работы автором был собран набор данных для проведения экспериментов, а также проведены исследования, подтверждающие эффективность персонализированного подхода для задач определения эмоций и вовлечённости. Е.Н. Чураев реализовал предложенные алгоритмы в комплексе программ, которые можно использовать для анализа поведения участников онлайн-конференций, а также для эффективного извлечения лицевых признаков. Автор принимал активное участие в подготовке научных публикаций и представлении результатов на международных конференциях, способствуя продвижению разработанных решений и обсуждению их с научным сообществом.
Апробация работы. Результаты работы были представлены на следующих конференциях и семинарах:
1. Конференция уровня Core-A 25th International Conference on Artificial Intelligence in Education (AIED 2024), Ресифи, Бразилия, Июль 2024. Тема: «To Kill a Student's Disengagement: Personalized Engagement Detection in Facial Video».
2. Конференция Высшей Школы Экономики для СКБ Контур, Москва, Май 2024. Тема: «Анализ эмоций и вовлеченности».
3. The XIV International Conference on Network Analysis (NET-2024), Нижний Новгород, Май 2024. Тема: «Personalized Engagement Detection in Facial Video»
4. Школа конференция «Анализ данных, сети и аппроксимации», Сочи, Октябрь 2023. Тема: «Personalized recognition of facial expressions on video using EmotiEffNet models».
5. The 13th International Conference on Network Analysis (NET-2023), Нижний Новгород, Май 2023. Тема: «Adaptive EmotiEffNet models for facial expression recognition in video».
6. Seminar of HSE Laboratory For Social And Cognitive Informatics (SCILa), онлайн, Апрель 2023. Тема: «Applying speaker-dependent approach to improve the accuracy of facial emotion recognition in video».
7. Machine Can See 2022, Москва, Июль 2022. Тема: «Personalized video-based facial expression recognition for multi-user software».
8. VIII International Conference on Information Technology and Nanotechnology (ITNT-2022), онлайн, Май 2022. Тема: «Multi-user facial emotion recognition in video based on user-dependent neural network adaptation».
9. The 11th International Conference on Network Analysis (NET-2021), Нижний Новгород, Октябрь 2021. Тема: «User-dependent Adaptation of Neural Network Model in Video-based Facial Emotion Recognition».
10. International Russian Automation Conference (RusAutoCon-2021), Сочи, Сентябрь 2021. Тема: «Touching the Limits of a Dataset in Video-Based Facial Expression Recognition».
Результаты были опубликованы в следующих работах:
Публикации стандартного уровня
1. Чураев Егор Николаевич, Савченко Андрей Владимирович, "To Kill a Student's Disengagement: Personalized Engagement Detection in Facial Video", Artificial Intelligence in Education. Posters and Late Breaking Results, Workshops and Tutorials, Industry and Innovation Tracks, Practitioners, Doctoral Consortium and Blue Sky. AIED 2024. Communications in Computer and Information Science, vol 2150. Springer, Cham., vol 2150, С. 329 - 337, doi: 10.1007/978-3-031-64315-6_29. (Scopus, Q4, конференция CORE-A)
https://link.springer.com/chapter/10.1007/978-3-031-64315-6_ 29
2. Чураев Егор Николаевич, Савченко Андрей Владимирович, "Распознавание выражений лиц на основе адаптации классификатора видеоданных пользователя", Компьютерная оптика, 2023, Т.47, №5, С. 806-815, doi: 10.18287/2412-6179-C0-1269. (Scopus, Q3) https://www.computeroptics.ru/K0/Annot/K047-5/470515.html
3. Чураев Егор Николаевич, Савченко Андрей Владимирович, "A standalone software for real-time facial analysis in online conferences and e-lessons", 2023, Software Impacts, 2023, Т.16,"№100507, С. -, doi: 10.1016/j.simpa.2023.100507. (Scopus, Q3) https://www.sciencedirect.com/science/article/pii/ S2665963823000441
Прочие публикации
1. Чураев Егор Николаевич, Савченко Андрей Владимирович, "Multi-user facial emotion recognition in video based on user-dependent neural network adaptation", 2022 VIII International Conference on Information Technology and Nanotechnology (ITNT), Samara, Russian Federation, 2022, pp. 1-5, IEEE Xplore, doi: 10.1109/ITNT55410.2022.9848645. https://ieeexplore.ieee.org/abstract/document/9848645
2. Чураев Егор Николаевич, Савченко Андрей Владимирович, "Touching the Limits of a Dataset in Video-Based Facial Expression Recognition", 2021 International Russian Automation Conference (RusAutoCon), Sochi, Russian Federation, 2021, pp. 633-638, IEEE Xplore doi: 10.1109/RusAutoCon52004.2021.9537388.
https://ieeexplore.ieee.org/abstract/document/9537388
Кроме того, была зарегистрирована программа для ЭВМ:
1. Свидетельство о гос. регистрации программы для ЭВМ. Программа определения онлайн характеристик учеников по данным видеонаблюдения [Текст] / Е. Н. Чураев, А. В. Савченко ; Ф. государственное автономное образовательное учреждение высшего образования "Национальный исследовательский университет «Высшая школа экономики»". № 2024618650 ; заявл. 22.04.2024 ; опубл. 07.05.2024, 2024660523 (Рос. Федерация).
Диссертационная работа была выполнена при поддержке гранта: проект № 20-71-10010 Российского Научного Фонда, тема «Эффективные методы аудиовизуального анализа динамики эмоционального состояния на основе теоретико-информационного подхода».
Объем и структура работы. Диссертация состоит из введения, 4 глав и заключения. Полный объём диссертации составляет 134 страницы, включая 30 рисунков и 9 таблиц. Список литературы содержит 137 наименований.
Глава 1. Обзор литературы 1.1 Определение психоэмоционального состояния человека
1.1.1 Представление эмоций
Распознавание выражений лиц (англ. Facial expression recognition, FER) по видеоизображению является одной из наиболее сложных проблем компьютерного зрения. Анализ выражений лиц зачастую позволяет понять внутреннее состояние человека и эмоции, которые он испытывает в данный момент времени. В задачах распознавания эмоций человека по выражению лица наиболее часто используется категориальное представление эмоций (Рис. 1.1а), включающее нейтральное состояние и шесть базовых эмоций Экмана [23]: гнев, отвращение, страх, счастье, печаль, удивление, нейтральность. Иногда в существующих наборах данных добавляется еще одна эмоция, например, спокойствие [24] или презрение [25].
Несмотря на то, что категориальное представление эмоций является довольно простым и удобным для использования в задачах распознавания эмоций по выражению лица, оно имеет свои недостатки. Во-первых, оно может не учитывать некоторые тонкие нюансы в выражении эмоций, которые могут быть важны в некоторых ситуациях. Например, улыбка может быть вызвана не только чувством счастья, но и другими, такими как ирония или презрение. Также, оно может не отображать сложную структуру эмоций и её изменение во времени.
Категориальное представление эмоций также имеет проблемы с точностью определения границ между эмоциями, что приводит к возможности ошибочной классификации. Например, выражение лица человека может одновременно интерпретироваться как гнев и отвращение.
Кроме того, категориальное представление эмоций не учитывает индивидуальных особенностей человека, таких как его культурные или личностные особенности, что может привести к неправильной интерпретации выражения лица [26].
Несмотря на эти недостатки, категориальное представление эмоций является одним из наиболее распространенных и широко используемых в задачах распознавания эмоций по выражению лица. Это связано с тем, что оно достаточно простое для понимания и реализации, а также позволяет достаточно точно распознавать базовые эмоции Экмана в большинстве случаев.
Другим дискретным способом представления эмоций является модель Facial Action Coding System (FACS) [27], которая описывает движения мышц лица, отвечающих за выражение эмоций и настроения (Рис. 1.1б). В FACS выделены более 40 мускулатурных действий на лице человека и дан им числовой код, что позволяет квантифицировать различия в выражении эмоциональных состояний между людьми. Например, код 6 относится к действию мышц, отвечающих за подъем щек и сужение глаз, что соответствует выражению удовольствия. Для каждой эмоции можно составить набор кодов для характеристики соответствующих мускулатурных действий. Полный список всех кодов можно найти в работе [28].
FACS имеет несколько преимуществ по сравнению с категориальным подходом к представлению эмоций. В частности, она позволяет более точно определить, какие конкретные мышцы использовались для выражения определенной эмоции. Это делает FACS более гранулярной моделью, чем категориальное представление. Кроме того, FACS может использоваться для анализа особенностей эмоций, которые могут быть трудны для выявления визуально, таких как различия в интенсивности и продолжительности выражения.
Однако FACS также имеет свои недостатки. Эта модель требует высокой экспертизы для корректной интерпретации движений мышц, что может ограничивать ее использование в некоторых задачах, особенно в случае больших наборов данных. Кроме того, FACS не учитывает контекстуальную информацию, такую как мимика глаз, поза тела и интонация голоса, которая также может быть важна для понимания эмоционального состояния человека.
Также для описания эмоций может использоваться непрерывная пространственная модель (Рис. 1.1в), которая представляет собой двухмерное пространство валентности и возбуждения (VA-пространство) [29]: валентность показывает, насколько положительным или отрицательным является эмоциональное состояние, а возбуждение показывает, насколько оно пассивно или активно.
В этой модели любое эмоциональное состояние может быть представлено в виде точки на графике УЛ-пространства. Например, точка с высоким уровнем валентности и высоким уровнем возбуждения может соответствовать состоянию эйфории, а точка с низким уровнем валентности и низким уровнем возбуждения - состоянию уныния.
Важным преимуществом УЛ-пространства является его способность отображать не только базовые эмоции, но и более сложные эмоциональные состояния, такие как смешанные эмоции. Также УЛ-пространство может быть использовано для анализа эмоций в реальном времени и предсказания эмоций на основе входных данных.
Однако, как и у всех моделей, УЛ-пространство имеет свои недостатки и ограничения. Один из недостатков заключается в том, что это пространство не учитывает контекстуальные факторы, которые могут влиять на выражение эмоций. Кроме того, как и в случае категориального представления, валидация и согласование между разными экспериментами могут быть сложными из-за различных методов сбора и обработки данных.
Все перечисленные выше виды представления эмоций показаны на рисунке 1.1.
Понимание эмоционального состояния людей может быть важным во многих сферах. Например, в системах видеонаблюдения, алгоритмы распознавании эмоций могут использоваться для автоматического обнаружения подозрительных действий и предотвращения возможных конфликтных ситуаций [1]. В современных автомобилях системы распознавания эмоций могли бы определять уровень внимания и стресса водителя во время движения, что в свою очередь поможет снизить количество аварий на дорогах [2]. Также распознавание эмоций может использоваться для отслеживания изменений в эмоциональном состоянии человека в зависимости от окружения и различных внешних событий [3].
В бизнесе системы распознавания эмоций могут быть использованы для определения реакции покупателей на рекламную компанию и тем самым помочь в улучшении эффективности маркетинговых кампаний [11]. В рекомендательных системах анализ эмоционального состояния пользователя может помочь в улучшении качества рекомендаций, учитывая предпочтения и настроение пользователя [14].
м Sadness Fear [яг Anger
(« 1 (.л «с. 1 H;:iH:ire5S Surprise Diseust
а) Категориальное представление.
1С Inner brow raise 2C Outer brou raise — 4Г) Corrugator —- 5D Upper lid raise
- 70 Lower Jici tighten
— 20BLip stretch 26В Jaw drop
б) Модель Facial Action Coding System.
* 'Arousal
Annoying (high) Excited
Angry Nervous 2 Happy Pleased Valence
(negative) Sad 3 4 Relaxed (positive)
Bored Sleepy Peaceful Calm (low)
в) VA-пространство. Рисунок 1.1 — Различные виды представления эмоций
1.1.2 Общий алгоритм распознавания эмоций по изображению
лица
Во многих работах [30—35], связанных с определением эмоций по изображению лица, применяется алгоритм, схематично представленный на рисунке 1.2.
Рисунок 1.2 — Общий алгоритм определения лицевых эмоций по изображению.
Обычно алгоритм распознавания эмоций по изображению лица включает в себя следующие этапы:
1. Захват изображения. Получение входного изображения, для которого будет проводиться распознавание эмоций. Изображение может быть получено с камеры или другого устройства, способного захватывать изображение, или же в виде файла на диске.
2. Извлечение лиц и предобработка изображения. Это первый шаг в алгоритме распознавания эмоций по изображению лица. Для распознавания эмоций необходимо сначала выделить область лица на изображении. Это может быть достигнуто с помощью различных методов, таких как каскады Хаара [36], методы машинного обучения [30] или методы на основе признаков [32]. После извлечения лиц алгоритм может включать в себя ряд шагов [37], направленных на улучшение качества входных данных и подготовку изображения для последующего анализа.
— Нормализация изображения. Изображения лиц могут иметь различные размеры, освещение и фон, что может затруднить их обработку. Поэтому нормализация изображения, включающая в себя изменение размера, коррекцию освещения и удаление фона, является необходимой для обеспечения согласованности входных данных.
— Удаление шума. Шум на изображении может повлиять на точность распознавания эмоций. Поэтому перед анализом изображения необходимо удалить шум, например, путем применения фильтров, таких как фильтр Гаусса или медианный фильтр.
Похожие диссертационные работы по специальности «Другие cпециальности», 00.00.00 шифр ВАК
Метод генерации ответно-вопросных реплик с учетом особенностей письменной речи пользователя2025 год, кандидат наук Матвеева Анастасия Андреевна
Алгоритмы обработки и представления изображений лиц в пространстве канонических переменных2010 год, кандидат наук Каменская, Екатерина Ивановна
Проектирование нейросетевых систем глубинного обучения эволюционными алгоритмами для задачи человеко-машинного взаимодействия2017 год, кандидат наук Иванов Илья Андреевич
Точность распознавания эмоциональной экспрессии в устном иноязычном сообщении2014 год, кандидат наук Жежелевская, Анна Александровна
Разработка и исследование моделей оценки качества передачи видео в IP-сетях2014 год, кандидат наук Маколкина, Мария Александровна
Список литературы диссертационного исследования кандидат наук Чураев Егор Николаевич, 2025 год
Список литературы
1. Arunnehru, J. Automatic human emotion recognition in surveillance video [Текст] / J. Arunnehru, M. Kalaiselvi Geetha // Intelligent techniques in signal processing for multimedia security. — 2017. — С. 321—342.
2. Convolutional neural network-based classification of driver's emotion during aggressive and smooth driving using multi-modal camera sensors [Текст] / K. W. Lee [и др.] // Sensors. — 2018. — Т. 18, № 4. — С. 957.
3. Scherr, S. A. Acceptance testing of mobile applications: Automated emotion tracking for large user groups [Текст] / S. A. Scherr, F. Elberzhager, K. Holl // Proceedings of the 5th International Conference on Mobile Software Engineering and Systems. — 2018. — С. 247—251.
4. Adedoyin, O. B. Covid-19 pandemic and online learning: the challenges and opportunities [Текст] / O. B. Adedoyin, E. Soykan // Interactive Learning Environments. — 2023. — Т. 31, № 2. — С. 863—875.
5. Paudel, P. Online education: Benefits, challenges and strategies during and after COVID-19 in higher education. [Текст] / P. Paudel // International Journal on Studies in Education. — 2021. — Т. 3, № 2.
6. Attentive or not? Toward a machine learning approach to assessing students' visible engagement in classroom instruction [Текст] / P. Goldberg [и др.] // Educational Psychology Review. — 2021. — Т. 33. — С. 27—49.
7. Subramainan, L. A systematic review on students' engagement in classroom: Indicators, challenges and computational techniques [Текст] / L. Subramainan, M. A. Mahmoud // International Journal of Advanced Computer Science and Applications. — 2020. — Т. 11, № 1.
8. Orji, F. A. Evaluating a persuasive intervention for engagement in a large university class [Текст] / F. A. Orji, J. Vassileva, J. Greer // International Journal of Artificial Intelligence in Education. — 2021. — Т. 31, № 4. — С. 700—725.
9. Coates, H. The value of student engagement for higher education quality assurance [Текст] / H. Coates // Quality in Higher Education. — 2005. — Т. 11, № 1. — С. 25—36.
10. Karaoglan Yilmaz, F. G. Learning analytics intervention improves students' engagement in online learning [Текст] / F. G. Karaoglan Yilmaz, R. Yilmaz // Technology, Knowledge and Learning. — 2022. — Т. 27, № 2. — С. 449—460.
11. Naas, S.-A. Real-time emotion recognition for sales [Текст] / S.-A. Naas, S. Sigg // 2020 16th International Conference on Mobility, Sensing and Networking (MSN). — IEEE. 2020. — С. 584—591.
12. A randomised control trial for measuring student engagement through the Internet of Things and serious games [Текст] / J. Henry [и др.] // Internet of Things. — 2021. — Т. 13. — С. 100332.
13. Dewan, M. Engagement detection in online learning: a review [Текст] / M. Dewan, M. Murshed, F. Lin // Smart Learning Environments. — 2019. — Т. 6, № 1. — С. 1—20.
14. Tkalcic, M. Affective recommender systems: the role of emotions in recommender systems [Текст] / M. Tkalcic, A. Kosir, J. Tasic // Proc. The RecSys 2011 Workshop on Human Decision Making in Recommender Systems. — 2011. — С. 9—13.
15. Associating facial expressions and upper-body gestures with learning tasks for enhancing intelligent tutoring systems [Текст] / A. Behera [и др.] // International Journal of Artificial Intelligence in Education. — 2020. — Т. 30. — С. 236—270.
16. Savchenko, A. V. Classifying emotions and engagement in online learning based on a single facial expression recognition neural network [Текст] / A. V. Savchenko, L. V. Savchenko, I. Makarov // IEEE Transactions on Affective Computing. — 2022. — Т. 13, № 4. — С. 2132—2143.
17. Predicting engagement in video lectures [Текст] / S. Bulathwela [и др.] // arXiv preprint arXiv:2006.00592. — 2020.
18. Churaev, E. Multi-user facial emotion recognition in video based on user-dependent neural network adaptation [Текст] / E. Churaev, A. V. Savchenko // 2022 VIII International Conference on Information Technology and Nanotechnology (ITNT). — IEEE. 2022. — С. 1—5. — doi: https://doi.org/10.1109/ITNT55410.2022.9848645.
19. Liao, J. Deep facial spatiotemporal network for engagement prediction in online learning [Текст] / J. Liao, Y. Liang, J. Pan // Applied Intelligence. — 2021. — Т. 51. — С. 6609—6621.
20. Savchenko, L. Speaker-aware training of speech emotion classifier with speaker recognition [Текст] / L. Savchenko, A. V Savchenko // Speech and Computer: 23rd International Conference, SPECOM 2021, St. Petersburg, Russia, September 27-30, 2021, Proceedings 23. — Springer. 2021. — С. 614—625.
21. Чураев, Е. Распознавание выражений лиц на основе адаптации классификатора видеоданных пользователя [Текст] / Е. Чураев, А. Савченко // Компьютерная оптика. — 2023. — Т. 47, № 5. — С. 806—815. — Q3, doi: https://doi.org/10.18287/2412-6179-C0-1269.
22. Churaev, E. To Kill a Student's Disengagement: Personalized Engagement Detection in Facial Video [Текст] / E. Churaev, A. V. Savchenko // International Conference on Artificial Intelligence in Education. — Springer. 2024. — С. 329—337. — Q4, doi: https://doi.org/10.1007/978-3-031-64315-6_29.
23. Basic emotions [Текст] / P. Ekman [и др.] // Handbook of cognition and emotion. — 1999. — Т. 98, № 45—60. — С. 16.
24. Livingstone, S. R. The Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS): A dynamic, multimodal set of facial and vocal expressions in North American English [Текст] / S. R. Livingstone, F. A. Russo // PloS one. — 2018. — Т. 13, № 5. — e0196391.
25. Mollahosseini, A. AffectNet: A database for facial expression, valence, and arousal computing in the wild [Текст] / A. Mollahosseini, B. Hasani, M. H. Mahoor // IEEE Transactions on Affective Computing. — 2017. — Т. 10, № 1. — С. 18—31.
26. Mesquita, B. Cultural differences in emotions: A context for interpreting emotional experiences [Текст] / B. Mesquita, R. Walker // Behaviour research and therapy. — 2003. — Т. 41, № 7. — С. 777—793.
27. Ekman, P. Facial action coding system [Текст] / P. Ekman, W. V. Friesen // Environmental Psychology & Nonverbal Behavior. — 1978.
28. EMFACS-7: Emotional facial action coding system [Текст] / W. V. Friesen, P. Ekman [и др.] // Unpublished manuscript, University of California at San Francisco. — 1983. — Т. 2, № 36. — С. 1.
29. Chang, W.-Y. FATAUVA-Net: An integrated deep learning framework for facial attribute recognition, action unit detection, and valence-arousal estimation [Текст] / W.-Y. Chang, S.-H. Hsu, J.-H. Chien // Proceedings of the IEEE conference on computer vision and pattern recognition workshops. — 2017. — С. 17—25.
30. Savchenko, A. V. Facial expression and attributes recognition based on multitask learning of lightweight neural networks [Текст] / A. V. Savchenko // 2021 IEEE 19th International Symposium on Intelligent Systems and Informatics (SISY). — IEEE. 2021. — С. 119—124.
31. Facial emotion recognition through artificial intelligence [Текст] / J. A. Ballesteros [и др.] // Frontiers in Computer Science. — 2024. — Т. 6. — С. 1359471.
32. Finding Emotions in Faces: A Meta-Classifier [Текст] / S. Dalal [и др.] // arXiv preprint arXiv:2208.09678. — 2022.
33. Hossain, M. A. Facial expression recognition based on active region of interest using deep learning and parallelism [Текст] / M. A. Hossain, B. Assiri // PeerJ Computer Science. — 2022. — Т. 8. — e894.
34. Advances in Facial Expression Recognition: A Survey of Methods, Benchmarks, Models, and Datasets [Текст] / T. Kopalidis [и др.] // Information. — 2024. — Т. 15, № 3. — С. 135.
35. Real-time facial expression recognition using facial landmarks and neural networks [Текст] / M. A. Haghpanah [и др.] // 2022 International Conference on Machine Vision and Image Processing (MVIP). — IEEE. 2022. — С. 1—7.
36. Padilla, R. Evaluation of haar cascade classifiers designed for face detection [Текст] / R. Padilla, C. Costa Filho, M. Costa // World Academy of Science, Engineering and Technology. — 2012. — Т. 64. — С. 362—365.
37. Dharavath, K. Improving face recognition rate with image preprocessing [Текст] / K. Dharavath, F. A. Talukdar, R. H. Laskar // Indian Journal of Science and Technology. — 2014. — Т. 7, № 8. — С. 1170—1175.
38. Struc, V. Histogram remapping as a preprocessing step for robust face recognition [Текст] / V. Struc, J. Zibert, N. Pavesic // image. — 2009. — Т. 7, № 8. — С. 9.
39. Shan, C. Facial expression recognition based on local binary patterns: A comprehensive study [Текст] / C. Shan, S. Gong, P. W. McOwan // Image and vision Computing. — 2009. — Т. 27, № 6. — С. 803—816.
40. Facial expression recognition and histograms of oriented gradients: a comprehensive study [Текст] / P. Carcagni [и др.] // SpringerPlus. — 2015. — Т. 4, № 1. — С. 1—25.
41. A principal component analysis of facial expressions [Текст] / A. J. Calder [и др.] // Vision research. — 2001. — Т. 41, № 9. — С. 1179—1208.
42. Video facial emotion recognition based on local enhanced motion history image and CNN-CTSLSTM networks [Текст] / M. Hu [и др.] // Journal of Visual Communication and Image Representation. — 2019. — Т. 59. — С. 176—185.
43. Zhang, H. Facial expression recognition based on deep convolution long short-term memory networks of double-channel weighted mixture [Текст] / H. Zhang, B. Huang, G. Tian // Pattern Recognition Letters. — 2020. — Т. 131. — С. 128—134.
44. Facial emotion recognition using light field images with deep attention-based bidirectional LSTM [Текст] / A. Sepas-Moghaddam [и др.] // ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). — IEEE. 2020. — С. 3367—3371.
45. Human Emotion Recognition Based on Spatio-Temporal Facial Features Using HOG-HOF and VGG-LSTM [Текст] / H. Chouhayebi [и др.] // Computers. — 2024. — Т. 13, № 4. — С. 101.
46. Cootes, T. F. Active appearance models [Текст] / T. F. Cootes, G. J. Edwards, C. J. Taylor // IEEE Transactions on pattern analysis and machine intelligence. — 2001. — Т. 23, № 6. — С. 681—685.
47. Wang, Z. Facial expression recognition based on local phase quantization and sparse representation [Текст] / Z. Wang, Z. Ying // 2012 8th International Conference on Natural Computation. — IEEE. 2012. — С. 222—225.
48. Ojala, T. Performance evaluation of texture measures with classification based on Kullback discrimination of distributions [Текст] / T. Ojala, M. Pietikainen, D. Harwood // Proceedings of 12th international conference on pattern recognition. Т. 1. — IEEE. 1994. — С. 582—585.
49. Automatic facial expression recognition using Gabor filter and expression analysis [Текст] / J. Ou [и др.] // 2010 Second International Conference on Computer Modeling and Simulation. Т. 2. — IEEE. 2010. — С. 215—218.
50. An introduction to support vector machines and other kernel-based learning methods [Текст] / N. Cristianini, J. Shawe-Taylor [и др.]. — Cambridge university press, 2000.
51. An overview of ensemble methods for binary classifiers in multi-class problems: Experimental study on one-vs-one and one-vs-all schemes [Текст] / M. Galar [и др.] // Pattern Recognition. — 2011. — Т. 44, № 8. — С. 1761—1776.
52. Tan, M. Efficientnet: Rethinking model scaling for convolutional neural networks [Текст] / M. Tan, Q. Le // International conference on machine learning. — PMLR. 2019. — С. 6105—6114.
53. CMix-NN: Mixed low-precision CNN library for memory-constrained edge devices [Текст] / A. Capotondi [и др.] // IEEE Transactions on Circuits and Systems II: Express Briefs. — 2020. — Т. 67, № 5. — С. 871—875.
54. Wang, P. Comparative analysis of image classification algorithms based on traditional machine learning and deep learning [Текст] / P. Wang, E. Fan, P. Wang // Pattern Recognition Letters. — 2021. — Т. 141. — С. 61—67.
55. Facial emotion recognition using deep convolutional networks [Текст] / M. Mohammadpour [и др.] // 2017 IEEE 4th international conference on knowledge-based engineering and innovation (KBEI). — IEEE. 2017. — С. 0017—0021.
56. The extended Cohn-Kanade dataset (CK+): A complete dataset for action unit and emotion-specified expression [Текст] / P. Lucey [и др.] // 2010 ieee computer society conference on computer vision and pattern recognition-workshops. — IEEE. 2010. — С. 94—101.
57. Privacy and security issues in deep learning: A survey [Текст] / X. Liu [и др.] // IEEE Access. — 2020. — Т. 9. — С. 4566—4593.
58. Savchenko, A. V. HSEmotion: High-speed emotion recognition library [Текст] / A. V. Savchenko // Software Impacts. — 2022. — Т. 14. — С. 100433.
59. Savchenko, A. V. Video-based frame-level facial analysis of affective behavior on mobile devices using EfficientNets [Текст] / A. V. Savchenko // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2022. — С. 2359—2366.
60. Kollias, D. Abaw: Valence-arousal estimation, expression recognition, action unit detection & multi-task learning challenges [Текст] / D. Kollias // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2022. — С. 2328—2336.
61. Savchenko, A. V. MT-EmotiEffNet for multi-task human affective behavior analysis and learning from synthetic data [Текст] / A. V. Savchenko // Proceedings of European Conference on Computer Vision (ECCV) Workshops. — Springer. 2022. — С. 45—59.
62. Kollias, D. Abaw: Learning from synthetic data & multi-task learning challenges [Текст] / D. Kollias // European Conference on Computer Vision. — Springer. 2023. — С. 157—172.
63. Churaev, E. A standalone software for real-time facial analysis in online conferences and e-lessons [Текст] / E. Churaev, A. V. Savchenko // Software Impacts. — 2023. — Т. 16. — С. 100507. — Q3, doi: https://doi.org/10.1016/ j.simpa.2023.100507.
64. TVM: end-to-end optimization stack for deep learning [Текст] / T. Chen [и др.] // arXiv preprint arXiv:1802.04799. — 2018. — Т. 11, № 20.
65. Web-based database for facial expression analysis [Текст] / M. Pantic [и др.] // 2005 IEEE international conference on multimedia and Expo. — IEEE. 2005. — 5—pp.
66. Collecting large, richly annotated facial-expression databases from movies [Текст] / A. Dhall [и др.] // IEEE multimedia. — 2012. — Т. 19, № 3. —
C. 34.
67. Frame attention networks for facial expression recognition in videos [Текст] /
D. Meng [и др.] // 2019 IEEE international conference on image processing (ICIP). — IEEE. 2019. — С. 3866—3870.
68. King, D. E. Dlib-ml: A machine learning toolkit [Текст] / D. E. King // The Journal of Machine Learning Research. — 2009. — Т. 10. — С. 1755—1758.
69. Deep residual learning for image recognition [Текст] / K. He [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — С. 770—778.
70. Ms-celeb-1m: A dataset and benchmark for large-scale face recognition [Текст] / Y. Guo [и др.] // Computer Vision-ECCV 2016: 14th European Conference, Amsterdam, The Netherlands, October 11-14, 2016, Proceedings, Part III 14. — Springer. 2016. — С. 87—102.
71. Training deep networks for facial expression recognition with crowd-sourced label distribution [Текст] / E. Barsoum [и др.] // Proceedings of the 18th ACM international conference on multimodal interaction. — 2016. — С. 279—283.
72. Emotiw 2018: Audio-video, student engagement and group-level affect prediction [Текст] / A. Dhall [и др.] // Proceedings of the 20th ACM International Conference on Multimodal Interaction. — 2018. — С. 653—656.
73. Ma, F. Facial expression recognition with visual transformers and attentional selective fusion [Текст] / F. Ma, B. Sun, S. Li // IEEE Transactions on Affective Computing. — 2021.
74. Li, S. Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild [Текст] / S. Li, W. Deng, J. Du // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — С. 2852—2861.
75. Challenges in representation learning: A report on three machine learning contests [Текст] / I. J. Goodfellow [и др.] // Neural Information Processing: 20th International Conference, ICONIP 2013, Daegu, Korea, November 3-7, 2013. Proceedings, Part III 20. — Springer. 2013. — С. 117—124.
76. Automated facial expression and speech emotion recognition app development on smart phones using cloud computing [Текст] / H. Alshamsi [и др.] // 2018 IEEE 9th Annual Information Technology, Electronics and Mobile Communication Conference (IEMCON). — IEEE. 2018. — С. 730—738.
77. Jaratrotkamjorn, A. Bimodal emotion recognition using deep belief network [Текст] / A. Jaratrotkamjorn, A. Choksuriwong // 2019 23rd International Computer Science and Engineering Conference (ICSEC). — IEEE. 2019. — С. 103—109.
78. Rzayeva, Z. Facial emotion recognition using convolutional neural networks [Текст] / Z. Rzayeva, E. Alasgarov // 2019 IEEE 13th international conference on application of information and communication technologies (AICT). — IEEE. 2019. — С. 1—5.
79. A novel model for emotion detection from facial muscles activity [Текст] / E. Bagheri [и др.] // Robot 2019: Fourth Iberian Robotics Conference: Advances in Robotics, Volume 2. — Springer. 2020. — С. 237—249.
80. Baltrusaitis, T. Openface: an open source facial behavior analysis toolkit [Текст] / T. Baltrusaitis, P. Robinson, L.-P. Morency // 2016 IEEE winter conference on applications of computer vision (WACV). — IEEE. 2016. — С. 1—10.
81. Human emotion recognition in video using subtraction pre-processing [Текст] / Z. He [и др.] // Proceedings of the 2019 11th International Conference on Machine Learning and Computing. — 2019. — С. 374—379.
82. Multimodal emotion recognition on ravdess dataset using transfer learning [Текст] / C. Luna-Jimenez [и др.] // Sensors. — 2021. — Т. 21, № 22. — С. 7665.
83. The impact of coronavirus pandemic (COVID-19) on education: The role of virtual and remote laboratories in education [Текст] / R. A. Abumalloh [и др.] // Technology in Society. — 2021. — Т. 67. — С. 101728.
84. Yeganeh, H. Emerging social and business trends associated with the Covid-19 pandemic [Текст] / H. Yeganeh // Critical perspectives on international business. — 2021. — Т. 17, № 2. — С. 188—209.
85. Remote or removed: Predicting successful engagement with online learning during COVID-19 [Текст] / T. Domina [и др.] // Socius. — 2021. — Т. 7. — С. 2378023120988200.
86. Students' motivation and engagement in higher education: The importance of attitude to online learning [Текст] / J. Ferrer [и др.] // Higher Education. — 2022. — Т. 83, № 2. — С. 317—338.
87. Kaddoura, S. A systematic review on machine learning models for online learning and examination systems [Текст] / S. Kaddoura, D. E. Popescu, J. D. Hemanth // PeerJ Computer Science. — 2022. — Т. 8. — e986.
88. Booth, B. M. Engagement Detection and Its Applications in Learning: A Tutorial and Selective Review [Текст] / B. M. Booth, N. Bosch, S. K. D'Mello // Proceedings of the IEEE. — 2023.
89. Greene, B. A. Measuring cognitive engagement with self-report scales: Reflections from over 20 years of research [Текст] / B. A. Greene // Educational Psychologist. — 2015. — Т. 50, № 1. — С. 14—30.
90. Multimodal engagement analysis from facial videos in the classroom [Текст] / O. Siimer [и др.] // IEEE Transactions on Affective Computing. — 2021.
91. Data-driven online learning engagement detection via facial expression and mouse behavior recognition technology [Текст] / Z. Zhang [и др.] // Journal of Educational Computing Research. — 2020. — Т. 58, № 1. — С. 63—86.
92. Prediction and localization of student engagement in the wild [Текст] / A. Kaur [и др.] // 2018 Digital Image Computing: Techniques and Applications (DICTA). — IEEE. 2018. — С. 1—8.
93. Hybrid analysis of the learner's online behavior based on learning style [Текст] / R. Balti [и др.] // Education and Information Technologies. — 2023. — С. 1—40.
94. Fine-grained engagement recognition in online learning environment [Текст] / T. Huang [и др.] // 2019 IEEE 9th international conference on electronics information and emergency communication (ICEIEC). — IEEE. 2019. — С. 338—341.
95. Automatic recognition of student engagement using deep learning and facial expression [Текст] / O. Mohamad Nezami [и др.] // Joint european conference on machine learning and knowledge discovery in databases. — Springer. 2020. — С. 273—289.
96. Muhammad, K. Efficient CNN based summarization of surveillance videos for resource-constrained devices [Текст] / K. Muhammad, T. Hussain, S. W. Baik // Pattern Recognition Letters. — 2020. — Т. 130. — С. 370—375.
97. Exploring visual engagement signals for representation learning [Текст] / M. Jia [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2021. — С. 4206—4217.
98. Quantifying dynamic facial expressions under naturalistic conditions [Текст] / J. Jeganathan [и др.] // Elife. — 2022. — Т. 11. — e79581.
99. The faces of engagement: Automatic recognition of student engagement from facial expressions [Текст] / J. Whitehill [и др.] // IEEE Transactions on Affective Computing. — 2014. — Т. 5, № 1. — С. 86—98.
100. UE-HRI: a new dataset for the study of user engagement in spontaneous human-robot interactions [Текст] / A. Ben-Youssef [и др.] // Proceedings of the 19th ACM international conference on multimodal interaction. — 2017. — С. 464—472.
101. The NoXi database: multimodal recordings of mediated novice-expert interactions [Текст] / A. Cafaro [и др.] // Proceedings of the 19th ACM International Conference on Multimodal Interaction. — 2017. — С. 350—359.
102. Automatic recognition of children engagement from facial video using convolutional neural networks [Текст] / W.-H. Yun [и др.] // IEEE Transactions on Affective Computing. — 2018. — Т. 11, № 4. — С. 696—707.
103. Student engagement dataset [Текст] / K. Delgado [и др.] // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2021. — С. 3628—3636.
104. ATL-BP: a student engagement dataset and model for affect transfer learning for behavior prediction [Текст] / N. Ruiz [и др.] // IEEE Transactions on Biometrics, Behavior, and Identity Science. — 2022. — Т. 5, № 3. — С. 411—424.
105. Daisee: Towards user engagement recognition in the wild [Текст] / A. Gupta [и др.] // arXiv preprint arXiv:1609.01885. — 2016.
106. Hu, Y. An optimized cnn model for engagement recognition in an e-learning environment [Текст] / Y. Hu, Z. Jiang, K. Zhu // Applied Sciences. — 2022. — Т. 12, № 16. — С. 8007.
107. Abedi, A. Improving state-of-the-art in detecting student engagement with ResNet and TCN hybrid network [Текст] / A. Abedi, S. S. Khan // Proceedings of the 18th Conference on Robots and Vision (CRV). — IEEE. 2021. — С. 151—157.
108. Emotion recognition in the wild from videos using images [Текст] / S. A. Bargal [и др.] // Proceedings of the 18th ACM International Conference on Multimodal Interaction. — 2016. — С. 433—436.
109. Hirzel, M. Sliding-window aggregation algorithms: Tutorial [Текст] / M. Hirzel, S. Schneider, K. Tangwongsan // Proceedings of the 11th ACM International Conference on Distributed and Event-based Systems. — 2017. — С. 11—14.
110. Do i have your attention: A large scale engagement prediction dataset and baselines [Текст] / M. Singh [и др.] // Proceedings of the 25th International Conference on Multimodal Interaction. — 2023. — С. 174—182.
111. Gupta, S. A multimodal facial cues based engagement detection system in e-learning context using deep learning approach [Текст] / S. Gupta, P. Kumar, R. Tekchandani // Multimedia Tools and Applications. — 2023. — Т. 82, № 18. — С. 28589—28615.
112. Thomas, C. Predicting student engagement in classrooms using facial behavioral cues [Текст] / C. Thomas, D. B. Jayagopi // Proceedings of the 1st ACM SIGCHI international workshop on multimodal interaction for education. — 2017. — С. 33—40.
113. Student engagement study based on multi-cue detection and recognition in an intelligent learning environment [Текст] / Y. Liu [и др.] // Multimedia Tools and Applications. — 2018. — Т. 77, № 21. — С. 28749—28775.
114. Automatic recognition of student engagement using deep learning and facial expression [Текст] / O. Mohamad Nezami [и др.] // Joint european conference on machine learning and knowledge discovery in databases. — Springer. 2019. — С. 273—289.
115. Students' emotion extraction and visualization for engagement detection in online learning [Текст] / M. N. Hasnine [и др.] // Procedia Computer Science. — 2021. — Т. 192. — С. 3423—3431.
116. OpenCV [Текст] / G. Bradski, A. Kaehler [и др.] // Dr. Dobb's journal of software tools. — 2000. — Т. 3, № 2.
117. Joint face detection and alignment using multitask cascaded convolutional networks [Текст] / K. Zhang [и др.] // IEEE signal processing letters. — 2016. — Т. 23, № 10. — С. 1499—1503.
118. Attention is all you need [Текст] / A. Vaswani [и др.] // Advances in neural information processing systems. — 2017. — Т. 30.
119. Dresvyanskiy, D. Deep learning based engagement recognition in highly imbalanced data [Текст] / D. Dresvyanskiy, W. Minker, A. Karpov // Proceedings of the 23rd International Conference on Speech and Computer (SPECOM). — Springer. 2021. — С. 166—178.
120. Arcface: Additive angular margin loss for deep face recognition [Текст] / J. Deng [и др.] // Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. — 2019. — С. 4690—4699.
121. User-adaptive models for activity and emotion recognition using deep transfer learning and data augmentation [Текст] / E. Garcia-Ceja [и др.] // User Modeling and User-Adapted Interaction. — 2020. — Т. 30. — С. 365—393.
122. Li, C. J. Partially speaker-dependent automatic speech recognition using deep neural networks [Текст] / C. J. Li, M. Spigner // Journal of the South Carolina Academy of Science. — 2021. — Т. 19, № 2. — С. 12.
123. Churaev, E. Touching the limits of a dataset in video-based facial expression recognition [Текст] / E. Churaev, A. V. Savchenko // 2021 International Russian Automation Conference (RusAutoCon). — IEEE. 2021. — С. 633—638. — doi: https://doi.org/10.1109/RusAutoCon52004. 2021.9537388.
124. Hu, J. Squeeze-and-excitation networks [Текст] / J. Hu, L. Shen, G. Sun // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2018. — С. 7132—7141.
125. Three-dimensional DenseNet self-attention neural network for automatic detection of student's engagement [Текст] / N. K. Mehta [и др.] // Applied Intelligence. — 2022. — Т. 52, № 12. — С. 13803—13823.
126. Densely connected convolutional networks [Текст] / G. Huang [и др.] // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2017. — С. 4700—4708.
127. Engagement analysis of students in online learning environments [Текст] / S. Kamath [и др.] // Machine Learning and Big Data Analytics (Proceedings of International Conference on Machine Learning and Big Data Analytics (ICMLBDA) 2021). — Springer. 2022. — С. 34—47.
128. Class-attention video transformer for engagement intensity prediction [Текст] / X. Ai [и др.] // arXiv preprint arXiv:2208.07216. — 2022.
129. Openface 2.0: Facial behavior analysis toolkit [Текст] / T. Baltrusaitis [и др.] // 2018 13th IEEE international conference on automatic face & gesture recognition (FG 2018). — IEEE. 2018. — С. 59—66.
130. Emotiw 2020: Driver gaze, group emotion, student engagement and physiological signal based challenges [Текст] / A. Dhall [и др.] // Proceedings of the 2020 International Conference on Multimodal Interaction. — 2020. — С. 784—789.
131. Multi-rate attention based gru model for engagement prediction [Текст] / B. Zhu [и др.] // Proceedings of the 2020 International Conference on Multimodal Interaction. — 2020. — С. 841—848.
132. Engagement intensity prediction withfacial behavior features [Текст] / V. Thong Huynh [и др.] // 2019 International Conference on Multimodal Interaction. — 2019. — С. 567—571.
133. Learning deep spatiotemporal feature for engagement recognition of online courses [Текст] / L. Geng [и др.] // Proceedings of the Symposium Series on Computational Intelligence (SSCI). — IEEE. 2019. — С. 442—447.
134. An novel end-to-end network for automatic student engagement recognition [Текст] / H. Zhang [и др.] // Proceedings of the 9th International Conference on Electronics Information and Emergency Communication (ICEIEC). — IEEE. 2019. — С. 342—345.
135. Vggface2: A dataset for recognising faces across pose and age [Текст] / Q. Cao [и др.] // 2018 13th IEEE international conference on automatic face & gesture recognition (FG 2018). — IEEE. 2018. — С. 67—74.
136. Свидетельство о гос. регистрации программы для ЭВМ. Программа определения онлайн характеристик учеников по данным видеонаблюдения [Текст] / Е. Н. Чураев, А. В. Савченко ; Ф. государственное автономное образовательное учреждение высшего образования "Национальный исследовательский университет «Высшая школа экономики»". — № 2024618650 ; заявл. 22.04.2024 ; опубл. 07.05.2024, 2024660523 (Рос. Федерация).
137. Savchenko, A. Facial Expression Recognition with Adaptive Frame Rate based on Multiple Testing Correction [Текст] / A. Savchenko // Proceedings of the 40th International Conference on Machine Learning (ICML). Т. 202. — PMLR, 2023. — С. 30119—30129.
Список рисунков
1.1 Различные виды представления эмоций..................................16
1.2 Общий алгоритм определения лицевых эмоций по изображению. . . 16
1.3 Схема алгоритма распознавания лицевых эмоций на видео......26
1.4 Пример кадров из набора Faces of Engagement............................37
1.5 Примеры видео кадров из набора данных Student engagement..........39
1.6 Примеры видео кадров из набора данных Student engagement..........39
1.7 Примеры видео кадров из наборов данных EngageWild и DAiSEE. . . 40
1.8 Общий алгоритм определения вовлечённости по видео..................42
2.1 Традиционный алгоритм распознаания эмоций/вовлечённости по
видео..........................................................................50
2.2 Схема алгоритма идентификации пользователя..........................59
2.3 Схема персонализированного метода распознавания эмоций на видео. 62
2.4 Примеры кадров из собранного набора данных..........................63
2.5 Схема метода персонализированного определения вовлечённости по видео..........................................................................65
2.6 Алгоритм сбора пользовательских видеоданных и создания на их основе персонализированных моделей на устройстве пользователя. . 67
3.1 Различные виды представления эмоций..................................75
3.2 Матрицы перемешивания для набора RAVDESS со случайным разбиением и с разбиением по актёрам ..................................77
3.3 Матрицы перемешивания для моделей основанных на EmotiEffNet-B0 и self-attention............................................79
3.4 Примеры кадров с видео, где персонализированная модель дала неверные предсказания ....................................................80
3.5 Матрицы перемешивания для моделей основанных на EmotiEffNet-B0 + single attention + std..................................88
3.6 Точность персональных и общей моделей, основанных на EmotiEffNet-B0, в зависимости от числа видео, использованных для дообучения классификатора................................................89
3.7 Точность предсказания вовлечённости в зависимости от числа
видео в обучающем наборе..................................................90
4.1 Схема алгоритма работы EngagementEstimator............. 98
4.2 Схема работы алгоритма трекинга пользователя............ 99
4.3 Графический интерфейс программного комплекса EngagementEstimator............................100
4.4 Пример отображения информации в режиме отладки.........101
4.5 Пример работы приложения FER Data Collector............102
4.6 Страница разработанного модуля, развёрнутого во фреймворке
центра ИИ..................................105
4.7 Пример работы модуля для распознавания эмоций на видео......106
4.8 Пример работы модуля для распознавания эмоций на видео......107
4.9 Пример работы модуля для распознавания эмоций на видео......108
Список таблиц
1 Точность распознавания эмоций существующих подходов на наборе данных КЛУВЕЗБ............................. 33
2 Сравнение различных подходов определения вовлечённости..... 46
3 Точность распознавания эмоций наших моделей на разных разбиениях набора данных КЛУЭЕЗЗ.................. 76
4 Точность (%) распознавания эмоций по видео изображению лица . . 78
5 Распределение видео файлов в наборах данных для распознавания вовлечённости ............................... 81
6 Распределение видео файлов в наборах данных для распознавания вовлечённости после балансировки.................... 83
7 Сравнение производительности моделей на наборах данных
ЭЛ18ЕЕ и ........................... 85
8 Сравнение точности универсальных и персонализированных
моделей для определения вовлечённости................. 86
9 Время работы EfficientNet моделей на разных фрейворках....... 96
Обратите внимание, представленные выше научные тексты размещены для ознакомления и получены посредством распознавания оригинальных текстов диссертаций (OCR). В связи с чем, в них могут содержаться ошибки, связанные с несовершенством алгоритмов распознавания. В PDF файлах диссертаций и авторефератов, которые мы доставляем, подобных ошибок нет.