
Исследователи из Института Генриха Герца Общества Фраунгофера и Берлинского университета имени Гумбольдта предложили способ распознавания эмоциональных выражений человека в виртуальной реальности, объединяющий изображение видимой нижней части лица с электромиографией мышц, скрытых под очками. В эксперименте такой мультимодальный подход достиг значения macro-F1 0,51 против 0,41 у системы, использующей только изображение, и 0,43 у варианта только с электромиографией.
Обычным системам компьютерного зрения трудно анализировать мимику пользователя ВР-очков: корпус устройства закрывает глаза, брови и лоб — области, важные для различения, например, удивления, страха, гнева и печали. Авторы работы решили получать нужные вводные непосредственно от лицевых мышц с помощью поверхностной электромиографии и объединять их с видеозаписью нижней части лица.
В исследовании участвовали 20 добровольцев. Они использовали PICO Neo 3 с открытой маской EmteqPRO, которая регистрировала активность семи каналов лицевой электромиографии. Нижнюю часть лица одновременно снимали три синхронизированные монохромные камеры разрешением 2448×2048 пикселей с частотой 22 кадра в секунду. В результате исследователи получили около 35 тыс. синхронизированных пар изображений и сигналов ЭМГ.

Участникам показывали 35 изображений лиц из базы NimStim — по пять примеров счастья, печали, гнева, страха, удивления, отвращения и нейтрального выражения. Сначала человек видел название эмоции, а затем в течение шести секунд старался внутренне воспроизвести её и выразить лицом. Поэтому работа фактически оценивает распознавание контролируемых эмоциональных выражений, а не достоверное определение внутреннего эмоционального состояния человека.
Для обработки изображения исследователи использовали нейросеть ResNet, анализирующую видимую часть лица. Сигналы семи лицевых мышц преобразовывались в представление, отражающее взаимосвязи между их активностью. На заключительном этапе система объединяла оба набора признаков и относила выражение к одной из семи категорий. Такая схема называется поздним объединением: каждый источник сначала обрабатывается независимо, а объединяются уже полученные из них признаки.
Лучший результат показала комбинация ResNet-50 и преобразованных с помощью радиально-базисной функции сигналов ЭМГ: точность классификации составила 50%, а macro-F1 — 0,51. Для сравнения, лучший вариант, использующий только изображение, получил macro-F1 0,41, а модель только на электромиографии — 0,43. Особенно заметно дополнительные данные помогли при распознавании удивления: показатель для этой категории вырос с 0,65 до 0,84, а для печали — с 0,17 до 0,49. Для счастья результат увеличился с 0,64 до 0,75. Гнев и отвращение оставались наиболее трудными для классификации.

Работа показывает, что биосигналы потенциально могут компенсировать одну из фундаментальных проблем анализа мимики в виртуальной реальности — физическое перекрытие значительной части лица устройством. В перспективе подобные системы могут использоваться в адаптивных ВР-приложениях, например, в тренажёрах общения или терапевтических сценариях, которые меняют поведение в зависимости от реакции пользователя. Авторы отмечают, что используемая архитектура достаточно легковесна для работы в реальном времени на современных графических процессорах.
Однако результаты пока нельзя напрямую переносить на повседневное использование. Выборка состояла всего из 20 человек, а независимая проверка модели проводилась только на двух участниках. Причём у них результат лучшей системы существенно различался: macro-F1 составил 0,66 у одного и 0,36 у другого. Кроме того, на валидационных данных показатель приближался к 0,95, но на незнакомых участниках падал примерно до 0,50, что указывает на заметное переобучение.
Сами авторы также подчёркивают, что участники воспроизводили заранее заданные выражения по статическим изображениям, тогда как естественное общение включает речь, движения головы, взаимодействие с другими людьми и спонтанные эмоциональные реакции. Поэтому систему следует рассматривать как экспериментальный прототип. Исследователи отдельно предупреждают, что результаты подобных алгоритмов должны трактоваться как вероятностные признаки и требовать человеческой интерпретации, а не считаться точным определением эмоционального состояния.
Исследователи планируют предоставить собранный набор данных другим научным группам по запросу и при принятии соглашения об этичном использовании. Доступ разрешается только для некоммерческих исследований.
Не пропускайте важнейшие новости о дополненной и виртуальной реальности — подписывайтесь на Голографику в Телеграме, Максе, ВК и X! Поддержите проект на Бусти.
Далее:





