ExpresSense:使用声学传感探索独立智能手机从面部表情感知用户参与度

人体姿态与行为识别生物传感器与生理监测

文献标题

ExpresSense: Exploring a Standalone Smartphone to Sense Engagement of Users from Facial Expressions Using Acoustic Sensing

文献信息

  • 主题领域: 人机交互,基于声学的面部表情检测
  • 关键词: 声学感知、智能手机、表情、参与度、辅助系统、机器学习、非视觉检测、实时处理

研究背景与问题

  • 问题描述:

    • 传统的基于图像和视频的表情检测方法在以下方面存在局限:对光照条件依赖性强;遮挡导致检测失败;隐私安全性问题;高算力与高能耗要求等。
    • 满足实时性和设备资源受限的表情检测需求对智能手机存在较大挑战。
  • 重要性:

    • 面部表情关联用户情感与参与度的检测可为心理健康监测与情绪管理提供应用可能,例如:快速发现抑郁症状或提升用户体验。
    • 针对隐私、能耗和干扰敏感场景的非视觉表情检测具有广泛的实际潜力。
  • 研究动机与相关工作:

    • 当前工作(如SonicFace、EarIO)在声学表情检测中的应用需要外部硬件(如麦克风阵列或耳机)支持或特殊设置。
    • 本研究的目标是开发一个基于消费级智能手机即可实现的轻量级解决方案,消除外部硬件依赖并弥补当前声学检测的不足。

解决方案

  • 方法/解决方案:

    • 提出一种基于声学检测的系统——ExpresSense,利用智能手机内置扬声器和麦克风,通过生成16kHz-19kHz的近超声波信号捕获面部反射信号中的相位和幅度变化以检测基本表情。
  • 创新之处:

    1. 使用商用智能手机中现成的硬件,无需外部设备。
    2. 引入轻量级实时信号处理与机器学习模型,优化精度与性能之间的平衡。
    3. 能适应不同光照条件,无需隐私敏感的摄像头数据。
    4. 还可以克服面部遮挡(如佩戴眼镜或口罩)等场景下的检测困难。
  • 实施步骤与关键技术:

    1. 声波生成与信号接收: 在16-19kHz之间生成线性调频连续波(FMCW)信号,并通过智能手机接收反射信号。
    2. 信号处理:
      • 使用高通滤波器消除低频噪声干扰。
      • 通过傅里叶变换提取信号的频域特征,并筛选针对面部区域的重要频率分量。
      • 消除静态反射干扰(如墙壁和桌面)。
    3. 表情分类:
      • 提取反射信号的幅度与相位特征。
      • 使用三种分类器(Logistic Regression、Decision Tree、Random Forest)组合进行表情分类,通过多数投票决策生成最终结果。
    4. 系统优化:
      • 设计用于实验和用户测试的安卓应用。
      • 对不同实验条件(如环境噪声、移动、设备角度变化等)进行敏感性分析。

研究成果

  • 具体成果:

    • 实现了无需摄像头、完全基于智能手机的表情检测工具。
    • 平均分类精度达到约75%,较其他表情检测声学技术有显著简便性优势。
  • 与现有解决方案的对比:

    • 在硬件需求上显著降低:不需要麦克风阵列、外置耳机或其他附加设备。
    • 在特定场景下(弱光条件、遮挡场景)达到了更鲁棒的性能。
  • 实验或评估结果:

    • 实验结果
      • 用户依赖模型(user-dependent model)的平均精度为约75%,采用基于受控实验与自然实验的多维度评估(如角度偏差、环境声音、运动影响)。
      • 在自然使用场景下表现优异,例如,通过个性化用户参与度评分实现的流媒体内容评价任务,取得平均F1分数为0.84。
    • 敏感性分析
      • 在距离、手机倾斜角度、噪声干扰、手持方式等不同条件下评估了模型鲁棒性。
      • 尽管环境运动和手指动态等因素对总体效果影响有限,但显著运动或设备遮挡确实会降低检测性能。
  • 局限性与未来方向:

    1. 声音适用性: 目前所用16-19kHz信号可能在某些情况下轻微可听,需要进一步优化信号范围或改进设备支持频率(如扩展至iOS设备)。
    2. 动态检视: 在用户产生大幅运动(如步行)或设备频繁移动的情况下,需进一步校准和优化。
    3. 误分类及泛化能力: 对新用户的准确性存在下降现象,未来需建立更大规模的数据集进行训练,以提升通用性。
    4. 表情精度影响: 特定类别(如悲伤、惊讶)的表情分类率偏低,需进一步优化AU(面部动作单元)分布敏感性分析。

总结

ExpresSense展示了无摄像头条件下基于声学表情检测的潜力,可适用于一定范围的实时用户情绪检测任务,同时也为隐私友好和计算负担轻量化的下一代智能手机应用提供了理论与实践参考。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96564/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581235
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
人体姿态与行为识别、生物传感器与生理监测
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文