ExpresSense:使用声学传感探索独立智能手机从面部表情感知用户参与度
作者
人体姿态与行为识别生物传感器与生理监测
文献标题
ExpresSense: Exploring a Standalone Smartphone to Sense Engagement of Users from Facial Expressions Using Acoustic Sensing
文献信息
- 主题领域: 人机交互,基于声学的面部表情检测
- 关键词: 声学感知、智能手机、表情、参与度、辅助系统、机器学习、非视觉检测、实时处理
研究背景与问题
-
问题描述:
- 传统的基于图像和视频的表情检测方法在以下方面存在局限:对光照条件依赖性强;遮挡导致检测失败;隐私安全性问题;高算力与高能耗要求等。
- 满足实时性和设备资源受限的表情检测需求对智能手机存在较大挑战。
-
重要性:
- 面部表情关联用户情感与参与度的检测可为心理健康监测与情绪管理提供应用可能,例如:快速发现抑郁症状或提升用户体验。
- 针对隐私、能耗和干扰敏感场景的非视觉表情检测具有广泛的实际潜力。
-
研究动机与相关工作:
- 当前工作(如SonicFace、EarIO)在声学表情检测中的应用需要外部硬件(如麦克风阵列或耳机)支持或特殊设置。
- 本研究的目标是开发一个基于消费级智能手机即可实现的轻量级解决方案,消除外部硬件依赖并弥补当前声学检测的不足。
解决方案
-
方法/解决方案:
- 提出一种基于声学检测的系统——ExpresSense,利用智能手机内置扬声器和麦克风,通过生成16kHz-19kHz的近超声波信号捕获面部反射信号中的相位和幅度变化以检测基本表情。
-
创新之处:
- 使用商用智能手机中现成的硬件,无需外部设备。
- 引入轻量级实时信号处理与机器学习模型,优化精度与性能之间的平衡。
- 能适应不同光照条件,无需隐私敏感的摄像头数据。
- 还可以克服面部遮挡(如佩戴眼镜或口罩)等场景下的检测困难。
-
实施步骤与关键技术:
- 声波生成与信号接收: 在16-19kHz之间生成线性调频连续波(FMCW)信号,并通过智能手机接收反射信号。
- 信号处理:
- 使用高通滤波器消除低频噪声干扰。
- 通过傅里叶变换提取信号的频域特征,并筛选针对面部区域的重要频率分量。
- 消除静态反射干扰(如墙壁和桌面)。
- 表情分类:
- 提取反射信号的幅度与相位特征。
- 使用三种分类器(Logistic Regression、Decision Tree、Random Forest)组合进行表情分类,通过多数投票决策生成最终结果。
- 系统优化:
- 设计用于实验和用户测试的安卓应用。
- 对不同实验条件(如环境噪声、移动、设备角度变化等)进行敏感性分析。
研究成果
-
具体成果:
- 实现了无需摄像头、完全基于智能手机的表情检测工具。
- 平均分类精度达到约75%,较其他表情检测声学技术有显著简便性优势。
-
与现有解决方案的对比:
- 在硬件需求上显著降低:不需要麦克风阵列、外置耳机或其他附加设备。
- 在特定场景下(弱光条件、遮挡场景)达到了更鲁棒的性能。
-
实验或评估结果:
- 实验结果:
- 用户依赖模型(user-dependent model)的平均精度为约75%,采用基于受控实验与自然实验的多维度评估(如角度偏差、环境声音、运动影响)。
- 在自然使用场景下表现优异,例如,通过个性化用户参与度评分实现的流媒体内容评价任务,取得平均F1分数为0.84。
- 敏感性分析:
- 在距离、手机倾斜角度、噪声干扰、手持方式等不同条件下评估了模型鲁棒性。
- 尽管环境运动和手指动态等因素对总体效果影响有限,但显著运动或设备遮挡确实会降低检测性能。
- 实验结果:
-
局限性与未来方向:
- 声音适用性: 目前所用16-19kHz信号可能在某些情况下轻微可听,需要进一步优化信号范围或改进设备支持频率(如扩展至iOS设备)。
- 动态检视: 在用户产生大幅运动(如步行)或设备频繁移动的情况下,需进一步校准和优化。
- 误分类及泛化能力: 对新用户的准确性存在下降现象,未来需建立更大规模的数据集进行训练,以提升通用性。
- 表情精度影响: 特定类别(如悲伤、惊讶)的表情分类率偏低,需进一步优化AU(面部动作单元)分布敏感性分析。
总结
ExpresSense展示了无摄像头条件下基于声学表情检测的潜力,可适用于一定范围的实时用户情绪检测任务,同时也为隐私友好和计算负担轻量化的下一代智能手机应用提供了理论与实践参考。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用智能手机内置扬声器和麦克风实现非视觉的用户面部表情检测?分类: 社会代理的情感与非语言表达同类问题arrow_forward
- 基于声学信号的表情检测系统如何在隐私保护和能效间取得平衡?分类: 社会代理的情感与非语言表达同类问题arrow_forward
- 在遮挡和弱光等复杂场景下,声学表情检测的效果如何?分类: 社会代理的情感与非语言表达同类问题arrow_forward
lightbulb
现实痛点
1- 用户在弱光或戴口罩等场景下的表情检测难度大,且传统方法隐私性差。分类: 社会代理的情感与非语言表达同类问题arrow_forward
- 100%
量化犬类:从可穿戴设备推断狗的性格
CHI '23· 人体姿态与行为识别 +1
- 100%
HotFoot:使用热成像的基于脚的用户识别
CHI '23· 人体姿态与行为识别 +1
- 100%
通过语言、姿态和合成IMU的联合表示增强基于惯性传感器的手部人体活动识别
UbiComp '24· 人体姿态与行为识别 +1
- 100%
MLP-HAR:利用纯全连接层提升边缘设备人体活动识别模型的性能与效率
UbiComp '24· 人体姿态与行为识别 +1
- 100%
使用智能手表惯性传感器识别和区分汽车驾驶员与乘客
AutoUI '18· 人体姿态与行为识别 +1
- 67%
从野外的智能手机触摸和传感器数据预测情感状态
CHI '22· 人体姿态与行为识别 +2
- 67%
坐姿识别与反馈:文献综述
CHI '24· 人体姿态与行为识别 +2
- 67%
PiaMuscle: 通过低成本估计和可视化微型手肌肉活动来提高钢琴技能获取
CHI '25· 人体姿态与行为识别 +1
- 67%
VAX: 使用现有基于视频和音频的活动识别模型引导隐私敏感传感器
UbiComp '23· 人体姿态与行为识别 +2
- 67%
PyroSense:使用热释电红外传感进行3D姿势重建
UbiComp '24· 人体姿态与行为识别 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581235
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
人体姿态与行为识别、生物传感器与生理监测
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文