通过用户视角手机遮挡选择真实世界对象
作者
手部手势识别眼动追踪与注视交互环境感知与上下文计算
文献标题
Selecting Real-World Objects via User-Perspective Phone Occlusion
文献信息
- 主题领域: 人机交互,通过智能手机进行物理目标物体选择
- 关键词: 对象选择, 智能手机交互, 用户视角, ROI区域选择, 空间交互, 相机遮挡, 视觉反馈技术, 目标选择, 人机交互效率
研究背景与问题
-
发现的问题或挑战:
- 传统使用智能手机的方法(例如通过屏幕上显示的相机预览进行目标选择)通常需要多步骤操作,效率低下。
- 一些现有方法直接使用设备(例如手机相机的方向)进行目标选择,但由于缺乏视觉反馈,准确性较差,并可能导致用户不安。
- 对于密集场景中的目标选择,传统的基于光束或用户视角的交互方式可能难以精确定位目标,特别是在重叠或密集的对象场景中。
-
问题重要性: 智能手机作为日常交互的重要工具,使其能够快速准确地选择用户感兴趣的目标对象,对于提高用户体验和交互效率至关重要。解决视觉反馈不足导致的用户不安和使用体验下降的问题也是该研究的重要意义。
-
研究动机与相关工作:
- 现有基于用户视角的交互通常面临“虚像问题”(double-vision problem),用户难以自信地选择正确的目标。
- 设计一种简单直接的用户交互方式,能提高选择目标的实时性和效率。
- 结合虚拟和真实场景的物体选择研究,为未来的物联网交互提供设计意见。
解决方案
-
提出的解决方法: 作者提出了一种创新的目标选择技术,利用智能手机遮挡区域来进行目标选择。这种方式将手机转化为与真实世界交互的物理光标(physical cursor),以用户视角为基础,提供可缩放和可旋转的ROI区域来实现目标选择。
-
创新之处:
- 摆脱了相机画面预览的约束,通过遮挡后的视觉反馈让用户自信选择目标。
- 支持密集场景中的目标选择和目标去歧义,使用类似于“矩形区域光标”的思路。
- 利用手机摄像头的前后结合捕捉用户的眼睛位置和遮挡区域,同时分析用户的行为模型以提高目标预测准确性。
-
实施步骤:
- 遮挡区域估算: 通过前置摄像头使用 MediaPipe Iris算法检测用户虹膜位置,并利用手机固定特性在后置摄像头图像估算遮挡区域。
- 对象检测: 使用YOLOv4深度学习模型检测后置摄像头图像中的可交互对象。
- 目标预测算法: 基于遮挡矩形与目标物体的距离加权Jaccard索引计算目标选择概率,并结合用户行为模型实现精准匹配。
- 技术原型搭建: 在iPhone 12 Pro上实现原型,结合云端进行计算处理并评估性能和准确性。
研究成果
-
具体成果:
- 提出的遮挡区域算法准确性达1.28°±0.96°,如果针对用户校准,平均准确性可进一步提高至0.65°±0.52°。
- 用户研究表明,遮挡选择技术相对于传统方法在效率、准确性和用户接受度方面均表现出显著优势。
- 比较了多个候选方法,遮挡选择具有较低的任务负担(NASA-TLX)和较高的系统可用性(SUS)。
-
优势:
- 适配于一目了然的用户视角交互模式,解决了传统方法因视觉反馈不足而引起的不安感。
- 简化了目标选择步骤,提高了交互的即时性和连贯性。
- 在复杂的密集场景中通过目标去歧义确保选择结果准确。
-
实验与评估结果:
- 两项用户研究分别验证了遮挡区域估算算法的准确性和用户体验,结果表明遮挡选择技术可以显著提高目标选择效率。
- 用户调查中有多人偏好使用遮挡技术,对其简便性和舒适性给予了高度评价。
-
局限性与未来方向:
- 目前仅能检测预定义的对象集,未来需支持动态注册新对象。
- 对于形状复杂的对象,需使用更精确的分割模型来改进算法。
- 针对当前深度估算误差问题,智能手机的短期深度传感器(如LiDAR)可以进一步优化系统。
- 扩展技术应用于其他场景(如AR/VR)以解决虚像问题并提升用户体验。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 通过用户视角的手机遮挡技术如何提升物体选择的效率和准确性?分类: 交互性能与人类运动预测模型同类问题arrow_forward
- 在密集场景中,如何通过遮挡区域技术准确分辨重叠目标?分类: 交互性能与人类运动预测模型同类问题arrow_forward
- 如何利用手机的前后摄像头结合用户行为模型预测目标?分类: 交互性能与人类运动预测模型同类问题arrow_forward
lightbulb
现实痛点
1- 用户在密集物体场景中用手机选择目标时常常误选,效率低下。分类: 交互性能与人类运动预测模型同类问题arrow_forward
- 67%
多点触摸表面用户识别的统一模型。综述与元分析。
CHI '18· 眼动追踪与注视交互 +1
- 67%
用户驱动的设计原则用于手势表示
CHI '18· 手部手势识别 +1
- 67%
利用Talk-and-Gaze语音文本输入中的错误纠正
CHI '20· 手部手势识别 +1
- 67%
手持设备上带有接近传感器的手势估计的机器学习技术评估
CHI '20· 手部手势识别 +1
- 67%
基于交叉的移动目标选择中的终点不确定性建模
CHI '20· 眼动追踪与注视交互 +1
- 67%
日常移动设备交互过程中用户视觉注意力的量化
CHI '20· 眼动追踪与注视交互 +1
- 67%
SpeciFingers: 电容触摸屏上的手指识别与错误纠正
UbiComp '24· 手部手势识别 +1
- 67%
使用基于音频的生态瞬时评估收集自我报告的身体活动和姿势数据
UbiComp '24· 眼动追踪与注视交互 +1
- 67%
RimSense:使用压电传感器在眼镜框上实现基于触摸的交互
UbiComp '24· 手部手势识别 +1
- 67%
用旋转双高斯模型建模触点分布
UIST '21· 手部手势识别 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580696
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
手部手势识别、眼动追踪与注视交互、环境感知与上下文计算
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文