先凝视后发声:通过无显示器智能眼镜的凝视和语音交互实现物理对象引用
最佳论文作者
眼动追踪与注视交互语音用户界面(VUI)设计环境感知与上下文计算软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
智能眼镜通过使用头戴式摄像头观察用户的视角来增强与环境互动,但缺乏用于常见互动的视觉反馈。我们引入了「先凝视后发声」这一多模态方法,允许用户使用无显示器智能眼镜通过凝视线和语音进行对象选择。用户可以用视线选择一个物理对象,系统会生成该对象的数字掩码和语音语义描述。用户还可以通过自由形式对话进一步纠正错误。为展示我们的方法,我们通过将先进的对象分割和检测与视觉语言模型集成,开发了一个交互式系统。用户研究表明,参与者在53%的任务试验中实现了正确的凝视线选择,并使用语音消歧纠正了58%的剩余错误。参与者还将该系统评分为可爱、有用且易于使用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
9 位作者
sell
研究子方向
眼动追踪与注视交互、语音用户界面(VUI)设计、环境感知与上下文计算
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
3 篇相关论文