D5.02.1Speech and pointing设计研究

语音提供动作,指点提供对象

别名: deictic reference · speech plus gesture · multimodal reference

概念解释

语音负责说明要做什么,指点负责指明对哪个对象做。这两种信息天然互补:「删除这个」中的「删除」来自语言,而「这个」必须由指点补齐。把它们分开使用会让每一方都不完整,把它们对齐使用则得到无需显式命名的表达。

机制

分工之所以稳定,是因为两种信息的形式不同。动作是抽象谓词,适合用语言表达,可以用有限的词组合出大量含义;对象是具体的空间位置,用指点表达比用语言描述更精确、更省力。整合的前提是两者的对象指代能够对齐,即用户指点时系统知道所指的是哪个对象,并且能把它与同时说出的动作绑定。这也决定了失败模式:一旦指代不清或时间错位,系统要么选错对象,要么选取默认对象。

怎么研究

可测量指代解析的正确率:让用户以语音加点指的方式给出指令,记录系统选择的对象与动作是否正确,并分析错误来自对象解析还是动作解析。变量包括指点的精度与稳定性、语音的表述方式、候选对象的密度与用户是否看到自己的指点反馈。因变量包括解析正确率与错误类型分布。

边界

当可选对象很少且可由语言唯一描述时(例如「打开设置」),指点并非必需,语言本身已足够。当对象密集或空间关系复杂时,指点的精度要求上升,系统需要提供可见的指点反馈以使用户能够校正。若用户无法使用其中一种模态,另一模态必须能够独立完成任务,否则交互不完整。

怎么落地

  • 让语音承担动作表述,让指点承担对象指定,避免要求用户用语言描述空间位置。
  • 提供可见的指点反馈,使用户能确认系统当前锁定的对象。
  • 在候选对象密集时提高指点精度要求或提供候选列表供确认。
  • 验证方式:测量指代解析正确率并按错误来源分类;若错误集中在对象解析,优先改进指点精度与反馈。

延伸

  • 同组D5.02.2 融合需要时间窗口内的对齐 · D5.02.3 融合失败时需退回单模态而非猜测
  • 相邻D5.01.2 互补分担不同类型的信息 · C5.03 手势与语音的指代消解
  • 站内检索deictic reference · speech and pointing · multimodal reference

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/D5.02.1