D5.02.1Speech and pointing设计研究
语音提供动作,指点提供对象
别名: deictic reference · speech plus gesture · multimodal reference
概念解释
语音负责说明要做什么,指点负责指明对哪个对象做。这两种信息天然互补:「删除这个」中的「删除」来自语言,而「这个」必须由指点补齐。把它们分开使用会让每一方都不完整,把它们对齐使用则得到无需显式命名的表达。
机制
分工之所以稳定,是因为两种信息的形式不同。动作是抽象谓词,适合用语言表达,可以用有限的词组合出大量含义;对象是具体的空间位置,用指点表达比用语言描述更精确、更省力。整合的前提是两者的对象指代能够对齐,即用户指点时系统知道所指的是哪个对象,并且能把它与同时说出的动作绑定。这也决定了失败模式:一旦指代不清或时间错位,系统要么选错对象,要么选取默认对象。
怎么研究
可测量指代解析的正确率:让用户以语音加点指的方式给出指令,记录系统选择的对象与动作是否正确,并分析错误来自对象解析还是动作解析。变量包括指点的精度与稳定性、语音的表述方式、候选对象的密度与用户是否看到自己的指点反馈。因变量包括解析正确率与错误类型分布。
边界
当可选对象很少且可由语言唯一描述时(例如「打开设置」),指点并非必需,语言本身已足够。当对象密集或空间关系复杂时,指点的精度要求上升,系统需要提供可见的指点反馈以使用户能够校正。若用户无法使用其中一种模态,另一模态必须能够独立完成任务,否则交互不完整。
怎么落地
- 让语音承担动作表述,让指点承担对象指定,避免要求用户用语言描述空间位置。
- 提供可见的指点反馈,使用户能确认系统当前锁定的对象。
- 在候选对象密集时提高指点精度要求或提供候选列表供确认。
- 验证方式:测量指代解析正确率并按错误来源分类;若错误集中在对象解析,优先改进指点精度与反馈。