D5.07.1Temporal integration window设计研究

多模态输入需要落在同一时间窗口内才被视为同一意图

别名: multimodal fusion window · input binding · temporal contiguity

概念解释

多模态输入只有在时间上足够接近时,才容易被系统解释为同一个意图,这一约束常称作多模态融合的时间窗口。例如“把那个”加手指指向,或语音指令加确认按钮,都会形成一个时间结构。窗口不是两段信号恰好在毫秒级同时到达,而是允许人在正常节奏中先后表达一个意图。

机制

时间邻近性是融合器判断信号是否属于同一事件的强线索。语音、手势、注视、触控和按键各有自己的开始、峰值与结束时刻;若只看到达队列的时间,系统会把这些不同步的证据当作互不相干。有效窗口必须覆盖从意图开始到辅助信号完成的自然跨度,同时避免把前一个任务遗留进当前事件。因此窗口真正对齐的不只是“到达时间”,还包括识别延迟、持续输入和用户表达节奏。

怎么研究

可用受控延迟范式测量融合边界:让语音与指向、指点与按钮、注视与手势在同一任务中出现,系统化改变两个信号起点或完成点的间隔,记录融合为同一意图、分成两个意图和无法解释三种结局。变量包括先后顺序、信号持续时间、识别延迟和任务上下文;因变量包括绑定正确率、命令完成时间、重复输入和错误对象选择。现场日志可作为补充,但需要区分用户刻意连续表达与设备延迟造成的时间差。

边界

同一窗口值不能横跨所有模态组合。语音语句可能持续数秒,短触觉点击只几十毫秒;注视作为前期线索与确认输入的关系,也不同于两个连续按键。用户若有运动控制差异、语言迟疑或辅助设备延迟,自然跨度会进一步变化。窗口也不能替代语义检查:两个信号即使接近,指向的对象与语音内容不一致时仍应触发澄清而不是强行合并。

怎么落地

  • 为每类意图记录各模态的开始、完成与识别返回时间,并让融合器使用这些状态而不是只看消息到达时间。
  • 给语音、指向、注视、触控等组合分别设定起点偏移、最大跨度和清空条件,默认值只在任务相同且延迟相近时复用。
  • 在窗口过期、证据冲突或部分信号丢失时给出可见状态,避免用户不知道系统等待的是哪一路输入。
  • 验证方式:录制真实输入流,测量“同一意图被分成两次”和“两个意图被合并”的比例,并在延迟模拟下复核边界。

延伸

  • 同组D5.07.2 窗口过窄会让正常的先后表达被误判为独立指令 · D5.07.4 窗口长度需要依据具体模态组合调整而非统一固定值
  • 相邻D5.02.2 融合需要时间窗口内的对齐 · D4.07.2 输出延迟会破坏事件之间的因果感
  • 站内检索multimodal fusion window · temporal contiguity · input binding

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/D5.07.1