D5.08.1Modality fallback设计研究

融合失败时系统应退回单一模态的字面解释

别名: fusion failure · single-modality interpretation · graceful degradation

概念解释

当多模态融合无法成立时,系统应退回某个可用模态的字面解释,而不是编造一个合并意图。字面解释是按该通道自身语义处理:完整语音命令可以执行;“删除这个”缺少指向对象时不能猜对象;只有环境噪声时不应生成命令。回退的产出可能是动作、明确的待补全状态或失败提示。

机制

融合依赖信号在时间、对象和动作上互相支持。若一路识别失败、置信度过低或证据冲突,合并结果会把不确定性放大成具体命令。退回单一模态把错误限制在已知证据范围内:可独立执行的输入继续执行,不完整的指代表达只保留其已确定部分并请求补全。规则需要预先定义优先源、最低置信度和“部分可执行”条件,否则系统会在错误处随机选择沉默、报错或猜测。

怎么研究

可构造三类失败:辅助信号缺失、识别置信度低、两路语义冲突。比较字面回退、猜测合并和全部拒绝在任务完成率、错误操作率、恢复步骤和信任评分上的差异。变量包括可执行通道、缺失的是对象还是动作、冲突程度和后果等级;因变量应包括用户能否说出系统采用了哪个解释。日志可按失败类型统计后续纠正命令,判断回退规则是否真的减少恢复成本。

边界

“字面”不等于把残缺输入硬执行。语音中的代词没有对象、手势没有动作、识别片段无法构成命令时,字面结论就是不可执行。也不能在所有失败中都退回同一模态:驾驶时听觉完整而视觉受限,或屏幕不可用时触觉可用,主源应随场景变化。若失败原因只是短暂延迟且窗口尚未结束,系统应等待而不是立刻回退。

怎么落地

  • 为每个多模态意图定义融合失败条件、备用通道和部分输入的处理方式。
  • 把对象绑定、动作完整性和置信度下限写成显式规则,不把不确定合并交给隐式默认值。
  • 高后果命令在回退后仍要求确认,缺失参数时进入澄清流程而不是执行近似动作。
  • 验证方式:模拟识别缺失、低置信和冲突输入,统计错误执行、澄清次数和用户对系统解释的理解率。

延伸

  • 同组D5.08.2 静默猜测比明确退回更容易造成难以察觉的误操作 · D5.08.3 回退后应提示用户当前采用的是哪一种解释
  • 相邻D5.02.3 模态组合需要有明确的融合失败处理 · D4.07.4 仲裁应让用户察觉发生了冲突
  • 站内检索modality fallback · graceful degradation · fusion failure

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/D5.08.1