Q5.04.3Wizard of Oz human advantage设计研究

人的响应速度与一致性优于真实系统,需校正

别名: WOZ 人类优势 · 扮演快于系统 · wizard speed bias

概念解释

操作者听懂含混请求、在几百毫秒内给出合适回复、并且几乎不重复同样的愚蠢错误——这些都优于大多数真实系统。Wizard of Oz 的人类优势(human advantage)因此会让交互看起来比上线后更顺、更聪明、更稳定。若不校正延迟、错误率和前后一致性,扮演测到的是一位机敏同事,不是目标模型。校正不是为了为难参与者,而是为了让失败模式出现在它们将来会出的位置。

机制

人在语境、指代和常识上远强于专用模型,于是会补全省略、原谅口误、主动消歧。人的响应也可以被社交压力加速:操作者怕冷场,会比服务器更快开口。一致性方面,人会记住十分钟前的细节并保持人设,而真实系统常在会话中途丢状态。结果是:需要确认、重复和修复的行为被优势吃掉,设计便不再为这些行为留位置。上线后模型一暴露真实错误分布,话轮结构会崩。优势是系统性偏差,不是某一次操作者发挥得好。

怎么研究

把操作者表现当成必须测量和操纵的变量。记录识别到输出的延迟分布、错误类型、同一请求的重复一致性。实验上常用节流器:强制最小延迟、按预定表注入识别错误、禁止操作者使用未写入状态的记忆。比较“不限操作者”与“按生产指标约束操作者”两种条件,看修复话轮、放弃和信任如何变化。训练操作者时以规则符合率为考核,而不是以任务成功率为考核,否则人会为了帮参与者成功而变得更聪明。

边界

早期只想看“这种交互是否根本不可理解”时,可以暂时不校正,把人类优势当作能力上限。一旦问题变成“在预期错误率下是否仍可用”,不校正就会得出假阳性。多操作者轮班会引入一致性问题,比单人更接近不稳定系统,但也会引入人格差异。生成式系统的错误是开放集,用固定错误表只能近似。对已经很慢的人工服务流程,人类优势可能不明显,偏差主要来自过度合作而非速度。

怎么落地

  • 从目标系统取延迟和错误预算,写成操作者不可违反的上限和下限。
  • 提供失败卡片(未听清、超出范围、状态丢失),要求操作者按卡片表现,而不是靠临场聪明救场。
  • 复盘时把“比规则更快或更准”的回合标成无效能力证据。
  • 向工程同步的不是“扮演时很顺”,而是在约束条件下仍成立的那些交互结构。

延伸

  • 同组Q5.04.1 人工扮演尚未实现的系统能力 · Q5.04.2 可在开发前验证交互假设
  • 相邻Q5.03 可交互原型 · Q5.07 原型的误导
  • 站内检索Wizard of Oz human advantage · wizard speed bias · error injection

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/Q5.04.3