人工扮演尚未实现的系统能力
别名: Wizard of Oz · 人工扮演系统 · WOZ
概念解释
Wizard of Oz 让隐藏的人扮演系统里还没建成的能力:听懂口语、推荐下一条、识别图像、生成回复。参与者面对的是看起来像系统的界面,实际决策由操作者完成。Kelley 用这个名字强调:魔力来自幕布后的人,而不是已经存在的识别或推理引擎。它与可用性测试中主持人“帮忙点一下”不同——扮演是实验条件的一部分,必须按脚本发生,且通常对参与者不可见。
机制
许多交互假设依赖尚未稳定的能力:语音能否在噪音里被理解、推荐是否让人信任、生成文本能否被编辑。等能力真正可运行再测,会把交互问题和模型问题绑死。Wizard of Oz 把能力层替换成一个灵活的人,于是界面、话轮和错误处理可以先被观察。人能即兴填上算法还没有的分支,这既是优点也是污染源:操作者会比模型更懂语境、更会补全。因此扮演必须被约束在“未来系统被允许做的行为集合”里,否则测到的是一位聪明助手,不是目标系统。
怎么研究
经典做法是单向玻璃或远程操作台:参与者只接触前端,操作者按识别/决策规则选择输出。自变量可以是扮演的能力范围、允许的延迟、错误注入率;因变量是任务成功、修复策略、信任与是否发现“对面是人”。Dahlbäck、Jönsson 与 Ahrenberg 强调要预先写操作者规则,否则研究不可复现。会话需记录操作者的每一次干预,分析时把“规则内扮演”和“即兴超范围”分开。事后告知(debrief)是伦理默认项。
边界
若参与者识破并开始对操作者说话,数据不再代表人机交互。高度专业的领域任务可能超出操作者的即时能力,扮演会引入错误或不可接受的停顿。对必须由模型自己产生的错误类型——幻觉、校准不良的置信度——人很难稳定模拟。长期、无人值守的使用也无法用专人扮演。法律或安全场景里隐藏人类决策者可能不可接受,应改为明示的人机协同原型。
怎么落地
- 先写操作者手册:允许输出什么、禁止补全什么、遇到不懂时如何表现失败。
- 把扮演能力做成可见的系统边界(例如“仅支持这三类请求”),避免操作者靠常识无限变聪明。
- 录两路:参与者界面与操作者动作,复盘时标出超范围干预。
- 会后告知有人在扮演,并询问这是否改变了他们对系统的理解。