L5.03.3expose failures for calibration设计研究

校准需要暴露失败而非隐藏失败

别名: 暴露失败 · 隐藏失败 · show the misses

概念解释

演示卷只放写对的正则、只放翻译漂亮的句子,人会按「它总会这样」去交托。失败被藏在演示之外,估计就没有向下的样本。校准要靠把失败亮出来,而不是藏起来(expose failures for calibration)。藏失败提高的是观感,削的是匹配。

亮出来不是为了吓人,是为了让估计吃到两侧的数据。

机制

人对频率的估计严重依赖看见了什么。成功被完整、漂亮地呈现,失败才出对话框或根本不出——编码进记忆的是成功。稀疏使用时,失败可能很久才轮到用户自己撞上,撞上之前估计已经偏高。Muir 的经验更新需要正负样本;界面若只供正样本,更新公式缺项。

隐藏还有第二种形式:失败被改写成用户的错(「请换一种说法」),系统的失误率在体验里被记成零。估计对准的是一个被编辑过的世界。

怎么研究

同一模型,一组只看成功演示,一组在同等次数里插入典型失败(含看起来流畅的错),再测估计与交托。自变量:失败是否展示、失败被归因于系统还是用户、失败的形态(无输出 / 流畅错误)。因变量:校准误差、交托范围、在随后真实失败上的惊讶。

插入的失败必须是该任务上真会出的那种,不能用无关的崩溃动画冒充。

边界

把所有失败平铺在首次使用上,会把人赶跑,那是过量,不是「必须藏」。高后果功能的失败展示要配可采取的核对策,裸展示而不给下一步会制造无助。这条说的是校准需要失败样本;用典型失败去压低已经偏高的信任、以及信任不能靠文档建立,是另一组操作。一次严重事故如何把信任砸穿,也不是这里的时间尺度。

怎么落地

  • 空状态和入门里至少放一个该任务上的典型失败,与典型成功同一层,不要只放最佳一次。
  • 失败发生时标明是系统这一次没做好,不要默认写成用户不会问。
  • 在设置或「关于表现」里给近期失败计数,而不是只给成功率。
  • 验证:新用户在第一次交托前,能否举出一种这系统会做错的情形。举不出,失败被藏住了;再看他们的交托范围是否明显宽于你们的基率。

延伸

  • 同组L5.03.1 目标是信任与实际可靠度匹配 · L5.03.2 过度信任与不足信任都是失败
  • 相邻L5.09 过度信任与信任崩塌 · L5.04 信任的崩塌 · L1.06 AI 失败的优雅降级
  • 站内检索expose failures · trust calibration · hidden failure

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L5.03.3