L5.03.1trust calibration设计研究
目标是信任与实际可靠度匹配
别名: 信任校准 · 匹配可靠度 · calibrated trust
概念解释
导航把到达时间说成「准到分钟」,人就按分钟来赴约;它实际的误差是正负八分钟,信任和可靠度就错开了。校准的目标是让信任贴着实际可靠度(trust calibration),不是把信任抬得越高越好,也不是把人吓到不敢用。
Lee 与 See 把对自动化的信任说成一种态度,态度要对准能力。对准是目标,不是副产品。
机制
信任是人对「下次还可以交托」的内部估计,可靠度是系统在该任务、该条件下的真实频率。两个量的单位可以都写成概率,来源却不同:一个来自体验、界面承诺和生动事件,一个来自重复试验。界面若用流畅、徽章、只展示成功来喂第一个量,而不把第二个量的范围说清,估计就会漂。
校准不是一种感觉。感觉可以很好——人很放心,或人很谨慎——同时估计仍然偏。目标函数是匹配误差,不是满意度。Muir 强调信任随经验更新;更新若只吃成功,估计会单边走。
怎么研究
先独立测系统在目标任务上的可靠度,再测人对「下一题还会对」的估计,以及实际交托。自变量:界面承诺的精度(准到分钟 / 给误差带)、成功与失败的展示比例。因变量:估计与基率的差、交托是否落在与基率相称的范围。
可靠度必须按用户面前的任务切片,不能用另一套基准冒充。实验室里连续多题会自己校准;产品里一天一次的稀疏使用更容易漂,要单独报。
边界
没有可测对错的创作任务上,「可靠度」这个量不存在,校准目标要改写成与承诺一致(草稿、灵感),而不是命中率。专家在自己领域里会自带基率,界面少说两句不一定破坏匹配。这条只定义目标。过高和过低各是什么失败、要不要靠亮出失败来校准,是后面的步骤。
怎么落地
- 承诺的精度不得超过你们测过的误差。能给误差带就给误差带,不要给假的点估计。
- 在交托发生前出示该任务切片上的近期表现,而不是产品级平均。
- 营销和空状态里的精度措辞与产品内必须同一套数字。
- 验证:问「下一趟你会预留几分钟余量」或「下一题你还交不交」。把答案和你们的真实误差/命中率并排。差得远,校准目标没达成,与人是否喜欢这个界面无关。