X3.08.1Human-interpretable confidence communication设计研究
感知与决策的置信程度需要以人可理解的方式呈现
别名: 置信可视化 · 人可理解置信 · confidence display
概念解释
人可理解的置信表达(human-interpretable confidence communication)把机器人对目标检测、状态估计或行动选择的把握,转换为人能据此继续、核对、接管或停止的表征。它不是直接显示任意模型分数;置信含义必须对应可验证的正确率、适用条件和任务后果。
机制
模型内部可能有概率、距离、熵或集成分歧,这些量的尺度和校准不同。人却需要判断“现在是否值得依赖”。界面通过类别、范围、自然语言或行动建议压缩数值,同时可能丢失校准信息。若视觉强度与真实可靠性单调一致,用户可逐渐学习;若高置信也频繁错误,表达会整体失去意义。
怎么研究
先用独立数据检查置信—正确率校准,再比较数值、区间、类别和行动建议对委派、核对、接管、决策时间及过度/不足依赖的影响。应跨错误后果与用户专业度测试,并报告可靠性图而非只报平均准确率。理解测试需问参与者会采取什么行动。
边界
某些分数只用于模型排序,不能解释为成功概率;分布外样本也可能获得虚高分。高风险决策不能把复杂不确定性压成单一颜色。对没有可用行动的人,精细置信显示可能只增加焦虑,应由系统先采取安全行为。
怎么落地
- 为每个置信来源写明含义、验证数据和可接受误差,未经校准的分数不标百分比。
- 将置信区间映射到具体行为:继续、降速、二次感知、请求确认或停止。
- 用可靠性图和用户委派曲线联合验收,检查高后果错误是否集中在看似高置信的区域。