L1.01.3lucky-hit competence illusion设计研究

用户会把偶发正确误判为稳定能力

别名: 偶发正确 · 能力高估 · one-shot overgeneralization

概念解释

模型第一次就把一段难写的正则写对了,用户就会说「它懂正则」。下一次同类请求失败,被体验成退步或故意捣乱,而不是「上一次抽到了分布里较好处」。偶发正确造成的能力错觉(lucky-hit competence illusion)是把单次采样当成能力点估计。

它不是「输出会变」这件事本身,而是人用一次成功去外推下一次、下一类、下一领域。错觉的原料是成功,不是失败。

机制

人做能力归因时样本极少。Tversky 和 Kahneman 的可得性,加上「一次即学会」的归纳偏好,让醒目的成功压过未观察的失败。生成质量的方差又很大:同一提示的通过率可能是 30%,用户却只看见自己碰上的那一次通过。

界面还在帮这把火。成功被完整、流畅、自信地呈现,失败才出警告。于是编码进记忆的是「它会」,不是「它有时会」。随后的任务选择会跟着这幅画像走:把还没验证过的相邻任务也交出去,直到一次扎眼的失败才把估计拽回来,而且往往拽过了头。

怎么研究

先让人看一次成功(或失败)的演示,再让他们估计同一模型在同分布新题、近邻题、远迁移题上的成功率,并选择是否把下一题交给系统。自变量:首个样本的对错、是否同时出示基率、任务表面相似度。因变量:校准误差、交托范围、在失败后的撤出幅度。

基率必须独立测量,不能用模型卡片上的 benchmark 代替用户面前这道题的通过率。实验室里若连续出五道同类题,错觉会被数据自己纠正;真正危险的是产品里「一天只用一次」的稀疏采样。

边界

用户若能看到多次结果的分布——并排几个方案、或历史里同一提示的若干次尝试——单次成功的权重会被摊薄。专家在自己的领域里更容易认出「碰巧对了」,新手和外域求助者最容易把流畅当成掌握。低方差任务(抽取数据库里的确定字段)上,一次正确确实近于能力证据,这条会变弱。它也不处理「系统平时很准、偶尔一次大错」那种校准问题,那是另一类不对称。

怎么落地

  • 在第一次成功附近给出基率或范围,而不是只庆祝结果:「这类题大约三回里有一回能直接用,请核对其余部分。」
  • 提供「再试一次」且保留上次,让人看见成功不是唯一可能的点。
  • 不要在营销或空状态里只陈列最佳一次输出。把典型失败和典型成功放在同一层。
  • 验证:给新用户一次漂亮的成功,立刻问「下一道同类题它大概会怎样」。若答案接近「肯定行」而你们的通过率远低于那,错觉已经形成。再看他们是否把相邻但未演示过的任务也交出去。

延伸

  • 同组L1.01.1 同一输入可能得到不同输出 · L1.01.2 界面惯例默认操作可重复且结果稳定 · L1.01.4 界面控件默认承诺同一操作得到同一结果,生成式功能违背这一承诺 · L1.01.5 用户无法通过重试区分是自己表述不当还是系统本身在波动 · L1.01.6 撤销与重做在输出不可复现时语义失效,撤销后回不到原来那次结果 · L1.01.7 把重新生成呈现为「刷新」会暗示上一个结果只是加载失败 · L1.01.8 把可变性显式呈现为多个并列方案,比藏在单一结果背后更诚实
  • 相邻L5.03 信任校准 · L5.09 过度信任与信任崩塌 · L3.03 幻觉与事实核查负担
  • 站内检索lucky-hit competence illusion · overgeneralization from success · base-rate neglect

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/L1.01.3