B3.20.3Inter-rater Decidability设计

一条合格的条目需能被两名评估者独立判定为同一结论

别名: 可判定条目 · 评估一致性 · 检查标准 · 风格偏好

概念解释

合格检查条目必须有足够明确的对象、条件、证据和结论规则,使两名有资格的评估者在互不见对方判断时得出相同"通过/不通过/需证据"。可判定性(inter-rater decidability)区分真正启发式与个人风格偏好。这一条衔接前两条:前两条解决了"要不要额外条目"和"条目该从哪里归纳",这一条解决归纳出来的条目本身合不合格——一条从真实事故里提炼出来的条目,如果写法上留下了太多解释空间,照样会在实际使用中失效。

机制

模糊条目之所以不可靠,根源在于它把判断的关键部分留给了评估者自己的经验去填补——"界面应专业"这句话没有指定检查对象是什么、判断的依据是什么,两名评估者各自用自己过去积累的审美和经验去补全这个空白,补出来的结果自然不同,这不是评估者能力有差异,而是条目本身没有把判断规则写清楚。可判定条目做的事情是把这个隐藏的补全过程显式化:明确规定检查对象是哪个字段、哪个流程节点、哪个状态;规定触发条件是"两者同时显示"还是"其中一项不可用却未提示";规定要看什么证据——截图、日志还是完整的任务路径录屏;规定判定之后走哪个分支——直接判定阻断、给出警告、还是只记录留待复审。缺了这几层规定中的任何一层,两名评估者面对同一个界面时,其实是在依据两套不同的、彼此都合理的隐藏假设做判断,结论出现分歧毫不意外。

边界

一致性不能靠把条目写得极端狭窄来买到——一条只匹配某个具体像素位置、具体文案的条目确实能让两名评估者达成一致,但代价是它连同一问题的稍微变体都识别不出来,很快就会随界面小改版失效,这种"用范围换一致性"的做法不划算。还有一类发现天然带有探索性质,比如"这个流程好像哪里让人不舒服,但说不清具体是什么"——这类信号有价值,但不该被硬塞进一条可判定的验收条目里假装精确,更适合的做法是把它保留为访谈或深访环节要追问的线索,而不是验收清单的一部分。另外,两名评估者判定一致,只能说明这条条目本身写得清楚,不代表它检查出来的问题真的重要——条目的可判定性和问题的严重程度是两件独立的事,可判定的条目命中之后,仍然需要用严重度评级去决定它排在修复队列的什么位置。

怎么落地

  • 每条条目的模板固定包含七项:目的、检查对象、触发条件、判定规则、所需证据、已知例外和适用角色,缺一项就补一项,不允许留白让评估者自行发挥。
  • 用一小组包含明确阳性、明确阴性和边界模糊样例的测试集来培训新评估者,确认他们在边界样例上给出的判断和有经验的评估者一致,而不是只在容易的样例上打勾。
  • 每次正式评估前,先让两名评估者互不通气独立打出判定,再对比分歧,分歧点直接反馈到条目的措辞修订或证据要求补充上。
  • 验证办法:记录每条条目在多轮评估中的一致性结果并按版本追踪;连续出现分歧的条目不要继续沿用同一套措辞硬撑,应该拆分成更细的几条、合并进已有条目,或者干脆降级为提示性线索而不再作为验收标准。

延伸

  • 同组B3.20.1 通用启发式覆盖不到领域特有的失效模式,需要额外条目 · B3.20.2 领域启发式应从该领域真实问题库归纳,而非把通用条目改写措辞 · B3.20.4 领域启发式需用已知问题集回测其检出率,未回测的条目不应发布
  • 相邻Q4 研究方法与评估 · B3.12 严重度评级
  • 站内检索inter-rater agreement · checklist item · decision rule · operational definition

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/B3.20.3