B3.12.3Severity Rating设计研究

多评估者独立评级后再合并

别名: 评估者间一致性 · 独立评级 · 严重度校准

概念解释

严重度应先由多名评估者在看到彼此分数前独立评级,再汇总差异、讨论证据并形成最终等级。独立评级(independent rating)降低个人经验、职位和说服顺序对优先级的影响,也让分歧成为可检查的信息。

机制

评级依赖对频率、影响、持续性和业务约束的解释。单一评估者容易受最戏剧性片段、最近事件或自己熟悉角色影响;多人来源能覆盖不同用户、平台和专业路径。先讨论会锚定分数,后讨论能暴露证据缺口。合并时不是简单平均,而要记录分数分布、理由和最终假设。

怎么研究

给评估者相同的问题描述、视频/日志、任务上下文和等级锚点,要求独立打分并写下关键假设。计算评分分布或一致性,组织分歧复盘,再让团队修订问题描述或权重。可用校准题定期检查不同评估者是否对同类问题给相近等级。

边界

人数不足或背景相似时,多评级并不能保证代表性;应补充数据或邀请实际角色。问题描述模糊会制造假分歧,因此先区分“问题不同”和“解释不同”。紧急安全缺陷不需要等待完整共识流程,可先处理再补记录。

怎么落地

  • 至少两名具备不同背景的评估者独立评级;记录各自分数、理由和不确定度。
  • 分歧超过一级时回看证据,明确频率、影响、恢复和适用人群。
  • 保存最终等级、合并理由和被否决的假设,供后续复审。
  • 建立校准问题库,新评估者先评级样例再参与正式排序。

延伸

  • 同组B3.12.1 严重度由频率、影响与持续性三因素合成 · B3.12.2 评级用于排序而非绝对判断
  • 相邻Q2 可用性评估 · Q4 研究方法与评估
  • 站内检索inter-rater reliability · severity calibration · heuristic evaluation

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/B3.12.3