提供跨产品可比的整体分数
别名: SUS 总分 · 跨产品可用性分数 · 0–100 可用性
概念解释
系统可用性量表(System Usability Scale, SUS)用十道对同一系统的总体评价题,按固定规则合成一个 0–100 的分数。它的用途是给出可跨产品比较的整体感知可用性,而不是描述该产品内部哪一步失败。奇数题为正向、偶数题为反向,先把每题贡献折到 0–4 再乘 2.5,得到与百分制同量纲的一个数。团队拿它比较版本、竞品或渠道,前提是工具本身保持同一套题目与计分。
机制
单一总分能比较,是因为题目集合、极性安排和线性变换被冻结,不同产品上的回答被映射到同一条尺子。尺子量的是会话结束后的总体印象,混合了学习、效率、信心和是否还想用,并不对应物理单位。任务难度、品牌和刚刚是否受挫会整体抬升或压低分数,所以“可比”指的是在相近任务与相近样本上的相对位置,不是 72 分在任何情境下都等于同一可用性。反向题降低一味同意的倾向,使总分不那么容易被默许偏差抬平,但并不把尺子变成诊断仪。
怎么研究
在代表性任务结束后立刻施测,记录任务集、产品和样本。比较产品时把任务难度与熟悉度作为共变,或限制在同一任务电池上。报告均值时同时给出分布和样本量,避免把小样本的点估计当成产品排序。分数常对照已发表的百分位表来读相对位置;百分位表来自特定汇编,不能当成自己产品的常模。缺失题按该工具的既定规则处理,不得随意用其他量表的填补方法。
边界
任务从“找一个按钮”换成“完成开户”,分数下降可以完全来自任务,而不是来自界面变差。不同语言译本、不同对象替换(把 system 换成完全不同的服务)会削弱跨研究可比性。专家用户与首次用户不应混成一个产品分。SUS 也不能替代完成率或错误率:高分产品仍可能在关键任务上失败。没有任务、只凭首页印象填写时,分数量的是吸引力,不是使用后的可用性。
怎么落地
- 需要比较两款产品或两个版本时,使用同一套 SUS、同一任务电池和同类样本,再读分数差。
- 把分数和任务完成、错误并列,不把 SUS 单独写成“可用性结论”。
- 对外只报告 0–100 总分与样本、任务说明;若要对标外部百分位,注明汇编来源而不是把百分位当成自己的测量。
- 用一次小样本重测检查:同一产品同一任务下分数应大致稳定;若剧烈抖动,先查任务和样本,再谈产品差异。