三者不可用单一「好用」评分合并
别名: 好用分数 · composite usability · 单一量表 · Likert collapse
概念解释
把易学、识别、舒适塞进一道“整体好用吗”的李克特题,得到的是一维分数,不是三维证据的摘要。分数高可能是因为好猜,尽管现场经常认错;也可能是因为演示里次次成功,尽管肩膀已经发酸。一维分数还会在版本之间假装可比较:改了模型,分数涨了,人们以为手势更好用了,其实只是实验室识别率变了,教学和姿势原样。需要做决策时,一维分数无法指出该动哪一根杠杆。
机制
人在打总分时会抓住当前最显著的体验。刚被教会,显著的是“我学会了”;刚看识别失败,显著的是“它不听我的”;刚放下酸胳膊,显著的是累。问卷顺序、演示是否成功、任务是否短,都会把权重偷偷滑向其中一维。算术上把三道分量表加总或取均值,等于假设它们可代偿:识别差一分,可以用更易学一分来补。物理上代偿不成立——认错不会因为好猜而变少,酸痛不会因为模型准确而消失。合成分数还对缺失值过敏:没测过疲劳的条目,用识别率填进总分,会系统性偏高。
怎么研究
若一定要用问卷,至少保留三道独立题,报告它们的相关,而不是只报总和。经验上三者相关往往中等偏低,这正是不能合并的证据。用任务日志里的客观量(首次成功率、混淆、垂臂)去预测那道总分,看总分被哪类客观量绑架。版本对比必须并列三列,不允许用总分的 t 检验代替。SUS 一类通用量表可以当产品级的粗温度计,但不能用来在手势词表内部排序条目。
边界
极小词表、单一场景、同一批熟练用户,三道题可能高度相关,合成看起来无害;词表一扩、换环境,相关就散。管理层要一张仪表盘时,合成压力会回来,这时应展示三根独立柱,而不是折成一颗星。无障碍评估更不能合成:一条手势对部分人不可执行,平均分仍可能过线。把“好用”当作形成性指标(每周看趋势)比当作发布门槛危害小,但趋势仍要能分解到三维。
怎么落地
- 评审材料里取消“手势好用度”总分;改成三列并列,用红黄绿独立上色。
- 若组织要求一个数,就同时附上三列原始值和“本周短板是哪一列”,禁止只传那个数。
- 版本发布说明写清动了教学、模型还是姿势,各自对应哪一列的变化,避免用总分叙事。