C4.05.2Unidimensional gesture usability scores设计研究

三者不可用单一「好用」评分合并

别名: 好用分数 · composite usability · 单一量表 · Likert collapse

概念解释

把易学、识别、舒适塞进一道“整体好用吗”的李克特题,得到的是一维分数,不是三维证据的摘要。分数高可能是因为好猜,尽管现场经常认错;也可能是因为演示里次次成功,尽管肩膀已经发酸。一维分数还会在版本之间假装可比较:改了模型,分数涨了,人们以为手势更好用了,其实只是实验室识别率变了,教学和姿势原样。需要做决策时,一维分数无法指出该动哪一根杠杆。

机制

人在打总分时会抓住当前最显著的体验。刚被教会,显著的是“我学会了”;刚看识别失败,显著的是“它不听我的”;刚放下酸胳膊,显著的是累。问卷顺序、演示是否成功、任务是否短,都会把权重偷偷滑向其中一维。算术上把三道分量表加总或取均值,等于假设它们可代偿:识别差一分,可以用更易学一分来补。物理上代偿不成立——认错不会因为好猜而变少,酸痛不会因为模型准确而消失。合成分数还对缺失值过敏:没测过疲劳的条目,用识别率填进总分,会系统性偏高。

怎么研究

若一定要用问卷,至少保留三道独立题,报告它们的相关,而不是只报总和。经验上三者相关往往中等偏低,这正是不能合并的证据。用任务日志里的客观量(首次成功率、混淆、垂臂)去预测那道总分,看总分被哪类客观量绑架。版本对比必须并列三列,不允许用总分的 t 检验代替。SUS 一类通用量表可以当产品级的粗温度计,但不能用来在手势词表内部排序条目。

边界

极小词表、单一场景、同一批熟练用户,三道题可能高度相关,合成看起来无害;词表一扩、换环境,相关就散。管理层要一张仪表盘时,合成压力会回来,这时应展示三根独立柱,而不是折成一颗星。无障碍评估更不能合成:一条手势对部分人不可执行,平均分仍可能过线。把“好用”当作形成性指标(每周看趋势)比当作发布门槛危害小,但趋势仍要能分解到三维。

怎么落地

  • 评审材料里取消“手势好用度”总分;改成三列并列,用红黄绿独立上色。
  • 若组织要求一个数,就同时附上三列原始值和“本周短板是哪一列”,禁止只传那个数。
  • 版本发布说明写清动了教学、模型还是姿势,各自对应哪一列的变化,避免用总分叙事。

延伸

  • 同组C4.05.1 易学性、识别可靠性、身体舒适度是三类独立证据 · C4.05.3 易学不等于可靠:语义直观的动作仍可能被误判 · C4.05.4 省力不等于舒适:动作幅度小仍可能姿势负担重
  • 相邻C4.14 手势词汇表的规模上限 · C1.15 指点设备指标与吞吐量
  • 站内检索composite usability · unidimensional score · gesture evaluation

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C4.05.2