E3.09.1rating scale granularity设计研究

星级的离散粒度决定可表达的区分度

别名: 评分粒度 · star rating · 量表点数

概念解释

评分控件把态度或质量收成有限个离散档。粒度(granularity)就是档的个数:两档(赞/踩)、五星、十分、百分。档数决定用户能表达的区分度,也决定事后能分析的区分度。档太少,不同感受被挤进同一格;档太多,相邻格的差别小于人能稳定复现的差别,分数开始抖。星级不是越细越专业,它是在「表达力」和「可复现」之间选一个台阶。

半星把五档变成十档,看起来仍是五颗星,粒度已经变了。

机制

人做绝对判断时,能稳定切开的类别有限。超过大约七个未经训练的类别,相邻档的主观距离会重叠,同一个人隔天会打出不同的分。过少则相反:三档里的「中」吞掉了微弱的正和微弱的负,产品分不出「还行」和「勉强能用」。星形还带有文化校准——五星常被当成「满分」,四星像轻微不满——粒度会叠上这种锚,而不是一条线性尺子。

展示均值时,粒度会再被压缩:内部用十分、对外显示成五星加一位小数,用户录入的区分度和别人读到的区分度不是同一把尺。若录入是五档、展示却精确到 4.73,读者会以为系统拥有录入者从未给出的精度。

怎么研究

经典做法是改变量表点数,看重测信度、相邻档使用率和极端档是否被弃用。任务可以是对同一批对象打分,间隔数日再打一次。

自变量:档数(2 / 5 / 7 / 10)、是否允许半档、是否展示锚点文字。 因变量:重测一致率、中间档与极端档的占用、完成时间、事后能否用语言说出相邻两档的差别。

不要只看均值方差。方差大可能是真有差异,也可能是档太多在抖。把「说不出两档之差」的被试单列,比整组标准差更接近粒度失败。

边界

专家在自己领域(酒评、临床量表)能用更多档,因为类别经过训练;把同样的十分制交给一次性访客会得到噪声。文化里没有「四星」习惯的用户会把五星当开关(好/不好),粒度名存实亡。必须允许「未评」时,零星和一星不能共用一个空图形,否则未评被算进均分。比较任务(这两个哪个好)比绝对打分更稳,若真实需要的是排序,不要用五星去间接得到序。

怎么落地

  • 先问事后要分几档做决策(上架/改进/淘汰),再用不少于且不多于那几档的控件去采集。
  • 半星只在分析侧真的需要十档时打开;对外仍说五星会误导录入者。
  • 均值展示的小数位不得超过录入粒度所允许的精度。
  • 验证:让同一人隔日对同一对象再评。相邻档来回跳且说不出差别,就减档;大量打进同一中间档且口头上其实有褒贬,就加档或改锚点文字。

延伸

  • 同组E3.09.2 触摸下的星级精度受手指宽度限制 · E3.09.3 评分需可修改与撤销
  • 相邻E3.10 选项数量与控件匹配
  • 站内检索rating scale granularity · number of scale points · star rating

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/E3.09.1