星级的离散粒度决定可表达的区分度
别名: 评分粒度 · star rating · 量表点数
概念解释
评分控件把态度或质量收成有限个离散档。粒度(granularity)就是档的个数:两档(赞/踩)、五星、十分、百分。档数决定用户能表达的区分度,也决定事后能分析的区分度。档太少,不同感受被挤进同一格;档太多,相邻格的差别小于人能稳定复现的差别,分数开始抖。星级不是越细越专业,它是在「表达力」和「可复现」之间选一个台阶。
半星把五档变成十档,看起来仍是五颗星,粒度已经变了。
机制
人做绝对判断时,能稳定切开的类别有限。超过大约七个未经训练的类别,相邻档的主观距离会重叠,同一个人隔天会打出不同的分。过少则相反:三档里的「中」吞掉了微弱的正和微弱的负,产品分不出「还行」和「勉强能用」。星形还带有文化校准——五星常被当成「满分」,四星像轻微不满——粒度会叠上这种锚,而不是一条线性尺子。
展示均值时,粒度会再被压缩:内部用十分、对外显示成五星加一位小数,用户录入的区分度和别人读到的区分度不是同一把尺。若录入是五档、展示却精确到 4.73,读者会以为系统拥有录入者从未给出的精度。
怎么研究
经典做法是改变量表点数,看重测信度、相邻档使用率和极端档是否被弃用。任务可以是对同一批对象打分,间隔数日再打一次。
自变量:档数(2 / 5 / 7 / 10)、是否允许半档、是否展示锚点文字。 因变量:重测一致率、中间档与极端档的占用、完成时间、事后能否用语言说出相邻两档的差别。
不要只看均值方差。方差大可能是真有差异,也可能是档太多在抖。把「说不出两档之差」的被试单列,比整组标准差更接近粒度失败。
边界
专家在自己领域(酒评、临床量表)能用更多档,因为类别经过训练;把同样的十分制交给一次性访客会得到噪声。文化里没有「四星」习惯的用户会把五星当开关(好/不好),粒度名存实亡。必须允许「未评」时,零星和一星不能共用一个空图形,否则未评被算进均分。比较任务(这两个哪个好)比绝对打分更稳,若真实需要的是排序,不要用五星去间接得到序。
怎么落地
- 先问事后要分几档做决策(上架/改进/淘汰),再用不少于且不多于那几档的控件去采集。
- 半星只在分析侧真的需要十档时打开;对外仍说五星会误导录入者。
- 均值展示的小数位不得超过录入粒度所允许的精度。
- 验证:让同一人隔日对同一对象再评。相邻档来回跳且说不出差别,就减档;大量打进同一中间档且口头上其实有褒贬,就加档或改锚点文字。