不同文化对评分尺度的使用习惯不同,跨国对比需谨慎
别名: 作答风格 · 极端作答 · 跨国评分不可比
概念解释
同一把 0–10 或李克特尺子,在不同文化里会被用成不同的社会动作。有人把顶端留给“近乎完美”,有人觉得给不到 9 就是在投诉,有人习惯停在中段以免失礼。这种系统性的用尺方式叫作答风格(response style),包括极端作答、中点偏好和默许。推荐值、满意度这类分数把数字当成可跨国加减的态度强度,于是国家之间的分差常常混进了“数字在当地表示什么”,而不只是产品好坏。它不是翻译对不对的问题,也不是把 0–10 切成推荐者/贬损者会丢掉档内信息的问题:即便题目语义对齐、也不做三分,跨国点值仍然可能不可比。
机制
评分是公开的表态。谦逊规范会压住顶端;表达热情被鼓励的环境会把质量一般的体验也推到高档。默许会把“同意”侧抬高,中点偏好会把不满收进看起来温和的数字。推荐题还叠加另一层:向熟人推荐在有的文化里是郑重承诺,在有的文化里只是随口夸奖,同一构念的社会成本不同。推荐值把高档占比减去低档占比之后,回避顶端的国家会系统性偏低,即使潜在态度相同。均值同样继承这种占用方式。没有把“尺怎么用”从“态度是什么”里分开,国家排行测到的是作答习俗加产品,而不是产品本身。
怎么研究
跨国主张至少要看原始分布,而不是只看合成分数:顶端占用率、中点占用率、方差和各档人数。认知访谈问的是“7 和 9 在这里差在哪”“什么情况下你会给满分”,而不是只核对译文。有足够样本时,检验测量不变性或题目功能差异;不通过的题目或量尺不能合并成国际总分。锚定小故事(同一段标准化情景,请各国打分)可以估计尺度偏移,再用来校正产品题。更稳的设计是比各国自己的时间变化,而不是比同一时点的水平。若必须做水平比较,预先声明比较的是分布形状还是校准后的位置,并报告未校准的原始占用。
边界
作答风格解释不掉真实的产品、价格、服务覆盖和品牌差异;把一切分差都说成文化,是另一种偷懒。一国之内的语言社区、年龄和渠道同样会形成局部用尺习惯,按护照切“文化”会切错。行为上的真实推荐、续订或投诉与陈述分数脱钩时,应把行为当作另一指标,而不是用它去“证明”分数的跨国含义。样本量在每个国家都很小的时候,分布差异本身就不稳,谈不上校准。
怎么落地
- 禁止用未校准的推荐值给国家或区域做排名和奖金。
- 仪表盘默认展示各国原始分档,而不是一张国际排行。
- 全球目标写成“各国相对自身基线的变化”,不要写成同一个绝对分数。
- 验证:把各国分数按该国内部标准化后再排序;若名次大面积翻转,原排名不得当作产品差距。