可读性指标只是粗略参考
别名: Flesch · 可读性公式 · 年级分数 · SMOG
概念解释
Flesch–Kincaid、SMOG 这类可读性公式(readability formula)用句长和词长(或音节)估一个年级。它们是筛子,不是及格线。分数说「小学」、外行仍然读不懂,是公式没看见的东西在起作用:术语有没有着落、指代清不清、读者带不带领域知识。中文没有可直接搬用的音节规则,套英文公式更粗。
机制
公式的假设是「长句 + 长词 = 难」。在英语教材语料上,这个相关够拿来排序。界面文本会被它误导:从中间切断长句,年级立刻下降,命题结构可以纹丝不动。它看不见否定叠放、表格、图标、需要点开才出现的定义。中文的「难」更常落在文言残留、缩写和未解释的专名上,这些在英文音节计数里没有对应物。
符合性里用「初中水平」当最高级阅读要求,本身也是一条粗阈值:它承认有一条线,不承认这条线等于理解。把公式当发布门禁,团队会为刷分而切句,监测看起来在下降,读者的失败点原地不动。
怎么研究
同一文本三路对照:公式分数、cloze、目标读者理解测验。报告相关有多弱,以及「为刷分而切句」前后真实理解有没有动。
自变量:公式种类、是否为刷分改过句界、语言(英/中)。 因变量:年级分数、cloze 填对率、任务理解题;重点看分数与理解的不一致。
大规模抓极端页(整站最难的 5%)公式有用。单页是否可发布,以目标读者复述为准。不要在这里改写成另一套句法手册——那是写法问题,这里只判指标本身。
边界
受控词表的技术领域,术语音节长,公式会虚高难度,专家读起来并不难。极短的界面字符串样本太小,年级分数不稳定,几乎无意义。文学、幽默、反讽不在公式的适用语料里。自动化只报分数、不报「这个分数和哪次理解测验相关」,会把筛子说成尺子。
怎么落地
- 公式可作整站监测:红线表示「去看一眼」,不表示改完分就过。
- 发布前用目标读者复述关键命题;分数下降但复述仍失败,说明改的是指标不是难度。
- 验证:找一篇公式显示很容易、术语却未解释的稿,给该领域外的人读。读不懂,就证明分数不够当判据。