F2.16.4real length distributions outrun mock copy设计
真实数据的长度分布往往比设计稿中的占位文本更极端
别名: 长度分布 · p99 文本 · 占位偏差
概念解释
设计稿用两行地址,生产库里有六行乡村地址外加四十个字的楼名。图例在稿上三条,生产十二条。空值比率被稿子写成零,接口失败时整列都空。真实长度常常是长尾:多数短、少数极长,再加上拼接(面包屑前缀、翻译膨胀、用户粘贴)。占位文本不是抽样,它是作者觉得顺眼的长度。布局按占位长出来,会系统性地低估尾巴。
用极端夹具去测,是方法;承认生产分布比稿子更极端,是这条经验。两者一起才不会只用「很长的英文名」假装覆盖了德语和空值。
机制
稿子从「正常」生成,生产从过程生成:法律姓名、机器 ID、用户rant、本地化(芬兰语、德语往往更长)、字段拼接、API 空。长度接近幂律:p50 看起来无害,p99 和 max 才打布局。输入若没有上限,max 会随时间涨。翻译不是均匀拉长,有的字符串翻三倍,有的几乎不长,按「全部 1.3 倍」做的布局会在那几个三倍上爆。
占位还系统性避开空值和单字符,于是塌高度的失败从来没在稿上出现过。
边界
全新产品没有生产库,只好用邻近产品或公开语料估分布,并在上线后重测。严格枚举的字段(货币代码)分布很窄,这条几乎不咬。一旦字段允许自由文本或拼接,长尾就会出现。演示环境若用「好看的种子数据」喂给评审,会把偏差再藏一截——评审看到的仍不是生产。
怎么落地
- 对每个槽从生产或预发抽样:空值率、p50、p90、p99、max。和稿子里那条占位比。p99 明显更长或空值率不是零,稿子按错了分布。
- 把 p99 和 max、以及若干空值做成夹具,替换组件预览里的「好看名字」。
- 验证:用 p99 和 max 灌进布局,看政策是否仍成立(折、截、滚)。再用空值灌,看高度和对齐是否塌。若只在占位文本上漂亮、在 p99 上撑破,就不是测没测到极端,是分布估计错了。改布局或改输入上限,并在下一个迭代重新抽样,因为 max 会动。