U2.17.5Suitability drift with data growth设计
数据量级变化后原本合适的图形可能失效,需重新复核
别名: 量级失效 · 重新复核
概念解释
图形的合适与否不是一次性判决:它是对当时的数据形态(行数、类别数、值域、密度、分布)的裁决。业务数据持续增长与漂移——类别从 8 涨到 40、量值从两位数涨到百万级、散点从一千点涨到百万点——当初的合格图形会越过自己的容量边界:饼图切片超限、条形图名目排不下、线性轴把小值压成零、散点糊成墨团。配型是随数据演进的复审项,不是交付时的定格。
机制
每种图形的容量边界来自其编码的物理约束:角度差在切片超过少数后低于分辨阈(饼图上限);条高的可分辨差在名目过多时小于字高(条形上限);线性标度下的相对差异在跨量级数据里被压缩(需换对数或指数化);墨水密度在点数超阈值后把结构糊死(需分箱或聚合)。数据增长把这些约束逐个触发,失效方式往往是渐变而非崩溃:图慢慢变得难读,没有人能指出哪天坏的,于是带着病运行。分布漂移同样致命:零值或负值的出现让对数轴失效,长尾的出现让线性轴失效。
边界
复审的触发不靠日历靠数据画像变化:类别基数、值域宽度(最大/最小比)、点数、零负值出现、缺失率。静态报告以发布日画像为准;在线仪表盘应把画像监控做成自动项(基数超阈即提醒换图)。复核通过后新图形同样要过问句检验——换图不是降级为"能画就行",判读成本约束照旧。
怎么落地
- 为每张在线图建立数据画像档案(发布时记录基数、值域、点数),设置阈值告警:类别 >15、量值比 >1000、点数 >1 万、出现负值即触发复核。
- 复核清单:编码通道是否仍够用(切片数、名目数、墨水密度)、标度是否仍合适(线性/对数)、是否该升维表示(分面、聚合、热力图)。
- 验证:每季度抽检在役图形与当前数据画像的匹配度;发现"图还是去年的、数据翻了几倍"即欠账,补复审。