长描述的编写需要理解图形背后的数据而非事后补写
别名: 数据作者写描述 · post-hoc caption · chart description authorship
概念解释
发布前才找人给图补一段说明,写的人往往已经说不清这根柱子是均值还是累计、缺的那一年是没有数据还是零。长描述必须由懂这组数据的人在做图的同时写下,而不是上线清单里最后补的一句外观。事后补写会写成看图作文;同时写才会写成对这组数负责的说明。
「懂数据」不是要作者会无障碍术语,而是要能回答:这个编码代表什么、比较的是谁、哪些点不能从视觉上直接读。
机制
图是压缩。压缩时丢掉的信息(误差棒、缺失年、加权方式、是否含税)不会自动长回像素里。只有做压缩的人还拿着被丢掉的那一层。事后接手的人看见的是已经画完的外观,只能描写斜率与颜色,无法判定「2021 年的缺口」是缺失还是零,也不能负责任地写「差异不显著」——那句话来自检验,不来自墨水。
时间也在跟作者作对。数据更新后图会重绘,贴在旁边的旧说明变成谎言。把描述当作发布前的文案补丁,就没有人拥有「图一变说明要跟着变」这条责任。写进做图流程(分析笔记本、图表配置、内容模型里的必填字段),描述才和数据同源。
怎么研究
对比两种作者条件:分析或内容的原作者在出图时写说明,与无数据背景的人员在视觉定稿后补写。用同一套数据问题打分,并请原作者标记补写中的事实错误(把缺失当零、把累计当均值、漏掉断轴)。
自变量:作者是否接触过原始表、写说明的时间点(出图时 / 发布前)、数据更新后是否有人改说明。 因变量:事实错误数、趋势题正确率、数据更新后说明与图不一致的次数。
过程审计比实验室更贴近生产:抽一组已上线的图,问「这段说明是谁写的、依据哪张表、上次数据更新有没有改」。答不上来的,就是事后补写留下的无主文本。
边界
库存图标、装饰性信息图没有「背后的数据」,不需要数据分析作者,这条不适用。转载已有图、拿不到微数据时,作者只能基于图上已经公开的编码来写,并标明「依据图中可见值,未核对源表」——这是证据边界,不是许可编趋势。自动生成的说明(把点表模板化)在结构简单时可用,但生成器看不见作者的解读(「这是疫情造成的断档」),仍需懂数据的人过一眼。机密数据不能为了写说明而把微数据交给外包文案。
怎么落地
- 把长描述做成出图流程里的必填产物,由做分析或供数的人写第一稿,不要等到视觉定稿后交给未看过表的人。
- 说明里写清编码含义与已知缺口(缺失 vs 零、是否断轴、比较口径),这些句子只能来自数据知识。
- 数据更新时把说明与表一起列入回归:图重绘、说明未改,视为内容缺陷。
- 验证:对抽样的图问三句——依据哪张表、谁写的、上次数据变更改了没有。任一问无人应答,或抽查发现把缺失写成零,判为事后补写失败。