标识缺失会污染后续信息环境
别名: 标识缺失污染 · 合成物入语料 · corpus contamination
概念解释
一张无标记的生成街景被新闻聚合抓取,再被当成「实地照片」写进条目,再被下一轮模型扫进训练。下游没有恶意,只是按「没有标记就是记录」在收。标识缺失污染(unlabeled pollution)指的是:未标明的生成物进入公共信息环境后,会把后续的检索、引用和训练当成人类记录来消化,错误以环境的方式放大,而不是以单次误读的方式结束。
某一个接收者当时有没有看出来,是可识别问题。这里管的是缺标识之后,环境如何被改写。
机制
信息环境依赖来源类别做过滤:搜索引擎、编辑室、数据集管道都用「这是不是记录」当入选条件。缺标识时,默认规则几乎全是「当记录收」。生成物产量高于人工记录,无标记输出会在后续语料里占越来越大的份额,下一轮系统又从被污染的环境里学「真实长什么样」,合成特征被当成世界特征。
污染是累积的。单次误读可以纠正;环境一旦把生成物编进「已核实资料」,纠正要面对的是引用网络,不是一张图。
怎么研究
追踪无标记生成物进入:搜索索引、百科引用、开放数据集。度量:被当成记录引用的次数、进入训练集的比例、下游模型在相关事实上的漂移。自变量:有无类别元数据、平台是否在入库时检测。因变量:污染率(被误分类为人类记录的比例)、二次引用后的类别恢复率。
实验室里的单人判断不够。污染发生在管道和批量入库,方法要跟着管道走,而不是只做受试者问卷。
边界
封闭、不归档、禁止导出的会话几乎不污染公共环境。明确的虚构社区(角色扮演、设定集)把合成当合成用,缺标识不一定造成「当记录」的污染,但仍可能污染「风格是谁的」。检测器误报把人类记录标成生成,是反向污染,不能用「多标」一笔勾销。这条不处理守规者负担,也不处理检测失败不能当人类创作的证据。
怎么落地
- 在内容进入可被第三方收割的状态(公开、可索引、可下载)之前,类别必须已在载荷里,而不是只在本站皮肤上。
- 自己的检索与推荐管道不要把无类别材料默认当成人类记录入库;无类别应是单独一档。
- 发现已污染的下游引用时,提供可机读的更正,而不是只改原帖。
- 验证:用公开爬虫或站点地图抽一批已发布生成物,看外部索引里还有没有来源类别。类别在外部为零,污染通道已经打开。