G1.07.2content audit设计研究
审计暴露重复、过时与孤立内容
别名: 内容审计 · duplicate stale orphan · ROT
概念解释
清单登记「有什么」之后,审计判定每一条是保留、合并、更新还是下线。它专门暴露三类伤害架构的对象:重复(同一事实多处各写各的)、过时(仍可到达但已不真)、孤立(无入口、无引用、无维护者)。这三类合称 ROT(redundant, outdated, trivial/orphaned)里最该先处理的部分。审计不是阅读品味检查,是为新结构清场:不先处理这三类,新类目会把垃圾一起分类得很漂亮。
清点回答存在,审计回答去留。没有清单的审计会变成抽样吐槽。
机制
重复让查找结果和类目计数膨胀,用户要在几个近似页里赌哪一份是真的。过时让正确的路径导向错误的事实,架构越「好找」,伤害越大。孤立对象平时不出现在导航里,却能被搜索和外链打中,成为无法解释的幽灵页;新结构若没给它们位置,上线后它们仍按旧 URL 活着。三类问题都会把「类目下有多少」变成不可信的数字,后续的广度深度、分面计数、相关推荐全被污染。
审计要把对象映射到动作,而不是映射到分数。分数不能合并两篇重复政策,动作可以。
怎么研究
以已知的重复组、过时页、孤儿 URL 为金标准,看审计流程能检出多少,以及漏检的后果。
- 范式:在清单上标注 ROT 动作;用近重复检测、日期与政策版本对照、入链与导航引用分析来辅助。对比「只做新导航」与「先 ROT 再导航」的找路与信任指标。
- 自变量:审计覆盖率、是否包含文件型内容、过时的操作定义(超过 N 天、被新政策替代、法律失效)。
- 因变量:检出的重复组数、用户撞上过时事实的任务数、上线后幽灵 URL 的命中。
- 方法论注意点:流量为零不等于孤立,可能是关键但低频的合规页。过时不能只看最后修改时间,一篇每年点一次「保存」的旧政策时间戳是新的。重复要看事实是否同一,不看标题是否同一。
边界
档案库和历史记录的职责就是保留过时对象,审计的动作变成「标成历史并移出当前查找默认集」,不是删除。法律保留期未到的内容即使孤立也不能下线。自动近重复会把多语言版本和无障碍替代格式误判为重复,要有「等价但必须并存」的类型。用户个人内容(草稿、私信)不适用站点级 ROT。
怎么落地
- 在清单上为每条对象填一个动作:保留 / 合并到 / 更新 / 下线 / 归档,禁止只打分。
- 重复组指定一个权威页,其余改重定向,不要在新导航里挂多个近义入口。
- 过时页要么更新要么移出默认检索与导航,并标明历史身份,避免「还能打开」被当成仍有效。
- 验证:从搜索日志里抽十次到达后立刻离开的页面,看审计是否已把它们标成过时或重复。抽十条无入链的 URL,看是否被标成孤立并给出动作。两者对不上,审计还停留在意见。