G1.07.2content audit设计研究

审计暴露重复、过时与孤立内容

别名: 内容审计 · duplicate stale orphan · ROT

概念解释

清单登记「有什么」之后,审计判定每一条是保留、合并、更新还是下线。它专门暴露三类伤害架构的对象:重复(同一事实多处各写各的)、过时(仍可到达但已不真)、孤立(无入口、无引用、无维护者)。这三类合称 ROT(redundant, outdated, trivial/orphaned)里最该先处理的部分。审计不是阅读品味检查,是为新结构清场:不先处理这三类,新类目会把垃圾一起分类得很漂亮。

清点回答存在,审计回答去留。没有清单的审计会变成抽样吐槽。

机制

重复让查找结果和类目计数膨胀,用户要在几个近似页里赌哪一份是真的。过时让正确的路径导向错误的事实,架构越「好找」,伤害越大。孤立对象平时不出现在导航里,却能被搜索和外链打中,成为无法解释的幽灵页;新结构若没给它们位置,上线后它们仍按旧 URL 活着。三类问题都会把「类目下有多少」变成不可信的数字,后续的广度深度、分面计数、相关推荐全被污染。

审计要把对象映射到动作,而不是映射到分数。分数不能合并两篇重复政策,动作可以。

怎么研究

以已知的重复组、过时页、孤儿 URL 为金标准,看审计流程能检出多少,以及漏检的后果。

  • 范式:在清单上标注 ROT 动作;用近重复检测、日期与政策版本对照、入链与导航引用分析来辅助。对比「只做新导航」与「先 ROT 再导航」的找路与信任指标。
  • 自变量:审计覆盖率、是否包含文件型内容、过时的操作定义(超过 N 天、被新政策替代、法律失效)。
  • 因变量:检出的重复组数、用户撞上过时事实的任务数、上线后幽灵 URL 的命中。
  • 方法论注意点:流量为零不等于孤立,可能是关键但低频的合规页。过时不能只看最后修改时间,一篇每年点一次「保存」的旧政策时间戳是新的。重复要看事实是否同一,不看标题是否同一。

边界

档案库和历史记录的职责就是保留过时对象,审计的动作变成「标成历史并移出当前查找默认集」,不是删除。法律保留期未到的内容即使孤立也不能下线。自动近重复会把多语言版本和无障碍替代格式误判为重复,要有「等价但必须并存」的类型。用户个人内容(草稿、私信)不适用站点级 ROT。

怎么落地

  • 在清单上为每条对象填一个动作:保留 / 合并到 / 更新 / 下线 / 归档,禁止只打分。
  • 重复组指定一个权威页,其余改重定向,不要在新导航里挂多个近义入口。
  • 过时页要么更新要么移出默认检索与导航,并标明历史身份,避免「还能打开」被当成仍有效。
  • 验证:从搜索日志里抽十次到达后立刻离开的页面,看审计是否已把它们标成过时或重复。抽十条无入链的 URL,看是否被标成孤立并给出动作。两者对不上,审计还停留在意见。

延伸

  • 同组G1.07.1 架构工作始于已有内容的清点 · G1.07.3 未清点的内容会破坏新架构
  • 相邻G1.11 架构的可扩展性与演进 · T3.03 内容的时效与维护 · G3.15 结果的分组与去重
  • 站内检索content audit · ROT · duplicate content

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/G1.07.2