G1.07.3uninventoried content breaks architecture设计研究
未清点的内容会破坏新架构
别名: 未清点内容 · rogue content · 影子内容
概念解释
新导航上线之后,那些从未进入清单的对象仍按旧地址活着:过期活动页、被业务私下放上的落地页、文档库里的副本、翻译半成品。用户从搜索、邮件和收藏到达它们,发现新结构管不到的另一套世界。未清点的内容破坏新架构,不是因为它比新类目更差,而是因为它证明新结构不是全集。一次这样的到达,就能让「全站已迁移」的承诺作废。
清点的遗漏和审计的「决定下线却没断入口」都会制造这类破坏。这里管的是漏登记本身,不是 ROT 判定。
机制
架构是对可达集合的覆盖声明。未登记对象让声明为假:同一查询会打出新类目里的权威页和旧地址上的影子页,气味互相拆台。旧地址还携带旧标签、旧模板、旧政策日期,用户无法判断哪边才算数。搜索引擎和外链不自动尊重新站点地图,漏网对象往往比新页更有排名惯性,破坏会从站外灌进来。
迁移项目若以「主要模板已换」为完成定义,漏网率被系统性低估。完成定义必须是可达 URL 的覆盖,不是视觉换肤的覆盖。
怎么研究
用可达性而不是用发布清单来定义「还活着」。
- 范式:上线后抓取 + 搜索日志 + 外链,减去新信息架构声明覆盖的 URL,得到漏网集;再让被试从漏网页尝试回到新结构,看能否找到权威替代。
- 自变量:清点覆盖率、是否对未登记 URL 做重定向或统一提示、搜索索引是否同步剔除。
- 因变量:漏网到达次数、从漏网页找回权威页的成功率、用户是否认为存在两套站点。
- 方法论注意点:只监测新域或新模板会看不到子域、CDN 上的文件和活动专用域。漏网集要按来源分层(内部收藏、邮件、搜索)。实验室里把人放进新首页,测不到这条破坏。
边界
有意保留的历史镜像(「2019 年站点存档」)只要入口标明身份,并与当前查找默认集隔离,就不是破坏。第三方嵌入的内容(地图、支付、社区)本来就不在本站清单里,应视为外部,不要算作未清点。持续发布的新对象会在两次清点之间出现,这是新鲜度窗口,要用增量登记而不是一次性完美清单去堵。
怎么落地
- 上线标准写成「可达 URL 要么进入新结构,要么 301 到权威页,要么明确的历史归档」,禁止「主要页面已迁移」。
- 上线后连续抓取搜索命中与 404/旧模板页,漏网条目进紧急清单,而不是等下一期改版。
- 旧搜索索引、站点地图、营销自动发送的链接一并切到新权威,不要只改导航。
- 验证:从上线后一周的搜索日志里抽出仍指向旧模板或未登记路径的查询。只要这类查询还能打开与新结构冲突的内容,新架构就已经被打出缺口。