G3.15.4intelligible deduplication criteria设计研究
'去重判定标准需让用户可理解,避免已知结果无故"消失"'
别名: 去重可解释 · vanished results · 合并规则可见
概念解释
用户记得某条结果应该在这里——上周点过的 URL、同事刚发的文档、自己刚上传的版本——打开列表却找不到。若它是被当成重复合并掉的,而界面没有任何「与某某合并」的说明,这条记录就像无故消失。可理解的去重标准要求合并规则能被用户用自己的话复述,并且在被合并的那一侧留痕迹,而不是只在索引内部成立。
这不是要求公开 SimHash 的阈值,而是要求人能回答「它去哪了」:并进了哪一条、凭什么算同一件。说不清的去重会被归因成系统丢数据。
机制
再找到依赖外部记忆:书签、聊天记录、口头推荐给出的是一条具体身份,不是「语义上最像的那簇」。去重按内容重叠或规范化 URL 工作,与外部身份不对齐时,已知对象会从列表里抽走,外部记忆落空。人没有「去重」这个范畴时,缺席只可能被解释成未收录、权限不够或自己记错。三种解释都会停止继续找,真正的对象其实还在代表项后面。
痕迹把缺席改写成移位。一句「已与《某某》合并」或代表项下的来源列表,让外部身份有落点。没有落点,去重对不拥有全局索引心智模型的人就是随机删除。
怎么研究
用「已知对象应在列表中」的再找到任务,操纵去重是否可追溯。
- 范式:先让人成功打开对象 A,再构造查询使 A 被合并进代表项 B;比较无说明、代表项下列出被合并来源、以及查询「为何没有 A」的解释。查询日志里同一 URL 在去重上线前后的「找不到」投诉可作现场证据。
- 自变量:合并痕迹的形式(无 / 来源列表 / 针对已知 URL 的定向说明)、代表项标题与 A 的标题差异有多大。
- 因变量:找回 A 的成功率、把缺席归因于「被删 / 未收录」的比例、对去重规则的复述能否与真实规则对上。
- 方法论注意点:被试若从未见过 A,不会体验消失,只会体验少一行。必须用他们自己的已知项。标题改写很大的代表项会额外增加认不出,要与「完全无痕迹」分开。
边界
公开爬取的网页搜索难以为每一个被省略 URL 做定向说明,退而求其次是「省略了相似结果」的可点击总入口。内网、邮箱、网盘这类身份稳定的集合,已知对象消失的代价高得多,标准必须更具体(相同文件哈希、相同消息 ID)。安全场景下不能把被折叠的来源域名全部列出(钓鱼镜像),痕迹要适度,不能为了可理解而变成攻击面清单。
怎么落地
- 对被合并的来源至少提供一条可发现的清单,挂在代表项上;内网场景允许按标题或 URL 反查「并进了哪条」。
- 用用户词汇写规则摘要(「相同正文的转载」「同一文件的不同链接」),不要写内部函数名。
- 若某人通过外部身份进入却落到代表项,明确说「你要的那条被并到这里」,并给出原地址(若仍可访问)。
- 验证:让用户先记下一条结果的标题或 URL,再跑会把它合并掉的查询。他们应能指出它现在在哪一行、凭什么被并。若只能说「没了」,标准对用户不可理解。