G1.10.3authority files设计研究
权威文件维护实体的规范名称,解决同名异指与异名同指
别名: 规范文档 · name authority · 同名异指
概念解释
权威文件(authority file)给现实世界的实体——人、机构、地名、作品——规定一个规范名称,并记下别名与容易混淆的同名者。它解决两类事故:同名异指(两个张伟)和异名同指(北京大学 / PKU / 北大)。受控词表管的是概念的词;权威文件管的是实例的身份。没有身份层,「作者 = 李娜」会把网球冠军和歌手叠成一个人,筛选和相关都在撒谎。
规范名称是该实体的首选写法,不是它在新闻里最常见的昵称。昵称进别名,不进身份键。
机制
字符串相等推不出对象相等,字符串不等也推不出对象不等。权威文件在字符串底下放一个稳定 ID,所有写法都指向 ID。同名异指靠附加属性拆开(生年、任职、作品),异名同指靠别名合并。检索和导航展示规范名,查询端仍吸收别名;用户看到的是可区分的实体,键入的是他们知道的那串字。
缺权威层时,去重只能靠字符串规则,必然在同名处合并过头、在别名处分裂过头。矩阵和分面若用「作者」当轴,轴上的值其实是一锅未消歧的字符串,交点没有可解释的实体。
怎么研究
用已知的同名对和别名组当金标准,看权威层能否拆开与合并。
- 范式:构造同名异指任务(找出正确的那位作者)和异名同指任务(用不同写法找到同一机构);对比无权威、只有字符串归一、有权威 ID。图书馆名称规范文档是方法来源,不必把馆藏系统搬进产品。
- 自变量:是否有稳定 ID、消歧属性是否对用户可见、别名覆盖率。
- 因变量:错并率、错分率、用昵称能否找回、用户能否说出「这是哪一个同名者」。
- 方法论注意点:精确匹配实验会低估同名伤害,因为实验室人名往往唯一。要从真实常见同名抽样。合并决策的错误成本高于暂时分裂:错并会污染所有该实体的内容,错分还能靠别名补。
边界
普通主题词(「报销」「发票」)不是实体,不该进权威文件,否则概念层和实例层搅在一起。一次性、无持久身份的对象(某次客服会话)建权威得不偿失。用户生成的「显示名」可以与规范名并存,但权限与审计必须绑 ID,不能绑显示名。开放世界里实体不断新增,权威文件会滞后;滞后应表现为「未消歧」状态,而不是自动把新字符串并进最像的旧实体。
怎么落地
- 为人、机构、地点、作品建立 ID,规范名 + 别名 + 一条消歧说明;界面在同名出现时展示消歧说明。
- 筛选、矩阵、相关用 ID 聚合,不要用显示字符串聚合。
- 导入外部名单时先对权威,对不上的进「未消歧」,禁止按字符串自动合并。
- 验证:用两个同名实体和三套别名做查找与筛选。同名者不应出现在同一计数里;三套别名应打到同一 ID。任一方向失败,权威层还没接上结构,只是多了一列「标准名」字段。