G1.10.3authority files设计研究

权威文件维护实体的规范名称,解决同名异指与异名同指

别名: 规范文档 · name authority · 同名异指

概念解释

权威文件(authority file)给现实世界的实体——人、机构、地名、作品——规定一个规范名称,并记下别名与容易混淆的同名者。它解决两类事故:同名异指(两个张伟)和异名同指(北京大学 / PKU / 北大)。受控词表管的是概念的词;权威文件管的是实例的身份。没有身份层,「作者 = 李娜」会把网球冠军和歌手叠成一个人,筛选和相关都在撒谎。

规范名称是该实体的首选写法,不是它在新闻里最常见的昵称。昵称进别名,不进身份键。

机制

字符串相等推不出对象相等,字符串不等也推不出对象不等。权威文件在字符串底下放一个稳定 ID,所有写法都指向 ID。同名异指靠附加属性拆开(生年、任职、作品),异名同指靠别名合并。检索和导航展示规范名,查询端仍吸收别名;用户看到的是可区分的实体,键入的是他们知道的那串字。

缺权威层时,去重只能靠字符串规则,必然在同名处合并过头、在别名处分裂过头。矩阵和分面若用「作者」当轴,轴上的值其实是一锅未消歧的字符串,交点没有可解释的实体。

怎么研究

用已知的同名对和别名组当金标准,看权威层能否拆开与合并。

  • 范式:构造同名异指任务(找出正确的那位作者)和异名同指任务(用不同写法找到同一机构);对比无权威、只有字符串归一、有权威 ID。图书馆名称规范文档是方法来源,不必把馆藏系统搬进产品。
  • 自变量:是否有稳定 ID、消歧属性是否对用户可见、别名覆盖率。
  • 因变量:错并率、错分率、用昵称能否找回、用户能否说出「这是哪一个同名者」。
  • 方法论注意点:精确匹配实验会低估同名伤害,因为实验室人名往往唯一。要从真实常见同名抽样。合并决策的错误成本高于暂时分裂:错并会污染所有该实体的内容,错分还能靠别名补。

边界

普通主题词(「报销」「发票」)不是实体,不该进权威文件,否则概念层和实例层搅在一起。一次性、无持久身份的对象(某次客服会话)建权威得不偿失。用户生成的「显示名」可以与规范名并存,但权限与审计必须绑 ID,不能绑显示名。开放世界里实体不断新增,权威文件会滞后;滞后应表现为「未消歧」状态,而不是自动把新字符串并进最像的旧实体。

怎么落地

  • 为人、机构、地点、作品建立 ID,规范名 + 别名 + 一条消歧说明;界面在同名出现时展示消歧说明。
  • 筛选、矩阵、相关用 ID 聚合,不要用显示字符串聚合。
  • 导入外部名单时先对权威,对不上的进「未消歧」,禁止按字符串自动合并。
  • 验证:用两个同名实体和三套别名做查找与筛选。同名者不应出现在同一计数里;三套别名应打到同一 ID。任一方向失败,权威层还没接上结构,只是多了一列「标准名」字段。

延伸

  • 同组G1.10.1 受控词表为每个概念规定唯一首选词,非首选词导向该首选词 · G1.10.2 叙词表用广义词、狭义词与相关词描述概念间的层级与关联 · G1.10.4 受控词表由专人维护,与用户自发生成的标签体系性质不同 · G1.10.5 检索时非首选词自动映射到首选词,结果与提交首选词一致 · G1.10.6 词表随领域演进需要版本管理与变更记录
  • 相邻G1.05 元数据 · G3.15 结果的分组与去重 · G1.08 术语一致性
  • 站内检索authority file · name disambiguation · homograph

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/G1.10.3