G1.05.3metadata entry cost设计研究

元数据的录入成本决定其完整度

别名: 编目成本 · cataloguing effort · 元数据完整度

概念解释

字段会不会被填满,首先取决于填它要花多少力气,而不是取决于架构图上画了多少字段。录入成本决定完整度:每多一个必填项、每一次要打开受控词表去对词、每一回要回忆「这个日期填发布还是修订」,完整度就掉一截。完整度不是道德问题,是投入与收益在编目现场的均衡。要求十个字段、只值一个字段的检索收益,多出来的九个会空着或被乱填。

乱填比空着更糟,因为它看起来完整。成本过高时,完整度仪表盘仍可能是绿的。

机制

编目是额外劳动,通常不由查找的受益人完成。成本由生产者付,收益由检索者拿,激励天然错位。成本包括:找到正确受控词的时间、理解字段定义的时间、在不确定时被强制选择的焦虑、以及稍后还要维护的预期。成本一过阈值,策略变成:跳过、选列表第一项、复制上一条、或把所有东西打上同一个热门标签。

自动抽取和继承(从父级、从文件名、从上传者身份)能把成本从「创造」降到「确认」,完整度才上得去。把希望寄托在「大家认真填」上,是在和这套激励作对。

怎么研究

测的是填字段的真实工作量与随后的数据质量,而不是问卷里「你愿意填吗」。

  • 范式:编目任务的时间与错误(选错受控词、填错日期语义);字段数量的增减实验;自动预填加确认 vs 空白表单。事后抽检完整度与乱填率,不要只看非空率。
  • 自变量:必填字段数、词表大小、是否预填、是否允许「未知」。
  • 因变量:每条对象的编目时间、非空率、抽检准确率、热门垃圾标签的集中度。
  • 方法论注意点:实验室里编几条会低估成本,生产环境是每天几十上百条。非空率会把乱填算成完整,必须加准确率。谁在填(作者本人、专职编目、外包)会彻底改变成本结构,要分层。

边界

法规强制的字段(病历、财务凭证)成本再高也得填,但应把强制集做小,并把系统能算的不算人功。用户生成内容几乎付不起专业编目成本,完整度只能来自默认值、机器抽取和事后众包,不能来自发布前的二十个下拉框。专家库由专职人员维护时,高成本可以换高精度,不代表同一套表单可以甩给普通作者。

怎么落地

  • 每个字段问:谁填、填一次要多久、检索侧少了它会怎样。三者对不上就删字段,不要先画高级检索。
  • 能从文件、账号、工作流状态推导的,预填并允许改,不要空白等着人回忆。
  • 允许「未知」,避免强制选择把噪声写成事实。
  • 验证:看新对象发布一周后的抽检——非空且正确的比例。只有非空率没有准确率,完整度就是假的。若正确率随字段数明显下降,先减字段,再谈治理。

延伸

  • 同组G1.05.1 元数据支撑筛选、排序与关联 · G1.05.2 元数据缺失时高级检索失效
  • 相邻G1.07 内容清单与审计 · G1.10 受控词表与同义词 · G1.11 架构的可扩展性与演进
  • 站内检索metadata entry cost · cataloguing effort · metadata completeness

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/G1.05.3