G1.05.3metadata entry cost设计研究
元数据的录入成本决定其完整度
别名: 编目成本 · cataloguing effort · 元数据完整度
概念解释
字段会不会被填满,首先取决于填它要花多少力气,而不是取决于架构图上画了多少字段。录入成本决定完整度:每多一个必填项、每一次要打开受控词表去对词、每一回要回忆「这个日期填发布还是修订」,完整度就掉一截。完整度不是道德问题,是投入与收益在编目现场的均衡。要求十个字段、只值一个字段的检索收益,多出来的九个会空着或被乱填。
乱填比空着更糟,因为它看起来完整。成本过高时,完整度仪表盘仍可能是绿的。
机制
编目是额外劳动,通常不由查找的受益人完成。成本由生产者付,收益由检索者拿,激励天然错位。成本包括:找到正确受控词的时间、理解字段定义的时间、在不确定时被强制选择的焦虑、以及稍后还要维护的预期。成本一过阈值,策略变成:跳过、选列表第一项、复制上一条、或把所有东西打上同一个热门标签。
自动抽取和继承(从父级、从文件名、从上传者身份)能把成本从「创造」降到「确认」,完整度才上得去。把希望寄托在「大家认真填」上,是在和这套激励作对。
怎么研究
测的是填字段的真实工作量与随后的数据质量,而不是问卷里「你愿意填吗」。
- 范式:编目任务的时间与错误(选错受控词、填错日期语义);字段数量的增减实验;自动预填加确认 vs 空白表单。事后抽检完整度与乱填率,不要只看非空率。
- 自变量:必填字段数、词表大小、是否预填、是否允许「未知」。
- 因变量:每条对象的编目时间、非空率、抽检准确率、热门垃圾标签的集中度。
- 方法论注意点:实验室里编几条会低估成本,生产环境是每天几十上百条。非空率会把乱填算成完整,必须加准确率。谁在填(作者本人、专职编目、外包)会彻底改变成本结构,要分层。
边界
法规强制的字段(病历、财务凭证)成本再高也得填,但应把强制集做小,并把系统能算的不算人功。用户生成内容几乎付不起专业编目成本,完整度只能来自默认值、机器抽取和事后众包,不能来自发布前的二十个下拉框。专家库由专职人员维护时,高成本可以换高精度,不代表同一套表单可以甩给普通作者。
怎么落地
- 每个字段问:谁填、填一次要多久、检索侧少了它会怎样。三者对不上就删字段,不要先画高级检索。
- 能从文件、账号、工作流状态推导的,预填并允许改,不要空白等着人回忆。
- 允许「未知」,避免强制选择把噪声写成事实。
- 验证:看新对象发布一周后的抽检——非空且正确的比例。只有非空率没有准确率,完整度就是假的。若正确率随字段数明显下降,先减字段,再谈治理。