G1.10.4controlled vocabulary versus folksonomy设计研究
受控词表由专人维护,与用户自发生成的标签体系性质不同
别名: folksonomy · 大众分类 · 受控与自发
概念解释
受控词表由指定的人裁定首选词和关系,更新有流程、有责任人。民间分类(folksonomy)是用户给对象贴的自发标签,谁都可以造词,没有唯一首选。两者都能让内容被找到,但不是同一类系统:前者求稳定与可聚合,后者求低成本和贴合当下说法。把用户标签直接升成导航类目,是把民间分类误当成受控词表;反过来禁止用户用自己的词检索,是把受控误当成唯一合法语言。
性质不同意味着治理、界面和失败模式都不同,不能用同一套「标签管理」混过去。
机制
受控侧的瓶颈是裁定速度:领域变了,词表没跟上,内容会被贴在过时的首选词上。民间侧的瓶颈是无控制的同义与多义:十个用户给同一对象十个词,聚合失败;一个词被用来指两件事,筛选撒谎。受控靠少数人的一致性换机器可算;民间靠多数人的即时性换覆盖,用事后聚类去补聚合。
两者可以衔接:民间词作为非首选候选进入受控流程,获准后才成为首选或正式别名。没有这道闸,民间词表会冲进导航,受控立即解体。
怎么研究
分开测量两种体系的一致性和时效,不要混成一个「标签质量」分数。
- 范式:同一批对象,专家受控标引 vs 用户自发标签;计算标签一致率、时间滞后、检索成功率。再做「民间词是否被错误地写进导航」的界面审计。
- 自变量:谁能造词、造词是否立刻出现在筛选、是否有审核闸门。
- 因变量:同对象标签分裂、同词多义率、新说法出现到可被官方检索的延迟、导航被民间词污染的次数。
- 方法论注意点:爱好者社区的 folksonomy 一致率会高于普通消费者。样本要匹配产品用户。专家标引的金标准会偏向受控侧的用词,评价民间标签时应以用户查询能否命中为准,而不是以是否等于首选词为准。
边界
专业库(医学主题词、法律主题)几乎必须受控,民间标签最多做个人组织,不能驱动公共导航。纯社交收藏可以只有民间分类,受控词表在这里是过度治理。企业里「大家都能在 CMS 里新建类目」看起来像受控,实际是无主的民间分类,失败模式按民间侧处理:先关新建权限,再谈词表,而不是培训「请认真填」。
怎么落地
- 写明两条管道:导航、筛选、官方检索只消费受控首选词;用户标签留在对象上,可被个人过滤,默认不进全局分面。
- 高频民间词定期进入受控候选,由责任人决定升为首选、收为别名,还是保持民间。
- 禁止在 CMS 里无审核地「新增类目」——那不是敏捷,是把词表改成 folksonomy。
- 验证:抽一条新流行叫法。用户侧应能立刻用来找自己的对象;全局导航和官方筛选在未裁定前不应出现该词。两边颠倒,就是两种体系被接反了。