系统标签与用户标签需要在界面上可区分来源
别名: 机器标签 · 自动分类标记 · tag provenance
概念解释
出现在内容上的词有两个来源:人打的,和系统打的(类型检测、垃圾、语言、发票、AI 摘要关键词)。来源必须在芯片上就能分清——不同形状、不同区、或明确写「自动」——因为人对两类词的信任和处置完全不同。人词可以改、可以删、可以当筛选线索;系统词可能一刷新就回来,或根本不该当个人分类。它不管词表开不开、交并怎么算。
机制
人把看见的芯片都当成自己的分类承诺。系统词混在同一排里,会被拿去当找回线索,也会被当成错误去删;删了又回来,人以为产品坏了。反过来,人词若看起来像系统徽章,人不敢删,词表被锁死。区分让处置匹配来源:系统词提供「不是这个类型」的纠正,而不是删除芯片;人词提供删除和改名。筛选里两类混在一个扁平列表,会让「自动:发票」和人打的「发票」看起来能交,实际一个随检测变、一个随人变,结果集不稳定。来源还影响责任:系统标错是模型问题,人标错是词表问题,混在一起无法修。
怎么研究
同一对象上放人词和自动类型。请人「去掉不该在这的标记」和「用发票把这类找出来」。比较混排无来源、分区、芯片上写自动。
自变量:来源是否可见、系统词删除是真删还是纠正、筛选列表是否分组。 因变量:误删系统词后的困惑、用系统词当稳定线索而失败的次数、不敢删自己词的次数。
实验室若告诉人「有些是自动的」,等于剧透。应从芯片外观读出来。自动词在检测更新后改变,要观察人是否注意到来源。不要把权限角色名称算进标签。
边界
纯手打、没有任何自动分类的产品没有这层区分。系统词若只用于内部排序、从不展示,也不必做成芯片。法规要求展示的来源标记(「此条由模型生成」)可能比标签芯片更重,不要用弱差异色代替。用户规则产生的词(「标题含发票则标记」)介于两者之间,应标成「规则」,既不是手打也不是模型。
怎么落地
- 人词与系统词分两排或两种芯片;系统词写「自动」或放在「检测」区。
- 系统词的负向操作是「纠正类型」,纠正后说明下次检测会学习或不会再标;人词的负向操作是删除。
- 筛选里分组:我的标签 / 系统检测。不要让两类进入同一次无说明的交运算。
- 验证:请人去掉一个自动类型芯片,看操作名称和事后是否又回来。再请人只用「发票」找回,问他们依赖的是自动检测还是自己打的词。答不出来源,区分失败。