V9.05.1Redundancy and agreement as quality control设计研究

多人重复同一任务并比对结果是最基础的质控手段

别名: 冗余比对 · 多数表决聚合 · majority voting

概念解释

众包没有雇佣关系里的技能保证,最基础的替代手段是冗余:同一个任务独立分给多个人,比对答案——一致的采纳,分裂的复核。它的推理基础是非正式的「大数定律」:单个陌生人的错误率不可控,但多个独立错误互相抵消的概率随人数上升,一致结果的可信度就随之上升。简单形态是多数表决(majority voting),进阶形态是按各人历史准确率加权或用统计模型同时估计「人的可靠度」与「真值」的聚合。质控在这里不是筛选人,而是用冗余换真值。

机制

冗余起效的前提是错误的独立性:两个人错在同一处的概率是两个单独错误率的乘积,随冗余数按指数衰减,于是「多数都错」的概率塌缩,多数票收敛到真值。这个前提同时暴露了机制的软肋(下一叶展开主题的另一面,此处不展开)——错误一旦相关,衰减失效。聚合技术的演进都在提高独立性假设下的效率:朴素多数票把所有票等权,浪费了「历史更准的人」的信息;加权与模型化聚合(如以期望最大化迭代同时估计工作者可靠度与项目真值的做法)用同样的冗余换回更高的准确率,等价于用算法替代了一部分额外的人力冗余。冗余也内建了对恶意行为的稀释:随机乱答在多人比对中被多数真实作答淹没,除非攻击者协调成规模——这把「防懒惰」变成了概率问题而不是品德问题。

怎么研究

  • 范式:带真值基准的标注实验——固定一批已知正确答案的输入,改变冗余度与聚合方法,测量聚合结果对真值的准确率曲线;平台日志的再分析(用已发布任务的历史冗余数据回放不同聚合策略)是低成本的第二路径。
  • 变量:自变量为冗余人数、聚合方法(多数/加权/模型化)、参与者质量构成;因变量为聚合准确率、达到目标准确率所需的最小冗余、单位有效成本。
  • 在界面研究里的用途:众包平台的聚合配置——冗余度预设、分裂结果的自动回流(转给下一层复核或升级人工)。
  • 方法论注意点:真值基准本身有测量误差,「与金标准的一致率」在金标准可疑时会低估聚合质量;冗余带来的准确率曲线在易任务上很快饱和、在难任务上爬升缓慢,跨任务外推最小冗余数是常见错误。

边界

冗余对独立性好的随机错误最有效,对系统性偏差无能为力:说明写得有歧义时,所有人一致地错,比对出任何一致度都无济于事(这层机制由专门条目展开,此处点到为止)——纠偏要先回到说明层。逐条判定成本低的分类任务适合冗余;创作类任务(写文案)没有「同一答案」可比,冗余失效,需换评审制。冗余还有边际递减:从 1 人到 3 人的可信度增益远大于从 7 人到 9 人,成本却是线性的,最优冗余度是成本—准确率曲线的截断点,而不是「越多越稳」。

怎么落地

  • 按任务的「单人准确率」设定冗余档位:单人越准,需要的冗余越少;新类型任务先跑小样本测单人准确率再定档。
  • 聚合不设单一策略:一致即自动通过,分裂项自动回流加做或升级人工,把人力只花在分歧上。
  • 有历史数据时上加权聚合:按各人既往与多数/金标准的一致率分配权重,同样的冗余换更高准确率。
  • 冗余分配对高价值项倾斜:错误代价大的条目多份冗余,低代价条目单份加抽检。
  • 验证:以金标准子集回放不同冗余度与聚合策略的准确率—成本曲线,选截断点上线;上线后跟踪分裂率——分裂率的升高早于质量事故,是冗余档位需要上调的先行指标。

延伸

  • 同组V9.05.2 冗余次数与成本成正比,需按任务难度分别设定 · V9.05.3 混入已知答案的检验题可持续估计贡献者的准确率 · V9.05.4 多人一致并不保证正确,共同的误解会一致地出错 · V9.05.5 按完成数量计酬会诱导快速而低质的作答
  • 相邻V9.04 众包任务的拆分与说明 · V9.01 投票与共识机制
  • 站内检索majority voting · redundancy · Dawid-Skene

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/V9.05.1