V9.05.2Redundancy tiering by task difficulty设计研究

冗余次数与成本成正比,需按任务难度分别设定

别名: 冗余档位 · 难度分层冗余 · 成本—准确率截断

概念解释

冗余是众包质控的主药,但每一份冗余都按件计费:三人冗余就是三倍的单件成本,五人冗余就是五倍。质控预算因此不是「统一冗余几份」的拍板,而是按任务难度分档配置的决策——单人准确率高的任务两份就够,准确率低的任务五份可能还不达标,而把高难度档的冗余浪费在简单任务上,烧掉的是整批预算。冗余档位(redundancy tier)是把「难易」翻译成「份数」的对照表,是众包运营里杠杆最大的成本旋钮。

机制

冗余的收益端服从饱和曲线,成本端是直线。单人准确率越低,聚合到目标可信度需要的份数越多,且增量收益递减——从 1 份到 3 份买到的可信度提升,远大于从 5 份到 7 份;而每加一份,成本严格线性增加。两条线的交点决定最优份数,且这个交点随单人准确率移动:任务越难(单人越不准),交点右移、单位成本陡增;任务越容易,交点左移到「两份比对、分裂再补」即可。难度本身又不是均匀的——同一批任务里通常混着难度带,边缘输入(真正模糊的判定)占少数却贡献了大部分分歧。所以分档不是二元的难/易,而是把任务流按预测难度路由:清晰带低冗余、争议带高冗余、分裂自动升级。档位配置错误的代价不对称:冗余不足漏过坏结果(质量事故),冗余过度烧预算(成本事故),而后者的隐蔽性使它更常被忽略。

怎么研究

  • 范式:金标回放的档位仿真——在带真值的历史数据上,模拟不同分档策略(统一 N 份 / 按难度分层 / 动态加做)的总成本与最终准确率,寻找帕累托前沿;在线实验则按档位随机分组,验证仿真结论的外部效度。
  • 变量:自变量为分档策略、难度预测特征(历史分歧率、边缘判定比例)、目标准确率阈值;因变量为总成本、最终聚合准确率、单件有效成本。
  • 在界面研究里的用途:任务发布器把冗余从全局常数改为按批配置的参数,配合难度预测给出建议份数。
  • 方法论注意点:难度预测特征存在冷启动(新任务无历史);仿真用历史分歧率预测未来难度时会低估分布漂移(参与者构成、季节性波动),上线后需持续回测。

边界

档位策略依赖难度可预测。有些任务的难度是个体性的而非条目性的——对 A 难对 B 易(专业背景差异),条目级难度预测失效,只能靠人均可靠度估计来路由。极端难任务(单人准确率逼近随机)在冗余框架内无解:份数需求发散,正确答案是从任务设计上降难(更好的说明与样例)或改用专家通道,而不是堆冗余。此外,档位调节有滞后——发现某档不足时已放出的任务无法追补冗余,只能事后加做,成本高于首发配足。

怎么落地

  • 建立难度—份数对照表并在小流量上标定:每类任务先跑金标子集,测单人准确率,查表定首发冗余。
  • 批内动态路由:预设「先两份,分裂自动加做第三份」的级联结构,让冗余跟着分歧走而不是平均撒。
  • 把争议带条目(历史高分歧特征)标记为高冗余档,清晰带条目单份加抽检。
  • 每季度用金标回放重校对照表,防分布漂移让档位失准。
  • 验证:跟踪各档的「分裂后加做率」与最终返工率;若某档加做率持续偏高,该档首发份数不足;若加做率趋零而成本占比高,该档冗余过度,可下调一档。

延伸

  • 同组V9.05.1 多人重复同一任务并比对结果是最基础的质控手段 · V9.05.3 混入已知答案的检验题可持续估计贡献者的准确率 · V9.05.4 多人一致并不保证正确,共同的误解会一致地出错 · V9.05.5 按完成数量计酬会诱导快速而低质的作答
  • 相邻V9.04 众包任务的拆分与说明 · V9.06 贡献者的动机与报酬
  • 站内检索redundancy level · cost-accuracy tradeoff · task difficulty

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/V9.05.2