本研究探索了众包"软"标签(如概率估计)的置信度收集方法,以降低具有模糊性数据的标注成本。机器学习研究表明,这类"软"标签更具信息量,可以减少训练监督机器学习模型所需的数据量。通过减少所需标签数量,我们可以降低音频标注等慢速标注流程的成本。在我们的实验中,我们评估了三种置信度收集方法:1)"无置信度"收集,2)"简单置信度"收集,以及3)"博弈"置信度机制,在个体(即每个参与者)和聚合(即众包)两个层面进行评估。此外,我们还评估了置信度收集方法、标注类型(二元概率和z-score导出概率)之间的交互,以及"软"与"硬"(即二值化)聚合标签。我们的结果表明,两种置信度收集机制在参与者和录音层面二元标注方面都比"无置信度"机制产生更高的标注质量。此外,当在录音层面聚合标签时,结果表明,如果我们聚合"软"标签而不是"硬"标签,可以使用更少的标注者获得与10参与者聚合标注相当的结果。这些结果表明,对于二元音频标注,使用置信度收集机制并聚合连续标签可以获得更高的标注质量、更具信息量的标签,且在标注者较少时质量差异更加明显。最后,我们提出了将这些置信度收集方法整合到两阶段多标签标注流程中的方案。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/87109/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3512935
一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文