提升众包音频标注质量的置信度收集方法研究
本研究探索了众包"软"标签(如概率估计)的置信度收集方法,以降低具有模糊性数据的标注成本。机器学习研究表明,这类"软"标签更具信息量,可以减少训练监督机器学习模型所需的数据量。通过减少所需标签数量,我们可以降低音频标注等慢速标注流程的成本。在我们的实验中,我们评估了三种置信度收集方法:1)"无置信度"收集,2)"简单置信度"收集,以及3)"博弈"置信度机制,在个体(即每个参与者)和聚合(即众包)两个层面进行评估。此外,我们还评估了置信度收集方法、标注类型(二元概率和z-score导出概率)之间的交互,以及"软"与"硬"(即二值化)聚合标签。我们的结果表明,两种置信度收集机制在参与者和录音层面二元标注方面都比"无置信度"机制产生更高的标注质量。此外,当在录音层面聚合标签时,结果表明,如果我们聚合"软"标签而不是"硬"标签,可以使用更少的标注者获得与10参与者聚合标注相当的结果。这些结果表明,对于二元音频标注,使用置信度收集机制并聚合连续标签可以获得更高的标注质量、更具信息量的标签,且在标注者较少时质量差异更加明显。最后,我们提出了将这些置信度收集方法整合到两阶段多标签标注流程中的方案。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3512935
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文