标注者人口统计特征对情感数据集标注的影响
随着机器学习方法变得更强大并能捕捉更多人类行为细节,数据集中的偏见会塑造模型的学习和评估内容。本文探讨创建情感分析数据集时由于标注者人口统计特征而产生的不确定性和偏见。我们邀请超过1000名众包工作者提供其人口统计信息以及对多模态情感数据及其各模态的标注。研究表明,标注者之间的人口统计差异对其评分产生了显著影响,且这种影响也出现在各模态组件中。我们将不同先进多模态机器学习算法的预测结果与不同人口统计群体的标注进行对比,发现改变标注者的人口统计特征会导致判断积极与消极情感时产生超过4.5%的准确率差异。我们的发现强调了在构建数据集、评估算法和解读情感分析结果时考虑众包工作者属性(如人口统计特征)的重要性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文