随着机器学习方法变得更强大并能捕捉更多人类行为细节,数据集中的偏见会塑造模型的学习和评估内容。本文探讨创建情感分析数据集时由于标注者人口统计特征而产生的不确定性和偏见。我们邀请超过1000名众包工作者提供其人口统计信息以及对多模态情感数据及其各模态的标注。研究表明,标注者之间的人口统计差异对其评分产生了显著影响,且这种影响也出现在各模态组件中。我们将不同先进多模态机器学习算法的预测结果与不同人口统计群体的标注进行对比,发现改变标注者的人口统计特征会导致判断积极与消极情感时产生超过4.5%的准确率差异。我们的发现强调了在构建数据集、评估算法和解读情感分析结果时考虑众包工作者属性(如人口统计特征)的重要性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/89630/2022

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
work
职业/产业
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文