寻找Snark:数据实践中的注释者多样性
荣誉提名可解释人工智能(XAI)算法公平与偏见AI/ML 研究员与工程师Amazon Mechanical Turk 工作者
文献标题
A hunt for the Snark: Annotator Diversity in Data Practices
文献信息
- 主题领域: 数据标注、多样性与人工智能/机器学习数据集的生产实践
- 关键词: 数据标注, 数据工作, 机器学习, ML数据集, 多样性, 标注员多样性, 数据生产
研究背景与问题
-
作者发现了哪些问题或挑战?
- 数据多样性被认识为负责任人工智能/机器学习(AI/ML)的核心要素,但关于参与标注数据集的标注员的多样性及其影响的研究较少。
- AI/ML 实践中通常忽略了标注员在数据生产中的主观性和多样性,标注员多样性很少被设计为数据集生产的重点考虑。
- 现有的实践受操作性障碍(如标注员招聘过程中的信息透明度缺乏、难以整合标注员的多样性)所限制。
-
为什么这个问题很重要?
- 数据标注是构建机器学习模型的关键环节,而标注员的主观性会影响标签质量并可能导致不公平或不准确的模型。
- 多样性不足可能加剧AI/ML系统中的偏见或不平等。
-
研究动机与相关工作
- 扩展现有文献对标注员多样性影响的理解,结合现有的关于AI系统设计的多样性讨论及人类标注主观性的研究。
- 对标注实践的操作性障碍及其背后的逻辑进行研究,以探索替代性的方法。
解决方案
-
作者提出了哪些方法或解决方案?
- 使用16次半结构化访谈和44份问卷调查,研究AI/ML实践者对标注员多样性的理解与操作化。
- 采用社会理论“存在的体制”作为分析框架,反思现有数据实践逻辑对标注员多样性的忽视。
- 提出重新考虑“准确数据”(Ground Truth)、偏差(Bias)以及多样性(Diversity)的方向。
-
该解决方案的创新之处是什么?
- 不仅关注增加标注员的多样性,还建议从知识方式(epistemic orientation)的角度重新思考数据实践,挑战当前以中立性和客观性为核心的逻辑。
- 结合交叉性(intersectionality)理论,为实现正义导向的多样性提供深度讨论。
-
实施步骤和关键技术
- 研究方法: 采用混合方法,包括调查问卷收集多样性观点和经验,半结构化访谈深入了解实际操作中的挑战。
- 数据分析: 定量分析问卷结果;通过多轮编码和议题归纳对访谈内容进行质性分析。
- 理论框架: 使用“再现主义思想”(representationalist thinking)、“存在体制”以及交叉性理论作为批判和分析的基础。
研究成果
-
取得了哪些具体成果?
- 描述了标注工作流程,其中标注员只是被工具化的“观察者”,其个人视角和背景被以“中立性”为名去除。
- 概括了AI/ML实践中对标注员多样性的三种处理方式:忽视多样性、追求客观标准和试图通过代表性实现“中立呈现”。
- 识别了标注员多样性不足的关键障碍,包括:
- 缺乏标注员背景数据。
- 标注平台与AI开发者间操作分离导致沟通障碍。
- 机器学习开发中优先实现模型性能而忽视多样性的现状。
- 通过现象分析揭示:目前的AI数据实践由“再现主义”逻辑主导,降低了多样性的重要性。
-
与现有解决方案相比,它有哪些优势?
- 从理论上批判并突破现有实践对“客观性”的单一追求。
- 提供正义导向的、包容多样性的实践建议。
-
实验或评估结果是什么?
- 75% 的调查对象认为标注员多样性对数据集质量有重要影响,但很少体现在标注员实际招聘或生产过程中的考量。
- 问卷与访谈揭示了标注任务设计与多样性考虑存在的脱节。
-
局限性与未来方向
- 本研究的样本可能偏向于已经关注多样性的从业者,建议未来研究扩大样本以覆盖更多普遍实践。
- 未来可探讨如何在标注平台与AI开发者间桥接沟通障碍,或通过工具设计支持多样性导向的标注实践。
- 呼吁更多学者检验和试验交叉性中更具挑战性的问题(如动态组群与权力结构)。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 数据标注中,标注者的多样性如何影响数据集的质量和机器学习模型的公平性?分类: 机器学习公平性与数据开发实践同类问题arrow_forward
- 现有的AI/ML数据实践中,是什么阻碍了标注者多样性的纳入?分类: 机器学习公平性与数据开发实践同类问题arrow_forward
- 如何从正义导向的视角重新定义数据的“准确性”和多样性?分类: 机器学习公平性与数据开发实践同类问题arrow_forward
lightbulb
现实痛点
1- AI的数据集标注常忽视标注者多样性,导致模型偏见。分类: 机器学习公平性与数据开发实践同类问题arrow_forward
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3580645
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
荣誉提名
group
作者
3 位作者
sell
研究子方向
可解释人工智能(XAI)、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、Amazon Mechanical Turk 工作者
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文