数据集有政治性吗?计算机视觉数据开发中的学科价值观

最佳论文

数据是机器学习的关键组成部分,该领域依赖数据来训练、验证和测试模型。随着技术能力的提升,机器学习研究在学术界和工业界都蓬勃发展,其中一个主要焦点是计算机视觉。计算机视觉是一个日益与现实世界应用相关的流行机器学习领域,从警务中的人脸识别到自动驾驶汽车的目标检测。鉴于计算机视觉塑造机器学习研究和影响人类生活的倾向,我们试图了解数据集文档编制方面的学科实践——数据如何被收集、策划、注释和打包成供计算机视觉研究者和从业者用于模型调整和开发的数据集。具体而言,我们研究数据集文档传达了哪些关于视觉数据潜在价值观以及计算机视觉作为更大领域实践和目标的信息。本研究收集了约500个计算机视觉数据集的语料库,从中抽取了114份跨不同视觉任务的数据集出版物。通过结构化和主题内容分析,我们记录了一系列关于可接受数据实践、什么是理想数据以及数据构建过程中人类处理方式的价值观。我们讨论了计算机视觉数据集作者如何以牺牲关怀为代价重视效率、以牺牲情境性为代价重视普遍性、以牺牲立场性为代价重视客观性、以及以牺牲数据工作为代价重视模型工作。我们发现的许多被忽视的价值观与社会计算实践相悖。最后,我们就如何更好地将被忽视的价值观纳入数据集创建和策划过程提出了建议。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/64151/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3476058
一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2021
emoji_events
奖项
最佳论文
group
作者
3 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文