理解机器学习从业者的数据文档感知、需求、挑战与愿望

数据是机器学习模型开发和评估的核心。然而,使用有问题的或不适当的数据集会在部署模型时造成伤害。为了通过更审慎地反思数据集及其创建过程的透明度来促进负责任的人工智能实践,研究者和从业者开始倡导加强数据文档,并提出了几个数据文档框架。然而,关于这些数据文档框架是否满足机器学习从业者的需求(他们既是数据的创建者也是数据的消费者),研究甚少。为了解决这一差距,我们着手了解机器学习从业者的数据文档感知、需求、挑战与愿望,最终目标是得出可inform未来数据文档框架的设计要求。我们与一家大型国际科技公司的14名机器学习从业者进行了半结构化访谈。我们让他们回答了来自数据集文档表的问题。我们的发现表明,当前数据文档方法在性质上大多是临时性的和短视的。参与者表示,数据文档框架需要适应他们的上下文,集成到他们现有的工具和工作流程中,并尽可能自动化。尽管数据文档框架的动机通常来自负责任人工智能的视角,但参与者并未将他们被要求回答的问题与负责任人工智能的含义联系起来。此外,参与者在优先考虑数据集消费者的需求以及提供不熟悉其数据集的人可能需要的信息方面经常存在困难。基于这些发现,我们为未来数据文档框架提出了七个设计要求,例如提供关于数据集特征如何可能导致伤害以及如何缓解这些伤害的更具操作性的指导、更多明确的反思提示、自动化适应不同上下文,以及集成到机器学习从业者现有的工具和工作流程中。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/87965/2022

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文