每个人都想做模型工作,而不是数据工作:高风险人工智能中的数据级联
最佳论文作者
可解释人工智能(XAI)算法公平与偏见AI/ML 研究员与工程师HCI 研究员
文献标题
“Everyone wants to do the model work, not the data work”: Data Cascades in High-Stakes AI
文献信息
- 主题领域: 高风险人工智能领域的数据质量问题与解决方案。
- 关键词: 数据质量, 人工智能, 机器学习, 高风险领域, 数据级联效应, 人机交互, 数据伦理, 数据收集, 全球南北公平, 数据文档。
研究背景与问题
-
发现的关键问题:
- 数据质量对 AI 系统性能和下游影响的重要性被严重低估。
- 数据工作常被视为“操作性”任务,与开发新模型和算法的工作相比缺乏激励。
- 在高风险领域(如医疗保健、环境保护等),数据质量问题可能对弱势群体和社会产生灾难性的后果。
- 数据的稀缺性和跨学科协作挑战进一步增加了数据质量问题的复杂性。
-
重要性:
- 数据质量问题在高风险领域可能导致错误预测,例如癌症误诊或扶贫计划失败,从而给社会和个人带来重大损失。
- 数据高级质量对 AI 系统的公正性、稳健性、安全性和可扩展性至关重要。
-
研究动机与相关工作:
- 现有的 AI 研究重点往往集中于模型开发,而忽视了数据质量的系统性改善。
- 人机交互(HCI)领域已开始研究数据包装、处理以及协同工作实践,但尚未充分涉及高风险领域的数据问题。
解决方案
-
方法与解决方案:
- 定义并提出了“数据级联效应”(Data Cascades)现象,即由数据问题引发的负面连锁事件,可能逐渐累积技术债务。
- 数据级联效应的特点:复杂、长期、缺乏明确的诊断指标、难以预测,并对系统产生负面影响,如重新迭代或项目中止。
- 对数据质量提出了结构化提升的路径,强调数据文档化、实时监控和跨组织协作。
-
创新之处:
- 研究揭示了高风险 AI 中数据问题的特定触发因素和表现形式。
- 深入探讨了数据级联效应的特点,以及解决这些问题所需的跨学科协作、数据伦理和标准文档化方法。
-
实施步骤与关键技术:
- 通过访谈了解内部和外部数据工作流中的问题,涵盖数据来源、反馈回路、激励结构及上下游影响。
- 提议采用数据质量标准化指标(如现象的保真性和有效性)作为对抗级联效应的系统性工具。
- 调整数据收集实践,与领域专家进行深度合作,确保数据的代表性和可再现性。
研究成果
-
具体成果:
- 发现数据级联效应广泛存在于高风险领域(92% 的受访者至少经历过一次数据级联效应)。
- 概括了四种核心数据级联现象:物理世界不稳定性、应用领域专家知识不足、奖励体系冲突、跨组织文档缺失。
- 提出了数据质量提升的框架,包括教育改革、工具开发以及全球数据公平的倡议。
-
优势与比较:
- 与传统 AI/ML 数据处理方法相比,此研究首次系统性地指出了高风险领域的数据质量问题及其复杂影响。
- 提出的创新性解决方案,如数据感知工具、数据文档标准和良好的跨团队协作实践,能够有效减少数据级联效应。
-
实验与评估结果:
- 数据问题主要集中于项目开发前期(上游阶段),但影响在后期(下游阶段)才显现。
- 通过引入更严格的文档化和监控手段,部分团队成功减少了数据问题带来的负面影响。
-
局限性与未来方向:
- 局限性:
- 由于 COVID-19 的限制,研究未能开展深度的现场工作流观察。
- 性别分布不均反映了 AI 行业的性别失衡问题。
- 未来方向:
- 推动建立跨学科的教学大纲,将数据质量、伦理和人机交互纳入 AI 教育课程。
- 开发新的工具和接口,支持高风险领域的数据收集、管理和监控。
- 支持全球 AI 公平框架,实现数据资源的平等共享和访问。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 数据级联效应(由数据质量问题引发的连锁反应)的触发因素和特征是什么?分类: 人机协同标注与示例选择同类问题arrow_forward
- 高风险领域(如医疗、环境保护)中,如何通过跨组织合作和标准化文档减少数据级联效应的发生?分类: 人机协同标注与示例选择同类问题arrow_forward
- 在人工智能开发中,如何定义和衡量数据质量指标以更好地应对数据问题?分类: 人机协同标注与示例选择同类问题arrow_forward
lightbulb
现实痛点
1- 高风险领域的AI难以规避因数据质量问题导致的错误预测。分类: 人机协同标注与示例选择同类问题arrow_forward
- 100%
文本分类中的公平性评估:机器学习从业者对个体和群体公平性的看法
CHI '23· 可解释人工智能(XAI) +1
- 100%
对机器学习中多重性公平影响的认知
CHI '25· 可解释人工智能(XAI) +1
- 80%
超越专业知识和角色:一个框架来描述可解释机器学习的利益相关者及其需求
CHI '21· 可解释人工智能(XAI) +2
- 80%
用户驱动的价值观对齐:理解用户对AI伴侣中偏见和歧视性陈述的看法及应对策略
CHI '25· 可解释人工智能(XAI) +2
- 80%
不仅仅是营销?关于人工智能基准测试对从业者的信息价值
IUI '25· 可解释人工智能(XAI) +1
- 75%
为算法素养和透明度设计交互式可解释人工智能工具
DIS '24· 可解释人工智能(XAI) +1
- 75%
会话式解释:与非AI专家讨论可解释AI
IUI '25· 可解释人工智能(XAI)
- 67%
表达方式会影响决策吗?探讨AI解释语气对决策制定的影响
CHI '25· 可解释人工智能(XAI) +2
- 67%
解释模型:一项关于解释如何影响公平性判断的实证研究
IUI '19· 可解释人工智能(XAI) +2
- 67%
解释对人类-AI决策公平性的影响:保护特征与代理特征
IUI '24· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445518
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
最佳论文
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文