每个人都想做模型工作,而不是数据工作:高风险人工智能中的数据级联

最佳论文
可解释人工智能(XAI)算法公平与偏见AI/ML 研究员与工程师HCI 研究员

文献标题

“Everyone wants to do the model work, not the data work”: Data Cascades in High-Stakes AI

文献信息

  • 主题领域: 高风险人工智能领域的数据质量问题与解决方案。
  • 关键词: 数据质量, 人工智能, 机器学习, 高风险领域, 数据级联效应, 人机交互, 数据伦理, 数据收集, 全球南北公平, 数据文档。

研究背景与问题

  • 发现的关键问题:

    • 数据质量对 AI 系统性能和下游影响的重要性被严重低估。
    • 数据工作常被视为“操作性”任务,与开发新模型和算法的工作相比缺乏激励。
    • 在高风险领域(如医疗保健、环境保护等),数据质量问题可能对弱势群体和社会产生灾难性的后果。
    • 数据的稀缺性和跨学科协作挑战进一步增加了数据质量问题的复杂性。
  • 重要性:

    • 数据质量问题在高风险领域可能导致错误预测,例如癌症误诊或扶贫计划失败,从而给社会和个人带来重大损失。
    • 数据高级质量对 AI 系统的公正性、稳健性、安全性和可扩展性至关重要。
  • 研究动机与相关工作:

    • 现有的 AI 研究重点往往集中于模型开发,而忽视了数据质量的系统性改善。
    • 人机交互(HCI)领域已开始研究数据包装、处理以及协同工作实践,但尚未充分涉及高风险领域的数据问题。

解决方案

  • 方法与解决方案:

    • 定义并提出了“数据级联效应”(Data Cascades)现象,即由数据问题引发的负面连锁事件,可能逐渐累积技术债务。
    • 数据级联效应的特点:复杂、长期、缺乏明确的诊断指标、难以预测,并对系统产生负面影响,如重新迭代或项目中止。
    • 对数据质量提出了结构化提升的路径,强调数据文档化、实时监控和跨组织协作。
  • 创新之处:

    • 研究揭示了高风险 AI 中数据问题的特定触发因素和表现形式。
    • 深入探讨了数据级联效应的特点,以及解决这些问题所需的跨学科协作、数据伦理和标准文档化方法。
  • 实施步骤与关键技术:

    • 通过访谈了解内部和外部数据工作流中的问题,涵盖数据来源、反馈回路、激励结构及上下游影响。
    • 提议采用数据质量标准化指标(如现象的保真性和有效性)作为对抗级联效应的系统性工具。
    • 调整数据收集实践,与领域专家进行深度合作,确保数据的代表性和可再现性。

研究成果

  • 具体成果:

    • 发现数据级联效应广泛存在于高风险领域(92% 的受访者至少经历过一次数据级联效应)。
    • 概括了四种核心数据级联现象:物理世界不稳定性、应用领域专家知识不足、奖励体系冲突、跨组织文档缺失。
    • 提出了数据质量提升的框架,包括教育改革、工具开发以及全球数据公平的倡议。
  • 优势与比较:

    • 与传统 AI/ML 数据处理方法相比,此研究首次系统性地指出了高风险领域的数据质量问题及其复杂影响。
    • 提出的创新性解决方案,如数据感知工具、数据文档标准和良好的跨团队协作实践,能够有效减少数据级联效应。
  • 实验与评估结果:

    • 数据问题主要集中于项目开发前期(上游阶段),但影响在后期(下游阶段)才显现。
    • 通过引入更严格的文档化和监控手段,部分团队成功减少了数据问题带来的负面影响。
  • 局限性与未来方向:

    • 局限性:
      • 由于 COVID-19 的限制,研究未能开展深度的现场工作流观察。
      • 性别分布不均反映了 AI 行业的性别失衡问题。
    • 未来方向:
      • 推动建立跨学科的教学大纲,将数据质量、伦理和人机交互纳入 AI 教育课程。
      • 开发新的工具和接口,支持高风险领域的数据收集、管理和监控。
      • 支持全球 AI 公平框架,实现数据资源的平等共享和访问。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47578/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445518
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
最佳论文
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文