新兴数据实践:大型语言模型时代的数据工作

生成式AI(文本、图像、音乐、视频)AI 伦理、公平与问责算法公平与偏见数据科学家与分析师AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 问题与挑战: 作者发现,在大型语言模型(LLMs)快速发展和广泛应用的背景下,关于如何构建和管理这些模型所需的数据集存在重大挑战。这些挑战包括数据不确定性、大规模数据需求、生成式 AI 的伦理和法律问题,以及开发进程中的快速迭代。
  • 重要性: 数据是人工智能发展的基础,而LLMs的能力很大程度依赖于数据。这不仅影响模型的性能,还可能带来社会偏见、隐私问题、知识产权纠纷和其他社会风险。因此,理解数据处理实践对设计更负责任和安全的人工智能至关重要。
  • 研究动机与相关工作:
    • LLM 的数据需求规模庞大、类型广泛,且在当前技术和法律框架下许多定义和标准尚未形成共识。
    • 相关领域的学术研究强调,全面研究从业者的数据实践可为解决生成式 AI 的风险问题提供重要洞察。

解决方案

  • 提出的方法:
    • 作者通过半结构化访谈,与来自一家跨国 IT 公司参与不同开发阶段的 25 位从业者进行深入对话,探讨他们的数据处理实践。
    • 研究关注以下三个开发阶段中的数据实践:
      1. 数据治理的定义和操作化。
      2. 预训练与微调阶段内的数据处理。
      3. 后训练阶段使用合成数据生成和评估模型。
  • 创新之处:
    • 提供了关于LLM开发周期中数据处理变化的实证性分析。
    • 研究揭示了从业者如何在不确定性中依赖情境资源(如法律法规、专家指导)推动模型开发。
    • 探讨了LLMs的独特特性如何影响数据实践及其未来的技术和社会影响。
  • 实施步骤:
    1. 招募具有数据处理经验的从业者并设计专门的访谈协议。
    2. 以归纳法进行主题分析,分类提取数据实践相关的挑战和依赖机制。
    3. 将研究结果与人机交互(HCI)领域的前沿问题相结合,提出支持从业者的研究机会。

研究成果

  • 具体成果:
    • 描述了在不同LLM开发阶段中数据处理实践的转变与关键决策点。
    • 强调了从业者如何应对不确定性,例如通过标准化流程、专家协作以及辅助LLM技术实现目标。
    • 阐明了LLMs的独特特性(如规模化需求和伦理模糊性)对数据实践的深层影响。
  • 与现有解决方案相比的优势:
    • 更加深入地分析了生成式 AI 数据工作的复杂性和临界问题,例如伦理影响和技术决策的社会后果。
    • 提供了操作性较强的具体建议,支持从业者应对大规模、不确定性和复杂性。
  • 实验或评估结果: 拆解了每个开发阶段中典型的数据实践,揭示了不确定性如何影响这些阶段的操作。
  • 局限性与未来方向:
    • 由于数据工作的复杂性,可能还有未探索的细节和实践。
    • 本研究以一家跨国公司为背景,未能覆盖小型企业或其他产业的实践。
    • 未来研究可关注行业间横向比较,加强对生成式 AI 社会影响的综合理解。研究者也可进一步探索支持从业者提高数据透明性和追踪性的工具与框架。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188816/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714069
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文