新兴数据实践:大型语言模型时代的数据工作
作者
生成式AI(文本、图像、音乐、视频)AI 伦理、公平与问责算法公平与偏见数据科学家与分析师AI/ML 研究员与工程师HCI 研究员
研究背景与问题
- 问题与挑战: 作者发现,在大型语言模型(LLMs)快速发展和广泛应用的背景下,关于如何构建和管理这些模型所需的数据集存在重大挑战。这些挑战包括数据不确定性、大规模数据需求、生成式 AI 的伦理和法律问题,以及开发进程中的快速迭代。
- 重要性: 数据是人工智能发展的基础,而LLMs的能力很大程度依赖于数据。这不仅影响模型的性能,还可能带来社会偏见、隐私问题、知识产权纠纷和其他社会风险。因此,理解数据处理实践对设计更负责任和安全的人工智能至关重要。
- 研究动机与相关工作:
- LLM 的数据需求规模庞大、类型广泛,且在当前技术和法律框架下许多定义和标准尚未形成共识。
- 相关领域的学术研究强调,全面研究从业者的数据实践可为解决生成式 AI 的风险问题提供重要洞察。
解决方案
- 提出的方法:
- 作者通过半结构化访谈,与来自一家跨国 IT 公司参与不同开发阶段的 25 位从业者进行深入对话,探讨他们的数据处理实践。
- 研究关注以下三个开发阶段中的数据实践:
- 数据治理的定义和操作化。
- 预训练与微调阶段内的数据处理。
- 后训练阶段使用合成数据生成和评估模型。
- 创新之处:
- 提供了关于LLM开发周期中数据处理变化的实证性分析。
- 研究揭示了从业者如何在不确定性中依赖情境资源(如法律法规、专家指导)推动模型开发。
- 探讨了LLMs的独特特性如何影响数据实践及其未来的技术和社会影响。
- 实施步骤:
- 招募具有数据处理经验的从业者并设计专门的访谈协议。
- 以归纳法进行主题分析,分类提取数据实践相关的挑战和依赖机制。
- 将研究结果与人机交互(HCI)领域的前沿问题相结合,提出支持从业者的研究机会。
研究成果
- 具体成果:
- 描述了在不同LLM开发阶段中数据处理实践的转变与关键决策点。
- 强调了从业者如何应对不确定性,例如通过标准化流程、专家协作以及辅助LLM技术实现目标。
- 阐明了LLMs的独特特性(如规模化需求和伦理模糊性)对数据实践的深层影响。
- 与现有解决方案相比的优势:
- 更加深入地分析了生成式 AI 数据工作的复杂性和临界问题,例如伦理影响和技术决策的社会后果。
- 提供了操作性较强的具体建议,支持从业者应对大规模、不确定性和复杂性。
- 实验或评估结果: 拆解了每个开发阶段中典型的数据实践,揭示了不确定性如何影响这些阶段的操作。
- 局限性与未来方向:
- 由于数据工作的复杂性,可能还有未探索的细节和实践。
- 本研究以一家跨国公司为背景,未能覆盖小型企业或其他产业的实践。
- 未来研究可关注行业间横向比较,加强对生成式 AI 社会影响的综合理解。研究者也可进一步探索支持从业者提高数据透明性和追踪性的工具与框架。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在大语言模型(LLMs)的开发中,数据治理和处理的主要挑战是什么?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 不同开发阶段的数据实践如何受到LLMs特性的影响?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 从业者如何应对数据处理中的不确定性,以推动LLMs的发展?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
lightbulb
现实痛点
1- 从业者难以管理开发LLMs所需的大规模且复杂的数据。分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 71%
AI能否成为道德受害者?道德能动性与所有权感知在AI生成内容使用伦理判断中的作用
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 71%
人工智能生成图像中残障偏见的评估界面支持
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
开源公平性工具包的现状与空白
CHI '21· AI 伦理、公平与问责 +1
- 67%
走向实践中的公平性:评估公平机器学习工具包的实践者导向标准
CHI '21· AI 伦理、公平与问责 +1
- 67%
陪审团学习:将不同意见整合到机器学习模型中
CHI '22· AI 伦理、公平与问责 +1
- 67%
有能力但不道德?比较AI和人类专家在道德决策中的合作
CHI '22· AI 伦理、公平与问责 +1
- 67%
脱离上下文:调查“人工智能作为服务”的偏见和公平性问题
CHI '23· AI 伦理、公平与问责 +1
- 67%
这目前是杂乱无章的:考察AI/ML从业者在负责任的AI价值观共同生产过程中的挑战
CHI '23· AI 伦理、公平与问责 +1
- 67%
STILE:探索和调试预训练文本表示中的社会偏见
CHI '24· AI 伦理、公平与问责 +1
- 67%
负责任数据科学行为改变干预的设计空间
IUI '25· AI 伦理、公平与问责 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714069
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
数据科学家与分析师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文