从反思到修复:数据集文档工具的范围综述

可解释人工智能(XAI)研究伦理与开放科学AI 辅助决策与自动化系统算法透明度与可审计性AI/ML 研究员与工程师HCI 研究员数据科学家与分析师

文献标题

From Reflection to Repair: A Scoping Review of Dataset Documentation Tools

出版信息

  • 主题领域: 面向负责任人工智能的数据集文档工具及其设计、采用和集成挑战。
  • 关键词: 数据集文档、负责任人工智能、透明性、问责性、数据集工具、人机交互、自动化、数据集基础设施、利益相关方参与、数据集标准化。

背景与问题

  • 问题/挑战: 尽管数据集文档工具迅速增多,但其采用和标准化仍然有限。这些工具通常在其价值的操作化方面缺乏清晰性,脱离上下文,增加劳动负担,并将集成视为未来的目标。
  • 重要性: 有效的数据集文档对于人工智能系统的透明性、问责性以及减轻偏见至关重要。如果无法广泛采用,这些目标将无法实现,从而在高风险人工智能应用中面临伦理和实际失败的风险。
  • 动机与相关研究: 先前研究强调了数据集文档对负责任人工智能的重要性,但尚未系统地探讨这些工具的动机、设计选择及采用障碍。本文通过分析59篇关于数据集文档工具的学术文献,填补了这一空白。

解决方案

  • 提出的方法: 对数据集文档工具进行范围性综述,研究其动机、概念化及集成努力,并提出从个人设计策略转向机构设计策略的建议。
  • 创新点:
    1. 系统识别数据集文档工具中的差距和共同点。
    2. 通过混合方法表征多样化目标和设计如何导致文档价值的碎片化。
    3. 提出支持机构化文档实践的人机交互研究议程。
  • 步骤与关键技术:
    • 使用PRISMA指南对59篇文献进行范围性综述。
    • 通过反思性主题分析研究工具的目标、概念化及集成努力。
    • 按类型、自动化程度及目标受众对工具进行分类。

结果

  • 具体发现:
    • 工具对文档的概念化多样化,包括为数据集创建者提供反思、为数据集使用者提供审查,以及修复数据集基础设施。
    • 大多数工具为手动(n=25),但混合型(n=17)和自动化(n=9)工具呈增长趋势。
    • 利益相关方参与极少,仅有2个工具在设计中融入了利益相关方的意见。
  • 相较基线的优势:
    • 识别工具设计和采用中的系统性问题,并提供可操作的洞见以改善标准化和集成。
  • 实验/评估:
    • 工具被分为七种类型(如数据表、框架、应用程序),并根据其设计动机、用户参与及集成策略进行分析。
    • 评估研究较少,大多数工具缺乏有效性的实证证据。
  • 局限性与未来工作:
    • 研究仅关注公开可用的工具,未涉及私营部门的文档实践。
    • 呼吁开展实证研究以衡量文档对透明性和问责性的影响。
    • 提出人机交互研究议程以解决学术界与工业界之间的系统性错位。

摘要

本文系统性地综述了59种数据集文档工具,揭示了采用中的四大障碍:概念化碎片化、设计脱离上下文、劳动负担以及集成努力停留在愿景层面。研究发现学术界工具设计与工业需求之间存在错位,这种情况因缺乏利益相关方参与和实证验证而加剧。作者建议从个人导向转向机构支持的文档实践,强调人机交互在弥合学术界与工业界差距中的作用。本文为推进负责任人工智能领域数据集文档工具的设计、标准化和集成提供了可操作的洞见。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223133/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791344
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
可解释人工智能(XAI)、研究伦理与开放科学、AI 辅助决策与自动化系统、算法透明度与可审计性
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文