从反思到修复:数据集文档工具的范围综述
作者
可解释人工智能(XAI)研究伦理与开放科学AI 辅助决策与自动化系统算法透明度与可审计性AI/ML 研究员与工程师HCI 研究员数据科学家与分析师
文献标题
From Reflection to Repair: A Scoping Review of Dataset Documentation Tools
出版信息
- 主题领域: 面向负责任人工智能的数据集文档工具及其设计、采用和集成挑战。
- 关键词: 数据集文档、负责任人工智能、透明性、问责性、数据集工具、人机交互、自动化、数据集基础设施、利益相关方参与、数据集标准化。
背景与问题
- 问题/挑战: 尽管数据集文档工具迅速增多,但其采用和标准化仍然有限。这些工具通常在其价值的操作化方面缺乏清晰性,脱离上下文,增加劳动负担,并将集成视为未来的目标。
- 重要性: 有效的数据集文档对于人工智能系统的透明性、问责性以及减轻偏见至关重要。如果无法广泛采用,这些目标将无法实现,从而在高风险人工智能应用中面临伦理和实际失败的风险。
- 动机与相关研究: 先前研究强调了数据集文档对负责任人工智能的重要性,但尚未系统地探讨这些工具的动机、设计选择及采用障碍。本文通过分析59篇关于数据集文档工具的学术文献,填补了这一空白。
解决方案
- 提出的方法: 对数据集文档工具进行范围性综述,研究其动机、概念化及集成努力,并提出从个人设计策略转向机构设计策略的建议。
- 创新点:
- 系统识别数据集文档工具中的差距和共同点。
- 通过混合方法表征多样化目标和设计如何导致文档价值的碎片化。
- 提出支持机构化文档实践的人机交互研究议程。
- 步骤与关键技术:
- 使用PRISMA指南对59篇文献进行范围性综述。
- 通过反思性主题分析研究工具的目标、概念化及集成努力。
- 按类型、自动化程度及目标受众对工具进行分类。
结果
- 具体发现:
- 工具对文档的概念化多样化,包括为数据集创建者提供反思、为数据集使用者提供审查,以及修复数据集基础设施。
- 大多数工具为手动(n=25),但混合型(n=17)和自动化(n=9)工具呈增长趋势。
- 利益相关方参与极少,仅有2个工具在设计中融入了利益相关方的意见。
- 相较基线的优势:
- 识别工具设计和采用中的系统性问题,并提供可操作的洞见以改善标准化和集成。
- 实验/评估:
- 工具被分为七种类型(如数据表、框架、应用程序),并根据其设计动机、用户参与及集成策略进行分析。
- 评估研究较少,大多数工具缺乏有效性的实证证据。
- 局限性与未来工作:
- 研究仅关注公开可用的工具,未涉及私营部门的文档实践。
- 呼吁开展实证研究以衡量文档对透明性和问责性的影响。
- 提出人机交互研究议程以解决学术界与工业界之间的系统性错位。
摘要
本文系统性地综述了59种数据集文档工具,揭示了采用中的四大障碍:概念化碎片化、设计脱离上下文、劳动负担以及集成努力停留在愿景层面。研究发现学术界工具设计与工业需求之间存在错位,这种情况因缺乏利益相关方参与和实证验证而加剧。作者建议从个人导向转向机构支持的文档实践,强调人机交互在弥合学术界与工业界差距中的作用。本文为推进负责任人工智能领域数据集文档工具的设计、标准化和集成提供了可操作的洞见。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 86%
RELIC:使用自我一致性调查大型语言模型的响应
CHI '24· 可解释人工智能(XAI) +2
- 86%
Comparables XAI:具有反事实轨迹调整的忠实基于示例的人工智能解释
CHI '26· 可解释人工智能(XAI) +2
- 86%
可迁移的可解释人工智能:通过解释迁移建立跨领域理解
IUI '26· 可解释人工智能(XAI) +2
- 75%
Vipera:融合视觉与LLM驱动的引导以实现文本到图像生成AI的系统性审计
CHI '26· 可解释人工智能(XAI) +3
- 71%
解释作为支持算法透明度的机制
CHI '18· 可解释人工智能(XAI) +1
- 71%
可解释、可问责和可理解系统的趋势与轨迹:一项HCI研究议程
CHI '18· 可解释人工智能(XAI) +2
- 63%
色域:一项设计探针以理解数据科学家如何理解机器学习模型
CHI '19· 可解释人工智能(XAI) +2
- 63%
解释可解释性:理解数据科学家对机器学习可解释性工具的使用
CHI '20· 可解释人工智能(XAI) +2
- 63%
通过设计研究人工智能的可读性
CHI '20· 可解释人工智能(XAI) +2
- 63%
没有问责制就没有可解释性:交互式机器学习中解释和反馈的经验研究
CHI '20· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791344
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
可解释人工智能(XAI)、研究伦理与开放科学、AI 辅助决策与自动化系统、算法透明度与可审计性
work
职业/产业
AI/ML 研究员与工程师、HCI 研究员、数据科学家与分析师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文