走钢丝般的透明度:基础模型数据透明度的风险与收益分类法(为透明度倡导者)

可解释人工智能(XAI)算法透明度与可审计性隐私设计与用户控制隐私政策制定者AI/ML 研究员与工程师HCI 研究员

文献标题

Treading the Transparency Tightrope: A Taxonomy of Risks and Benefits of Foundation Model Data Transparency for Transparency Advocates

出版信息

  • 主题领域: 基础模型(FMs)数据透明性的风险与收益。
  • 关键词: 人工智能数据透明性、基础模型、数据集文档化、数据集可用性、透明性风险、透明性收益、利益相关者分析、负责任的人工智能、情境透明性、透明性分类法。

背景与问题

  • 问题/挑战: 基础模型(FMs)所使用数据集的不透明性阻碍了对其潜在危害、问责机制和创新的独立分析。目前的透明性需求通常缺乏对具体收益或风险的明确说明,导致其实际相关性受到批评。
  • 重要性: 透明性对于解决人工智能中的伦理、法律和社会问题至关重要,例如隐私泄露、知识产权侵权和公平性问题。然而,不加批判的透明性也可能引入诸如安全隐患和竞争劣势等风险。
  • 动机与相关工作: 现有研究强调了人工智能系统透明性的必要性,但通常将透明性视为固有的优点,而未考虑其情境性。本研究基于批判性透明性研究和利益相关者分析,填补这一空白。

解决方案

  • 提出的方法: 提出一种人工智能数据透明性的风险与收益分类法,强调考虑利益相关者立场和透明性形式的情境透明性。
  • 创新点:
    1. 识别了数据透明性的四种风险(污染、竞争力、安全性、审查)和四种收益(问责制、创新性、完整性、适用性)。
    2. 引入了影响透明性认知的两个关键因素:利益相关者立场(支持与反对)和透明性形式(数据文档化与数据可用性)。
    3. 概念化情境数据透明性,以平衡风险与收益。
    4. 为透明性倡导者提供优化收益并减轻风险的实际考量。
  • 方法与关键技术:
    1. 系统性抽样153个来源,包括学术论文、非政府组织报告、法律框架和基础模型开发者文档。
    2. 通过定性编码识别透明性的风险与收益,并将其聚类为更高层次的主题类别。
    3. 分析利益相关者立场、透明性形式与感知风险/收益之间的相互作用。

结果

  • 具体发现:
    • 风险: 污染(5.2%的来源)、竞争力(23.5%)、安全性(39.2%)、审查(17.6%)。
    • 收益: 问责制(35.9%)、创新性(34%)、完整性(47.1%)、适用性(9.2%)。
    • 风险与收益受利益相关者立场和透明性形式的影响。
  • 相较基线的优势: 提供了一个细致入微的框架,将透明性视为一种情境性特征,而非固有的优劣,从而支持更具战略性的倡导。
  • 实验/评估: 分析了多样化的利益相关者文档,包括研究人员、非政府组织、法律与政策领导者以及基础模型开发者。通过编码和主题分析得出了分类法。
  • 局限性与未来工作:
    • 对数据主体和社区开发者等代表性不足的利益相关者的覆盖有限。
    • 关注于英语来源和英语语境。
    • 未来研究应对分类法进行实证验证,探索更多风险/收益,并研究不断变化的监管影响。

总结

本文提出了与人工智能数据透明性相关的四种风险(污染、竞争力、安全性、审查)和四种收益(问责制、创新性、完整性、适用性)的分类法。引入了两个关键因素——利益相关者立场(支持与反对)和透明性形式(数据文档化与数据可用性)——以将透明性情境化。该分类法为情境数据透明性提供了框架,使倡导者能够根据具体目标和情境平衡收益与风险。本研究为透明性倡导者提供了实际指导,并为未来关于负责任的人工智能数据实践的研究奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223313/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790364
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、算法透明度与可审计性、隐私设计与用户控制
work
职业/产业
隐私政策制定者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文