解释性去偏差:在数据生成过程中涉及领域专家以减轻AI系统中的表示偏差

荣誉提名
AI 伦理、公平与问责算法公平与偏见医生、护士、临床医生软件工程师与开发者AI/ML 研究员与工程师HCI 研究员

研究背景与问题

  • 问题与挑战: 作者识别了人工智能(AI)系统中**代表性偏差(Representation Bias)**这一常见问题。训练数据中亚群体的样本稀少导致AI模型在这些群体上的预测表现较差。此外,目前的去偏方法多依赖数据扩增技术,但这些算法会保留甚至放大原始数据中的现有偏差,还可能生成不符合现实的非合理样本。

  • 重要性: 代表性偏差影响AI系统的准确性、公平性及可推广性,尤其在医疗等高风险领域。有偏的数据可能导致决策中的歧视性结果,例如皮肤病诊断模型对深肤色患者表现较差。

  • 研究动机与相关工作: 尽管已有研究提出加入数据扩增来加强少数群体的代表性,这些方法常因缺乏领域知识而无法妥善解决问题。通过领域专家的介入,可以利用其专业知识识别数据问题并确保生成样本与实际观察一致。然而,对领域专家参与去偏过程的研究尚属薄弱,特别是针对用户研究的不足,限制了这一领域的探索。


解决方案

  • 提出的方法: 作者提出了一组通用设计指南,旨在将领域专家纳入数据扩增和去偏过程中。这些指南分为三个核心阶段:

    1. 数据扩增前阶段(Pre-Augmentation):通过直观的数据解释和分析,帮助领域专家识别代表性偏差。
    2. 数据扩增阶段(During Augmentation):专家能参与样本生成,提供约束以指导数据扩增算法。
    3. 数据扩增后阶段(Post-Augmentation):通过筛选和验证生成数据,确保其符现实性并提升数据质量。
  • 创新之处: 作者将具有针对性和解释性的用户交互方法与生成数据控制相结合,首次系统性地为领域专家参与去偏过程提出具体指导。尤其在医疗领域,整合了数据中心解释(Data-Centric Explanations)和个案级“假设探索”(What-If Exploration),强调由领域知识驱动的交互和验证。

  • 实施步骤与技术:

    • 在去偏前,利用交互式数据可视化和模型影响分析,帮助专家理解偏差如何影响模型性能。
    • 在数据扩增时,允许专家根据变量定义特定约束(如变量的联合影响范围),并针对亚群体生成样本。
    • 在数据扩增后,提供样本筛查工具和“假设探索”功能,允许领域专家验证并优化生成数据。
    • 开发了基于CTGAN生成对抗网络的医疗应用,用以预测2型糖尿病。

研究成果

  • 具体成果:

    1. 提出了可在多领域适用的通用设计指南,并在医疗场景下进行了原型实现和验证。
    2. 用户研究结果表明,领域专家的参与可以显著降低代表性偏差,同时不影响模型性能。
    3. 研究还设计了开源的代码架构与实现,使开发者能更轻松地应用这些方法。
  • 与现有解决方案的对比优势:

    • 与单纯依赖数据扩增算法的传统方法相比,该方法通过加入领域知识显著提高生成样本的真实性和模型的公平性。
    • 专家参与进一步揭示了原始训练集和生成数据中潜在的隐性关联(如特征间的真实世界关系)。
  • 实验与评估结果:

    1. 模型性能改善:与默认模型和不引入领域知识的自动化方法相比,专家介入后模型准确率平均提升了2.1%。
    2. 代表性偏差降低:31名专家通过交互式工具有效改善了样本的代表性率和覆盖率。
    3. 领域专家信任度提升:实验结果显示,专家在理解偏差后对AI系统的信任感提升了约7%。
  • 局限性与未来方向:

    1. 生成数据体量未设置限制,生成过多样本可能导致性能问题。
    2. 当前用户界面缺乏对生成数据的全局检查功能。未来设计应增强数据可视化和自动化数据验证能力。
    3. 本研究聚焦医疗数据,未来需验证在其他领域(如金融、法规)及非结构化数据(如图像、文本)上的适用性。

总结:

通过引入领域专家并提出了系统的设计指导,本研究在缓解AI系统代表性偏差方面迈出了重要一步。这为建立公平、透明的AI系统做出了贡献,并为未来研究与实践奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188455/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713497
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
荣誉提名
group
作者
4 位作者
sell
研究子方向
AI 伦理、公平与问责、算法公平与偏见
work
职业/产业
医生、护士、临床医生、软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文