“我觉得这很公平”:揭示AI公平性评估中利益相关者决策的复杂性

AI 伦理、公平与问责可解释人工智能(XAI)算法公平与偏见AI/ML 研究员与工程师个人理财用户隐私政策制定者

文献标题

"I think this is fair": Uncovering the Complexities of Stakeholder Decision-Making in AI Fairness Assessment

出版信息

  • 主题领域: AI公平性评估中的利益相关者参与
  • 关键词: AI公平性、利益相关者决策、结果公平性、公平性指标、公平性阈值、人机交互AI、参与式设计、信用评级、定性研究、公平性治理

背景与问题

  • 问题/挑战: 当前AI公平性评估实践主要由专家主导,重点集中在技术指标和法律保护特征上,往往忽视了直接受AI决策影响的非专家利益相关者的观点。
  • 意义: 包括多样化的利益相关者观点对于使AI公平性与社会价值观保持一致、提高透明度以及缓解公众对AI系统的不信任问题至关重要。
  • 动机与相关研究: 之前的研究探讨了公平性指标和专家驱动的工具,但未能充分纳入普通利益相关者的声音。这一缺口限制了AI系统反映更广泛以人为中心的公平性关切的能力。

解决方案

  • 提出的方法: 一个参与式公平性评估框架,允许普通利益相关者在信用评级场景中选择特征、将特征与公平性指标配对并设置公平性阈值。
  • 创新点:
    1. 提供实证证据,展示普通利益相关者如何在特征、指标和阈值上评估AI公平性。
    2. 揭示非保护性特征的重要性以及对定制公平性指标的需求。
    3. 为设计使非专家能够进行公平性评估的工具提供设计启示。
  • 流程与关键技术:
    • 使用交互式原型系统对26名非专家参与者进行了定性研究。
    • 任务包括特征选择与排序、特征与指标配对设置阈值以及公平性重新排序。
    • 使用德国信用数据集和逻辑回归模型提供一个现实且可解释的AI决策背景。

结果

  • 具体发现:
    • 参与者选择了广泛的特征(平均值=6.15,标准差=2.30),包括保护性特征(如性别、年龄)和非保护性特征(如电话、受抚养人)。
    • 反事实公平性(31次选择)和定制公平性(28次选择)是最常被选择的指标,而人口统计平等未被任何参与者选择。
    • 公平性阈值比典型AI专家标准更严格,通常低于6%的最佳公平性偏差。
  • 相较基线的优势:
    • 考虑的特征范围更广,相较于通常仅关注法律保护特征的AI专家。
    • 动态且情境特定的指标选择和阈值设置,与AI专家的“一刀切”方法形成对比。
  • 实验/评估:
    • 参与者在信用评级场景中使用一个包含因果图、指标解释和交互式可视化功能的原型系统。
    • 数据收集包括思维大声说协议、屏幕录制和任务后调查问卷。
  • 局限性与未来工作:
    • 仅限于单一利益相关者类型和信用评级场景;未来研究应涉及多样化的角色和领域。
    • 原型未实现定制指标的操作化;未来工具应支持其实施和集成。
    • 未探讨其他公平性视角(如程序公平性、通过忽略实现的公平性)。

总结

本研究揭示了AI系统中普通利益相关者公平性决策的复杂性。参与者表现出比AI专家更广泛且更细致的公平性考量,选择多样化的特征、根据特征定制指标并设置严格的公平性阈值。研究结果强调了需要以人为中心的工具,使利益相关者能够表达并操作化其公平性期望。未来工作应扩展到多样化的场景和利益相关者角色,同时解决将定制公平性指标集成到AI系统中的挑战。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223372/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790770
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
AI 伦理、公平与问责、可解释人工智能(XAI)、算法公平与偏见
work
职业/产业
AI/ML 研究员与工程师、个人理财用户、隐私政策制定者
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文