模型可解释性和结果反馈对AI信任的影响

可解释人工智能(XAI)AI 辅助决策与自动化系统

文献标题

Impact of Model Interpretability and Outcome Feedback on Trust in AI

文献信息

  • 主题领域: 人机交互 (HCI)、人工智能信任和协作性能
  • 关键词: 人机系统, 混合智能, 机器学习, AI信任, 人类实验, AI辅助决策, 可解释性AI, 结果反馈

研究背景与问题

  • 发现问题或挑战: 人工智能在多领域表现优质,但用户并未广泛采纳。这种对算法的抗拒被称为“算法厌恶”(algorithm aversion),可能源于两个主要因素:其一是缺乏可解释性;其二是对模型性能缺乏信任。

  • 重要性: 开发有效的AI系统不仅需要高性能,还需要让用户信任该系统,进而实际采用并受益于AI建议。信任不仅能够推动AI技术的普及,还能增强人类与AI协作的效果。

  • 研究动机与相关工作: 过去研究探讨了可解释性对用户信任的影响,但结果并不一致。有些研究发现可解释性可以提高用户信任,而另一些则发现其作用有限。此外,与模型性能相关的信息(如准确率或错误率)也受到关注。本研究旨在比较这两类因素,即可解释性和结果反馈对用户信任和协作性能的影响。

解决方案

  • 提出的解决方案: 通过预注册的实验设计,研究AI模型的可解释性和结果反馈如何分别影响用户任务表现和对AI的信任。

  • 创新之处:

    • 首次比较了可解释性和结果反馈这两组因素对AI信任和协作性能的综合影响,并探讨它们间的交互作用。
    • 使用“建议权重”(Weight of Advice, WoA)作为行为信任的测量方式,以分离用户信任与模型准确度的影响。
  • 实施步骤:

    1. 实验设计采用两阶段任务:第一阶段让参与者在无AI建议帮助下完成预测任务;第二阶段参与者接收AI预测并可以调整自身预测。
    2. 设置六种实验情况,分别结合不同类型可解释性(无可解释性、全局可解释性、局部可解释性)与结果反馈(有反馈或无反馈)。
    3. 使用真实数据(速度约会数据集)训练AI模型,并对参与者进行随机分组以确保实验结果的稳定性。

研究成果

  • 具体成果:

    1. 信任: 结果反馈对用户行为信任(WoA)的影响明显高于可解释性。无论是全局可解释性还是局部可解释性,并未显著提高信任。
    2. 协作性能: 结果反馈提升了用户任务表现,但其提升幅度远低于对信任的影响。可解释性未显著提高任务表现。
  • 与现有解决方案比较: 本研究挑战了传统观点,即可解释性是提升AI信任的关键。发现结果反馈可能是提高AI可信度和采用率的更有效方法。

  • 实验或评估结果:

    • 在接受结果反馈的情况下,用户倾向于信任AI建议,但也更容易出现过度信任(overshooting)或欠信任(contradicting),从而引发“信任-性能悖论”。
    • 时间趋势分析表明,当用户发现AI建议降低其表现时,后续对AI建议的信任显著下降,这进一步削弱了协作效率。
  • 局限性与未来方向:

    • 研究集中在一个特定情境(速度约会预测任务),需要进一步验证不同情境下结果反馈与可解释性的影响。
    • 本研究仅测试了有限种类的可解释性展示形式,未来可探索“对比性解释”或“反事实解释”等其他形式。
    • 未来研究可综合使用行为信任(WoA)和信任校准(Trust Calibration)指标,以更系统性地理解AI信任与协作性能的动态关系。

总之,本研究揭示了结果反馈比可解释性更能增强用户对AI的信任,同时揭示了提高信任可能并不总能带来协作性能的显著提升,为HCI领域设计可信AI系统提供了新的思路。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147213/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642780
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文