我应该相信谁:AI还是我自己?利用人类和AI正确的可能性来促进对AI辅助决策的适当信任

可解释人工智能(XAI)AI 辅助决策与自动化系统UI/UX 设计师数据科学家与分析师AI/ML 研究员与工程师

文献标题

Who Should I Trust: AI or Myself? Leveraging Human and AI Correctness Likelihood to Promote Appropriate Trust in AI-Assisted Decision-Making

文献信息

  • 主题领域: 人工智能辅助决策与人机交互
  • 关键词: AI辅助决策, 人机协作, AI信任, 信任校准, 决策支持

研究背景与问题

  • 发现的问题或挑战:

    1. 人工智能(AI)在许多真实世界应用中仍未达到100%的精确度,在高风险领域(如医学和刑事司法)中仅依赖AI决策是有风险的。
    2. AI辅助决策的目标是实现人机互补性能,即团队决策的总准确率高于人类或AI单独决策。
    3. 当前研究多采用AI的信心分数代表其准确性概率(CL)来校准人类对AI的信任,但忽视了对人类自身CL的估计,这可能导致次优的团队决策表现。
  • 研究动机与相关工作:

    • 人类CL通常表现为主观自信估计,但这种估计常常是校准差或不准确的。
    • 当前大多数基于AI的信任校准方法仅关注AI CL,忽视了人类CL的作用。当AI CL较低而人类CL更低时,仅鼓励人类怀疑AI可能是次优的。

解决方案

  • 提出的解决方案: 作者提出了一个框架,通过同时整合人类和AI的CL,在任务实例层面校准人类对AI的信任。

    • 提出了一种估计人类CL的方法,可以预测人类在新任务实例上的潜在表现。
    • 设计了三种CL利用策略(Direct Display、Adaptive Workflow、Adaptive Recommendation)以校准用户对AI的信任。
  • 创新之处:

    • 作者首次在任务实例层面同时建模并利用人类和AI的CL。
    • 提议通过交互式规则创建界面模拟用户的决策模型,克服仅依赖经验法则的不足。
    • 在实验设计中引入“自适应”工作流,动态改变决策呈现方式,增强人类信任校准的精确度。
  • 实施步骤与关键技术:

    1. 人类CL建模: 使用人类在相似任务中的表现计算CL,并采用数据驱动初始化和交互式修正的方法生成决策规则模型。
    2. CL利用策略设计:
      • Direct Display: 直接展示人类与AI的CL和AI的建议。
      • Adaptive Workflow: 根据人类和AI CL动态调整工作流,例如在人类CL高时要求用户先作出决策。
      • Adaptive Recommendation: 在人类CL较高时只提供AI建议的解释而不显示具体推荐。

研究成果

  • 具体成果:

    1. 提出的人类CL建模方法能够有效捕捉CL并预测补充性任务实例。
    2. 实验表明,三种CL利用策略相比传统的AI信心分数方法能够更好地促进人类对AI的适当信任。
    3. 初步探索中发现,参与者对交互式规则界面的接受度较高,该界面比基于决策树的界面更直观。
  • 与现有解决方案的比较优势:

    1. 作者的方法在信任校准时既考虑了AI也考虑了人类的能力。
    2. 提出的Adaptive Workflow策略有效减少了过度信任AI的现象,且通过动态工作流提升了总体团队性能。
  • 实验或评估结果:

    • 在实验中,Direct Display、Adaptive Workflow和Adaptive Recommendation三个策略的团队表现显著优于AI信心分数方法(提升约3-4%)。
    • 当AI信心与预测结果不一致(如高信心但错误预测)时,新的策略展示出更高的准确性和鲁棒性。
    • 在主观感知方面,Adaptive Workflow获得了参与者对CL信息更高的接受度和感知效用。
  • 局限性与未来方向:

    1. 当前方法依赖用户提供规则,对于更复杂的数据(如图像和文本)需构建更通用的建模方法。
    2. 当前CL建模未考虑长时间任务中人类决策模型的动态变化。
    3. 在高风险任务场景(如临床诊断)中尚未验证有效性。
    4. 存在潜在的伦理和责任问题,例如如果人类CL估计不准确可能带来错误决策。

未来研究

  1. 探索如何动态更新用户决策模型以适应长期AI-人类交互。
  2. 针对高复杂度任务(如涵盖文本、图像)的决策模型进行扩展。
  3. 研究解释性设计如何帮助不同用户更好地理解CL信息,提升接受度和使用效果。
  4. 在高风险任务环境中验证方法的可行性和安全性,同时探索不确定性信息的可视化。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/96211/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581058
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
UI/UX 设计师、数据科学家与分析师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文