《你真的确定吗?》理解人类自我信心校准在人工智能辅助决策中的影响
可解释人工智能(XAI)AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师HCI 研究员
文献标题
“Are You Really Sure?” Understanding the Effects of Human Self-Confidence Calibration in AI-Assisted Decision Making
文献信息
- 主题领域: 人机交互、人工智能决策支持系统
- 关键词: AI辅助决策、人机协作、依赖性校准、信任校准、适当依赖性
研究背景与问题
- 作者发现的问题或挑战:
- 在AI辅助决策中,确保人类对AI的依赖性适当无比关键但困难。
- 现有的研究多关注于AI置信度的呈现,但忽略了人类自身置信度在决策中的作用。
- 人类通常表现出置信度的错误校准(过度或不足),进而影响对AI的适当依赖。
- 为什么这个问题重要:
- 人类对AI的过度依赖可能导致错误决策,而不足的依赖则可能错过正确建议。
- 提高人类-人工智能团队的整体表现需要改进人类置信度的准确性。
- 研究动机:
- 通过校准人类自身置信度(human self-confidence calibration),希望提升AI-human协作的决策效率与合理性。
- 探讨不同校准机制如何影响人类的置信度、对AI的行为依赖以及任务表现。
解决方案
方法与框架
-
分析框架:
- 提出“置信度-正确性匹配”(Confidence-Correctness Matching, C-C Matching)框架,从人类和AI两方面分析其置信度是否与实际准确性一致,以解释决策中不适当依赖的具体原因。
-
研究问题:
- RQ1: 人类的置信度不匹配如何影响对AI建议的依赖?
- RQ2: 如何校准人类的置信度,校准机制又如何影响用户体验?
- RQ3: 校准机制如何影响决策表现,以及对AI依赖的适当性?
-
校准机制:
- Think the Opposite (反向思考): 通过模拟“如果当前预测是错误的”的情境来辅助用户深度思考。
- Thinking in Bets (下注思考): 用“下注”机制提高人类置信度评估的准确性。
- Calibration Status Feedback (校准反馈): 提供关于用户置信度匹配与否的实时或总反馈。
-
实验设计:
- 共进行三项研究: (1) 分析置信度与决策依赖的关系;(2) 对比三种校准机制的影响;(3) 探究校准在人机协作中的作用。
- 使用收入预测任务测试模型搭建与效果(基于公开的成人收入数据集)。
研究成果
具体成果
-
研究一(RQ1:理解置信度校准的重要性):
- 人类的置信度不匹配显著导致决策错误率更高。
- AI置信度的显示无法显著改善人类的置信度校准和决策表现。
-
研究二(RQ2:比较不同校准机制):
- “Think the Opposite” 和 “Calibration Feedback” 能显著降低置信度不匹配(衡量指标:ECE)。
- “Bet” 对避免过度置信有轻微作用,但无法有效改善置信度校准。
- 用户体验方面,“Think the Opposite” 增加了认知负荷,降低了用户满意度。
-
研究三(RQ3:校准对AI辅助决策的影响):
- 校准机制降低了用户的“少依赖”(Under-Reliance),但没有减少“过度依赖”(Over-Reliance)。
- 校准显著提高用户的初始决策准确率和人机团队的最终任务表现。
- 当AI置信度准确时,校准机制减少错误率;当AI置信度错误时,校准可能导致错误率上升。
相较于现有方法的优势
- 提出“人类置信度校准”的人本视角,补充了以往对AI置信度研究的不足。
- 提出的研究框架从根源解析了不适当依赖的形成路径,有助于改进未来AI决策设计。
限制与未来方向
- 当前的校准机制存在局限性(如过多的认知负荷、依赖数据反馈等),未来可研究更简约高效的校准方案。
- 校准机制的效果受AI置信度准确性的影响很大,因此在AI置信度不足时需设计额外机制。
- 校准方法更适合多步决策场景,未来可扩展至即时低交互决策情境。
总结
文章从用户置信度的角度重新审视了AI辅助决策的依赖性问题,提出了一种通用的分析框架,并通过实验验证了人类置信度校准的效能和不足。这一研究成果对设计有效的AI交互界面具有重要的理论与实践指导意义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 人类信心的不匹配如何影响对AI建议的依赖?分类: 信心表达与元认知校准同类问题arrow_forward
- 人类信心如何被校准,校准机制对用户体验有何影响?分类: 信心表达与元认知校准同类问题arrow_forward
- 校准机制如何影响决策表现及对AI依赖的合适性?分类: 信心表达与元认知校准同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以适度依赖AI,过度或不足信赖导致决策错误。分类: 信心表达与元认知校准同类问题arrow_forward
- 83%
通过交互重建评估生成模型的可解释性
CHI '21· 可解释人工智能(XAI) +2
- 83%
PaTAT:具有可解释交互规则合成的人工智能协作定性编码
CHI '23· 可解释人工智能(XAI) +2
- 83%
故障还是就绪?在部署之前处理深度学习计算机视觉模型中的故障:一项关于实践、挑战和需求的研究
CHI '23· 可解释人工智能(XAI) +2
- 83%
《应该信任你还是信任人工智能?》——混合人机团队中领导者的信任与感知研究
CHI '26· 人-机器人协作(HRC) +2
- 83%
人们是否适当依赖人工智能建议?人机交互研究中关于人机决策的分析综述
CHI '26· AI 辅助决策与自动化系统 +2
- 83%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
指导来源的重要性:AI、专家或分析师团队的指导如何影响视觉数据准备和分析
IUI '25· 生成式AI(文本、图像、音乐、视频) +2
- 83%
Unakite:利用 Web 支持开发者的决策制定
UIST '19· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642671
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文