当信心遇到准确性:探索多个性能指标对机器学习模型信任的影响

最佳论文
可解释人工智能(XAI)AI 辅助决策与自动化系统AI/ML 研究员与工程师认知科学家

文献标题

When Confidence Meets Accuracy: Exploring the Effects of Multiple Performance Indicators on Trust in Machine Learning Models

文献信息

  • 主题领域: 人工智能与人机交互
  • 关键词: 机器学习,信心,准确性,信任,人类实验,性能指标

研究背景与问题

  • 发现问题或挑战: 随着机器学习模型广泛应用于日常生活与决策场景,用户如何理解和信任模型成为关键问题。尽管模型的性能指标(如准确率)已被证明对用户信任有显著影响,但当多种性能指标同时呈现时,其对用户的影响尚不明确。
  • 问题重要性: 用户对于机器学习模型的信任直接影响其预测结果的采纳程度。该问题尤其重要,因为不同的指标可能会引发用户信任的不一致,影响模型实际应用效果。
  • 研究动机与相关工作: 现有研究表明,仅有一个性能指标(例如准确性或模型信心)会对用户信任产生影响。然而,关于当多种指标(例如准确性和信心)结合时对用户信任的影响研究尚处于探索阶段。

解决方案

  • 提出的方法或解决方案:
    • 设计了一项随机化的行为实验,用于调查多个性能指标共同作用对用户信任的影响。
    • 实验对影响用户信任的因素(模型的信心、声明的准确性和实践观察的准确性)进行了控制和系统对比。
  • 创新之处:
    • 同时观察多种性能指标对用户信任的交互作用。
    • 比较用户对单独指标和综合指标的反应变化。
  • 实施步骤与关键技术:
    • 使用Amazon Mechanical Turk(MTurk)招募普通人作为实验对象,让其完成多轮低风险决策任务,与机器学习模型共同完成速度约会结果预测。
    • 测试了不同信心水平、声明准确率和观测准确率组合的八种实验处理。
    • 多维度量化信任,包括:用户的信任自我报告、是否采纳模型预测、预测转换率等。

研究成果

  • 取得的具体成果:
    • 在用户尚未观察模型实际表现时,高信心的模型使用户更相信其预测的准确性,但相较之下声明准确率对信任的影响更显著。
    • 在用户观察到模型实际表现后,实践的准确率超越声明的准确率和信心水平,对用户信任具有主导作用。
    • 模型信心与准确率之间存在交互作用,尤其对用户的模型准确性信念产生调节作用。
  • 与现有解决方案的比较与优势:
    • 不仅关注单指标对信任的影响,还探讨了多指标交互下的影响,这弥补了现有单一指标研究的不足。
    • 首次明确指出在实践中观察的准确性对信任的影响最为显著,并且可能导致用户忽略模型信心。
  • 实验或评估结果:
    • 模型信心主要影响用户对准确性的信念,却很少影响用户自报告的信任程度或对模型预测的采纳频率。
    • 比较三种指标的影响发现,实践中观察的准确性对用户行为和信任感的影响远大于其他指标。
  • 局限性与未来方向:
    • 局限于实验条件下的极端设置(例如明显差异化的准确率和信心水平),可能未完全反映中间值情况下的用户反应。
    • 仅使用一种任务类型(速度约会预测)的实验发现可能难以推广到高风险决策情境(例如医疗诊断)。
    • 未来可进一步探究其他性能指标(例如F1分数)以及不同指标组合对信任的影响,并开发理论模型,解释人们对机器学习性能信息的认知、处理和反应机制。

总结

研究提供了关于多个性能指标影响用户信任的初步实证分析,明确了不同指标的作用范围和交互关系。文献对任务设计、结果分析以及机器学习模型的实际应用提供了重要启示,后续研究需在更广泛的应用场景与用户群体中验证并扩展这些发现。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/68856/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3501967
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
最佳论文
group
作者
2 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
AI/ML 研究员与工程师、认知科学家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文