「我信任AI吗?」迈向可信的AI辅助诊断:理解用户在LLM支持的临床推理中的感知

大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统医生、护士、临床医生AI/ML 研究员与工程师HCI 研究员

文献标题

“Do I Trust the AI?” Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Clinical Reasoning

出版信息

  • 主题领域: 大型语言模型(LLMs)在临床推理和诊断中的信任与可用性。
  • 关键词: 可信AI、大型语言模型、临床推理、人机协作、诊断支持、医生感知、AI信任校准、医学基准测试、人类评估、医疗AI。

背景与问题

  • 问题/挑战: 医生难以准确感知和信任LLMs的诊断能力,原因在于模型的透明度不足以及性能的可变性。现有评估主要集中在基准测试上,未能充分反映真实世界临床推理的复杂性。
  • 重要性: 对LLMs信任的错误校准可能导致过度依赖或不足依赖,从而削弱其在高风险医疗环境中改善诊断结果的潜力。
  • 动机与相关研究: 先前研究探讨了人机协作、信任校准以及LLM评估,但未充分关注医生对LLMs在临床推理中的主观感知。本论文旨在弥合基准测试评估与现实医生感知之间的差距。

解决方案

  • 提出的方法: 通过两步研究评估医生对LLMs临床推理能力的感知,并将这些感知与基准测试性能进行比较。
  • 创新点:
    1. 开发一个结构化评估框架,将医生的主观感知与客观指标相结合。
    2. 引入感知能力评分(Perceived Capability Score),量化医生视角下LLMs的诊断能力。
    3. 识别基于感知与基准测试评估之间的差异,突出基准测试中被忽视的维度。
  • 流程与关键技术:
    1. 第一步:案例分析收集:设计了九个临床案例,由医生和六个LLMs进行分析。捕捉诊断工作流程,包括询问、诊断和治疗规划。
    2. 第二步:案例分析评估:医生从七个维度(如诊断准确性、推理合理性、治疗适宜性)评估分析。通过排名和评分得出感知能力评分,并与基准测试性能进行比较。

结果

  • 具体发现:
    • LLMs的感知能力与基准测试性能呈正相关但非线性关系,在较高基准分数时表现出边际效益递减。
    • 医生更看重推理连贯性和临床可接受性等维度,而这些维度在基准测试中往往被忽视。
    • 表现最佳的LLMs在总体排名中优于大多数医生,但不包括资深专家。
  • 相较基准的优势: 研究表明,仅关注诊断准确性的基准测试未能捕捉诸如证据获取、推理连贯性和临床可行性等关键维度,这些维度对信任校准至关重要。
  • 实验/评估:
    • 参与者:37位医生评估了九个临床案例的分析。
    • 指标:维度评分、排名和感知能力评分通过统计模型(如Bradley–Terry排名回归、Kendall’s W)进行分析。
    • 基准测试:与DiagnosisArena(一个临床诊断基准测试)进行比较。
  • 局限性与未来工作:
    • LLMs和临床案例数量有限。
    • 由于访问和资源限制,未能纳入专业医学LLMs。
    • 未来工作应包括更多样化的案例、先进的虚拟患者,以及纵向研究以优化评估框架。

总结

本研究探讨了医生对LLMs临床推理能力的感知及其与基准测试评估的匹配情况。通过引入感知能力评分,作者强调了主观评估与传统基准测试之间的差异,特别是推理连贯性和临床可接受性等被忽视的维度。研究结果突出了多维信任校准的必要性以及交互式、基于证据的推理支持,以促进医生与LLMs的有效协作。这些洞察为设计可信的AI辅助诊断系统提供了符合临床现实的基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223374/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790835
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
医生、护士、临床医生、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文