「我信任AI吗?」迈向可信的AI辅助诊断:理解用户在LLM支持的临床推理中的感知
作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统医生、护士、临床医生AI/ML 研究员与工程师HCI 研究员
文献标题
“Do I Trust the AI?” Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Clinical Reasoning
出版信息
- 主题领域: 大型语言模型(LLMs)在临床推理和诊断中的信任与可用性。
- 关键词: 可信AI、大型语言模型、临床推理、人机协作、诊断支持、医生感知、AI信任校准、医学基准测试、人类评估、医疗AI。
背景与问题
- 问题/挑战: 医生难以准确感知和信任LLMs的诊断能力,原因在于模型的透明度不足以及性能的可变性。现有评估主要集中在基准测试上,未能充分反映真实世界临床推理的复杂性。
- 重要性: 对LLMs信任的错误校准可能导致过度依赖或不足依赖,从而削弱其在高风险医疗环境中改善诊断结果的潜力。
- 动机与相关研究: 先前研究探讨了人机协作、信任校准以及LLM评估,但未充分关注医生对LLMs在临床推理中的主观感知。本论文旨在弥合基准测试评估与现实医生感知之间的差距。
解决方案
- 提出的方法: 通过两步研究评估医生对LLMs临床推理能力的感知,并将这些感知与基准测试性能进行比较。
- 创新点:
- 开发一个结构化评估框架,将医生的主观感知与客观指标相结合。
- 引入感知能力评分(Perceived Capability Score),量化医生视角下LLMs的诊断能力。
- 识别基于感知与基准测试评估之间的差异,突出基准测试中被忽视的维度。
- 流程与关键技术:
- 第一步:案例分析收集:设计了九个临床案例,由医生和六个LLMs进行分析。捕捉诊断工作流程,包括询问、诊断和治疗规划。
- 第二步:案例分析评估:医生从七个维度(如诊断准确性、推理合理性、治疗适宜性)评估分析。通过排名和评分得出感知能力评分,并与基准测试性能进行比较。
结果
- 具体发现:
- LLMs的感知能力与基准测试性能呈正相关但非线性关系,在较高基准分数时表现出边际效益递减。
- 医生更看重推理连贯性和临床可接受性等维度,而这些维度在基准测试中往往被忽视。
- 表现最佳的LLMs在总体排名中优于大多数医生,但不包括资深专家。
- 相较基准的优势: 研究表明,仅关注诊断准确性的基准测试未能捕捉诸如证据获取、推理连贯性和临床可行性等关键维度,这些维度对信任校准至关重要。
- 实验/评估:
- 参与者:37位医生评估了九个临床案例的分析。
- 指标:维度评分、排名和感知能力评分通过统计模型(如Bradley–Terry排名回归、Kendall’s W)进行分析。
- 基准测试:与DiagnosisArena(一个临床诊断基准测试)进行比较。
- 局限性与未来工作:
- LLMs和临床案例数量有限。
- 由于访问和资源限制,未能纳入专业医学LLMs。
- 未来工作应包括更多样化的案例、先进的虚拟患者,以及纵向研究以优化评估框架。
总结
本研究探讨了医生对LLMs临床推理能力的感知及其与基准测试评估的匹配情况。通过引入感知能力评分,作者强调了主观评估与传统基准测试之间的差异,特别是推理连贯性和临床可接受性等被忽视的维度。研究结果突出了多维信任校准的必要性以及交互式、基于证据的推理支持,以促进医生与LLMs的有效协作。这些洞察为设计可信的AI辅助诊断系统提供了符合临床现实的基础。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 83%
哪些贡献值得认可?人类与AI共同创作中的归属感认知
CHI '25· 大语言模型(LLM)的人机协作 +2
- 83%
共同揭示计算机:通过反思性对话实现 LLM 媒介的计算
CHI '26· 大语言模型(LLM)的人机协作 +2
- 83%
AI能为我做什么: 评估合作游戏中机器学习解释的效果
IUI '19· 大语言模型(LLM)的人机协作 +2
- 83%
CAIM:面向智能智能体长期交互的认知 AI 记忆框架的开发与评估
IUI '26· 大语言模型(LLM)的人机协作 +2
- 83%
用户对协作伙伴选择中 AI 辅助的依赖性研究
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
基于LLM的搜索对决策制定的影响:速度、准确性和过度依赖
CHI '25· 大语言模型(LLM)的人机协作 +2
- 71%
并非越多越好:在多AI建议中平衡决策准确性与从众压力
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
看不见的破坏者:谄媚型大语言模型在问题解决任务中误导新手
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
响应延迟和任务类型对人类-LLM 交互与感知的影响
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
与我共编还是为我编程?AI 自动化程度提升如何改变开发者工作流
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790835
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统
work
职业/产业
医生、护士、临床医生、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文