探索AI在临床协作中的未来:肿瘤会诊病例准备研究
荣誉提名作者
大语言模型(LLM)的人机协作可解释人工智能(XAI)AI 辅助决策与自动化系统心理健康应用与在线支持社区医生、护士、临床医生精神科医生与心理咨询师
文献标题
Exploring the Future of AI in Clinical Collaboration: A Study on Tumor Board Case Preparation
出版信息
- 主题领域: 人工智能在高风险临床工作流程中的应用,特别是多学科肿瘤委员会(MTB)病例准备。
- 关键词: 医疗领域的人工智能、多学科肿瘤委员会、临床决策支持、大型语言模型、多智能体系统、人工智能信任、临床工作流程、肿瘤学、人工智能错误、负责任的人工智能。
背景与问题
- 问题/挑战: 准备多学科肿瘤委员会(MTB)病例需要大量时间和复杂的工作,要求临床医生从海量且非结构化的医疗记录中提取并综合信息。现有的现成人工智能系统缺乏在高风险临床任务中所需的专业化和准确性。
- 重要性: 高效的MTB病例准备对于及时和准确的癌症治疗决策至关重要,直接影响患者的治疗效果。解决这一过程中的效率问题可以提高护理质量并减轻临床医生的工作负担。
- 动机与相关研究: 之前的研究探讨了人工智能在医疗任务(如总结和文档处理)中的应用,但其在高风险、多学科工作流程中的应用仍未被充分研究。多智能体人工智能框架在模拟领域特定推理方面表现出潜力,但需要在真实临床环境中进一步评估。
解决方案
- 提出的方法: 本研究评估了两种用于MTB病例准备的人工智能系统:现成助手(Copilot)和任务特定的多智能体系统(Healthcare Agent Orchestrator, HAO),重点关注其可用性、准确性以及与临床医生工作流程的匹配程度。
- 创新点:
- 确定肿瘤学家的信息需求以及对人工智能在MTB病例准备中的期望。
- 分析关键人工智能错误及其在临床工作流程中的传播。
- 深入了解临床医生对人工智能能力的认知偏差。
- 提出设计建议,以改进任务特定人工智能系统对临床任务的支持。
- 研究程序与关键技术:
- 通过随机A/B测试设置,对16位肿瘤学家使用Copilot和HAO进行了混合方法研究。
- 分析了163个人工智能提示,涵盖三个任务类别:信息检索、建议/选项/证据以及任务完成。
- 使用TBFact框架评估人工智能和人工生成的病例摘要。
- 收集调查问卷并对访谈进行主题分析,以评估临床医生对人工智能系统的看法和交互体验。
结果
- 具体发现:
- HAO在任务信心评分(4.62对3.68)和使用意愿评分(4.50对3.56)方面均优于Copilot。
- 在Copilot的响应中发现了四个关键错误,包括状态混淆和对临床决策的误解。HAO未出现关键错误。
- 肿瘤学家在病例摘要中出现了四个错误,均与Copilot提供的错误输出相关。
- 相较基线的优势:
- HAO的多智能体结构更符合临床医生的推理方式,提供了更个性化和上下文相关的响应。
- Copilot的简洁性受到部分医生的认可,但导致了关键错误和较少的细致输出。
- 实验/评估:
- 在模拟使用研究中,16位肿瘤学家使用两种人工智能系统准备了两个患者病例。
- 使用TBFact框架和人工验证评估人工智能响应及临床医生笔记的准确性。
- 通过调查问卷和主题分析评估人工智能系统的可用性、信任度及医生的看法。
- 局限性与未来工作:
- 研究仅聚焦于胰腺癌病例和新患者场景,限制了其普适性。
- 女性参与者比例较低(16名肿瘤学家中仅2名女性)。
- 需要更多的控制实验以单独评估多智能体架构的影响。
- 未来研究应探索更广泛的应用场景、信任校准技术以及长期采用情况。
总结
本研究评估了两种人工智能系统Copilot和HAO在多学科肿瘤委员会(MTB)会议中准备患者病例的应用效果。HAO的任务特定多智能体设计更符合临床医生的推理方式,在信心评分和使用意愿评分方面表现更优,而Copilot则出现了关键错误并将其传播到临床工作流程中。研究发现了临床医生对人工智能能力的认知偏差以及传统信任校准技术的低效性。研究结果强调了任务特定人工智能系统在高风险临床任务中的潜力,并提供了可操作的设计建议,以提高其安全性、可用性以及与临床医生工作流程的匹配度。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
MindfulDiary:利用大型语言模型支持精神疾病患者的日记记录
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
探索用于心理治疗中治疗作业支持的可定制交互工具
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
超越决策支持:探索患者在真实医疗环境中对大语言模型的长期使用
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
将诊前体验数字化:影响与设计建议
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
迈向更优质的健康对话:情境寻求的益处
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
设计理论驱动的以用户为中心的可解释人工智能
CHI '19· 可解释人工智能(XAI) +1
- 67%
在时间紧迫的医疗决策中设计值得信赖和协作的AI:一种社会技术视角
CHI '21· 可解释人工智能(XAI) +1
- 67%
可解释性笔记:探讨如何通过互动和人工智能解锁医疗笔记的意义
CHI '24· 可解释人工智能(XAI) +1
- 67%
用户体验AI系统的可追溯性:考察自动化胰岛素输送(AID)系统中的主观信息处理意识
IUI '24· 可解释人工智能(XAI) +1
- 67%
健康专家会采用基于游戏数字生物标志物的临床决策支持系统吗?探究不同解释对感知易用性、感知有用性和信任的影响
IUI '25· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790448
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
30 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、可解释人工智能(XAI)、AI 辅助决策与自动化系统、心理健康应用与在线支持社区
work
职业/产业
医生、护士、临床医生、精神科医生与心理咨询师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文