提示、监督与采用:医生在 LMIC 环境下使用大语言模型进行诊断推理
作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统AI 伦理、公平与问责远程医疗与远程患者监测医生、护士、临床医生精神科医生与心理咨询师社区健康工作者
文献标题
Prompting, Oversight, and Adoption: Physicians’ Use of Large Language Models for Diagnostic Reasoning in an LMIC
出版信息
- 主题领域: 医生在低收入和中等收入国家(LMICs)中使用大型语言模型(LLMs)进行诊断推理的交互研究。
- 关键词: 大型语言模型,诊断推理,医疗AI,LMICs,医生与AI协作,提示策略,人类监督,认知扩展,自动化偏差,AI采纳。
背景与问题
- 问题/挑战: 尽管LLMs在医疗领域的应用日益增长,但关于临床医生在诊断推理过程中如何与这些工具交互的实证研究仍然有限,尤其是在LMICs中。关键空白包括医生如何提示、验证和与LLMs协作,以及这些交互如何影响诊断质量和效率。
- 重要性: 理解医生与LLMs的协作对于提高诊断准确性、解决资源限制以及减轻自动化偏差风险至关重要。在LMICs中,医疗系统面临严重的人员和基础设施挑战。
- 动机与相关研究: 先前研究表明,LLMs可以实现较高的诊断准确性,但由于协作方式不佳,往往未能改善医生的表现。关于LMICs的研究突出了AI采纳的基础设施和文化障碍,但对这些环境中的临床医生如何实际使用LLMs知之甚少。本研究旨在通过关注巴基斯坦医生与ChatGPT的交互来填补这些空白。
解决方案
- 提出的方法: 采用混合方法研究,结合交互日志分析和半结构化访谈,探讨巴基斯坦医生如何使用ChatGPT进行诊断推理。
- 创新点:
- 首次详细分析LMICs背景下医生与LLMs的交互模式。
- 开发医生使用的提示策略和监督机制分类法。
- 提供资源受限医疗环境中负责任AI整合的设计启示。
- 程序和关键技术:
- 医生在解决六个专家设计的临床案例时可选择使用ChatGPT,并记录所有交互。
- 诊断推理分数由三位持证医生评估。
- 对12名参与者进行半结构化访谈,探讨他们对AI使用的看法、策略和挑战。
- 数据分析识别提示策略、监督行为以及AI采纳的系统性障碍。
结果
- 具体发现:
- 当医生通过复制粘贴提供完整临床背景时,诊断准确率最高(62.5%),相比手动输入(39.1%)。
- 交互风格多样化,52.6%的案例表现出对ChatGPT的高度依赖,其他则用于补充或完全不使用。
- 初级医生采用结构化支架,而高级医生则机会性地使用ChatGPT进行交叉检查。
- 医生将ChatGPT视为“认知扩展器”,但对其可靠性、隐私和自动化偏差表示担忧。
- 相较基线的优势: 提供完整临床背景显著提高诊断准确率。结构化提示和监督减少了过度依赖和错误的风险。
- 实验/评估:
- 19名医生完成了六个诊断案例,诊断推理分数由三位专家评估。
- 交互日志和访谈揭示了多样化的提示策略、监督行为和采纳障碍。
- 定量分析显示诊断准确率因案例和输入方式而显著变化。
- 局限性与未来工作:
- 样本量较小(日志N=19,访谈N=12),限制了普适性。
- 研究集中于城市环境中有稳定互联网的AI训练医生,可能无法反映更广泛的LMICs背景。
- 未来工作应探索纵向采纳、患者结果以及农村或资源匮乏环境中的情境障碍。
总结
本研究深入分析了巴基斯坦医生如何与ChatGPT交互以进行诊断推理,识别了多样化的提示策略,如诊断结构化、对抗性测试和效率驱动的快捷方式,同时强调了人类监督对于保持诊断准确性的关键作用。医生将ChatGPT视为认知辅助工具,但对其可靠性、隐私和系统性采纳障碍表示担忧。研究结果突出了情境敏感型AI设计的必要性,包括结构化提示模板、与电子健康记录的无缝集成以及针对不同经验水平的定制界面。这些洞察为资源受限医疗环境中AI的负责任部署提供了重要参考。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 63%
希望还是危机?探索黑人成年人对人工智能在健康环境中使用的看法
CHI '26· AI 伦理、公平与问责 +2
- 63%
用言语描述我的感受:探索AI代理人在预先医疗护理计划高主观性决策中的潜力
CHI '26· AI 辅助决策与自动化系统 +2
- 63%
超越决策支持:探索患者在真实医疗环境中对大语言模型的长期使用
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
大型语言模型在同伴主导的社区行为健康服务中的应用:理解同伴专家与服务用户对机会、风险与缓解策略的视角
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
与患者共设计,而非为其设计:急诊科候诊区患者面人工智能伴侣概念的合作设计
CHI '26· AI 辅助决策与自动化系统 +2
- 63%
角色分配:人机协作决策中大语言模型角色原型研究
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791761
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、AI 伦理、公平与问责、远程医疗与远程患者监测
work
职业/产业
医生、护士、临床医生、精神科医生与心理咨询师、社区健康工作者
article
内容状态
已索引正文
hub
相关论文
6 篇相关论文