MAP-X 设计与多层次评估:一个医学对齐、以患者为中心的人工智能解释系统
作者
可解释人工智能(XAI)远程医疗与远程患者监测医生、护士、临床医生精神科医生与心理咨询师
文献标题
Design and Multi-level Evaluation of MAP-X: a Medically Aligned, Patient-Centered AI Explanation System
出版信息
- 主题领域: 医疗领域中以患者为中心的人工智能解释。
- 关键词: 可解释人工智能,医疗人工智能,以患者为中心的设计,大型语言模型,检索增强生成,卒中后语言评估,临床验证,多层次评估,信任校准。
背景与问题
- 问题/挑战: 许多医疗人工智能系统缺乏针对患者量身定制的解释,导致透明性、信任度和采用率有限。目前的评估框架未能全面验证在功能、临床医生和患者层面的解释。
- 重要性: 在高风险的临床环境中,透明、以患者为中心的解释对于增强理解、信任和共同决策至关重要,特别是对于像卒中后语言障碍这样复杂的病症。
- 动机与相关工作: 先前的研究强调了将解释基于临床推理并与患者需求对齐的重要性。然而,现有系统通常无法平衡临床有效性和患者可理解性。多层次评估框架较为罕见,大多数研究仅关注准确性或零散的证据。
解决方案
- 提出的方法: MAP-X(Medically Aligned, Patient-centered eXplanation),一个利用检索增强生成(RAG)和大型语言模型(LLMs)生成分层、面向患者的解释系统,并以临床证据为基础。
- 创新点:
- 提出“结构–信号–来源”蓝图,用于在临床医生定义的结构、模型推理信号和临床数据来源之间设计和验证解释。
- 集成RAG以减少幻觉生成,确保解释基于临床医生撰写的证据。
- 采用渐进式披露界面,提供分层解释以适应患者的理解能力。
- 多阶段评估框架,涵盖功能、临床医生和患者的视角。
- 流程与关键技术:
- 预测模块: 从语音任务中提取声学特征,并使用带有SHAP值的集成模型预测严重程度以实现可解释性。
- 检索模块: 使用向量搜索将患者数据与临床验证的参考案例匹配。
- 生成模块: 使用GPT-4将检索到的证据和模型输出合成为结构化解释。
- 界面设计: 通过仪表盘、特定特征的洞察和对话式摘要展示解释,采用渐进式披露以管理认知负荷。
结果
- 具体发现:
- 功能评估:严重程度分类的宏F1分数为84.98%,子系统评分的平均绝对误差(MAE)为0.81,文本质量得分为75.44(内部相关性)和71.78(外部准确性)。
- 临床医生评估:流畅性评分为4.62/5,相关性评分为4.49/5,一致性评分为4.74/5,但叙述风格一致性评分仅为2.89/5。
- 患者评估:MAP-X的信任评分显著高于不可解释的对照组(6.39/7对比5.44/7),解释满意度呈现积极趋势。
- 相较基线的优势: MAP-X的解释在信任和理解方面优于不可解释的对照组,临床医生也认可其结构化、基于证据的输出作为协作工具。
- 实验/评估:
- 第一阶段:使用临床医生定义的指标和基于评分标准的文本评分对忠实性进行功能评估。
- 第二阶段:10名语言病理学家评估其临床相关性和工作流程适配性。
- 第三阶段:15名卒中后患者比较MAP-X解释与不可解释对照组的表现。
- 局限性与未来工作:
- 存在患者过度信任的风险;需要制定风险缓解协议。
- 数据集规模有限,依赖于基于音频的感知评分。
- 泛化性限制于韩国和慢性卒中患者。
- 缺乏对临床医生介导的工作流程和长期影响的实证测试。
总结
MAP-X是一种旨在为卒中后语言评估生成医学对齐、以患者为中心的解释的人工智能系统。通过“结构–信号–来源”蓝图和RAG技术,该系统生成了分层、透明的解释,与临床推理和患者需求相一致。三阶段评估表明其功能忠实性、临床医生接受度以及患者信任和理解的提升。局限性包括过度信任风险、数据集限制和泛化性不足。未来工作应聚焦于自适应解释、风险缓解以及评估其在实际场景中的长期影响。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 67%
DiagLink:通过协同大型语言模型与知识图谱赋能双用户诊断辅助系统
CHI '26· 大语言模型(LLM)的人机协作 +2
- 67%
护理点的不确定性与风险:患者生成的心电图及算法解读对临床决策的影响
CHI '26· 生物传感器与生理监测 +2
- 60%
设计理论驱动的以用户为中心的可解释人工智能
CHI '19· 可解释人工智能(XAI) +1
- 60%
OralCam:使用智能手机摄像头实现口腔健康自我检查和意识
CHI '20· 心理健康应用与在线支持社区 +1
- 60%
在时间紧迫的医疗决策中设计值得信赖和协作的AI:一种社会技术视角
CHI '21· 可解释人工智能(XAI) +1
- 60%
在数字健康的人本设计中利用实施科学
CHI '24· 心理健康应用与在线支持社区 +1
- 60%
可解释性笔记:探讨如何通过互动和人工智能解锁医疗笔记的意义
CHI '24· 可解释人工智能(XAI) +1
- 60%
'这是一个动态过程': 理解肺部医学中临床医生可解释性需求的演变
CHI '24· 可解释人工智能(XAI) +1
- 60%
以人为中心的放射学人工智能个性化:评估信任度、可用性与跨医院稳健性
CHI '26· 可解释人工智能(XAI) +1
- 60%
用户体验AI系统的可追溯性:考察自动化胰岛素输送(AID)系统中的主观信息处理意识
IUI '24· 可解释人工智能(XAI) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790971
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
可解释人工智能(XAI)、远程医疗与远程患者监测
work
职业/产业
医生、护士、临床医生、精神科医生与心理咨询师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文