高精度与隐藏差距:基础模型在临床认知评估中的表现研究
可解释人工智能(XAI)AI 辅助决策与自动化系统心理健康应用与在线支持社区慢性病自我管理(糖尿病、高血压等)医生、护士、临床医生精神科医生与心理咨询师AI/ML 研究员与工程师
文献标题
High Accuracy and Hidden Disparities: Investigating Foundation Model Performance in Clinical Cognitive Assessment
出版信息
- 研究领域: 基础模型在临床认知评估中的表现评估。
- 关键词: 基础模型, 认知评估, 时钟绘图测试, 临床人工智能, 分解框架, 人机协作, 医疗评估, 前瞻性思维, 视觉空间技能, 运动控制。
背景与问题
- 问题 / 挑战: 当前用于基础模型的评估指标未能捕捉其决策机制的底层原理,尽管整体准确率较高,但掩盖了在组件级别表现上的差异。
- 重要性: 准确的认知评估对于早期发现轻度认知障碍(MCI)至关重要,MCI影响了65岁以上人群的10–20%,早期干预可以帮助保持功能独立性。
- 动机与相关研究: 以往研究主要关注整体指标如准确率和敏感性,这些指标是为人类临床医生设计的,未能反映基础模型处理信息的差异。时钟绘图测试(CDT)是一种经过验证的认知评估工具,涉及多个认知领域,非常适合用于评估基础模型。
解决方案
- 提出的方法: 基于理论驱动的分解框架,将CDT分解为24个二元问题,涵盖五个认知领域,以系统评估基础模型。
- 创新点:
- 证明人类临床医生的评估指标不能直接应用于基础模型。
- 开发了一个分解框架,用于评估特定的认知操作及其向人工智能系统的可迁移性。
- 探讨了人机协作在医疗领域的设计意义,强调基于证据的系统和将弃权作为安全信号。
- 流程与关键技术:
- 将CDT评分分解为五个认知领域:视觉空间技能、运动控制、执行功能与规划、持续与选择性注意、前瞻性思维。
- 基于临床理论开发了24个二元问题,并通过CDT评分系统的元评审验证。
- 使用NHATS数据集中的100张CDT图像,进行人机比较研究,收集了三个基础模型(ChatGPT、Claude和Gemini)和人类评分者的响应数据。
结果
- 具体发现:
- 模型在痴呆筛查中的准确率为94%,但在细化评分(0–5分)中的准确率仅为55%。
- 在三个模型一致但与人类评分者不一致的情况下,错误率为22.1%。
- 不同认知领域的表现存在差异:在基于规则的执行功能任务中与人类一致率为88%,但在基于情境的前瞻性思维任务中仅为46%。
- 模型的弃权率是人类的三倍(12.4% vs. 4.4%),尤其是在低质量图像中。
- 相较基线的优势: 分解框架揭示了模型表现中被整体指标掩盖的隐藏差异,提供了关于模型能力和局限性的领域特定见解。
- 实验 / 评估:
- 使用NHATS数据集中基于验证的6分制评分的100张CDT图像。
- 对基础模型进行了零样本评估,使用结构化提示,并通过Prolific收集人类评分。
- 分析了认知领域和时钟质量水平上的一致率、不匹配率和弃权模式。
- 局限性与未来工作:
- 样本量较小(100张图像),且依赖于以美国为中心的NHATS数据集。
- 提示敏感性和数据集偏差可能影响结果的普适性。
- 未来工作应在更大规模和多样化的人群中验证研究结果。
总结
本研究调查了基础模型在时钟绘图测试(CDT)中的表现,发现高整体准确率掩盖了组件级任务中的显著差异。通过基于理论驱动的分解框架,作者证明模型在基于规则的任务中表现出色,但在诸如前瞻性思维等依赖情境判断的任务中表现较差。模型的弃权率是人类的三倍,表明弃权可能是一个有价值的安全信号。研究结果强调了为人工智能设计特定评估指标和基于证据的设计在临床人工智能系统中的重要性,突出人类监督和模块化输出以改进人机协作。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
利用AI系统推进老年癌症患者的以患者为中心的共同决策
CHI '24· AI 辅助决策与自动化系统 +2
- 63%
探索用于心理治疗中治疗作业支持的可定制交互工具
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
以人为中心的视角:退伍军人创伤后应激障碍强化门诊治疗临床决策支持系统
CHI '26· AI 辅助决策与自动化系统 +2
- 63%
将诊前体验数字化:影响与设计建议
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
迈向更优质的健康对话:情境寻求的益处
CHI '26· 大语言模型(LLM)的人机协作 +2
- 63%
探索AI在临床协作中的未来:肿瘤会诊病例准备研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
时间压力下AI辅助决策的准确性-时间权衡
IUI '24· 可解释人工智能(XAI) +2
- 63%
调整信任:减轻信任导致的AI辅助不当依赖
IUI '26· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791866
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
可解释人工智能(XAI)、AI 辅助决策与自动化系统、心理健康应用与在线支持社区、慢性病自我管理(糖尿病、高血压等)
work
职业/产业
医生、护士、临床医生、精神科医生与心理咨询师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文