临床预咨询中聊天机器人、问卷和人类信息收集的比较分析
研究背景与问题
-
发现的问题或挑战: 作者指出,尽管大型语言模型(LLM)已显著提升了聊天机器人的对话能力,但其在信息收集任务中的效率仍未被充分研究。在临床预咨询情境(患者在就医前与中间人分享医疗信息以提高沟通效率)中,与静态问卷和真人相比,LLM驱动的聊天机器人在信息收集能力上的表现尚不明确。当前,诊断性聊天机器人容易因输入信息不完整而决策错误,但对于聊天机器人的信息收集能力的系统性分析仍然缺乏。
-
重要性: 准确的信息收集是诊断和决策的基础。在临床场景中,高质量的信息收集可以改善医患间的沟通,提升患者的参与感,增加医疗效率,并降低医生的文书负担。同时,理解聊天机器人在信息收集中的表现有助于改善其设计和应用。
-
研究动机与相关工作: 作者提出,静态问卷虽然易于分发,但会因问卷疲劳而导致低质量回答。而人类面试官(如护士)具有适应性,但依赖的时间和人力资源成本很高。动态聊天机器人可能平衡两者的优缺点,但当前在这一领域的研究主要聚焦于聊天机器人是否被接受,而非其信息收集能力的质量。这为研究提供了研究动机:如何在动态机器人中实现高质量的信息收集。
解决方案
-
方法或解决方案: 作者设计了一项研究,比较了三种预咨询信息收集方式(静态问卷、基于GPT-4的LLM聊天机器人、真人扮演的Wizard-of-Oz情境)的效率。研究分析基于Grice的会话准则(清晰度、深度、信息量和相关性)对三种方式的信息收集质量进行评价。
-
创新之处:
- 将Grice的会话准则用于评估聊天机器人的信息收集能力,开发了新颖的评估指标(清晰度、深度、信息性、相关性)。
- 在真实的临床预咨询中比较三种代理的信息收集效率,在动态跟进提问和问答适应性上提供详细分析。
- 提出适用于未来聊天机器人设计的具体改进建议,如如何更好地动态调整问题和设计后续提问。
-
实施步骤与技术:
- 研究招募了45名患者,随机分配到三种信息收集代理条件中。
- 每个代理设定了15个标准化问题,但动态代理(LLM和Wizard)允许根据患者回答调整问题的顺序、措辞和跟进提问。
- 对对话转录进行了逐轮编码并基于提出的四个准则进行二元评价(如清楚/不清楚)。
- 分析了首次提问的回答质量及后续提问的改进效果,并比较了三种代理的整体绩效。
研究成果
-
具体成果:
- 动态代理(LLM和Wizard)在使用动态策略和追问时,显著提高了信息收集质量,尤其表现为患者回答的清晰度、深度、信息量和相关性的改进。
- 静态问卷在复杂和开放性问题(如“服用的药物有哪些?”)中的表现较弱,但在封闭性问题(如“疼痛等级是多少?”)上表现不逊色。
- 动态代理能够对重复信息进行过滤、优化问题顺序、并适当调整问题措辞(如表示同情或承接之前的信息),从而提升患者回答质量。
-
与现有解决方案的比较及优势:
- 与静态问卷相比,动态代理具有适应性和灵活性,可以根据患者需求调整问题,从而实现更有效的互动。
- 与聊天机器人相比,真人扮演的Wizard在复杂的医疗问题上表现出了更高的主动性和跟进频率,但聊天机器人表现出稳定性,更适合大规模部署。
-
实验或评估结果: 动态代理的整体满意回答率(约85%-86%)显著高于静态问卷(79.7%)。其中,Wizard提出的跟进提问频率远高于LLM(16.9% vs. 3.6%)。尽管LLM能够提供动态问题调整,但在推敲模糊或多主题回答时仍存在不足。
-
局限性与未来方向:
- 局限性:
- 样本量有限(45人),且参与者的医疗问题复杂性多样,可能影响数据的一致性。
- 未对医生对信息质量的实际满意程度进行评估,仅基于患者对话的编码。
- LLM模型未经过特定领域(如医疗)的额外训练,可能在处理特定术语时受限。
- 未来方向:
- 在更大规模和统一医疗场景下重复此研究。
- 开发结合链式思考(Chain-of-Thought)和检索增强生成(Retrieval-Augmented Generation)的混合模型,以进一步提升多主题记录能力。
- 探索如何让聊天机器人主动发现和应对患者的隐含信息或潜在话题,例如对“排除性重要信息”的关注。
- 局限性:
总结与意义
研究意义: 该研究揭示了动态提问和问题适应性是提升聊天机器人在信息收集领域效能的重要手段,对医疗和其他领域(如客户服务、技术支持)中的聊天机器人设计具有广泛适用性。研究不仅为开发更智能、更以人为本的预咨询代理提供了框架,还为提高自动化解决方案的信息采集质量提供了实践依据。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 在预问诊场景中,基于LLM的聊天机器人在信息收集效率上如何表现相较于静态问卷和人类代理?分类: 医疗AI临床支持与系统采纳需求同类问题arrow_forward
- 动态提问策略如何影响聊天机器人的信息收集质量(如清晰性、深度、信息量和相关性)?分类: 医疗AI临床支持与系统采纳需求同类问题arrow_forward
- 用于医疗预问诊的聊天机器人设计如何更好地提升动态调整和追问能力?分类: 医疗AI临床支持与系统采纳需求同类问题arrow_forward
现实痛点
1- 患者在预问诊中用静态问卷易疲劳,动态信息收集效率低。分类: 医疗AI临床支持与系统采纳需求同类问题arrow_forward
- 80%
构建对话回合和逻辑对话:设计人性化LLM驱动的会话代理用于医院入院访谈
CHI '25· 对话式聊天机器人 +1
- 67%
超越候诊室:患者对预咨询聊天机器人的对话细微差别的看法
CHI '24· 对话式聊天机器人 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)