临床预咨询中聊天机器人、问卷和人类信息收集的比较分析

中空超声波触觉(Mid-air Haptics)对话式聊天机器人大语言模型(LLM)的人机协作医生、护士、临床医生精神科医生与心理咨询师

研究背景与问题

  • 发现的问题或挑战: 作者指出,尽管大型语言模型(LLM)已显著提升了聊天机器人的对话能力,但其在信息收集任务中的效率仍未被充分研究。在临床预咨询情境(患者在就医前与中间人分享医疗信息以提高沟通效率)中,与静态问卷和真人相比,LLM驱动的聊天机器人在信息收集能力上的表现尚不明确。当前,诊断性聊天机器人容易因输入信息不完整而决策错误,但对于聊天机器人的信息收集能力的系统性分析仍然缺乏。

  • 重要性: 准确的信息收集是诊断和决策的基础。在临床场景中,高质量的信息收集可以改善医患间的沟通,提升患者的参与感,增加医疗效率,并降低医生的文书负担。同时,理解聊天机器人在信息收集中的表现有助于改善其设计和应用。

  • 研究动机与相关工作: 作者提出,静态问卷虽然易于分发,但会因问卷疲劳而导致低质量回答。而人类面试官(如护士)具有适应性,但依赖的时间和人力资源成本很高。动态聊天机器人可能平衡两者的优缺点,但当前在这一领域的研究主要聚焦于聊天机器人是否被接受,而非其信息收集能力的质量。这为研究提供了研究动机:如何在动态机器人中实现高质量的信息收集。

解决方案

  • 方法或解决方案: 作者设计了一项研究,比较了三种预咨询信息收集方式(静态问卷、基于GPT-4的LLM聊天机器人、真人扮演的Wizard-of-Oz情境)的效率。研究分析基于Grice的会话准则(清晰度、深度、信息量和相关性)对三种方式的信息收集质量进行评价。

  • 创新之处:

    1. 将Grice的会话准则用于评估聊天机器人的信息收集能力,开发了新颖的评估指标(清晰度、深度、信息性、相关性)。
    2. 在真实的临床预咨询中比较三种代理的信息收集效率,在动态跟进提问和问答适应性上提供详细分析。
    3. 提出适用于未来聊天机器人设计的具体改进建议,如如何更好地动态调整问题和设计后续提问。
  • 实施步骤与技术:

    • 研究招募了45名患者,随机分配到三种信息收集代理条件中。
    • 每个代理设定了15个标准化问题,但动态代理(LLM和Wizard)允许根据患者回答调整问题的顺序、措辞和跟进提问。
    • 对对话转录进行了逐轮编码并基于提出的四个准则进行二元评价(如清楚/不清楚)。
    • 分析了首次提问的回答质量及后续提问的改进效果,并比较了三种代理的整体绩效。

研究成果

  • 具体成果:

    1. 动态代理(LLM和Wizard)在使用动态策略和追问时,显著提高了信息收集质量,尤其表现为患者回答的清晰度、深度、信息量和相关性的改进。
    2. 静态问卷在复杂和开放性问题(如“服用的药物有哪些?”)中的表现较弱,但在封闭性问题(如“疼痛等级是多少?”)上表现不逊色。
    3. 动态代理能够对重复信息进行过滤、优化问题顺序、并适当调整问题措辞(如表示同情或承接之前的信息),从而提升患者回答质量。
  • 与现有解决方案的比较及优势:

    • 与静态问卷相比,动态代理具有适应性和灵活性,可以根据患者需求调整问题,从而实现更有效的互动。
    • 与聊天机器人相比,真人扮演的Wizard在复杂的医疗问题上表现出了更高的主动性和跟进频率,但聊天机器人表现出稳定性,更适合大规模部署。
  • 实验或评估结果: 动态代理的整体满意回答率(约85%-86%)显著高于静态问卷(79.7%)。其中,Wizard提出的跟进提问频率远高于LLM(16.9% vs. 3.6%)。尽管LLM能够提供动态问题调整,但在推敲模糊或多主题回答时仍存在不足。

  • 局限性与未来方向:

    • 局限性:
      1. 样本量有限(45人),且参与者的医疗问题复杂性多样,可能影响数据的一致性。
      2. 未对医生对信息质量的实际满意程度进行评估,仅基于患者对话的编码。
      3. LLM模型未经过特定领域(如医疗)的额外训练,可能在处理特定术语时受限。
    • 未来方向:
      1. 在更大规模和统一医疗场景下重复此研究。
      2. 开发结合链式思考(Chain-of-Thought)和检索增强生成(Retrieval-Augmented Generation)的混合模型,以进一步提升多主题记录能力。
      3. 探索如何让聊天机器人主动发现和应对患者的隐含信息或潜在话题,例如对“排除性重要信息”的关注。

总结与意义

研究意义: 该研究揭示了动态提问和问题适应性是提升聊天机器人在信息收集领域效能的重要手段,对医疗和其他领域(如客户服务、技术支持)中的聊天机器人设计具有广泛适用性。研究不仅为开发更智能、更以人为本的预咨询代理提供了框架,还为提高自动化解决方案的信息采集质量提供了实践依据。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188706/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713613
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
中空超声波触觉(Mid-air Haptics)、对话式聊天机器人、大语言模型(LLM)的人机协作
work
职业/产业
医生、护士、临床医生、精神科医生与心理咨询师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文