迈向AI驱动的医疗保健:针对戒烟干预措施的大型语言模型的系统优化、语言分析和临床医生评估

荣誉提名
中空超声波触觉(Mid-air Haptics)大语言模型(LLM)的人机协作AI 辅助决策与自动化系统医生、护士、临床医生AI/ML 研究员与工程师

文献标题

Towards AI-Driven Healthcare: Systematic Optimization, Linguistic Analysis, and Clinicians’ Evaluation of Large Language Models for Smoking Cessation Interventions

文献信息

  • 主题领域: 人工智能与健康领域结合,烟草戒断干预
  • 关键词: 大语言模型, 信息生成, 计算语言学分析, 专家评审, 戒烟干预

研究背景与问题

  • 主要问题:
    1. 如何优化大语言模型 (LLM) 模拟人类专家撰写干预信息的能力。
    2. LLM生成的消息是否满足临床标准以安全应用于戒烟治疗。
  • 研究的重要性:
    • 戒烟干预需要高质量的消息内容,而手工撰写这些内容需要大量的时间与人力。
    • 基于LLM的生成能够加速这一过程,提升干预效率和信息质量。
  • 研究动机与相关工作:
    • 现有研究已证明LLM在不同健康领域信息生成中的潜力,例如COVID-19疫苗宣传和叶酸相关健康信息。
    • 然而,针对戒烟干预信息的研究尚不成熟,仍需优化生成过程并验证生成内容的临床适用性。

解决方案

  • 方法概述: 作者通过三项研究系统地探索LLM生成与评估戒烟干预信息的过程:
    1. 提示工程 (Prompt Engineering)。
    2. 解码优化 (Decoding Optimization)。
    3. 专家评审 (Expert Review)。
  • 创新之处:
    • 提出了优化LLM提示和解码的具体策略。
    • 引入综合评估框架,结合自动化指标、语言学属性和专家评审,全面分析信息生成。
  • 实施步骤:
    1. 在不同LLM上测试五种提示版本,评估多样性、质量和效率。
    2. 优化八种解码方法以改善信息生成质量,包括温度采样和top-k采样。
    3. 与戒烟治疗专家合作评审LLM生成的消息质量、准确性和临床适用性。

研究成果

  • 具体成果:
    • 较大的模型如ChatGPT、OPT-13B和OPT-30B能够非常接近人类专家撰写水平,生成高质量、可信且有说服力的戒烟干预信息。
    • 制定了优化提示和解码的方法,并推荐了一种解码组合(nucleus sampling与top-k和温度调整结合)。
  • 比较优势:
    • 与其他LLM相比,ChatGPT显示出更高的消息质量,甚至超过人类专家。
    • 提供了可执行的框架,用于在临床实践中集成LLM生成的信息。
  • 实验或评估结果:
    • 专家评审表明约50%的LLM生成信息满足临床标准。
    • ChatGPT的消息达标率最高(71%),显著领先其他模型。
  • 局限性与未来方向:
    • 专家评审样本较小,可能存在代表性偏差。
    • 部分情况下因缺乏具体场景,影响了消息评估的有效性。
    • 建议未来整合更多专家评审数据,并提供评估上下文以改善消息评估准确性。

总结

这项研究通过提示优化、解码优化及专家评审综合评估了LLM在高风险健康领域的应用。研究显示,LLM(尤其是ChatGPT)能够生成高质量的干预信息,有望成为临床烟草治疗中的重要辅助工具。但同时强调,严格的质量评估和专家验证仍是技术安全应用的关键。未来工作可进一步扩展到模型调校或特定医疗场景的优化设计。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147450/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3641965
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
荣誉提名
group
作者
8 位作者
sell
研究子方向
中空超声波触觉(Mid-air Haptics)、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
医生、护士、临床医生、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文