最后的JITAI?探讨大型语言模型在即时适应性干预中的应用:在前瞻性心脏康复环境中促进体育活动

大语言模型(LLM)的人机协作心理健康应用与在线支持社区环境感知与上下文计算医生、护士、临床医生物理治疗师与康复治疗师

研究背景与问题

作者发现了哪些问题或挑战?

  • 心脏康复后许多患者难以维持初期形成的健康行为(如身体活动),特别是在逐渐减少面对面支持后,他们往往回归到久坐的习惯。
  • Just-in-Time Adaptive Interventions (JITAIs) 能够在适当时间和场景提供个性化的健康干预,但其传统实现方式(基于规则或机器学习模型)在灵活性、适应性和扩展性方面受到限制。
  • JITAIs 的现有实现方式难以有效处理稀疏数据、缺少多模态信息整合能力,且生成的信息往往缺乏个性化和动态调整的能力。

为什么这个问题很重要?

  • 心脏康复后持续的身体活动对于改善长期健康至关重要,但缺乏有效的支持机制。
  • 数字健康干预工具在减少医疗资源成本并提供长期支持时潜力巨大,但方法和技术上的局限性限制了其效果。
  • 生成语言模型(LLMs)近年来在处理复杂数据空间和生成自然语言内容上表现出令人期待的潜力,因此值得研究其在 JITAIs 中的应用。

研究动机与相关工作

  • LLMs,如 GPT-4,能以「零样本学习」方式处理高维上下文数据,生成动态、个性化的响应,这种能力正是传统 JITAIs 实施的短板。
  • 之前的研究表明,LLMs 在推荐系统、健康领域(如 USMLE 通过率)以及定制干预措施生成方面表现出一定潜力,但仍需验证其应用于特定场景(如心脏康复 JITAIs)的实际效用。
  • 本研究的核心问题是探究:LLMs(如 GPT-4)能否作为决策机制触发并针对上下文生成内容,以支持患者身体活动目标?

解决方案

作者提出了哪些方法或解决方案?

  • 提出基于 GPT-4 的 LLM,用于触发和生成心脏康复情境中的 JITAIs。
  • 通过对三种患者角色(基于真实心脏康复患者特征生成的 personas)和不同情境数据创建规则化输入场景,为 LLM 提供生成内容的基础。
  • 将 GPT-4 生成的干预措施与两组人工生成干预(非专业人群和医疗专业人员)进行对比研究,综合评估内容的质量和可用性。

该解决方案的创新之处是什么?

  1. 情境感知生成:与传统基于规则或机器学习的 JITAIs 不同,GPT-4 能动态理解复杂和稀疏情境数据,并生成更个性化的干预内容。
  2. 双重任务能力:生成决策(是否触发干预)和文本内容(针对具体情境的用户提示)。
  3. 性能比较与验证:通过多维度量表(如适当性、专业性等)以及参与者的定性反馈,对比 GPT-4 与人体生成的干预方案。

实施步骤是什么?使用了哪些关键技术?

  1. 创建 患者角色 (Personas)上下文变量:综合健康参数及用户行为情境(如身体状态、时间点、地点)。
  2. 模型运行:通过 GPT-4,针对每个情境生成两种干预文本。
  3. 比较分析
    • 三种生成者(GPT-4、非专业人群、医疗专业人员)的输出各 150 个,供评估者进行评价。
    • 综合 Likert 评分和情感影响分析,覆盖四维(适当性、参与性、有效性、专业性)。
  4. 定性反馈收集:允许评估者回复提供详细意见,提炼模式和趋势。
  5. 统计分析:使用线性混合模型和主题内容分析,识别生成模式和结果差异。

研究成果

取得了哪些具体成果?

  • GPT-4 生成的 JITAIs 在适当性、参与性、有效性和专业性评分上显著优于非专业人群和医疗专业人员生成的内容。
  • 情境评价(如受试者体验的正/负面影响)表明 GPT-4 所生成干预具有更高的情感接受度(更少引发负面情感)。
  • 参与者难以区分 GPT-4 与医疗专业人员生成的内容,这进一步暗示了 GPT-4 的效能。

与现有解决方案相比,它有哪些优势?

  • 更强适应性:GPT-4 能动态理解复杂情境,比传统基于规则的 JITAIs 灵活。
  • 扩展能力:LLMs 在处理高维度数据流、自动生成上下文相关内容方面更具优势,可实现规模化干预。
  • 可靠性和一致性:GPT-4 输出的一致性高于人工生成内容,尤其适应于长时间间隔的健康干预。

实验或评估结果是什么?

  • 量化指标
    • GPT-4 生成干预的四维评分显著高于其他组(如适当性均值提升约 1 分,尺度点为 7 分)。
    • 量化的一致性验证(Cohen’s Kappa)显示 GPT-4 生成的内容在评估者中的评分一致性最高。
  • 定性反馈
    • GPT-4 的内容普遍被认为更个性化、更贴合情境需求。
    • GPT-4 引发的负面反馈比例显著低于其他两组生成者。

局限性与未来方向

  • 局限性
    • 模拟情境下的研究设计,结果尚未被实际部署环境验证。
    • 模型的实时生成效果可能因为实现时间不同(GPT-4 技术变化)而有所偏差。
    • 没有对比传统 JITAIs(如规则系统或机器学习)产生的结果。
  • 未来方向
    • 进一步测试 LLM 为 JITAIs 实时生成干预内容的实际效果(如跨越意图-行为的差距)。
    • 结合健康领域的强化学习机制,为 LLM 提供更优质的用户反馈循环。
    • 研究混合集成模型,将 LLM 与知识本体融合,比如检索-增强生成 (RAG),以提升专业性。
    • 通过连续部署来探索动态个性化干预在真实生活中的有效性和接受性。

通过本研究,LLMs 在健康干预场景中的潜在优势(如动态生成、多模态数据处理)得到了初步证实,为 Just-in-Time Adaptive Intervention 提供了一种可行且具有前景的改进路径。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188381/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713307
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
10 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、心理健康应用与在线支持社区、环境感知与上下文计算
work
职业/产业
医生、护士、临床医生、物理治疗师与康复治疗师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文