先计划后执行:一项关于用户信任和团队表现的经验研究,当使用LLM代理作为日常助手时

大语言模型(LLM)的人机协作AI 辅助决策与自动化系统

研究背景与问题

  • 作者发现了哪些问题或挑战?

    • 虽然大型语言模型(LLMs)具有作为日常助理的潜力,但尚不清楚它们在规划和顺序决策任务中的有效性如何。
    • 用户在与LLM代理合作时,信任的建立和调节机制不明确。
    • 对于简单任务,LLMs表现出良好性能,但在涉及高风险任务(如货币交易或信用卡支付)时,其可靠性和使用信任存在问题。
    • 用户过度信任或不信任AI可能导致对系统的不当依赖或低效。
  • 为什么这个问题很重要?

    • LLM代理作为日常助理,可以在各类任务场景中提升工作效率和减少人工负担,但其错误可能导致高风险后果(如财务损失)。
    • 人类和AI的协作研究对于设计更高效的AI系统以及改善人类对AI的使用体验至关重要。
  • 研究动机与相关工作

    • 现有研究表明,LLMs在任务解决中的逻辑规划灵活性和交互性较高,但其自动化的规划能力有限,需要结合用户的参与来改善性能。
    • 信任调节和适当的依赖对于人机协作至关重要,但现有实验主要集中于具体用例,而缺少对日常任务场景中LLM代理的全面研究。

解决方案

  • 作者提出了哪些方法或解决方案?

    • 使用“计划-然后执行”(Plan-then-Execute)框架,分解LLM代理的规划和执行过程。用户可以分别在高层规划和实时执行阶段参与,以控制计划质量和修复执行错误。
    • 提出2×2因子实验设计,研究LLM代理的自动化程度(自动规划/用户参与规划、自动执行/用户参与执行)对用户信任和任务性能的影响。
  • 该解决方案的创新之处是什么?

    • 整合用户参与与LLM的自动化能力,旨在探索人类参与对信任校准和任务成果的具体影响。
    • 提供用户交互接口,让用户能灵活地编辑和校正计划以及执行结果,以实现更高效的任务完成。
    • 首次在综合任务场景(低风险、高风险,简单、复杂)中验证LLM代理的效果和局限性。
  • 实施步骤是什么?使用了哪些关键技术?

    1. 规划阶段
      • 用户基于LLM生成的分步计划评估并编辑,包括添加/删除/拆分步骤。
    2. 执行阶段
      • 用户检查LLM的每一步执行动作,选择接受、反馈或覆盖执行选项。
      • LLM代理的动作通过预定义的API模拟实现。
    3. 实验设计
      • 248名被试分别测试6个任务(如货币交易、信用卡支付、旅行计划等)。
      • 收集用户信任、校准信任(对计划/执行结果是否准确的判断)、任务性能(计划质量和执行准确率)以及用户的主观感受。

研究成果

  • 取得了哪些具体成果?

    • 用户参与在修复缺陷计划和错误执行方面有效提升了任务性能。
    • 任务性能与计划质量高度相关,但用户参与的计划编辑可能在某些情况下反而降低了计划质量(如原本正确的计划被误编辑)。
    • 用户对于LLM生成的“表面上可信但错误”的计划产生了非校准信任,导致依赖失误。
    • 用户参与显著增加了认知负担,降低了对任务的信心。
  • 与现有解决方案相比,它有哪些优势?

    • 提供了用户直接校正AI代理的能力,特别是在执行阶段发现重大错误时。
    • 综合考虑了信任、任务性能和用户认知负担之间的权衡,并指出不同任务类型需采取差异化的人机协作设计。
  • 实验或评估结果是什么?

    • 信任校准:用户对高质量计划的校准信任比低质量计划更高,但用户参与未显著提高这种校准信任。
    • 任务性能
      • 在具有显著缺陷的计划中(如“包含语法错误的计划”),用户参与显著改善了计划的总体质量。
      • 用户参与执行提高了任务最终执行准确性,但在严格评估动作序列时,自动化执行表现优于用户参与。
    • 用户认知负担:用户在参与规划和执行时的认知负担显著高于自动模式。
  • 局限性与未来方向

    • 局限性
      • 当前实验基于受控模拟环境,未完全涵盖真实世界任务的复杂场景。
      • 用户在“表面可信但错误”的生成计划面前易产生高信任但导致误用。
    • 未来方向
      • 开发动态灵活的协作工作流,允许用户在规划和执行过程中多次校正。
      • 研究如何提供透明度和反馈以降低认知负担,同时提升用户对LLM代理生成内容的批判性。
      • 探索风险评估机制,根据任务复杂性与风险动态调整用户参与程度。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189597/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713218
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文