先计划后执行:一项关于用户信任和团队表现的经验研究,当使用LLM代理作为日常助手时
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统
研究背景与问题
-
作者发现了哪些问题或挑战?
- 虽然大型语言模型(LLMs)具有作为日常助理的潜力,但尚不清楚它们在规划和顺序决策任务中的有效性如何。
- 用户在与LLM代理合作时,信任的建立和调节机制不明确。
- 对于简单任务,LLMs表现出良好性能,但在涉及高风险任务(如货币交易或信用卡支付)时,其可靠性和使用信任存在问题。
- 用户过度信任或不信任AI可能导致对系统的不当依赖或低效。
-
为什么这个问题很重要?
- LLM代理作为日常助理,可以在各类任务场景中提升工作效率和减少人工负担,但其错误可能导致高风险后果(如财务损失)。
- 人类和AI的协作研究对于设计更高效的AI系统以及改善人类对AI的使用体验至关重要。
-
研究动机与相关工作
- 现有研究表明,LLMs在任务解决中的逻辑规划灵活性和交互性较高,但其自动化的规划能力有限,需要结合用户的参与来改善性能。
- 信任调节和适当的依赖对于人机协作至关重要,但现有实验主要集中于具体用例,而缺少对日常任务场景中LLM代理的全面研究。
解决方案
-
作者提出了哪些方法或解决方案?
- 使用“计划-然后执行”(Plan-then-Execute)框架,分解LLM代理的规划和执行过程。用户可以分别在高层规划和实时执行阶段参与,以控制计划质量和修复执行错误。
- 提出2×2因子实验设计,研究LLM代理的自动化程度(自动规划/用户参与规划、自动执行/用户参与执行)对用户信任和任务性能的影响。
-
该解决方案的创新之处是什么?
- 整合用户参与与LLM的自动化能力,旨在探索人类参与对信任校准和任务成果的具体影响。
- 提供用户交互接口,让用户能灵活地编辑和校正计划以及执行结果,以实现更高效的任务完成。
- 首次在综合任务场景(低风险、高风险,简单、复杂)中验证LLM代理的效果和局限性。
-
实施步骤是什么?使用了哪些关键技术?
- 规划阶段:
- 用户基于LLM生成的分步计划评估并编辑,包括添加/删除/拆分步骤。
- 执行阶段:
- 用户检查LLM的每一步执行动作,选择接受、反馈或覆盖执行选项。
- LLM代理的动作通过预定义的API模拟实现。
- 实验设计:
- 248名被试分别测试6个任务(如货币交易、信用卡支付、旅行计划等)。
- 收集用户信任、校准信任(对计划/执行结果是否准确的判断)、任务性能(计划质量和执行准确率)以及用户的主观感受。
- 规划阶段:
研究成果
-
取得了哪些具体成果?
- 用户参与在修复缺陷计划和错误执行方面有效提升了任务性能。
- 任务性能与计划质量高度相关,但用户参与的计划编辑可能在某些情况下反而降低了计划质量(如原本正确的计划被误编辑)。
- 用户对于LLM生成的“表面上可信但错误”的计划产生了非校准信任,导致依赖失误。
- 用户参与显著增加了认知负担,降低了对任务的信心。
-
与现有解决方案相比,它有哪些优势?
- 提供了用户直接校正AI代理的能力,特别是在执行阶段发现重大错误时。
- 综合考虑了信任、任务性能和用户认知负担之间的权衡,并指出不同任务类型需采取差异化的人机协作设计。
-
实验或评估结果是什么?
- 信任校准:用户对高质量计划的校准信任比低质量计划更高,但用户参与未显著提高这种校准信任。
- 任务性能:
- 在具有显著缺陷的计划中(如“包含语法错误的计划”),用户参与显著改善了计划的总体质量。
- 用户参与执行提高了任务最终执行准确性,但在严格评估动作序列时,自动化执行表现优于用户参与。
- 用户认知负担:用户在参与规划和执行时的认知负担显著高于自动模式。
-
局限性与未来方向
- 局限性:
- 当前实验基于受控模拟环境,未完全涵盖真实世界任务的复杂场景。
- 用户在“表面可信但错误”的生成计划面前易产生高信任但导致误用。
- 未来方向:
- 开发动态灵活的协作工作流,允许用户在规划和执行过程中多次校正。
- 研究如何提供透明度和反馈以降低认知负担,同时提升用户对LLM代理生成内容的批判性。
- 探索风险评估机制,根据任务复杂性与风险动态调整用户参与程度。
- 局限性:
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 在不同任务情境下,用户参与对LLM(大型语言模型)规划和执行的信任校准和任务表现有何影响?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 用户参与LLM规划和执行的过程中,如何平衡信任、任务表现和用户认知负担?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- LLM在高风险任务(如金融交易)中的可靠性如何表现,用户参与能否显著降低错误率?分类: LLM 信任与过度/不足依赖同类问题arrow_forward
lightbulb
现实痛点
1- 用户在高风险任务中难以信任和正确使用AI助手,可能导致错误或损失。分类: LLM 信任与过度/不足依赖同类问题arrow_forward
- 100%
重新思考交互:从工具性交互到人机合作
CHI '18· 大语言模型(LLM)的人机协作 +1
- 100%
依赖还是不依赖?评估对大型语言模型适当依赖的干预措施
CHI '25· 大语言模型(LLM)的人机协作 +1
- 100%
通过LLM驱动的魔鬼代言人增强AI辅助群体决策
IUI '24· 大语言模型(LLM)的人机协作 +1
- 100%
C-PAK:纠正和补全基于可变长度前缀的缩写击键
UIST '23· 大语言模型(LLM)的人机协作 +1
- 67%
使用数字记录员自动化临床文档:理解对医生的影响
CHI '21· 大语言模型(LLM)的人机协作 +1
- 67%
统一对话模型中系统发起的闲聊与任务导向对话之间的转换
CUI '23· 对话式聊天机器人 +2
- 67%
TiiS:交互式机器学习的用户界面设计综述
IUI '19· 大语言模型(LLM)的人机协作 +2
- 67%
通过短言语反应时间诱导多智能体决策交互中的主动态度
IUI '19· 会话代理的人格与拟人化 +2
- 67%
探索机器学习素养干预对普通人依赖机器学习模型的影响
IUI '22· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713218
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文