Cocoa:与AI智能体的协作规划与协同执行

最佳论文
大语言模型(LLM)的人机协作原型设计与用户测试计算方法在HCI中的应用大学教授与研究人员HCI 研究员AI/ML 研究员与工程师

文献标题

Cocoa: Co-Planning and Co-Execution with AI Agents

出版信息

  • 主题领域: 人工智能与人类协作的科学研究工作流
  • 关键词: AI代理、人机协作、共同规划、共同执行、科学研究、计算笔记本、交互系统、大型语言模型、任务委派、文档编辑

背景与问题

  • 问题/挑战: 现有的研究领域AI系统通常将规划和执行严格分离,或依赖固定的协作工作流,限制了灵活性和用户控制。这些系统缺乏流畅的人机协作机制,无法支持任务执行过程中的迭代调整。
  • 重要性: 解决这些限制可以提高AI代理在复杂知识密集型领域(如科学研究)中的可用性、可控性和有效性。
  • 动机与相关工作: 之前的系统探索了代理引导和用户引导的工作流,但缺乏灵活的代理委派机制。完全自主系统如ReAct将规划与执行交替进行,但未涉及人类协作。计算笔记本为迭代工作流提供了灵感,但尚未被改造用于科学研究中的人机协作。

解决方案

  • 提出的方法: Cocoa,一个交互式系统,将AI代理集成到文档编辑器中,以实现科学研究任务的交替共同规划和共同执行。
  • 创新点:
    1. 引入交替共同规划和共同执行,使用户和AI代理能够协作规划并迭代执行任务。
    2. 灵活的任务委派机制,允许根据上下文进行调整。
    3. 将AI代理集成到文档编辑环境中,借鉴计算笔记本的设计,支持直观的交互式工作流。
  • 流程与关键技术:
    • 用户调用代理提出计划,计划内容可在文档中进行编辑和交互。
    • 计划中的任务可以分配给用户或代理,并支持逐步或连续执行。
    • 用户可以编辑输出、重新规划步骤,并动态交替进行规划和执行。
    • 输出以交互式侧边栏或文档中的最终摘要面板形式呈现。

结果

  • 具体发现:
    • 在实验室研究中(n = 16),Cocoa提高了代理的可控性(中位评分为4,相较于聊天基线的3,p = 0.005),同时未降低易用性。
    • 在实际应用部署中(n = 7),用户利用Cocoa进行文献综述和早期项目规划,将高层任务分配给自己,将迭代任务分配给代理。
  • 相较基线的优势:
    • Cocoa减少了被动输出检查时间(33.6% vs. 基线的54.1%),并通过共同执行增加了主动参与时间(15.2% vs. 3.1%,p < 0.001)。
    • 参与者认为Cocoa结构化、可编辑的计划相比聊天界面更有效地引导代理。
  • 实验/评估:
    • 实验室研究: 采用被试内设计,比较Cocoa与基于聊天的基线在文献增强任务中的表现。
    • 部署研究: Cocoa在真实研究项目中的7天使用情况,跟踪任务委派和迭代工作流。
  • 局限性与未来工作:
    • Cocoa的线性文档格式限制了计划分叉和并行迭代;未来工作可探索基于节点的画布。
    • 系统缺乏多模态能力和代码执行支持。
    • 研究仅限于计算机科学及相关领域的研究人员;需要探索更广泛的领域。

总结

Cocoa是一个交互式系统,允许科学研究人员在文档编辑环境中与AI代理协作规划和执行任务。通过交替共同规划和共同执行,Cocoa使用户能够迭代优化计划和输出,相较于传统的基于聊天的界面提供了更大的灵活性和控制力。实验室和实际应用研究表明,Cocoa提高了代理的可控性,并支持动态的人机协作,同时未降低易用性。未来工作可以扩展Cocoa的功能,以支持多模态输入、层次化计划以及更广泛的研究领域。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223085/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791673
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
9 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、原型设计与用户测试、计算方法在HCI中的应用
work
职业/产业
大学教授与研究人员、HCI 研究员、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
8 篇相关论文