“让我来帮忙”:人与网络代理协作中用户干预的实证研究
荣誉提名作者
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
文献标题
'Here, Let Me Help': An Empirical Study of User Interventions in Human–Web Agent Collaboration
出版信息
- 主题领域: 人类与网页代理协作中的用户干预。
- 关键词: 网页代理、人机协作、用户干预、混合主动系统、可用性、任务完成、用户行为、大型语言模型、界面自动化、实证研究。
背景与问题
- 问题/挑战: 当前的网页代理在准确性、延迟和任务复杂性方面存在不足,需要人类进行干预。现有研究主要关注基于结果的指标,而忽视了人类与代理协作过程中动态的过程层面。
- 重要性: 理解用户干预对提升网页代理的可用性、可靠性和协作性至关重要,尤其是在代理仍然不完美且容易出错的情况下。
- 动机与相关工作: 以往的研究探索了网页代理、基准测试和混合主动系统,但缺乏对用户在代理执行过程中为何以及如何干预的系统性理解。本研究通过分析干预行为并提出分类法来填补这一空白。
解决方案
- 提出的方法: 对网页代理执行过程中用户干预的系统性实证研究,聚焦于干预的原因、类型和模式。
- 创新点:
- 提出干预原因和类型的分类法,区分显性干预和隐性干预。
- 分析可用性感知及其与干预行为之间的关系。
- 提出改进混合主动系统的可操作设计建议。
- 提供关于任务和领域特定因素如何影响干预的洞察。
- 研究程序和关键技术:
- 在实验室中开展研究,30名参与者在购物、旅行和信息领域的真实网站上完成12项任务。
- 收集交互日志、用户输入和屏幕录制以分析干预行为。
- 开发干预原因(如指令与行动不匹配、不完整任务终止)和类型(如提示重构、直接替代)的分类法。
- 对主观可用性评分和行为指标进行定量分析。
结果
- 具体发现:
- 44.2%的任务在无干预的情况下完成,29.7%的任务在干预后完成,14.7%的任务尽管有干预仍然失败。
- 用户界面误解(41%)和指令误解(23%)是最常见的干预原因。
- 显性干预(如提示重构、直接替代)比隐性干预(如跟踪、交叉检查)更为频繁。
- 干预频率越高,与感知的有效性、满意度和信任度越低相关。
- 相较基线的优势: 提供了用户干预的过程层面洞察,而这些在基于结果的网页代理评估中是缺失的。
- 实验/评估:
- 任务来源于基准测试,并围绕四种活动类型(导航、查找、收集、交易)进行结构化设计。
- 使用基于GPT-4o的通用网页代理执行任务。
- 测量可用性(有效性、易用性、满意度、信任度)和干预行为。
- 局限性与未来工作:
- 仅限于新手用户和三个领域(购物、旅行、信息)。
- 未捕捉长期行为演变或高风险情境。
- 未来研究应探索更广泛的领域、更有经验的用户以及更丰富的行为信号(如眼动追踪)。
总结
本研究通过一项系统的实验室实验,调查了人类与网页代理协作中的用户干预行为,30名参与者在三个领域完成了12项任务。研究提出了干预原因(如指令与行动不匹配、不完整任务终止)和类型(如提示重构、直接替代)的分类法,揭示了系统性模式及其对可用性的影响。研究结果强调了干预频率与用户满意度之间的权衡,突出了协作性混合主动系统的必要性。研究提供了可操作的设计建议,例如改进提示框架、增强进度可见性以及解决因延迟引发的干预,以支持无缝的人机协作。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 88%
访谈驱动的生成代理用于产品发现:一项验证研究
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
即时目标:一种用于专业人工智能交互的通用方法
CHI '26· 大语言模型(LLM)的人机协作 +3
- 88%
ImpReSS:面向对话支持智能体的轻量级隐式推荐系统设计与评估
IUI '26· 大语言模型(LLM)的人机协作 +4
- 86%
辅助还是干扰?探讨和评估主动AI编程支持的设计和权衡
CHI '25· 大语言模型(LLM)的人机协作 +2
- 86%
PointAloud:AI支持的指针中心发声计算交互套件
CHI '26· 大语言模型(LLM)的人机协作 +2
- 75%
DALL:基于数据编程和大型语言模型增强的主动学习进行数据标注
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
数据与提示词协同演化:通过扩展测试集优化大语言模型行为
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
隐形导师:从屏幕录制推断用户操作以推荐更好的工作流程
CHI '26· 大语言模型(LLM)的人机协作 +3
- 75%
居于循环之中:面向提示的快速运行时反馈
CHI '26· 大语言模型(LLM)的人机协作 +3
- 71%
《并非总是发现时间》:设计AI系统的四种实用方法
CHI '22· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791536
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文