“让我来帮忙”:人与网络代理协作中用户干预的实证研究

荣誉提名
大语言模型(LLM)的人机协作AI 辅助决策与自动化系统用户研究方法(访谈、调查、观察)原型设计与用户测试软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师

文献标题

'Here, Let Me Help': An Empirical Study of User Interventions in Human–Web Agent Collaboration

出版信息

  • 主题领域: 人类与网页代理协作中的用户干预。
  • 关键词: 网页代理、人机协作、用户干预、混合主动系统、可用性、任务完成、用户行为、大型语言模型、界面自动化、实证研究。

背景与问题

  • 问题/挑战: 当前的网页代理在准确性、延迟和任务复杂性方面存在不足,需要人类进行干预。现有研究主要关注基于结果的指标,而忽视了人类与代理协作过程中动态的过程层面。
  • 重要性: 理解用户干预对提升网页代理的可用性、可靠性和协作性至关重要,尤其是在代理仍然不完美且容易出错的情况下。
  • 动机与相关工作: 以往的研究探索了网页代理、基准测试和混合主动系统,但缺乏对用户在代理执行过程中为何以及如何干预的系统性理解。本研究通过分析干预行为并提出分类法来填补这一空白。

解决方案

  • 提出的方法: 对网页代理执行过程中用户干预的系统性实证研究,聚焦于干预的原因、类型和模式。
  • 创新点:
    1. 提出干预原因和类型的分类法,区分显性干预和隐性干预。
    2. 分析可用性感知及其与干预行为之间的关系。
    3. 提出改进混合主动系统的可操作设计建议。
    4. 提供关于任务和领域特定因素如何影响干预的洞察。
  • 研究程序和关键技术:
    • 在实验室中开展研究,30名参与者在购物、旅行和信息领域的真实网站上完成12项任务。
    • 收集交互日志、用户输入和屏幕录制以分析干预行为。
    • 开发干预原因(如指令与行动不匹配、不完整任务终止)和类型(如提示重构、直接替代)的分类法。
    • 对主观可用性评分和行为指标进行定量分析。

结果

  • 具体发现:
    • 44.2%的任务在无干预的情况下完成,29.7%的任务在干预后完成,14.7%的任务尽管有干预仍然失败。
    • 用户界面误解(41%)和指令误解(23%)是最常见的干预原因。
    • 显性干预(如提示重构、直接替代)比隐性干预(如跟踪、交叉检查)更为频繁。
    • 干预频率越高,与感知的有效性、满意度和信任度越低相关。
  • 相较基线的优势: 提供了用户干预的过程层面洞察,而这些在基于结果的网页代理评估中是缺失的。
  • 实验/评估:
    • 任务来源于基准测试,并围绕四种活动类型(导航、查找、收集、交易)进行结构化设计。
    • 使用基于GPT-4o的通用网页代理执行任务。
    • 测量可用性(有效性、易用性、满意度、信任度)和干预行为。
  • 局限性与未来工作:
    • 仅限于新手用户和三个领域(购物、旅行、信息)。
    • 未捕捉长期行为演变或高风险情境。
    • 未来研究应探索更广泛的领域、更有经验的用户以及更丰富的行为信号(如眼动追踪)。

总结

本研究通过一项系统的实验室实验,调查了人类与网页代理协作中的用户干预行为,30名参与者在三个领域完成了12项任务。研究提出了干预原因(如指令与行动不匹配、不完整任务终止)和类型(如提示重构、直接替代)的分类法,揭示了系统性模式及其对可用性的影响。研究结果强调了干预频率与用户满意度之间的权衡,突出了协作性混合主动系统的必要性。研究提供了可操作的设计建议,例如改进提示框架、增强进度可见性以及解决因延迟引发的干预,以支持无缝的人机协作。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222579/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791536
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文