LLM驱动的GUI代理的行为结构:人类价值观与交互结果
作者
大型语言模型(LLM)驱动的网络GUI代理正日益自动化日常在线任务。尽管它们很受欢迎,但人们对用户偏好和价值观如何影响代理的推理和行为知之甚少。在本工作中,我们研究了显式和隐式用户偏好以及潜在用户价值观如何影响代理决策和行为轨迹。我们构建了一个包含14个常见交互式网络任务的受控测试平台,涵盖购物、旅行、餐饮和住宿领域,每个任务都从真实网站复制并集成低保真LLM推荐系统。我们将12个人类偏好和价值观作为人物角色注入到四个最先进的代理中,并系统地分析他们的任务行为。我们的结果显示,偏好和价值观注入的提示始终引导代理走向反映这些偏好和价值观的结果。虽然缺乏用户偏好或价值观引导导致代理表现出强烈的效率偏见并采用最短路径策略,但它们的存在通过更充分地使用相应过滤器和交互式网络功能来引导代理的行为轨迹。尽管具有影响力,但主导界面线索(如折扣和广告)经常超越这些效果,缩短代理的行为轨迹并诱导合理化,掩盖而非反映与价值观一致的推理。本文的贡献有二:(1)一个用于研究价值观对代理行为影响的开源测试平台;(2)用户偏好和价值观如何塑造网络代理行为的实证研究。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
- 86%
代码属于谁?人工智能自主性如何重塑人工智能辅助编程中的所有权、责任和披露
IUI '26· 大语言模型(LLM)的人机协作 +2
- 71%
行间阅读:建模AI辅助编程中的用户行为和成本
CHI '24· 大语言模型(LLM)的人机协作 +2
- 71%
"如果机器和我一样好,那我还有什么用?" – 使用ChatGPT如何改变年轻专业人士对生产力和成就的看法
CHI '24· 大语言模型(LLM)的人机协作 +1
- 71%
「这对我也会有效」:在线社区如何影响软件开发人员对AI驱动的代码生成工具的信任
IUI '25· 大语言模型(LLM)的人机协作 +1
- 71%
基于 Ply 的生成式触发-动作编程
UIST '25· 大语言模型(LLM)的人机协作 +1
- 67%
ImpReSS:面向对话支持智能体的轻量级隐式推荐系统设计与评估
IUI '26· 大语言模型(LLM)的人机协作 +4
- 63%
使用AI指南规划自然语言失败
CHI '21· 大语言模型(LLM)的人机协作 +2
- 63%
基于模型的强化学习适应用户界面
CHI '21· 大语言模型(LLM)的人机协作 +2
- 63%
Stack Overflow 过时了吗?对 ChatGPT 回答 Stack Overflow 问题特征的经验研究
CHI '24· 大语言模型(LLM)的人机协作 +2
- 63%
理解配置AI在用户体验工作实践中的非使用情况的社会技术因素
CHI '25· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)