从交互到影响:通过理解与评估移动端UI操作影响构建更安全的AI智能体
作者
生成式AI(文本、图像、音乐、视频)AI 辅助决策与自动化系统软件工程师与开发者AI/ML 研究员与工程师
随着生成式AI的发展,越来越多的研究致力于创建能够通过操作用户界面(UI)来管理日常任务的自主智能体。先前的研究探讨了AI智能体如何导航UI并理解UI结构,但智能体及其自主操作的影响——尤其是那些可能存在风险或不可逆的操作——仍未得到充分探索。本研究调查了AI智能体执行移动端UI操作的真实世界影响和后果。我们首先通过与领域专家的一系列研讨会开发了移动端UI操作影响的分类法。随后,我们进行了一项数据综合研究,收集用户认为有影响的真实移动端UI屏幕轨迹和操作数据。然后,我们使用影响分类法对收集的数据以及从现有移动端UI导航数据集重新利用的数据进行标注。我们对不同大型语言模型(LLM)及其变体进行了定量评估,以展示不同LLM理解智能体可能采取的移动端UI操作影响的能力。我们的分类法增强了这些LLM理解移动端UI操作影响的推理能力,但研究结果也揭示了它们在可靠分类更细微或更复杂的影响类别方面存在显著差距。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 生成式人工智能在用户界面操作中会带来哪些可能的影响?分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
- 如何构建一个多维分类体系来系统分析UI操作的影响?分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
- 大语言模型(LLMs)在预测UI操作潜在影响时表现如何?分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
lightbulb
现实痛点
1- 当AI操控手机界面时,用户可能面临安全和隐私威胁。分类: AI/LLM 作为设计协作者与创意工具同类问题arrow_forward
- 80%
GenComUI:探索生成式视觉辅助作为支持任务导向人机通信的媒介
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 80%
专业能力的新表现:软件工程师使用AI编码助手评估和展示编码专长
CHI '26· 大语言模型(LLM)的人机协作 +2
- 80%
从初级到高级:代理AI介导的软件工程中分配代理与导航职业成长
CHI '26· 大语言模型(LLM)的人机协作 +2
- 80%
开发者与主动式AI的交互模式:一项为期五天的实地研究
IUI '26· AI 辅助决策与自动化系统 +2
- 67%
为神经形态编程设计可访问且直观的开发工具
CHI '25· 生成式AI(文本、图像、音乐、视频) +2
- 67%
氛围编程的纠缠——重新定位生成式 AI 编程中意图、作者身份与责任的边界
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
大规模颜色-名称数据集的对比学习:利用负采样解决稀疏性问题
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 67%
Gemini 在工作场所:知识工作者对生产力提升的感知与评估
DIS '25· 生成式AI(文本、图像、音乐、视频) +3
- 67%
PREDILECT:基于零样本语言推理的强化学习偏好提取方法
HRI '24· 生成式AI(文本、图像、音乐、视频) +2
- 67%
指导来源的重要性:AI、专家或分析师团队的指导如何影响视觉数据准备和分析
IUI '25· 生成式AI(文本、图像、音乐、视频) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712153
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 辅助决策与自动化系统
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文