SeekUI:基于增强奖励视觉语言模型的图形用户界面视觉搜索行为预测
眼动追踪与注视交互可解释人工智能(XAI)用户研究方法(访谈、调查、观察)原型设计与用户测试UI/UX 设计师软件工程师与开发者HCI 研究员
文献标题
SeekUI: Predicting Visual Search Behavior on Graphical User Interfaces with a Reward-Augmented Vision Language Model
出版信息
- 主题领域: 图形用户界面(GUI)上的视觉搜索行为建模。
- 关键词: 视觉搜索、扫描路径预测、图形用户界面、视觉语言模型、强化学习、人机交互、可用性测试、多模态建模、布局优化、眼动追踪。
背景与问题
- 问题/挑战: 现有针对视觉搜索的模型,尤其是那些基于自然图像或自由观看任务训练的模型,无法准确预测用户在GUI上的扫描路径。这是因为它们无法有效考虑GUI特定的结构、语义以及任务驱动的行为。
- 重要性: 准确预测GUI上的视觉搜索行为对于提高可用性、减少用户挫败感以及支持界面设计和优化至关重要,同时无需进行大量用户测试。
- 动机与相关工作: 之前的研究已经识别出用户在GUI上的关键搜索行为,例如“猜测–扫描–确认”策略,但尚无计算模型能够在多种界面类型中成功再现这些模式。现有模型缺乏将GUI布局理解和任务驱动线索整合到扫描路径预测中的能力。
解决方案
- 提出的方法: SeekUI,一种奖励增强型视觉语言模型(VLM),通过整合视觉和文本线索,并利用强化学习(RL)进行序列级优化,预测类似人类的GUI扫描路径。
- 创新点:
- 引入解释建模,不仅预测用户“看哪里”,还预测“看什么以及为什么”驱动其视线移动。
- 使用两阶段训练过程:通过指令微调实现解释–扫描路径对齐,并通过RL微调提高扫描路径的连贯性。
- 展示类似人类行为的再现,包括“猜测–扫描–确认”策略以及对视觉杂乱的敏感性。
- 支持无需眼动追踪数据的GUI评估和布局优化的实际应用。
- 流程与关键技术:
- 指令微调: 使用经过筛选的数据集(包括合成解释)微调VLM,从GUI截图和文本目标线索生成解释和扫描路径。
- 强化学习: 使用基于ScanMatch的奖励函数优化扫描路径预测,以增强与人类行为的空间和时间对齐。
- 评估: 使用ScanMatch、MultiMatch以及成功率等指标,将SeekUI与基线模型进行比较,并评估其再现人类搜索特性的能力。
结果
- 具体发现:
- SeekUI在目标定位上的成功率达到62%,接近人类基准的70%,远超基线模型(≤18%)。
- 在指标如ScanMatch(0.347对比基线的0.236)和NSS(1.394对比基线的0.810)上显著提升。
- 准确再现人类搜索模式,包括眼跳方向偏好、重尾眼跳长度以及由杂乱驱动的搜索时间。
- 相较基线的优势:
- 在所有评估指标和GUI类型(移动端、桌面端、网页端)上,超越自由观看和自然图像搜索的最先进模型。
- 在任务驱动的搜索场景中,与人类扫描路径的对齐度更高,成功率更高。
- 实验/评估:
- 数据集: VSGUI10K,包括1,616条人类扫描路径和730张GUI截图。
- 指标: ScanMatch、MultiMatch、SED、NSS、AUC等,用于评估空间、时间和分布上的对齐。
- 消融研究证实了解释建模和RL对性能的重要性。
- 局限性与未来工作:
- 在目标模糊和高度杂乱的GUI上表现较弱。
- 仅限于基于文本的目标线索;未来工作可整合多模态信号(如图标、颜色)。
- 未建模动态交互,如滚动或多页面导航。
- 缺乏显式认知机制,主要依赖统计学习。
总结
SeekUI是一种奖励增强型视觉语言模型,旨在预测GUI上的类似人类的视觉搜索行为。通过整合视觉和文本线索,并采用解释建模和强化学习,SeekUI在扫描路径预测中实现了最先进的性能,超越基线模型的准确性和人类相似性。它再现了关键行为模式,例如“猜测–扫描–确认”策略,并支持GUI评估和布局优化的实际应用。未来工作可进一步解决目标模糊、动态交互以及更丰富的多模态线索,以增强其适用性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
一种用于个人层次结构时间效率的分析模型
CHI '19· 用户研究方法(访谈、调查、观察) +1
- 63%
Eye-Write:用于协作写作的眼神共享
CHI '19· 眼动追踪与注视交互 +2
- 63%
Screen2Vec: GUI屏幕和GUI组件的语义嵌入
CHI '21· 可解释人工智能(XAI) +2
- 63%
从标签页到结构:理解与支持网页管理
CHI '26· 知识工作者工具与工作流 +2
- 63%
界面差异性:研究影响图形用户界面感知差异的特征
CHI '26· 用户研究方法(访谈、调查、观察) +2
- 63%
文档阅读软件中AI边注的设计与评估
CHI '26· AI辅助写作与文本生成 +2
- 63%
SlideAudit:用于演示幻灯片自动评估的数据集与分类法
UIST '25· 可解释人工智能(XAI) +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791178
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
眼动追踪与注视交互、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
UI/UX 设计师、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文