SeekUI:基于增强奖励视觉语言模型的图形用户界面视觉搜索行为预测

眼动追踪与注视交互可解释人工智能(XAI)用户研究方法(访谈、调查、观察)原型设计与用户测试UI/UX 设计师软件工程师与开发者HCI 研究员

文献标题

SeekUI: Predicting Visual Search Behavior on Graphical User Interfaces with a Reward-Augmented Vision Language Model

出版信息

  • 主题领域: 图形用户界面(GUI)上的视觉搜索行为建模。
  • 关键词: 视觉搜索、扫描路径预测、图形用户界面、视觉语言模型、强化学习、人机交互、可用性测试、多模态建模、布局优化、眼动追踪。

背景与问题

  • 问题/挑战: 现有针对视觉搜索的模型,尤其是那些基于自然图像或自由观看任务训练的模型,无法准确预测用户在GUI上的扫描路径。这是因为它们无法有效考虑GUI特定的结构、语义以及任务驱动的行为。
  • 重要性: 准确预测GUI上的视觉搜索行为对于提高可用性、减少用户挫败感以及支持界面设计和优化至关重要,同时无需进行大量用户测试。
  • 动机与相关工作: 之前的研究已经识别出用户在GUI上的关键搜索行为,例如“猜测–扫描–确认”策略,但尚无计算模型能够在多种界面类型中成功再现这些模式。现有模型缺乏将GUI布局理解和任务驱动线索整合到扫描路径预测中的能力。

解决方案

  • 提出的方法: SeekUI,一种奖励增强型视觉语言模型(VLM),通过整合视觉和文本线索,并利用强化学习(RL)进行序列级优化,预测类似人类的GUI扫描路径。
  • 创新点:
    1. 引入解释建模,不仅预测用户“看哪里”,还预测“看什么以及为什么”驱动其视线移动。
    2. 使用两阶段训练过程:通过指令微调实现解释–扫描路径对齐,并通过RL微调提高扫描路径的连贯性。
    3. 展示类似人类行为的再现,包括“猜测–扫描–确认”策略以及对视觉杂乱的敏感性。
    4. 支持无需眼动追踪数据的GUI评估和布局优化的实际应用。
  • 流程与关键技术:
    1. 指令微调: 使用经过筛选的数据集(包括合成解释)微调VLM,从GUI截图和文本目标线索生成解释和扫描路径。
    2. 强化学习: 使用基于ScanMatch的奖励函数优化扫描路径预测,以增强与人类行为的空间和时间对齐。
    3. 评估: 使用ScanMatch、MultiMatch以及成功率等指标,将SeekUI与基线模型进行比较,并评估其再现人类搜索特性的能力。

结果

  • 具体发现:
    • SeekUI在目标定位上的成功率达到62%,接近人类基准的70%,远超基线模型(≤18%)。
    • 在指标如ScanMatch(0.347对比基线的0.236)和NSS(1.394对比基线的0.810)上显著提升。
    • 准确再现人类搜索模式,包括眼跳方向偏好、重尾眼跳长度以及由杂乱驱动的搜索时间。
  • 相较基线的优势:
    • 在所有评估指标和GUI类型(移动端、桌面端、网页端)上,超越自由观看和自然图像搜索的最先进模型。
    • 在任务驱动的搜索场景中,与人类扫描路径的对齐度更高,成功率更高。
  • 实验/评估:
    • 数据集: VSGUI10K,包括1,616条人类扫描路径和730张GUI截图。
    • 指标: ScanMatch、MultiMatch、SED、NSS、AUC等,用于评估空间、时间和分布上的对齐。
    • 消融研究证实了解释建模和RL对性能的重要性。
  • 局限性与未来工作:
    • 在目标模糊和高度杂乱的GUI上表现较弱。
    • 仅限于基于文本的目标线索;未来工作可整合多模态信号(如图标、颜色)。
    • 未建模动态交互,如滚动或多页面导航。
    • 缺乏显式认知机制,主要依赖统计学习。

总结

SeekUI是一种奖励增强型视觉语言模型,旨在预测GUI上的类似人类的视觉搜索行为。通过整合视觉和文本线索,并采用解释建模和强化学习,SeekUI在扫描路径预测中实现了最先进的性能,超越基线模型的准确性和人类相似性。它再现了关键行为模式,例如“猜测–扫描–确认”策略,并支持GUI评估和布局优化的实际应用。未来工作可进一步解决目标模糊、动态交互以及更丰富的多模态线索,以增强其适用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222994/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791178
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
眼动追踪与注视交互、可解释人工智能(XAI)、用户研究方法(访谈、调查、观察)、原型设计与用户测试
work
职业/产业
UI/UX 设计师、软件工程师与开发者、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文