ILuvUI:通过机器对话进行UI的指令微调语言-视觉建模

语音用户界面(VUI)设计大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师

多模态视觉-语言模型(VLMs)因其融合的图像和语言理解能力而支持强大的应用,但许多模型由于缺乏UI训练数据而在UI任务上表现不佳。本文通过将现有的基于像素的方法与大语言模型(LLM)相结合,为VLMs生成配对的文本-图像训练数据适应到UI领域。与现有方法不同,我们的方法不需要人工提供的注释,并且可以应用于任何UI截图数据集。我们生成了一个包含35.3万对话示例与UI配对的数据集,涵盖问答、UI描述和规划,并使用它来微调用于UI任务的对话VLM。为了评估我们模型的性能,我们在UI元素检测任务上进行了基准测试,评估了响应质量,并展示了其在UI验证中的适用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/195813/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712129
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文