ILuvUI:通过机器对话进行UI的指令微调语言-视觉建模
语音用户界面(VUI)设计大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师
多模态视觉-语言模型(VLMs)因其融合的图像和语言理解能力而支持强大的应用,但许多模型由于缺乏UI训练数据而在UI任务上表现不佳。本文通过将现有的基于像素的方法与大语言模型(LLM)相结合,为VLMs生成配对的文本-图像训练数据适应到UI领域。与现有方法不同,我们的方法不需要人工提供的注释,并且可以应用于任何UI截图数据集。我们生成了一个包含35.3万对话示例与UI配对的数据集,涵盖问答、UI描述和规划,并使用它来微调用于UI任务的对话VLM。为了评估我们模型的性能,我们在UI元素检测任务上进行了基准测试,评估了响应质量,并展示了其在UI验证中的适用性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 多模态视觉-语言模型(VLMs)在图形用户界面(UI)任务中的表现为何较差?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 如何针对UI任务生成无人工标注的高质量图文训练数据?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 改进后的多模态模型在UI元素识别、描述生成和任务规划中能达到什么性能水平?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
lightbulb
现实痛点
1- 用户难以有效理解复杂界面,阻碍自动化操作和无障碍技术发展。分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 100%
内容驱动的本地响应:支持带有和不带有AI的句子级和消息级移动电子邮件回复
CHI '25· 语音用户界面(VUI)设计 +1
- 100%
Vajra:基于自然语言的逐步编程系统
IUI '19· 语音用户界面(VUI)设计 +1
- 80%
使用大型语言模型实现与移动UI的对话交互
CHI '23· 语音用户界面(VUI)设计 +1
- 80%
Screen2Words:基于多模态学习的自动移动端UI摘要生成
UIST '21· 语音用户界面(VUI)设计 +1
- 75%
Tap&Say:结合触摸位置的大型语言模型,用于智能手机上的多模态文本校正
CHI '25· 大语言模型(LLM)的人机协作
- 67%
ReactGenie:使用大型语言模型开发复杂多模式交互的框架
CHI '24· 语音用户界面(VUI)设计 +2
- 67%
自动驾驶移动办公室中语音转文本的多模态错误纠正:远程研究结果
IUI '22· 自动驾驶界面与接管设计 +2
- 67%
VoiceAlign:一个用于增强传统语音用户界面系统可用性的自适应中间层
IUI '26· 语音用户界面(VUI)设计 +2
- 67%
ReMap:通过多模态搜索降低寻求帮助的门槛
UIST '20· 语音用户界面(VUI)设计 +2
- 60%
GestAKey: 个体键帽上的触控交互
CHI '18· 手部手势识别 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712129
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文