学习基于网络的多模态移动用户界面嵌入
AI 辅助决策与自动化系统推荐系统用户体验UI/UX 设计师AI/ML 研究员与工程师
文献标题
Learning Network-Based Multi-Modal Mobile User Interface Embeddings
文献信息
- 主题领域: 移动用户界面设计、多模态网络表示学习、深度学习
- 关键词: 网络嵌入,移动应用用户界面,无监督检索,多模态,多任务学习
研究背景与问题
-
发现的问题或挑战:
- 移动用户界面设计蕴含丰富的多模态信息(如文本、代码、图像、类别和数值数据),目前的方法无法有效捕获这些信息的综合语义。
- 现有的检索系统仅依赖关键词或分类方法,无法充分利用界面设计中的多模态和非欧几里得性质,导致检索和推荐效率低下。
- 多数嵌入生成方法仅专注单一模态,未能有效捕捉网络结构中多模态特征之间的关系。
-
重要性:
- 跨模态的移动应用用户界面表示对于提高界面设计的检索效率、准确性及用户满意度非常重要,尤其是对于大量的真实世界数据(如 RICO 数据集)的应用。
-
研究动机与相关工作:
- 作者分析了现有基于网络嵌入和用户界面检索模型的局限性,包括对多模态信息及多任务学习的支持不足。
- 针对上述问题,本文提出了一个新的多模态嵌入模型(MAAN),旨在综合利用用户界面设计的多模态和异构网络信息。
解决方案
-
提出的方法或解决方案:
- 提出了一种新的无监督模型——多模态注意力驱动的属性网络嵌入模型 (Multi-modal Attention-Based Attributed Network Embedding, MAAN)。
- 基于图变分自编码器(Graph Variational Autoencoder, GVAE),MAAN能够有效联合嵌入多模态和网络结构信息,同时通过注意力机制权衡不同模态的贡献。
-
创新之处:
- 首次结合注意机制与变分自编码器框架,用于多任务学习(如链接预测、属性预测、回归和检索);
- 两阶段编码流程确保生成的嵌入不会被某一模态主导;
- 利用注意力机制自发现不同模态的信息相关性;
- 首次在 GVAE 中引入最大平均差异(MMD)损失项以平衡多任务目标,提高训练稳定性和嵌入意义。
-
实施步骤和关键技术:
- 网络结构表示:
- 构建异构二部图,其中包含 UI 屏幕节点和 UI 元素节点,以及它们之间的边。
- 使用多头注意力机制编码节点特征,并通过图卷积网络(GCN)生成高斯分布的节点嵌入。
- 多模态信息融合:
- 针对不同模态的节点特征创建独立的 GAT(图注意力网络)模块。
- 通过加入注意力机制,从多个模态特征中自适应地分配权重。
- 生成最终嵌入:
- 压缩编码的特征表示至嵌入空间。
- 利用内积解码器重建节点及其属性信息。
- 目标函数优化:
- 结合重建损失和 KL 散度/MMD 损失优化图自编码器。
- 网络结构表示:
研究成果
-
具体成果:
- MAAN 在多项任务中(如链接预测、UI 属性推断、UI 评分预测、UI 检索)较其他最先进模型表现更佳。
- 在两组 RICO 数据集上实验表明,MAAN 显著优于传统单模态嵌入方法(如 CAN 和 GAT),特别是在处理连续值属性及多模态检索任务上表现突出。
-
与现有解决方案的对比优势:
- MAAN 更好地捕捉了模态间的相关性和网络结构特点。
- 基于 MMD 损失的改进增强了模型的训练稳定性和表达能力。
- 在用户评价中 MAAN 的检索性能超越了现有模型多达 8 倍。
-
实验与评估结果:
- 在预测 UI 屏幕评分任务中,MAAN 的 RMSE 为最低(0.55),显示了对真实评分的准确建模能力。
- 在 UI 屏幕属性推断上,MAAN 显著提高了精度,特别是对连续型属性的推断误差(如屏幕图像的 RMSE 从 2.454 降至 0.994)。
- 在 UI 检索任务中,AMT 用户测试表明 MAAN 的结果平均准确率达 85%,高于其他方法。
-
局限性与未来方向:
- 多边类型: 目前仅支持单一边类型的结构信息,未来可拓展至多边类型。
- 位置信息: 缺乏对 UI 元素在视图层次结构中的顺序信息的捕捉,可能影响模型表现。
- 端到端训练: 当前模型对部分模态的编码未与主模型集成,未来可开发端到端架构以提升性能。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用多模态信息和网络结构知识生成高效的移动用户界面嵌入?分类: 生成式创作中的控制与共创同类问题arrow_forward
- 基于注意力机制和变分自编码器,能否改进多模态嵌入生成的稳定性和表示能力?分类: 生成式创作中的控制与共创同类问题arrow_forward
- 在多模态检索中,如何更好地平衡各模式信息的权重以提升检索精度?分类: 生成式创作中的控制与共创同类问题arrow_forward
lightbulb
现实痛点
1- 设计师在检索移动应用界面时面临低效和不精确的问题。分类: 生成式创作中的控制与共创同类问题arrow_forward
- 75%
TiiS:人性化推荐系统:最新技术状态与研究问题
IUI '22· 推荐系统用户体验
- 67%
辅助接口的决策论表示
CHI '26· AI 辅助决策与自动化系统 +2
- 67%
重新思考人工智能推荐系统中的用户赋能:创新透明与可控界面
CHI '26· 可解释人工智能(XAI) +2
- 67%
在线浏览的现场自适应界面:意图响应自动化与用户控制的设计维度
IUI '26· AI 辅助决策与自动化系统 +2
- 60%
设计苦乐参半的体验:用推荐系统改进敏感体验
CHI '22· AI 伦理、公平与问责 +1
- 60%
使用视觉建模和显著性分析预测和解释移动UI的可点击性
CHI '22· 可解释人工智能(XAI) +1
- 60%
经验丰富的企业应用设计师如何将AI作为设计材料进行运用
CHI '22· 生成式AI(文本、图像、音乐、视频) +1
- 60%
两个脑袋比一个好:一个统一共享控制中人类和人工智能的维度空间
CHI '22· AI 辅助决策与自动化系统 +1
- 60%
我应该跟随人类还是机器人?——拥有权力的机器人可能比人类更有影响力来影响决策
CHI '23· AI 辅助决策与自动化系统 +1
- 60%
处理不确定性:理解预测任务与诊断任务对人类-AI决策中信任和依赖的影响
CHI '24· AI 辅助决策与自动化系统 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3397481.3450693
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
AI 辅助决策与自动化系统、推荐系统用户体验
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文