面向移动应用中的完整图标标注
作者
大语言模型(LLM)的人机协作推荐系统用户体验UI/UX 设计师
文献标题
Towards Complete Icon Labeling in Mobile Applications
文献信息
- 主题领域: 图标识别、移动应用用户界面设计、深度学习与计算机视觉
- 关键词: 图标分类, 深度学习, 长尾图标, 图标语义, 图像分类, OCR, 模型评估, 校准数据集, 可访问性支持, 移动用户界面
研究背景与问题
- 发现的问题或挑战:
- 现阶段在移动应用中,很多图标缺乏开发者明确的标签,导致这些图标对可访问性技术的使用者(如盲人或低视力用户)不可访问。
- 当前图标识别的研究主要关注高频(常见)图标,对于低频的“长尾”图标支持有限,致使无法实现完整的图标覆盖和准确分类。
- 许多当前的方法依赖于应用程序元数据(如视图层次结构),然而这些信息通常是不完整的或不可访问的。
- 重要性:
- 为了提升用户界面设计的可访问性和便捷性,全面准确识别图标及其语义信息至关重要。
- 长尾图标(尽管其出现频率低)往往暴露出核心功能,在具体应用场景中具有关键意义。
- 研究动机与相关工作:
- 作者分析了大规模数据集后发现,现有技术覆盖的图标类型和准确性都有提高空间。
- 当前已有一些方法采用机器学习或众包技术进行图标分类,但这些方法无法很好地处理未知长尾图标类型。
- 作者旨在提出一种综合性的方法,通过像素数据生成图标标签,同时结合上下文信息(如附近文本和修改符)改进整体图标覆盖率和识别性能。
解决方案
-
提出的方法或解决方案:
- 提出一个基于像素的端到端系统,从移动应用的屏幕截图中提取图标并生成标签。
- 系统分两大部分:分类(常见图标与长尾图标)和上下文分析(基于附近文本和修改符信息)。
- 提供了多种处理机制:图像分类模型用于高频图标,少样本学习模型用于长尾图标,OCR和目标检测模型用于上下文。
-
创新之处:
- 创建了一个具有高覆盖率的图标数据集与长尾图标分簇法,覆盖了常见与长尾图标的总计429种类型。
- 不依赖于应用程序的元数据(如视图层级结构),仅使用截图像素信息。
- 提出了结合上下文(附近文本与修改符)的综合标签生成流程。
-
实施步骤与关键技术:
- 图标检测: 使用一个UI元素检测模型在屏幕截图中检测图标,并通过扩展边框确保裁剪为正方形。
- 分类模型: 使用ResNet-50作为骨干网络对常见图标进行分类(准确率96.3%)。
- 少样本学习: 借助Prototypical网络对长尾图标进行分类(准确率78.6%)。
- 上下文分析:
- 基于启发式规则和OCR检测图标附近文本(准确率95.3%)。
- 基于目标检测模型识别图标内部的修改符(准确率87.4%)。
- 众包补充: 若以上方法失败,则引入众包方法生成标签。
研究成果
-
具体成果:
- 图标分类覆盖率达99.5%,显著优于原有方法的最高78%覆盖率。
- 常见图标分类准确率为96.3%,长尾图标分类准确率为78.6%;附近文本检测准确率95.3%;修改符识别准确率87.4%。
- 通过实验与用户验证显示,生成的标签中96.61%的注解标签和80.33%的预测标签被认为是有用的。
-
与现有解决方案的优势:
- 能够支持常见及长尾图标的同时,涵盖罕见的长尾功能图标。
- 不依赖视图层次结构,减少了依赖元数据可能产生的问题。
- 提供更丰富的语义信息,包括附近文本和修改符。
-
局限性与未来方向:
- 目前实验只针对iOS平台,但其方法可扩展至Android和网页。
- 数据集上的不均衡分布、语境影响、多义性等问题仍需处理。
- 提议未来研究扩展多标签分类,优化修改符检测合成数据质量以及改善基于上下文的标签生成。
- 还有机会尝试基于图像描述生成(Image Captioning)的模型以提升结果可读性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 移动应用中,缺乏标签的图标如何影响盲人或视障用户的使用?分类: 屏幕阅读器与界面无障碍访问同类问题arrow_forward
- 如何在移动应用中识别并标注长尾图标(低频率但关键功能的图标)?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 不依赖应用元数据的情况下,如何通过像素数据结合上下文分析生成精确图标标签?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
lightbulb
现实痛点
1- 盲人难以通过辅助技术访问缺乏标签的图标。分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 75%
输入效率和建议准确性影响单词建议的收益和采用
CHI '21· 大语言模型(LLM)的人机协作 +1
- 75%
基于LLM的推荐系统用户体验:以音乐推荐为例
CHI '25· 大语言模型(LLM)的人机协作 +1
- 67%
最终用户创建个性化内容分类器:比较示例标记、规则编写和LLM提示
CHI '25· 大语言模型(LLM)的人机协作 +1
- 60%
ChainForge:用于提示工程和LLM假设检验的可视化工具包
CHI '24· 大语言模型(LLM)的人机协作 +2
- 60%
'一款现代最新款笔记本电脑'——产品搜索中自然语言查询的模糊性
DIS '20· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3502073
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、推荐系统用户体验
work
职业/产业
UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文