CGAT-Net: 用于场景草图识别的上下文感知图注意力Transformer网络
交互式数据可视化计算方法在HCI中的应用软件工程师与开发者UI/UX 设计师AI/ML 研究员与工程师
草图通常缺乏独立识别所需的足够细节或质量,使得在没有上下文信息的情况下识别具有挑战性。虽然上下文理解在计算机视觉应用如目标检测或图像分类中已得到广泛研究,但在草图领域仍然未被充分探索。现有研究主要关注独立识别草图对象,对场景级草图理解关注甚少。为解决这一空白,我们引入了上下文感知图注意力Transformer网络(CGAT-Net),该网络利用对象间的视觉和空间关系来获得场景中更准确的分类。这是场景草图识别领域首个在基于Transformer的网络中利用对象关系来纳入上下文理解的研究。大量实验表明,CGAT-Net超越了当前最先进的单草图分类器,凸显了上下文信息在增强单个草图识别方面的价值。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 现有的速写识别方法如何忽略场景级上下文信息而仅关注单个物体?分类: 场景化速写理解与识别同类问题arrow_forward
- 如何利用深度学习模型(如Transformer)提升包含场景上下文的速写识别准确性?分类: 场景化速写理解与识别同类问题arrow_forward
- 场景中的空间关系(如距离、遮挡、大小比)对速写分类性能有多大影响?分类: 场景化速写理解与识别同类问题arrow_forward
lightbulb
现实痛点
1- 速写往往抽象且细节缺失,单独识别物体常常降低准确性。分类: 场景化速写理解与识别同类问题arrow_forward
- 100%
设备端交互挖掘
MobileHCI '25· 交互式数据可视化 +1
- 80%
DeepFlow:面向深度学习开发的流式可视化编程工具
IUI '25· 交互式数据可视化 +1
- 80%
Skyline:深度神经网络训练中的编辑器内交互式计算性能分析
UIST '20· 交互式数据可视化 +1
- 67%
面向数据科学家的有效搜索以发现过去的分析选择
CHI '19· 交互式数据可视化 +1
- 67%
使用贝叶斯定理进行命令输入:原理、模型和应用
CHI '20· 语音用户界面(VUI)设计 +1
- 67%
Rapsai:通过可视化编程加速多媒体应用程序的机器学习原型设计
CHI '23· 大语言模型(LLM)的人机协作 +1
- 67%
Emblaze:通过交互式比较嵌入空间阐明机器学习表征
IUI '22· 交互式数据可视化 +1
- 67%
CoLadder:通过多层级代码块操作控制代码生成
UIST '24· 大语言模型(LLM)的人机协作 +1
- 60%
利用社区使用数据实现数据驱动的API设计:一项需求研究
CHI '20· 计算方法在HCI中的应用
- 60%
认真对待ASCII绘图:程序员如何绘制代码图
CHI '24· 交互式数据可视化 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3708359.3712135
一眼看懂
fact_check论文快照
dataset
来源
IUI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
交互式数据可视化、计算方法在HCI中的应用
work
职业/产业
软件工程师与开发者、UI/UX 设计师、AI/ML 研究员与工程师
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文