回答关于图像的问题这一任务作为帮助视力障碍人群的实用服务以及人工智能社区的视觉图灵测试已获得关注。我们的首要目标是识别这两种场景所需的共同视觉技能。为此,我们分析了物体识别、文本识别、颜色识别和计数这四种视觉技能在来自两个代表两种场景的数据集的超过27,000个视觉问题上的需求。接下来,我们量化了这些技能对两个数据集中人类和计算机的难度。最后,我们提出了一项新任务:预测回答关于图像的问题需要哪些视觉技能。我们的研究结果揭示了此类服务的真实用户目标与人工智能社区关注点之间的(不)匹配。我们以讨论视觉问题回答任务的未来方向作为结语。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
一眼看懂
fact_check论文快照
dataset
来源
CSCW
calendar_month
年份
2020
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文