利用密集视频字幕技术为视障人士生成漫画图像描述

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)可视化感知与认知辅助技术专家

为了提高视觉图形的可及性,针对单个图像的自动文本描述生成已被研究。然而,由于类似场景连续出现会导致描述冗余,因此不能直接应用于漫画。为了解决这一问题,我们提出按相关图像组生成描述,并展示如何利用视频的密集字幕技术来实现这一目的以及改进其性能的方法。为了评估我们方法的有效性并确定影响漫画文本描述质量的因素,我们对 3 名视力正常的评估者进行了一项初步研究,并对 12 名视障参与者进行了一项主要用户研究。结果表明,当注释者为人类时,按图像组生成的文本描述在准确性、清晰度、可理解性、长度、信息量和视力正常组的偏好方面均优于按单个图像生成的文本描述。在相同条件下,当注释者为人工智能时,它在长度方面表现更好。此外,视障人士更偏好图像组描述,因为其简洁、句子连接流畅且无重复特征。根据这些发现,我们为视障用户大规模生成可及性漫画描述提供了设计建议。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/139230/2024

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、可视化感知与认知
work
职业/产业
辅助技术专家
article
内容状态
仅摘要
hub
相关论文
10 篇相关论文