从来源到异常:图像创建者和屏幕阅读用户对AI生成图像的替代文本的观点
作者
生成式AI(文本、图像、音乐、视频)视觉障碍者技术(屏幕阅读器、触觉图形、盲文)通用设计与包容性设计消费者与购物者辅助技术专家HCI 研究员
文献标题
从图像溯源到异常:AI生成图像的替代文本和盲人用户视角
文献信息
- 主题领域: 无障碍计算(Accessibility)、人工智能生成内容、盲人用户体验
- 关键词: AI艺术, 文本生成图像, 无障碍性, 替代文本, 盲人, 屏幕阅读器用户
研究背景与问题
- 发现的问题或挑战:
- AI生成图像的快速普及过程中,大部分生成的图像缺乏面向屏幕阅读器用户(SRU)的替代文本,导致无障碍使用性不足。
- 即使在其他场景中存在替代文本,很多描述质量参差不齐,一些主流网页内容甚至完全缺失替代文本(如30%的图片无替代文本)。
- 当前没有系统地研究针对AI生成图像的替代文本策略,也缺乏明确的描述标准以应对该类型的新型媒介。
- 重要性: AI生成图像独特的特性(如风格的组合、错觉以及未知的溯源信息)给图像无障碍描述带来了新的思考维度,正确描述AI图像的可访问性至关重要,特别是在防止误导性信息方面。
- 研究动机与相关工作:
- 全球已有超150亿张AI生成图像,但这些图片对盲人等依赖文本描述的用户可访问性极低。
- 此前的无障碍研究已经探讨了传统图片和传达复杂信息(如科学论文可视化、社交媒体)的替代文本需求,但对AI生成图像的需求尚未深入研究。
- 随着生成模型(如DALL-E、Midjourney等)普及及使用场景的扩展,研究这些内容对屏幕阅读器用户的影响,使其更易于感知和理解显得尤为必要。
解决方案
- 提出的方法和解决方案: 作者设计了一项综合方法,系统地研究了来自不同来源(如图像生成时的文本提示、生成者撰写的替代文本、专业无障碍领域专家撰写的替代文本以及自动生成的文本描述模型)的替代文本。
- 创新之处:
- 提出了评估不同来源的替代文本质量的框架。
- 引入了人工智能所特有的描述要求,如溯源信息的必要性、对图像生成异常(aberrations)的描述,以及新颖的风格和媒介表达。
- 收集并分析了多样化参与者(图像生成者和屏幕阅读器用户)对于替代文本质量和内容的偏好。
- 实施步骤和关键技术:
- 参与者评估: 招募了16名AI图像生成者和16名频繁使用屏幕阅读器的用户进行实验。
- 替代文本编码与分类:
- 创建四类替代文本:生成模型输入的文本提示、生成者撰写的文本、专家撰写文本以及自动化替代文本模型生成的文本。
- 每张图像评估其替代文本的长度、部分词性特征(名词、动词、形容词等)以及词汇选择独特性。
- 主观与客观评价结合:参与者对四种替代文本进行打分、对比,并另撰理想版本描述。
- 定量与定性结合分析:使用统计方法了解语言特征和文本偏好趋势,同时主题分析参与者体验和建议。
研究成果
- 具体成果:
- 生成的一套64张AI图像及其四类替代文本的完整数据集。
- 针对不同来源文本的量化分析表明:
- 专家撰写的文本内容较详细且排名最高,但有时显得过于冗长。
- 屏幕阅读器用户的理想版本偏好简洁、描述具体的内容。
- 生成文本提示时常包含技术术语,仅在极少数情况下被评为描述理想。
- 将图像生成时的提示作为替代文本的信息潜力有限,特别是提示中可能包含不相关、未渲染出现在图像中的内容。
- 发现关键描述需求:考虑图像溯源、生成异常内容、媒介与风格等。
- 现有解决方案的比较优势:
- 与仅依赖模型自动生成文本和传统描述方法相比,作者的方法综合考虑图片背景、用户实际偏好和技术实现的可行性,展示了更好的描述针对性与可读性。
- 实验结果: 方法在“描述翔实性”和“描述适配性”这两个定性定量问题上,均获得参与者正面反馈。此外,根据对参与者的理想版本数据统计,作者提出了一种更动态的“分层描述结构”设计替代文本策略。
- 局限性与未来方向:
- 局限性:
- 研究主要是面向较宽泛的通用场景,未深入特定上下文(如社交媒体与学术出版的不同)。
- 生成模型的替代文本(V2L)可能未代表最新大规模多模态模型的能力。
- 未来方向:
- 探索各种应用场景的替代文本需求差异。
- 结合新型感知和推理模型(如LLM)进一步评估与提升描述精度。
- 研究如何更好地在生成文本中嵌入图像溯源信息,尤其是在水印缺失或图像被篡改的情况下。
- 局限性:
输出格式
输出文章深入探讨了AI图像为盲人用户传达的核心可访问性要素,为各行业制定AI图像无障碍策略提供了坚实的参考框架。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何为盲人用户设计更高质量的AI生成图像的替代文本?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- AI生成图像的独特特性(如风格组合和生成偏差)对替代文本描述有哪些需求?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 不同来源的替代文本(生成提示、创作者撰写、专家撰写、自动生成)在质量上有何差异?分类: 图表图像与视觉内容可访问性同类问题arrow_forward
lightbulb
现实痛点
1- 盲人用户很难理解AI生成图像内容,现有替代文本不足或不清晰。分类: 图表图像与视觉内容可访问性同类问题arrow_forward
- 67%
《我买这个是为了看起来更普通》:盲人网上购物的研究
CHI '19· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 67%
与AI进行社交意义构建:为盲童设计一个开放式的AI体验
CHI '21· 生成式AI(文本、图像、音乐、视频) +1
- 67%
改进颜色图案以帮助色觉缺陷人士
CHI '22· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 67%
天空才是极限:理解生成式AI如何提升屏幕阅读器用户在生产力应用中的体验
CHI '25· 生成式AI(文本、图像、音乐、视频) +1
- 67%
“恶意”图像集:替代文本如何影响屏幕阅读器用户对图像密集型媒体的体验
DIS '24· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 67%
理解视力障碍与健全用户使用移动用户界面备选颜色模式的体验
MobileHCI '25· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 67%
GenAssist:使图像生成更具可访问性
UIST '23· 生成式AI(文本、图像、音乐、视频) +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642325
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、通用设计与包容性设计
work
职业/产业
消费者与购物者、辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
7 篇相关论文