"由非残疾人训练":评估图像质量如何影响视觉语言模型的产品描述

荣誉提名
可解释人工智能(XAI)视觉障碍者技术(屏幕阅读器、触觉图形、盲文)通用设计与包容性设计语音可访问性语言治疗师与听觉学家社区健康工作者辅助技术专家

文献标题

'It's trained by non-disabled people': Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

出版信息

  • 主题领域: 图像-语言模型(Vision-Language Models, VLMs)在图像描述中的可访问性研究。
  • 关键词: 图像-语言模型, 图像质量, 盲人及低视力用户, 产品识别, 可访问性, 图像描述, 人机交互, 数据集标注, 模型评估, 辅助技术。

背景与问题

  • 问题/挑战: 图像-语言模型(VLMs)在处理盲人及低视力(BLV)用户拍摄的常见低质量图像(如模糊、构图不当、旋转等)时表现不佳。现有评估通常忽略了这些现实世界中的挑战。
  • 重要性: 对于BLV用户来说,准确且详细的图像描述对于安全有效地识别产品至关重要,尤其是在涉及健康或安全的任务(如识别食品或药品)中。
  • 动机与相关研究: 以往研究主要关注高质量图像及通用描述指标,忽略了现实世界中图像质量问题对VLM性能的影响。本研究通过系统性评估VLM在与BLV相关的数据集上的表现,填补了这一研究空白。

解决方案

  • 提出的方法: 两部分研究:(1) 对BLV用户进行问卷调查,以了解他们使用基于VLM的工具的体验;(2) 对VLM在一个经过精心挑选的数据集上进行系统性评估,该数据集包含各种质量问题的产品图像。
  • 创新点:
    1. 开发了一个包含1,859张BLV用户拍摄的产品图像的数据集,并对图像进行了产品类型、品牌和品种的标注。
    2. 系统性评估了四种VLM(GPT-4.1, Gemini 2.5 Flash, Llama 3.2 90B, Molmo 72B)在高质量和低质量图像上的表现。
    3. 分析了特定图像质量问题(如模糊、构图不当、旋转)以及产品属性(如圆形标签)对VLM性能的影响。
    4. 提出了改进VLM可靠性及用户支持的建议。
  • 研究过程与关键技术:
    1. 对86名BLV参与者进行了问卷调查,以收集关于VLM使用及挑战的见解。
    2. 从VizWiz数据集中挑选并标注了高质量和低质量的产品图像。
    3. 使用结构化标注方案和逻辑回归分析了图像质量问题及产品属性对模型性能的影响。
    4. 提出了数据集优化、训练目标改进以及推理阶段技术提升的建议。

研究结果

  • 具体发现:
    • VLM在处理低质量图像时准确率显著下降,其中GPT的准确率从高质量图像的98.5%降至74.9%,Gemini为71.7%,Llama为44.1%,Molmo为36.1%。
    • 模糊使正确识别概率降低88.3%,构图不当降低84.5%,旋转降低79.5%。
    • 同时具有圆形标签和文字面板的产品对Gemini、Llama和Molmo的挑战更大,准确率分别降至67.5%、42.5%和30.0%。
  • 相较基线的优势:
    • GPT和Gemini在高质量和低质量图像上的表现均优于开源模型(Llama, Molmo)。
    • GPT在应对图像质量问题方面表现出更强的韧性。
  • 实验/评估:
    • 数据集: 包含729张高质量图像和1,130张低质量图像,标注了产品类型、品牌和品种。
    • 指标: 在图像质量问题及产品属性上的产品识别准确率。
    • 模型: GPT-4.1, Gemini 2.5 Flash, Llama 3.2 90B, Molmo 72B。
  • 局限性与未来工作:
    • 研究集中于美国产品及英语用户;需要进行跨文化及多语言评估。
    • 图像质量问题的处理为二元分类;未来工作应量化质量退化程度。
    • 未评估整体描述质量(如模糊语言、不确定性表达)。

总结

本研究揭示了VLM在处理BLV用户拍摄的低质量图像时面临的挑战,常见问题如模糊、构图不当和旋转导致模型性能显著下降。通过精心挑选的数据集及四种VLM的系统性评估发现,GPT和Gemini表现较好,而开源模型如Llama和Molmo表现较差。研究结果强调了以残障用户为中心的模型评估、数据集优化以及针对性训练和推理技术的重要性。这些发现为开发更具可访问性和鲁棒性的AI工具铺平了道路,以更好地服务BLV用户。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221844/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791309
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
7 位作者
sell
研究子方向
可解释人工智能(XAI)、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、通用设计与包容性设计、语音可访问性
work
职业/产业
语言治疗师与听觉学家、社区健康工作者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文