使用时间约束方法的缩略图标题众包采集

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)众包任务设计与质量控制辅助技术专家Amazon Mechanical Turk 工作者

文献标题

Crowdsourcing Thumbnail Captions via Time-Constrained Methods

文献信息

  • 主题领域: 用户界面与人机交互,特别是为视障用户设计无障碍图像说明
  • 关键词: 图像标题、众包、无障碍、注释界面、时间限制方法、视觉障碍用户、人工智能、语言处理

研究背景与问题

  • 问题与挑战:
    • 现有的图像标题生成方法通常只提供单一级别的描述,这难以满足不同使用场景下的需求。
    • 尤其对视障用户来说,简短标题(即缩略标题,thumbnail captions)便于快速浏览内容,但现有的“替代文本”多为冗长或不详细的标题。
    • 自动图像标题工具 (AAT) 的质量仍有待提高,而依赖人工的标题生成则成本高、速度慢。
  • 重要性:
    • 互联网图片数据量迅速增长,提供健全的图像标题生成机制对信息无障碍传播尤为关键。
    • 特别是在无障碍场景中,缩略标题可以提升视障用户的浏览效率。
  • 研究动机与相关工作:
    • 受视障用户对渐进式详细程度交互标题 (progressive detail) 的需求启发,研究如何系统性地收集具备不同详细程度的图像标题。
    • 当前评估图像说明或标题的诸多方法(例如 BLEU、ROUGE 等)存在限制,需探索更有效的模型指标。

解决方案

方法与框架

  • 作者提出了一种时间限制型的众包方法,结合其他文本说明方法:
    1. Control(对照方法): 基于 MS COCO 图像标题数据集的标准说明。
    2. Comprehensive: 指导在线员工生成更全面的标题。
    3. Essential: 指导员工仅描述图像中最重要的信息。
    4. Timed(时间限制方法): 限制图片观察时间为 500 毫秒,假设这一方法鼓励回忆最重要的图像细节。

实施步骤与关键技术

  1. 众包收集实验:
    • 从 Amazon Mechanical Turk 上招募在线员工,采用上述四种方法生成标题。
    • 图像数据来自 MS COCO 数据集,包含事件/场景、人、物体等主题。
  2. 评价维度:
    • 通过人类评价和自动化评价指标评估标题的正确性、流畅性和详细程度。
    • 人类评价延续了现有框架,以 0-100 分量化标题的正确性、流畅性及详细度。
  3. 模型化评价:
    • Correctness Metrics: 使用 SPICE_f 和 ViLBERTScore_f 指标测评标题正确性。
    • Detail Metrics: 通过名词短语词数(NPs)和交叉熵(Cross-entropy)量化标题详细程度。

创新点

  • 提出了基于时间限制的缩略标题生成新方法,有效利用人的快速视觉处理能力。
  • 系统探索了如何通过传统文字提示或时间控制方法区分不同层次的图像描述。
  • 验证了现有模型指标用于多详细度内容测评的有效性,为未来自动评价系统的设计提供依据。

研究成果

具体成果

  1. 有效性验证:
    • 时间限制(Timed)方法显著实现了更精简的标题生成,且在正确性与流畅性上与其他方法相当。
    • 人类评价显示 Timed 方法生成的标题详细程度显著低于对照组,文本提示方法无显著差异。
  2. 一致性与效率:
    • 工作者通过 Timed 方法生成的标题在多个实验中表现出较高一致性。
    • Timed 方法更高效,工人在生成标题的时间上显著少于其他方法。
  3. 自动化指标评估:
    • SPICE_f 和 ViLBERTScore_f 与人类对正确性的打分具有一定正相关(相关系数分别为 0.29 和 0.18)。
    • 交叉熵和名词短语词数能够较好地反映标题详细程度,与人类评价有显著相关性。

与现有解决方案的优势

  • 相比传统的文字提示机制,时间限制方法无需明确指令,即可自动引导工作者生成缩略标题。
  • 本方法更高效,对在线众包的采集成本和时间控制更友好。
  • 提供了系统化的评估机制,为未来的用户体验优化奠定了基础。

局限性与未来方向

  • 标题的情境适用性:
    • 当前研究未评估生成标题在视障用户实际使用场景中的效果。
    • 未来需进一步测试这些标题对盲人用户浏览效率的实用性和可接受性。
  • 详细度的多样化:
    • 本研究主要成功收集了缩略标题,而详细描述层级未显著拓展。
    • 后续需探索更精细的任务指令或动态反馈机制,以收集多层级描述。
  • 模型化评价改进:
    • 当前指标(特别是 ViLBERTScore_f)对标题长度有所偏倚,未来需发展更加普适的评价模型。

总结

本文验证了时间限制型方法在缩略图像标题无障碍生成中的有效性。研究不仅指出了现有文字提示方法在生成不同详细级别内容时的局限性,还为未来大规模自动化数据集构建提供了新颖思路和探索方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/79942/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511136
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、众包任务设计与质量控制
work
职业/产业
辅助技术专家、Amazon Mechanical Turk 工作者
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文