iTagPDF:迈向PDF无障碍的最终自动化
最佳论文视觉障碍者技术(屏幕阅读器、触觉图形、盲文)通用设计与包容性设计用户研究方法(访谈、调查、观察)UI/UX 设计师HCI 研究员
文献标题
iTagPDF: Towards Finally Automating PDF Accessibility
出版信息
- 主题领域: 自动生成研究论文PDF的可访问性元数据。
- 关键词: PDF可访问性, 语义标记, LaTeX, 阅读顺序, 元数据, 视觉语言模型, 目标检测, OCR, 可访问性修复, 文档处理。
背景与问题
- 问题/挑战: PDF的可访问性仍然是一个长期存在的问题,主要原因是缺乏自动化工具来生成可访问性元数据。现有方法严重依赖人工标记,过程繁琐、容易出错且不一致。
- 重要性: 确保PDF的可访问性对于辅助技术解释内容以帮助残障人士至关重要,但大多数学术PDF未能达到可访问性标准。
- 动机与相关研究: 现有工具如Adobe Acrobat及开源替代方案需要大量人工干预,且通常生成的标记质量较低。尤其是在LaTeX中创建原生可访问PDF的努力范围有限。视觉语言模型和目标检测管道具有潜力,但尚未完全解决PDF的语义和结构标记需求。
解决方案
- 提出的方法: iTagPDF系统结合视觉渲染和源文档语义,自动化PDF可访问性标记。
- 创新点:
- 将视觉和源数据结合以生成准确的标记、阅读顺序和元数据。
- 引入针对PDF可访问性评估的新数据集和指标。
- 建立自动标记性能的强基线。
- 流程与关键技术:
- 使用目标检测和OCR处理PDF页面以识别视觉内容区域。
- 解析LaTeX源文档以提取语义上下文。
- 使用启发式方法和大型语言模型(LLM)对视觉和语义数据进行对齐。
- 在PDF中生成并嵌入13种文档级标记(如<H1>, <P>, <Figure>)和3种内容特定标记(如<TH>, <TD>)。
- 优化阅读顺序并生成表格、图形、列表、标题和公式的元数据。
结果
- 具体发现:
- iTagPDF在边界框定位(95.28%)、分类(95.96%)和阅读顺序(97.26%)方面表现出高准确性。
- 在可访问性标记方面优于Adobe Acrobat和作者提交的PDF,平均归一化得分为95.19%。
- 在多次运行中表现稳定,归一化准确率为94.06%。
- 相较基线的优势:
- iTagPDF在阅读顺序、标题、列表、表格和图注方面超越了Adobe Acrobat和作者的手动标记。
- 生成的元数据更加一致和准确,避免了常见错误如冗余标记和错误分类的伪影。
- 实验/评估:
- 在来自ACM CHI和ASSETS会议的40个PDF(554页)数据集上进行评估。
- 引入新的错误指标(边界框错误率、分类错误率、阅读顺序错误率)进行人工评估。
- 与Adobe Acrobat的自动标记和作者提交的PDF进行比较。
- 局限性与未来工作:
- 目前专注于LaTeX生成的PDF,需要扩展到其他格式如Microsoft Word。
- 依赖启发式方法和LLM,在模糊情况下(如图形和图注)可能会失败。
- 尚未支持某些标记(如<Link>)或内联公式。
- 未来工作包括创建更大的训练数据集、改进目标检测模型以及降低管道延迟。
总结
iTagPDF是一种结合视觉和语义表示的创新系统,可自动化研究论文PDF的可访问性标记。它在生成准确的标记、阅读顺序和元数据方面优于现有工具和作者提交的PDF。在ACM会议论文数据集上的评估显示,iTagPDF具有高准确性和一致性,标志着PDF可访问性修复自动化的重要进展。未来工作旨在扩展其适用性至其他文档格式,并提升其鲁棒性和效率。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790289
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
3 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、通用设计与包容性设计、用户研究方法(访谈、调查、观察)
work
职业/产业
UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
1 篇相关论文