表格叙述者:使图像表格对盲人和低视力人群可用

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)残障服务提供者

研究背景与问题

  • 作者发现了哪些问题或挑战?
    作者指出,图像表格的广泛使用对盲人和低视力人群(BLV)的信息获取构成了重大挑战。传统的屏幕阅读器和光学字符识别(OCR)技术无法有效处理图像表格复杂的结构和语义信息,导致BLV用户无法全面理解或操作这些表格。

  • 为什么这个问题很重要?
    表格作为最重要的数据呈现形式之一,在科学研究、教育、商业分析等领域具有广泛应用。欠缺图像表格的可访问性会限制BLV用户参与这些关键领域,从而影响公平性和社会参与。

  • 研究动机与相关工作
    尽管人工智能技术(如表格识别和表格理解)取得了一定进展,它们在满足BLV用户需求方面依然存在局限性,例如无法处理复杂表格格式及输出容易出现信息"冗余"或"幻觉"(不真实信息)。文中的研究旨在通过调查BLV用户的需求并设计一个满足用户需求的系统来解决这些问题。

解决方案

  • 作者提出了哪些方法或解决方案?
    作者开发了一个称为TableNarrator的系统,用于提高图像表格的可访问性。该系统基于人工智能技术,提取表格的结构和语义信息,并通过简洁清晰的交互模式向BLV用户提供可定制的替代文本。

  • 该解决方案的创新之处是什么?

    • 根据BLV用户的需求设计系统,包括对表格元数据(如行数、列数、表头)和内容语义的深度挖掘。
    • 提供简单直接的交互模式,使BLV用户能够像访问实际表格一样灵活地访问图像表格。
    • 允许用户根据个人偏好定制替代文本的粒度和信息顺序。
    • 针对生成替代文本,结合了表格布局分析与结构识别,并利用大型语言模型(LLM)生成可理解的表格内容总结。
  • 实施步骤是什么?使用了哪些关键技术?
    TableNarrator由三个主要模块组成:

    1. 表格布局分析模块:通过检测和分割图像中的表格区域及其标题、页脚和正文,以便后续任务处理。
    2. 表格结构识别模块:提取每个单元格的位置、行列关系及复杂语义关系(如键值对),结合多模态算法和LLM生成精确的替代文本。
    3. 个性化选项与交互模块:通过手势(例如单指或双指滑动)和自定义选项为用户提供灵活的交互体验,同时支持多种粒度的信息访问。

研究成果

  • 取得了哪些具体成果?

    1. 技术评估:实验表明,TableNarrator在表格元数据准确性、内容提取及语义分析方面均优于包括GPT-4V在内的基准方法。
    2. 用户研究:用户对TableNarrator的交互模式表现出高度认可,其系统可用性评分达到了90.6(优秀范围),且工作负荷测试中表现出较少的认知负担和较高的效率。
  • 与现有解决方案相比,它有哪些优势?

    • 比其他基准方法如GPT-4V和VoiceOver更能适应复杂表格结构,提供更精确的信息。
    • 通过定制与交互优化减少冗余信息,提高了用户浏览效率。
    • 提供用户友好的界面,能根据需求调整输出文本的粒度和信息顺序,增加了灵活性。
  • 实验或评估结果是什么?

    • 技术评估中,TableNarrator在表格检测、单元格逻辑位置和单元格关系分类等任务上表现出极高的准确度,相关指标超过了现有领域模型。
    • 用户评估中,TableNarrator获得了“非常直观”和“效率极高”的评价,其提供的定制化选项被认为更有针对性且降低了用户的学习成本。
  • 局限性与未来方向

    • 目前TableNarrator对复杂布局或摄影图像中的表格处理效果仍有待提高,多轮交互和错误纠正机制可以进一步改善系统的鲁棒性。
    • 对多语言表格的处理能力需要加强,以服务来自不同语言背景的BLV用户,避免语言偏差带来的不公平。
    • 可以引入更多深入的信息处理功能,例如QA对话模块和数据分析功能,为用户提供更多的创意交互选择。

总结

TableNarrator通过模块化设计和创新交互模式,为BLV用户显著提升了图像表格的可访问性,其技术与用户评估中的出色表现验证了其有效性与潜力。同时,通过与用户需求深度结合,该系统超越了现有解决方案在信息传递、交互便利性和定制化方面的局限性。然而,复杂表格的解析与多语言兼容性仍是未来研究与优化的主要方向。这项工作不仅为BLV社群提供了重要的新工具,也为图像表格可访问性研究树立了标杆。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/188971/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714329
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
残障服务提供者
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文