调查AI赋能场景描述应用程序在盲人和低视力人群中的应用案例

生成式AI(文本、图像、音乐、视频)视觉障碍者技术(屏幕阅读器、触觉图形、盲文)认知障碍与神经多样性(自闭症、ADHD、阅读困难)通用设计与包容性设计残障服务提供者辅助技术专家

文献标题

Investigating Use Cases of AI-Powered Scene Description Applications for Blind and Low Vision People

文献信息

  • 主题领域: 人机交互、辅助技术、计算机视觉
  • 关键词: 使用案例、场景描述、人工智能、盲人及低视力人群、计算机视觉、辅助技术、日记研究

研究背景与问题

  • 发现的问题或挑战:
    • 当前已有许多场景描述应用程序能够帮助盲人和低视力(BLV)人群获取视觉信息,但大多数研究关注的是需要人类远程助手支持的应用,而不充分了解基于AI的场景描述应用如何使用。
    • BLV人群对AI生成的描述的信任和满意度较低,例如对描述的信任平均得分为2.43(满分4),满意度得分为2.76(满分5)。
  • 重要性:
    • AI技术迅速进步,基于AI的辅助工具有望减少对人类助手的依赖,增强BLV人群的独立性,但其有效性和适用性亟需进一步研究。
  • 研究动机与相关工作:
    • 比较了VizWiz和Aira等需要人类助手的辅助应用的使用情况,它们在日常任务中表现出很高的适用性;然而基于AI的场景描述应用(如Seeing AI)对于“满足BLV人群的需求”仍有许多未知的领域。
    • 初步研究表明,BLV用户在使用Seeing AI时对于得到的描述并不总是满意,只有43%的描述会让用户满意,且普遍准确性较低。

解决方案

  • 提出的解决方法:
    • 通过设计和开发一个基于AI的场景描述应用,对BLV人群使用此类应用的使用场景进行观察和分析。
    • 实验采用了两周的日记研究方法,让16名BLV参与者记录与描述工具的互动及使用感受。
  • 解决方案的创新点:
    • 提出了BLV用户基于AI场景描述应用的首次系统性研究,研究了AI描述与用户现有知识和视觉信息目标的交互。
    • 探讨了BLV用户如何创意性地使用应用(如避免危险、解决视觉争议)以及如何通过测试AI熟悉其能力。
  • 实施步骤:
    1. 应用开发:基于Microsoft Azure AI Vision图像分析API开发应用,生成照片场景描述,并记录用户反馈。
    2. 实验设计:为参与者提供训练,要求参与者在两周期间每天至少提交一张照片,记录所在地点、信息需求、满意度和信任等打分。
    3. 数据分析:结合日记数据与后续半结构化访谈,采用定性编码发现使用场景和用户行为模式,同时通过线性混合效应模型分析信任与满意度的影响因素。

研究成果

  • 具体成果:
    • 常见使用场景包括:
      • 识别物体及其特征(如颜色、形状等);
      • 理解环境信息;
      • 校验应用能力(测试及学习AI描述的准确性)。
    • 用户独特的需求:
      • 避免接触危险或不洁的物品;
      • 判断人群是否存在;
      • 捕捉情感性时刻(如宠物互动)。
    • 场景描述的性能数据:
      • 平均描述准确度得分为1.95(满分3),说明总体表现一般;
      • 描述的满意度和信任度与准确性显著相关,但用户有时能从部分正确的描述中推断有用信息。
  • 优势:
    • 提供了基于AI场景描述工具在自动化和私密性方面的特性,这在某些情况下可能优于人类助手。
    • AI被用户视为“客观”的信息来源,用于解决视觉争议。
  • 实验或评估结果:
    • 用户对AI的信任和满意度因不同使用场景和描述准确性而异。
    • 参与者更倾向于在个人空间(如家中)使用应用,这与其信息需求场景相符。
    • AI在复杂任务上的局限性阻碍了其普及化应用,但其提供的核心视觉信息仍可为用户决策提供支持。
  • 局限性与未来方向:
    • 局限性:
      • 日记研究无法完全捕捉长时间持续使用的行为特征。
      • 短期实验可能高估了“测试应用”这一使用场景的比例。
    • 未来方向:
      • 研究如何通过集成更多功能(如OCR、图像探索等)扩展AI场景描述工具的适用性。
      • 优化用户与AI之间的反馈机制,提升模型性能的同时让用户能动态调整其信任和满意度。
      • 进一步研究结合生成式AI技术的场景描述应用的潜在用例与用户反馈机制。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147196/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642211
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、认知障碍与神经多样性(自闭症、ADHD、阅读困难)、通用设计与包容性设计
work
职业/产业
残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文