SceneScout:面向盲用户的街景影像人工智能驱动访问研究

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)隐私设计与用户控制生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作医生、护士、临床医生语言治疗师与听觉学家辅助技术专家

文献标题

SceneScout: Towards AI-Driven Access to Street Level Imagery for Blind Users

出版信息

  • 主题领域: 针对盲人和低视力(BLV)用户的基于人工智能的导航辅助解决方案。
  • 关键词: 盲人用户, 低视力, 街景图像, 多模态大语言模型, 导航辅助, 无障碍, 路线预览, 虚拟探索, 空间推理, 用户研究。

背景与问题

  • 问题/挑战: 现有的导航工具主要关注盲人和低视力用户的实时引导,但缺乏关于环境无障碍特征的详细出行前信息。街景图像虽然包含丰富的视觉上下文,但由于其视觉和空间复杂性,对BLV用户来说仍然不可访问。
  • 重要性: 为BLV用户提供街景图像的访问权限,可以通过提供详细的空间和环境洞察,增强他们在陌生环境中导航的信心和独立性。
  • 动机与相关工作: 之前的研究探索了触觉地图、音频-触觉反馈和虚拟导航系统,但通常忽略了诸如坡道或盲道等环境细节。尽管已有研究利用街景图像进行无障碍性评估,但尚未使其直接为BLV用户所用。本文通过使BLV用户能够独立与街景图像交互来填补这一空白。

解决方案

  • 提出的方法: SceneScout是一个基于多模态大语言模型(MLLM)的原型系统,通过“路线预览”和“虚拟探索”两种交互模式,使BLV用户能够访问和解读街景图像。
  • 创新点:
    1. 开发了一个将MLLM与街景图像集成的系统,生成具有空间基础的个性化描述。
    2. 针对BLV用户设计了两种交互模式:“路线预览”提供结构化的路线叙述,“虚拟探索”支持开放式的社区探索。
    3. 在BLV参与者的用户研究中评估了MLLM生成描述的准确性、相关性和时间一致性。
  • 流程和关键技术:
    • 路线预览:将连续的全景图像融合为结构化叙述,包含高层次概述和与移动相关的关键细节。
    • 虚拟探索:允许用户指定探索目标,并交互式地导航街景图像。
    • 计算流程:将全景图像分割为方向性明确的视图,整合地图元数据,并生成面向用户意图的方向感知描述。

结果

  • 具体发现:
    • 72%的描述是准确的,95%的描述可能在时间上保持一致,96%的虚拟探索描述与用户意图一致。
    • 错误包括合理但无法验证的细节(40%)、事实性错误(19%)、空间错误(16%)和幻觉(16%)。
  • 相较基线的优势:
    • SceneScout提供了比现有导航工具更丰富的环境细节,使BLV用户能够发现原本无法访问的视觉信息。
    • 参与者重视指定关键词并接收个性化描述的能力。
  • 实验/评估:
    • 对10名BLV参与者进行了混合方法的用户研究。
    • 场景包括熟悉和不熟悉的地点,涵盖两种交互模式。
    • 评估指标:相关性、实用性、信任度、自信心、时间一致性和冗余性。
  • 局限性与未来工作:
    • 空间不精确以及对用户能力的假设降低了信任度。
    • 参与者人口统计的多样性有限,且缺乏真实场景的导航测试。
    • 未来工作应聚焦于改进空间推理、支持回溯功能,并整合实时导航辅助。

总结

SceneScout是一个利用多模态大语言模型的原型系统,使盲人和低视力用户能够访问街景图像。通过“路线预览”和“虚拟探索”两种交互模式,用户可以获取详细的空间和环境信息。用户研究表明,SceneScout能够有效提取相关细节,增强用户的导航信心和独立性。然而,空间不精确、时间不一致以及对用户能力的假设等挑战表明仍有改进空间。本研究为基于人工智能的BLV用户无障碍解决方案迈出了初步的一步,具有在出行前规划和实时导航中的潜在应用。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/223523/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790449
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、隐私设计与用户控制、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
医生、护士、临床医生、语言治疗师与听觉学家、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文