超越视觉感知:视力障碍用户与大型多模态模型的智能手机交互见解

大语言模型(LLM)的人机协作视觉障碍者技术(屏幕阅读器、触觉图形、盲文)残障服务提供者辅助技术专家

研究背景与问题

  • 作者发现了哪些问题或挑战?
    论文探讨了通过大型多模态模型(LMM,如GPT-4)为视觉障碍用户提供视觉辅助的能力及其限制。尽管这些新兴技术可以通过自然语言描述帮助用户更好地理解其环境,但作者发现了两个主要问题:

    • 系统的上下文感知能力受限,存在“幻觉”(即生成非存在的细节)以及对社会场景、风格和人类身份的误解。
    • 基于用户意图的功能无法正确理解或执行用户目标,导致操作支持不足。
  • 为什么这个问题很重要?
    视觉障碍用户需要有效的辅助技术来完成日常任务。随着人工智能技术的提升,探索其在实际应用中的局限性和开发潜力对于改进技术设计和增强用户体验至关重要。

  • 研究动机与相关工作
    已有研究关注使用生成式AI平台开展视觉辅助,如描述图片中物体和回答视觉问题。然而,这些研究大多集中在技术性能或内容获取上,缺乏对真实生活场景中用户交互方法的深入探索。本研究试图通过引入用户案例和经验描绘LMM技术如何影响视觉障碍者的日常生活和社会互动。


解决方案

  • 作者提出了哪些方法或解决方案?
    作者提出了一些策略来克服这些技术的局限性,包括改进用户与AI工具之间的交互和在必要时引入人类辅助。此外,还提出了通过多代理系统(human-human和human-AI协作)以及未来的AI-AI合作来解决任务执行问题。

  • 该解决方案的创新之处是什么?

    • 强调了用户、AI工具和远程视力协助者(RSAs)之间的动态交接机制。
    • 提出了AI“让渡学习”(Deferral Learning)架构,用于敏感内容处理和涉及身份识别任务时的交接。
    • 探讨了实时视频分析的潜在应用,以解决静态图像处理中存在的数据不足和导航风险问题。
  • 实施步骤是什么?使用了哪些关键技术?

    • 通过半结构化访谈收集用户对BMA(Be My AI)的使用经验。
    • 归纳访谈中系统的性能与局限,并与来自社交媒体中的图像描述数据互为补充。
    • 分析用户“实时反馈”“目标理解”和“目标支持”等体验,并提出基于长期与短期记忆AI机制的设计建议。
    • 设计跨用户、AI助手和人类助理的协作以优化交互流。

研究成果

  • 取得了哪些具体成果?

    • BMA可以通过视觉描述提升视觉障碍者的空间感知、社会互动理解以及物体识别能力。
    • 在描述视觉场景时,该系统经常出现“幻觉”,如添加不存在的细节、对人与动物的情感和身份错误解读。
    • 在执行任务方面显示出关键性的支持不足,例如缺少明确的后续指导或实时反馈。
  • 与现有解决方案相比,它有哪些优势?

    • LMM模型具有更加自然的语言交互能力,超越传统视觉辅助应用如“Seeing AI”。
    • 提出了用户、AI工具与RSAs间的衔接改进方式,从而提升了社会与任务场景中的适用性。
  • 实验或评估结果是什么?
    通过访谈发现,用户在特定任务中能够利用BMA实现更高程度的独立性,但在面对局限时需要引入RSAs或依靠用户自己的空间记忆与听觉感知来解决问题,例如寻找掉落的物品或验证AI幻觉。

  • 局限性与未来方向

    • 局限性:
      • BMA无法存储会话历史,缺少上下文记忆功能。
      • 偏重静态图像,缺乏实时反馈能力,限制了导航任务的效率。
      • 对情感和身份的描述过于主观,有时会引发争议或不准确。
    • 未来方向:
      • 开发实时视频处理技术以提高交互效率。
      • 引入人工与AI合作的自动切换机制以改善复杂任务的完成能力。
      • 扩展研究范围至更广泛的文化背景和多语言环境,以验证技术的普适性。

总结

本文通过对视觉障碍用户使用BMA的经验分析,揭示了LMM技术的实际应用潜力与缺陷。研究为设计未来更智能、互动性强且个性化的辅助技术提供了指导,并提出了一些具体的改进方向,如改进交接机制、引入实时视频分析和实现AI-AI合作。这些成果对视觉辅助领域的技术发展具有重要意义。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189592/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3714210
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
残障服务提供者、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文