多模态大语言模型如何支持视觉信息获取:针对盲人和低视力人士的日志研究

荣誉提名
大语言模型(LLM)的人机协作视觉障碍者技术(屏幕阅读器、触觉图形、盲文)语音可访问性精神科医生与心理咨询师语言治疗师与听觉学家辅助技术专家

文献标题

How Multimodal Large Language Models Support Access to Visual Information: A Diary Study With Blind and Low Vision People

出版信息

  • 主题领域: 面向盲人和低视力(BLV)用户的无障碍设计与AI驱动的视觉解释。
  • 关键词: 多模态大语言模型, 视觉解释, 盲人和低视力, 无障碍, 对话式AI, 日记研究, 用户满意度, 信任, GPT-4o, 视觉助手。

背景与问题

  • 问题/挑战: 现有的AI驱动视觉解释工具往往提供不准确或不完整的描述,无法可靠地满足BLV用户的日常需求,并且缺乏为目标导向任务提供帮助的对话能力。
  • 重要性: 可靠的视觉解释系统可以增强BLV个体在烹饪、导航和管理药物等日常任务中的独立性,从而减少对有视力人士的依赖。
  • 动机与相关工作: 之前的系统(如Seeing AI和Orcam)在实际场景中的准确性和可用性有限。多模态大语言模型(MLLMs)的最新进展有望提高描述的准确性和对话交互能力,但其在BLV用户中的实际表现和影响尚未得到充分探索。

解决方案

  • 提出的方法: 开发了一个名为VisionPal的MLLM驱动视觉解释应用程序,通过为期两周的日记研究,研究BLV用户在实际环境中如何与该系统交互。
  • 创新点:
    1. 提供了关于BLV用户在实际使用MLLM驱动视觉解释系统时的使用模式、目标和挑战的实证见解。
    2. 证明了MLLM的优势(如高描述准确性)和局限性(如对话错误和幻觉)。
    3. 定义了“视觉助手”技能及其九种相关行为,为未来系统设计提供指导。
  • 研究程序与关键技术:
    • 对20名BLV参与者进行了为期两周的日记研究,使用VisionPal。
    • 收集了551条日记条目,包括照片、AI生成的描述、后续对话和用户反馈。
    • 分析了准确性、满意度、信任度和对话交互。
    • 提出了基于MLLM的视觉助手的设计原则和行为指南。

结果

  • 具体发现:
    • 初始照片描述的准确性非常高(平均准确性=2.91/3;91.8%无幻觉)。
    • 满意度(平均=4.13/5)和信任度(平均=3.76/5)评分普遍较高。
    • 后续对话的正确率仅为56.6%,其中22.2%包含错误信息。
    • 基于文本的查询错误率最高(34.6%的回答不正确或部分不正确)。
  • 相较基线的优势:
    • 与MLLM之前的系统相比(如先前研究报告的满意度=2.76/5,信任度=2.43/4),VisionPal在满意度、信任度和描述准确性方面表现更优。
  • 实验/评估:
    • 参与者在多种场景(如家庭、工作、交通)和多种目标(如识别物体、阅读文本、理解场景)下使用了VisionPal。
    • 分析了375次对话,揭示了参与模式和后续交互中的挑战。
  • 局限性与未来工作:
    • 观察者效应和参与者对视觉解释系统的熟悉程度可能影响了结果。
    • 对新手用户的代表性不足,以及节假日期间的数据收集可能引入偏差。
    • 未来工作应解决对话准确性不足的问题,并纳入更多样化的用户视角。

总结

本研究探讨了MLLM驱动的视觉解释应用程序如何在实际环境中支持BLV用户。VisionPal在生成描述性视觉解释方面表现出高准确性,与MLLM之前的系统相比,显著提高了用户满意度和信任度。然而,对话交互中暴露出显著的准确性问题,特别是在基于文本的查询和后续问题中。本文定义了“视觉助手”技能,并提出了九种行为,为开发更高效且符合用户需求的视觉解释系统提供了指导。未来的研究应重点改进对话准确性、情境适应性和个性化,以更好地满足BLV用户的需求。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222234/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3793266
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
5 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、语音可访问性
work
职业/产业
精神科医生与心理咨询师、语言治疗师与听觉学家、辅助技术专家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文