以我之方式表达:探索与盲人用户对话式视觉问答中的控制机制

语音可访问性生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作可解释人工智能(XAI)语言治疗师与听觉学家HCI 研究员

文献标题

Say It My Way: Exploring Control in Conversational Visual Question Answering with Blind Users

出版信息

  • 主题领域: 针对盲人用户的辅助技术,利用对话式视觉问答系统。
  • 关键词: 视觉问答,盲人用户,定制化,提示技术,辅助人工智能,生成式人工智能,用户控制,可访问性,个性化,多模态系统。

背景与问题

  • 问题与挑战: 当前针对盲人用户的辅助视觉问答系统采用固定的交互模式,限制了用户对系统响应进行定制和控制的机会。
  • 重要性: 盲人用户依赖这些系统获取视觉信息,其中效率、清晰度以及与用户目标的匹配至关重要。不匹配或冗长的响应可能导致混淆、延误或安全风险。
  • 动机与相关研究: 以往研究主要关注视觉问答的自动化系统,但对如何让盲人用户塑造或控制这些系统的关注较少。通用生成式人工智能已探索提示工程和微调等技术,但这些方法在辅助技术领域尚未得到充分研究。

解决方案

  • 提出的方法: 通过三阶段研究探讨盲人用户与对话式视觉问答系统(Be My AI)交互的定制化技术:实验室会话、日记研究和后期访谈。
  • 创新点:
    1. 通过实证研究揭示盲人用户如何适应视觉问答系统的限制并使用定制化技术。
    2. 引入Ask&Prompt数据集,捕捉来自真实场景和实验室环境的多轮交互、图像及注释。
    3. 确定设计机会,以增强用户对辅助视觉问答系统的控制。
  • 研究流程与关键技术:
    • 引入的定制化技术包括二元反馈、零样本风格和意图提示、链式思维提示以及图像转文本提示。
    • 进行为期10天的日记研究,记录363次交互,并通过后期访谈完善注释并深入了解用户体验。
    • 分析用户行为、偏好及在不同环境中的反思。

研究结果

  • 具体发现:
    • 用户输入平均为10–20个词,而系统响应的长度超过输入的十倍(中位数=160–242词)。
    • 对话通常延续多轮(中位数=3轮,最多达21轮),特别是在图像捕捉或澄清等迭代任务中。
    • 参与者积极尝试定制化技术,以管理响应的冗长程度、聚焦任务相关细节并增强信任。
  • 相较基线的优势:
    • 定制化技术减少了冗长内容,提高了与用户目标的匹配度,并支持迭代问题解决,相较于系统默认行为表现更优。
  • 实验与评估:
    • 研究包括11名盲人参与者(年龄25–57岁),他们的失明程度和对人工智能的熟悉程度各不相同。
    • 对交互进行了词数、对话轮次、成功率及定制化技术的分析。
    • 注释并分析了环境熟悉度、时间压力及社交场景等上下文因素。
  • 局限性与未来工作:
    • 系统缺乏持久性定制功能,限制了用户在不同会话中的影响力。
    • 研究时长限制为10天,以减轻重复偏好的疲劳感。
    • 未来工作可探索支持持久用户驱动个性化和多模态定制的记忆功能系统。

总结

本研究探讨了盲人用户如何通过二元反馈、风格提示、意图提示及链式思维提示等定制化技术控制对话式视觉问答系统的响应。通过三阶段研究,参与者积极调整响应以管理冗长内容、聚焦任务相关细节并增强信任。研究结果强调了按需控制冗长程度、以用户为中心的空间参考、主动摄像指导以及高风险任务的验证机制的必要性。Ask&Prompt数据集捕捉了多轮交互及注释,并公开发布以支持进一步研究。这些贡献旨在推动辅助人工智能系统的发展,增强盲人用户的自主性和个性化体验。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222265/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791834
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
语音可访问性、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、可解释人工智能(XAI)
work
职业/产业
语言治疗师与听觉学家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文