(计算机)视觉在行动中:远程视力辅助与多模态语音代理在检查序列中的比较

智能语音助手(Alexa、Siri 等)语音可访问性语言治疗师与听觉学家HCI 研究员

文献标题

(Computer) Vision in Action: Comparing Remote Sighted Assistance and a Multimodal Voice Agent in Inspection Sequences

出版信息

  • 主题领域: 针对盲人个体辅助任务中人类与人工智能辅助的比较分析。
  • 关键词: 远程视觉辅助, 多模态语音代理, 主动性, 人机协作, 辅助技术, 民族方法学, 会话分析, 盲人和低视力, 协作实践, 轮流发言。

背景与问题

  • 问题/挑战: 当前的多模态语音代理缺乏基于实时环境线索发起和调整行动的能力,这限制了其在协作任务中相比人类助手的有效性。
  • 意义: 弥补这一差距对于改善盲人和低视力(BLV)个体使用的辅助技术至关重要,这些个体依赖此类工具完成日常任务,如清洁检查。
  • 动机与相关工作: 尽管之前的研究探讨了多模态语音代理和远程视觉辅助的能力,但尚未对成功的人类辅助所依赖的协作实践进行细致分析。本文旨在通过比较人类助手和语音代理的交互来填补这一空白。

解决方案

  • 提出的方法: 对盲人参与者与两种类型助手(人类远程视觉助手(RSA)和多模态语音代理(ChatGPT多模态“语音模式”))之间的交互进行比较的民族方法学会话分析。
  • 创新点:
    1. 详细识别在人类辅助中存在但在人工智能辅助中缺失的主动性实践。
    2. 实证性地明确辅助协作成功或失败的条件。
    3. 对使语音代理能够发起基于环境的行动的伦理影响进行讨论。
  • 程序和关键技术:
    • 数据收集包括视频记录盲人参与者与人类RSA和多模态语音代理进行污渍查找任务的交互。
    • 使用民族方法学会话分析(EMCA)研究轮流发言、相互调整和任务协调。
    • 使用Jeffersonian和Mondadian转录规范创建转录文本,以捕捉语言和身体动作。

结果

  • 具体发现:
    • 人类RSA基于视觉线索发起行动,实时调整行动,并与参与者分配感知工作,从而完成任务。
    • 语音代理未能基于环境线索发起或调整行动,导致僵化的逐步交互结构,未能找到污渍。
  • 相较基线的优势:
    • 人类RSA表现出优越的主动性和适应性,能够实现有效的协作和任务完成。
    • 语音代理缺乏响应或基于实时视觉数据发起行动的能力,突显了其显著的局限性。
  • 实验/评估:
    • 分析了两个来自更大语料库的片段:一个涉及使用Be My Eyes应用的人类RSA,另一个涉及ChatGPT多模态“语音模式”。
    • 评估指标包括找到污渍的能力、轮流发言的性质以及感知工作的分配。
  • 局限性与未来工作:
    • 研究结果基于小样本量和语音代理的特定配置,限制了其普适性。
    • 未来研究应探索更广泛的任务、场景和辅助技术,以及主动性AI行为的伦理影响。

总结

本研究比较了人类远程视觉助手和多模态语音代理在协助盲人参与者完成污渍查找任务中的协作实践。人类助手的成功依赖于主动行为,包括基于视觉线索发起行动、实时调整以及分配感知工作。相比之下,语音代理的僵化逐步交互未能完成任务。研究结果强调了主动性和环境响应行为对有效辅助技术的重要性。然而,研究也提出了关于使AI自主发起行动的伦理问题,因为这可能对用户施加价值判断。未来工作应解决这些伦理和技术挑战,以改进辅助语音代理的设计。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222431/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791708
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、语音可访问性
work
职业/产业
语言治疗师与听觉学家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文