面向盲人和低视力用户的LLM动力辅助无人机

无人机(Drone)交互与控制脑机接口(BCI)与神经反馈视觉障碍者技术(屏幕阅读器、触觉图形、盲文)残障服务提供者医生、护士、临床医生HCI 研究员

文献标题

Towards LLM-powered Assistive Drone for Blind and Low Vision Users

出版信息

  • 主题领域: 使用无人机和大型语言模型(LLMs)为盲人和低视力(BLV)用户提供辅助技术。
  • 关键词: 辅助无人机,盲人和低视力,大型语言模型,自然语言交互,参与式设计,人机交互,可访问性,语音界面,物体定位,空间定向。

背景与问题

  • 问题/挑战: 当前针对BLV用户的辅助技术(如可穿戴设备或机器人手杖)在提供灵活、自然的交流以及处理复杂的现实任务方面存在局限性。无人机虽然具有潜力,但缺乏针对BLV用户的无缝交互方法。
  • 重要性: 解决这些局限性可以显著提高BLV个体的独立性和生活质量,使他们能够完成诸如物体定位、空间定向以及在陌生环境中导航等任务。
  • 动机与相关工作: 之前的研究探索了针对BLV用户的辅助机器人和可穿戴设备,以及基于语音的交互和LLM驱动的机器人技术。然而,利用LLMs实现针对BLV用户的辅助无人机的自然和灵活交流的研究仍然有限。

解决方案

  • 提出的方法: 开发一个基于LLM驱动的语音辅助无人机原型,能够将自然语言指令转换为无人机动作,并从图像中提取视觉信息。
  • 创新点:
    1. 一个利用LLMs进行指令转换和基于视觉任务的原型。
    2. 采用参与式设计方法,邀请BLV用户和领域专家共同迭代优化原型。
    3. 探索无人机作为一种新型辅助技术形式,为BLV用户提供服务。
  • 程序与关键技术:
    • 对9位BLV用户进行形成性研究,以识别使用场景和设计考虑因素。
    • 使用Tello EDU无人机、Google语音转文字以及GPT-4o进行代码生成和视觉任务开发原型。
    • 根据3位BLV用户和5位专家的反馈迭代优化原型。
    • 在受控实验室环境中对最终原型进行评估,参与者包括6位BLV用户。

结果

  • 具体发现:
    • 系统可用性量表(SUS)平均得分为73.3,表明可用性良好。
    • 任务成功率评分:物体定位4.0/5,物体识别3.8/5,空间定向3.2/5。
    • AI响应准确率:用户查询成功率为85%,主要错误来自代码生成(7.04%)和视觉任务(6.35%)。
    • 平均响应时间:代码生成1.46秒,视觉任务3.18秒。
  • 相较基线的优势:
    • 实现了灵活的自然语言交互,无需预定义指令。
    • 提供免手操作的多视角辅助,超越了智能眼镜或移动应用等可穿戴设备的能力。
  • 实验/评估:
    • 对6位BLV参与者进行了混合方法用户研究,包括入门培训、探索任务(物体定位、识别和空间定向)以及测试后访谈。
    • 收集的数据包括李克特量表评分、SUS分数、系统日志和定性反馈。
  • 局限性与未来工作:
    • 研究在受控室内环境中进行,限制了其在现实场景中的普适性。
    • 依赖网络连接和现成组件,导致延迟和偶发错误。
    • 未来工作应探索现实场景部署、离线模型、改进AI准确性以及更用户友好的硬件设计。

总结

本文提出了一种基于LLM驱动的语音辅助无人机原型,旨在将自然语言指令转换为无人机动作并执行基于视觉的任务。通过参与式设计和迭代开发,该原型展示了良好的可用性和灵活性,解决了物体定位、识别和空间定向方面的未满足需求。尽管仍存在技术和社会挑战,例如AI错误和公众对无人机的接受度,但这项工作为未来针对BLV个体的辅助无人机技术研究奠定了基础。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222811/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791343
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
无人机(Drone)交互与控制、脑机接口(BCI)与神经反馈、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
残障服务提供者、医生、护士、临床医生、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文