与你同行的AI:移动障碍辅助大型基础模型驱动交互技术综述
最佳论文生成式AI(文本、图像、音乐、视频)AI 辅助决策与自动化系统运动障碍辅助输入技术残障服务提供者辅助技术专家HCI 研究员
文献标题
AI That Moves With You: A Review of Interactive Technologies Powered by Large Foundation Models for Mobility Impairment
出版信息
- 主题领域: 大型基础模型在辅助技术中的应用,聚焦于行动障碍。
- 关键词: 基础模型、大型语言模型、视觉语言模型、行动障碍、辅助技术、人机交互、无障碍、机器人技术、可穿戴设备、导航。
背景与问题
- 问题/挑战: 传统辅助技术依赖于僵化、狭窄的管道,缺乏灵活性、适应性和个性化。目前关于基础模型在辅助系统中的研究较为分散,对行动障碍的关注有限。
- 意义: 行动障碍影响全球数亿人,涉及独立性、医疗保健和生活质量。利用先进的人工智能系统解决这些挑战,可以彻底改变受影响人群的无障碍性和自主性。
- 动机与相关工作: 以往的研究通过机械系统、信号驱动设备和自适应平台推动了辅助技术的发展,但在可用性、鲁棒性和真实场景验证方面仍存在显著差距。基础模型在多模态推理和灵活交互方面具有潜力,但其在与行动相关的辅助系统中的整合缺乏系统性综述。
解决方案
- 提出的方法: 对支持行动障碍的基础模型(FM)驱动交互系统进行范围综述,分析其方法论、整合策略、交互范式和挑战。
- 创新点:
- 针对行动障碍的FM驱动交互的系统性分类法。
- 包含可复现编码表的表格化文献集,捕捉设计模式和评估方法。
- 强调鲁棒性、个性化、安全性和公平性的前瞻性研究议程。
- 流程与关键技术:
- 从五个数据库筛选6,249篇记录,最终筛选出26篇论文。
- 基于研究贡献、评估方法、FM整合策略和问题领域对论文进行编码。
- 将研究结果综合为概念设计空间,并识别技术和伦理挑战。
结果
- 具体发现:
- 53.8%的系统针对盲人或低视力用户;33.3%聚焦于信息获取与理解,29.6%关注导航,29.6%涉及健康自我管理,仅7.4%专注于物理辅助。
- 大多数系统依赖于大型语言模型(LLMs)或视觉语言模型(VLMs),多模态整合较为有限。
- 常见的FM角色包括推理器(59%)、协调器(19%)、加速器(11%)和规划-执行桥梁(4%)。
- 相较基线的优势:
- 在手语识别、导航和GUI无障碍性方面提高了准确性。
- 改善了用户体验,包括降低工作负荷、增加自主性和提升信任感。
- 扩展了交互模式,例如对话式日志记录和可穿戴视觉查询。
- 实验/评估:
- 评估方法包括系统测试、形成性研究和现场部署。
- 评估指标涵盖任务成功率、延迟以及可用性量表(如SUS、NASA-TLX)。
- 以小规模参与者群体为主,长期研究较少。
- 局限性与未来工作:
- 挑战包括延迟、计算限制、多模态整合脆弱性、推理能力局限和数据集稀缺。
- 伦理问题包括隐私风险、旁观者暴露、高风险场景中的可靠性以及公平性差距。
- 未来方向包括参与式设计、标准化基准测试、跨障碍系统以及稳健的FM整合策略。
总结
本综述整合了26项关于支持行动障碍的FM驱动交互技术的研究,突出了其在解决无障碍性和自主性长期挑战中的潜力。这些系统主要针对盲人或低视力用户,重点关注信息获取、导航和健康自我管理。尽管FM角色如推理器和协调器提升了交互质量,但技术和伦理挑战仍然存在,包括延迟、隐私和公平性问题。本文提出了结构化分类法和研究议程,以指导未来工作,强调参与式设计、稳健的评估框架和可扩展的FM整合。这些见解旨在激励HCI和CHI社区开发包容且高效的辅助系统。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791239
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、AI 辅助决策与自动化系统、运动障碍辅助输入技术
work
职业/产业
残障服务提供者、辅助技术专家、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文