LifeInsight:设计与评估用于多种日常生活场景的盲人及低视力人群的AI辅助可穿戴设备

触觉可穿戴设备视觉障碍者技术(屏幕阅读器、触觉图形、盲文)医生、护士、临床医生残障服务提供者

研究背景与问题

  • 发现的问题或挑战: 目前的助视技术(Assistive Technologies, ATs)虽然能够支持盲人和低视力人群进行部分日常活动,但大多设备具有场景局限性,且交互复杂性较高,不适应移动场景。这导致盲人和低视力人群需要依赖多种设备,且设备经常闲置。主要问题集中在识别物品、阅读文字以及与设备界面交互的多场景需求上。

  • 重要性: 智能化助视设备能有效减少盲人或低视力人群对他人的依赖,提高社会参与及生活质量,同时简化现有复杂的设备场景限制。

  • 研究动机与相关工作: 现有研究探讨了盲人如何用手机应用(如Seeing AI和Be My Eyes)进行视觉问题求解,或依赖远程工人提供帮助。而过渡到可穿戴设备,尤其结合AI的设计,有望通过释放用户双手、增强交互效率进一步改进用户体验。然而,如何设计多场景通用的AI助视设备并推动其普及仍是一个亟待解决的问题。

解决方案

  • 提出的方法或解决方案: 作者设计了一个名为LifeInsight的AI驱动助视可穿戴设备,包括一个可穿戴摄像头、麦克风和单击式交互接口,允许用户通过语音输入提出视觉问题。设备整合了多场景问答功能,并通过目标导向的视觉识别(例如区分食品罐或检查蜡烛状态)为用户提供专门化的信息反馈。

  • 创新之处:

    1. 克服了传统手持设备的局限性,通过可穿戴硬件实现双手自由交互。
    2. 使用多模态大型语言模型(OpenAI GPT-4 Vision API)以优化视觉问题解答。
    3. 提供多场景的通用解决方案,涵盖物品定位、状态检查、文字阅读、比较之类的需求。
  • 实施步骤:

    1. 需求收集: 使用文化探针收集盲人和低视力人群一周内的日常活动场景视频及访谈,理解主要挑战。
    2. 设备设计与实现: 成功开发了LifeInsight设备,结合语言模型API对视觉问题进行实时分析并返回语音反馈。
    3. 设备评估: 通过实验对LifeInsight在六种日常场景中的表现进行评估,包括对象定位、文字理解、环境导航等。

研究成果

  • 具体成果:

    1. 提供了一套显著改善多场景交互的AI驱动助视设备,评估表明其在80%以上场景中实现了准确视觉问题解答。
    2. 用户表示LifeInsight显著减少了使用不同设备带来的摩擦,尤其相较于智能手机应用。
  • 优势: 相较于现有的手机应用(如Seeing AI),LifeInsight的可穿戴形式增强了使用便捷性,并且通过语音与单击接口大幅降低交互复杂度。此外,设备还支持目标导向的信息输出,减少了无关冗余信息。

  • 实验或评估结果:

    1. 用户平均发起23次视觉查询,主要问题为目标导向型场景需求(41.4%的查询为目标导向型)。
    2. 设备的系统可用性评分(SUS)为74.81,表明其具备较高的可用性。
    3. 用户指出设备在蜡烛状态判断显示方面表现优异,达到了100%的准确率。
  • 局限性与未来方向:

    1. 感应范围受摄像头视角限制,在导航或物体定位场景中偶有失误(例如处理视线范围外的目标)。
    2. 需要进一步优化隐私保护措施以应对日常持续监控带来的潜在旁观者隐私问题。
    3. 探讨如何通过用户自定义或可训练AI功能进一步提高模型对用户需求的理解。

未来工作可深度研究BLV人群对设备的长期行为改变及其社会接受度,同时探索增强LifeInsight在多场景下的隐私保护能力及AI对复杂视觉问题的解答准确性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189505/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713486
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
触觉可穿戴设备、视觉障碍者技术(屏幕阅读器、触觉图形、盲文)
work
职业/产业
医生、护士、临床医生、残障服务提供者
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文