LifeInsight:设计与评估用于多种日常生活场景的盲人及低视力人群的AI辅助可穿戴设备
研究背景与问题
-
发现的问题或挑战: 目前的助视技术(Assistive Technologies, ATs)虽然能够支持盲人和低视力人群进行部分日常活动,但大多设备具有场景局限性,且交互复杂性较高,不适应移动场景。这导致盲人和低视力人群需要依赖多种设备,且设备经常闲置。主要问题集中在识别物品、阅读文字以及与设备界面交互的多场景需求上。
-
重要性: 智能化助视设备能有效减少盲人或低视力人群对他人的依赖,提高社会参与及生活质量,同时简化现有复杂的设备场景限制。
-
研究动机与相关工作: 现有研究探讨了盲人如何用手机应用(如Seeing AI和Be My Eyes)进行视觉问题求解,或依赖远程工人提供帮助。而过渡到可穿戴设备,尤其结合AI的设计,有望通过释放用户双手、增强交互效率进一步改进用户体验。然而,如何设计多场景通用的AI助视设备并推动其普及仍是一个亟待解决的问题。
解决方案
-
提出的方法或解决方案: 作者设计了一个名为LifeInsight的AI驱动助视可穿戴设备,包括一个可穿戴摄像头、麦克风和单击式交互接口,允许用户通过语音输入提出视觉问题。设备整合了多场景问答功能,并通过目标导向的视觉识别(例如区分食品罐或检查蜡烛状态)为用户提供专门化的信息反馈。
-
创新之处:
- 克服了传统手持设备的局限性,通过可穿戴硬件实现双手自由交互。
- 使用多模态大型语言模型(OpenAI GPT-4 Vision API)以优化视觉问题解答。
- 提供多场景的通用解决方案,涵盖物品定位、状态检查、文字阅读、比较之类的需求。
-
实施步骤:
- 需求收集: 使用文化探针收集盲人和低视力人群一周内的日常活动场景视频及访谈,理解主要挑战。
- 设备设计与实现: 成功开发了LifeInsight设备,结合语言模型API对视觉问题进行实时分析并返回语音反馈。
- 设备评估: 通过实验对LifeInsight在六种日常场景中的表现进行评估,包括对象定位、文字理解、环境导航等。
研究成果
-
具体成果:
- 提供了一套显著改善多场景交互的AI驱动助视设备,评估表明其在80%以上场景中实现了准确视觉问题解答。
- 用户表示LifeInsight显著减少了使用不同设备带来的摩擦,尤其相较于智能手机应用。
-
优势: 相较于现有的手机应用(如Seeing AI),LifeInsight的可穿戴形式增强了使用便捷性,并且通过语音与单击接口大幅降低交互复杂度。此外,设备还支持目标导向的信息输出,减少了无关冗余信息。
-
实验或评估结果:
- 用户平均发起23次视觉查询,主要问题为目标导向型场景需求(41.4%的查询为目标导向型)。
- 设备的系统可用性评分(SUS)为74.81,表明其具备较高的可用性。
- 用户指出设备在蜡烛状态判断显示方面表现优异,达到了100%的准确率。
-
局限性与未来方向:
- 感应范围受摄像头视角限制,在导航或物体定位场景中偶有失误(例如处理视线范围外的目标)。
- 需要进一步优化隐私保护措施以应对日常持续监控带来的潜在旁观者隐私问题。
- 探讨如何通过用户自定义或可训练AI功能进一步提高模型对用户需求的理解。
未来工作可深度研究BLV人群对设备的长期行为改变及其社会接受度,同时探索增强LifeInsight在多场景下的隐私保护能力及AI对复杂视觉问题的解答准确性。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3现实痛点
1- 盲人和弱视用户在移动场景下难以高效完成视觉相关任务。分类: 盲人与低视力无障碍同类问题arrow_forward
- 60%
触觉罗盘:使视障人士能够通过持续的方向反馈跟随路径
CHI '21· 振动反馈与皮肤刺激 +2
- 60%
那是什么形状?探究无视觉识别纺织图标
CHI '23· 触觉可穿戴设备 +1
- 60%
对视力障碍者在烹饪中的情境探究
CHI '24· 视觉障碍者技术(屏幕阅读器、触觉图形、盲文) +1
- 60%
FetchAid:通过深度学习增强的触摸屏引导、错误恢复机制和基于AR的搜索支持,使包裹储物柜对盲人和低视力人群更易访问
CHI '24· AR 导航与情境感知 +1
- 60%
照亮我的路。开发和探索一个多模态界面,以帮助视觉障碍者离开高度自动化的车辆
CHI '25· 车内触觉、声音、多模态反馈 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)