TouchScribe:通过自动化实时视觉描述增强非视觉手-物体交互

视觉障碍者技术(屏幕阅读器、触觉图形、盲文)振动反馈与皮肤刺激行为改变与反思技术辅助技术专家医生、护士、临床医生

文献标题

TouchScribe: Augmenting Non-Visual Hand-Object Interactions with Automated Live Visual Descriptions

出版信息

  • 主题领域: 为盲人和视障人士设计的辅助技术,聚焦于实时视觉描述。
  • 关键词: 盲人、视障人士、手-物体交互、视觉描述、辅助技术、手势识别、实时反馈、视觉语言模型、可访问性、物体理解。

背景与问题

  • 问题与挑战: 盲人和视障人士(BLV)在获取物体的丰富视觉特征(如颜色、文字和细节图案)方面面临挑战,这些特征仅通过触摸无法获得。现有辅助技术通常依赖拍照和人工智能对话系统,这些方法速度慢、准确性不足且操作繁琐。
  • 重要性: 使BLV个体能够实时获取详细的视觉信息,有助于增强其独立性、物体理解能力以及日常功能,例如购物或物品分类。
  • 动机与相关研究: 之前的系统如SeeingAI和VizLens提供了有限的视觉反馈(例如文字或颜色),并需要用户明确输入(如拍照)。基于手势的系统虽有所探索,但缺乏对丰富、层次化描述的整合。本研究通过利用自然的手-物体交互来提供实时、适应性的视觉描述,以填补这些空白。

解决方案

  • 提出的方法: TouchScribe系统利用第一视角手势生成实时、层次化的物体视觉描述,包括手势状态、物体标签、详细描述、文字、颜色和比较信息。
  • 创新点:
    1. 整合多样化手势(如握持、触摸、指点、滑动)以访问层次化、适应性的视觉描述。
    2. 结合经过微调的手势识别模型与视觉语言模型(VLMs),实现实时物体理解。
    3. 设计层次化反馈,使用户根据交互上下文获取简要、详细和比较性描述。
    4. 在实时环境中对手势识别准确性、延迟和描述准确性进行技术评估。
  • 流程与关键技术:
    • 使用Google MediaPipe和微调分类模型进行手势和手指动作识别。
    • 利用Hands23进行关键帧提取和物体裁剪,以识别手-物体接触。
    • 通过Moondream和GPT-4o模型生成简要、详细和比较性反馈描述。
    • 实时管道运行在配备广角摄像头的颈挂式智能手机设备上。

结果

  • 具体发现:
    • 手势识别的F1分数达到0.77,其中“握持”手势的准确性最高(F1=0.84)。
    • 描述准确性:简要物体标签为91.59%,详细描述为93.27%,比较性描述为91.43%,物体文字为67.83%。
    • 延迟:手势状态反馈平均为0.56秒;简要描述耗时5.36秒;详细描述耗时10.3秒;比较性描述耗时14.0秒。
  • 相较基线的优势: TouchScribe提供了比现有系统更丰富、更整合的描述,而现有系统通常仅关注单一信息类型(如文字或颜色)。此外,它减少了对拍照和轮流对话的依赖。
  • 实验与评估:
    • 对8名BLV参与者(年龄18–72岁)进行用户研究,完成4项物体理解任务。
    • 任务包括理解单一物体、区分相似物体、分类多个物体以及根据特定标准选择物品。
    • 参与者评价TouchScribe直观性(M=5.63/7)、准确性(M=5.5/7)和全面性(M=6.5/7),但指出存在适度的认知负担和学习曲线。
  • 局限性与未来工作:
    • 摄像头限制:广角镜头畸变影响了手势识别准确性。
    • 手势识别错误:非意图性手部动作导致误报。
    • 学习曲线:用户需要时间适应手势映射和手部定位。
    • 未来方向:支持自定义手势、通过多模态传感器改进手势识别、探索替代摄像头配置(如智能眼镜),以及支持超出物理范围的交互。

总结

TouchScribe引入了一种新颖系统,使BLV个体能够通过自然的手-物体交互获取丰富的物体视觉描述。该系统利用第一视角手势和视觉语言模型提供层次化反馈,包括简要、详细和比较性描述。用户研究证明了其有效性,参与者认为该系统直观且准确,但也指出手势识别错误和摄像头限制等挑战。未来工作旨在增强手势自定义、多模态传感器以及在真实场景中的广泛适用性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222163/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791308
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
7 位作者
sell
研究子方向
视觉障碍者技术(屏幕阅读器、触觉图形、盲文)、振动反馈与皮肤刺激、行为改变与反思技术
work
职业/产业
辅助技术专家、医生、护士、临床医生
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文