VueBuds:无线耳机的视觉智能

荣誉提名
智能手表与健身手环生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作眼动追踪与注视交互行为改变与反思技术软件工程师与开发者AI/ML 研究员与工程师UI/UX 设计师

文献标题

VueBuds: Visual Intelligence with Wireless Earbuds

出版信息

  • 主题领域: 融合到可穿戴设备中的自我中心视觉智能。
  • 关键词: 无线耳机、自我中心视觉、视觉语言模型、可穿戴人工智能、双目摄像头、实时处理、低功耗系统、用户研究、隐私、可访问性。

背景与问题

  • 问题/挑战: 无线耳机缺乏视觉能力,与智能眼镜和其他可穿戴设备相比,其在多模态交互中的潜力受到限制。挑战包括在严格的尺寸、重量和功耗(SWaP)限制下集成摄像头,以及解决耳机级摄像头导致的面部遮挡问题。
  • 重要性: 无线耳机是最普及的可穿戴平台之一,其用户基数是智能眼镜的150–200倍。为耳机添加视觉智能功能可以普及AI驱动的视觉辅助技术。
  • 动机与相关工作: 先前的可穿戴系统(如智能眼镜和AR头显)已探索视觉智能,但由于社会不适感和有限的用户群体而面临采用障碍。耳戴设备已经发展出健康和运动追踪传感器,但缺乏自我中心视觉能力。现有摄像头系统在功耗和隐私问题上存在挑战,亟需一种紧凑、低功耗的摄像头集成耳机解决方案。

解决方案

  • 提出的方法: VueBuds,一种集成摄像头的无线耳机系统,可将视觉数据流传输到主机设备,由视觉语言模型(VLMs)进行实时处理。
  • 创新点:
    1. 开发了首个功耗低于5mW的双摄像头耳机原型,电池负担最小化。
    2. 双目视觉系统缓解面部遮挡问题,并提供全面的前向覆盖。
    3. 针对VLMs的实时多模态交互进行端到端系统优化,实现低于3秒的延迟。
    4. 比较评估显示,在视觉问答任务中性能与智能眼镜相当。
  • 实施过程与关键技术:
    • 将低功耗Himax HM01B0 CMOS摄像头集成到Sony WF-1000XM3耳机中,使用定制PCB和3D打印外壳。
    • 双目摄像头的方向设置和窗口化读取减少面部遮挡并扩展视野。
    • 基于BLE的无线流媒体管道,结合机会性图像拼接以降低延迟。
    • 使用Qwen2.5-VL进行场景理解、OCR和翻译任务的设备端处理。

结果

  • 具体发现:
    • VueBuds在物体识别任务中达到了82.5%的准确率,在OCR任务中达到了94.3%,在翻译任务中达到了83.8%。
    • 通过机会性拼接将端到端延迟降低到1.14秒。
    • 在高使用率(60次查询/小时)下,电池寿命影响仅为11–14%。
  • 相较基线的优势:
    • 在响应质量上与Ray-Ban Meta智能眼镜相当(平均意见分数:VueBuds 3.33 vs. Ray-Ban Meta 3.32)。
    • 更广泛的可访问性,93.3%的参与者使用耳机,而仅62.7%使用眼镜。
  • 实验/评估:
    • 在线研究(n = 74),比较17个VQA任务的响应质量。
    • 线下研究(n = 16),评估在多样化环境中的实际性能。
    • 系统在功耗、延迟和视野方面的基准测试。
  • 局限性与未来工作:
    • 单色成像限制了在细小文本OCR和不利光照条件下的物体识别性能。
    • 缺乏注视追踪和多轮对话能力。
    • 与旁观者意识和推论性信息泄露相关的隐私问题。
    • 未来方向包括彩色成像、自适应摄像头定位、基于手势的交互和隐私保护技术。

总结

VueBuds通过集成摄像头的无线耳机引入了一种新型的自我中心视觉智能平台,利用双目视觉和视觉语言模型实现实时交互。该系统在性能上与智能眼镜相当,同时克服了可访问性障碍,对电池寿命和延迟的影响最小。用户研究验证了其在场景理解、OCR和翻译任务中的可行性,但在分辨率、隐私和交互模式方面仍面临挑战。VueBuds将耳机定位为视觉AI应用的一个有前景的可穿戴形式因素。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/221927/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791322
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
荣誉提名
group
作者
7 位作者
sell
研究子方向
智能手表与健身手环、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作、眼动追踪与注视交互
work
职业/产业
软件工程师与开发者、AI/ML 研究员与工程师、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
2 篇相关论文