心有灵犀:通过人机协作中共享第一人称视角实现认知对齐

大语言模型(LLM)的人机协作AR 导航与情境感知沉浸感与临场感研究AI/ML 研究员与工程师UI/UX 设计师大学教授与研究人员

文献标题

Seeing Eye to Eye: Enabling Cognitive Alignment Through Shared First-Person Perspective in Human–AI Collaboration

出版信息

  • 主题领域: 使用第一人称视角实现认知对齐的人机协作。
  • 关键词: 人机协作, 第一人称视角, 认知对齐, 增强现实, 共同注意, 共同认知, 多模态反馈, 可穿戴AI, 自我中心视觉。

背景与问题

  • 问题/挑战: 当前基于视觉的AI助手在协作任务中面临沟通和理解的鸿沟。这包括将人类意图转化为AI指令的低效性以及对具身线索的解释困难。
  • 重要性: 解决这些鸿沟可以提高任务性能,减少交互摩擦,并增强人机合作中的信任,特别是在动态、情境依赖的场景中。
  • 动机与相关工作: 先前关于可穿戴AI助手和自我中心视觉的研究主要集中在单向输入处理和预定义知识库上,缺乏针对用户特定规则和隐性线索的动态适应机制。本文在这些基础上进一步发展,将自我中心视觉概念化为一个双向的共享感知空间。

解决方案

  • 提出的方法: Eye2Eye框架,利用第一人称视角作为人机协作中认知对齐的共享通道。
  • 创新点:
    1. 将第一人称视角概念化为实现认知对齐的共享感知通道。
    2. 实现了一个基于增强现实的实时原型,集成了多模态信号(视线、手势、语音)。
    3. 通过三种任务类型的对照用户研究,展示了降低对齐成本和增强协作信任的效果。
  • 流程和关键技术:
    • 共同注意协调: 利用视线、手势和增强现实高亮功能对齐人类与AI的关注点。
    • 累积共同认知: 维护随着用户交互动态演化的记忆单元。
    • 反思性情境反馈: 提供情境感知的多模态指导,并基于用户反馈优化AI理解。

结果

  • 具体发现:
    • Eye2Eye相比基线系统减少了约58%的错误率和约50%的澄清成本。
    • 改善了任务完成时间(整体平均减少15秒)和交互效率,适用于程序性、分类和检查任务。
    • 增强了用户信任、流畅性和共享意识,同时显著降低了认知负荷(NASA-TLX评分)。
  • 相较基线的优势:
    • 在消融研究中,Eye2Eye在准确性、实用性和时间鲁棒性方面优于基线系统。
    • 展现了框架组件之间的强协同效应,当移除组件时性能显著下降。
  • 实验/评估:
    • 包含60名参与者的用户研究,涵盖三种任务(咖啡机操作、书籍分类、电路板故障排查)。
    • 混合实验设计,将Eye2Eye与基线系统进行比较,使用客观指标(错误率、交互回合)和主观评分(信任、负荷)。
    • 后续管道评估通过消融变体评估组件贡献。
  • 局限性与未来工作:
    • 处理延迟(约4–5秒)限制了在时间敏感场景中的响应能力。
    • 研究样本偏向于对AI接受度较高的年轻参与者;需要更广泛的人口统计学研究。
    • 离线消融研究与实时用户反应脱节;未来工作应探索在线评估并解耦组件间的相互依赖。

总结

Eye2Eye框架将第一人称视角转化为人机协作中认知对齐的共享通道。通过整合共同注意、动态记忆和多模态反馈,它减少了交互摩擦,提高了任务性能,并促进了信任与共在感。控制研究和消融实验证实了其有效性和协同效应,但仍存在如延迟和任务特定中断等挑战。该框架在工业组装和辅助技术等多种应用中具有潜力,同时也对可穿戴AI系统的设计和伦理提出了重要考虑。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222072/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791059
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
大语言模型(LLM)的人机协作、AR 导航与情境感知、沉浸感与临场感研究
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、大学教授与研究人员
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文