GazeCoT:通过 gaze-inform Chain-of-Thought 推理释放多模态LLM的社会智能

眼动追踪与注视交互大语言模型(LLM)的人机协作AI 辅助决策与自动化系统情感化人机对话大学教授与研究人员HCI 研究员社会学家与人类学家

文献标题

GazeCoT: Unleashing Social Intelligence in Multimodal LLMs With Gaze-Informed Chain-of-Thought Reasoning

出版信息

  • 主题领域: 通过基于注视的社会智能增强多模态大语言模型(MLLMs),以改进人机交互。
  • 关键词: 人工社会智能, 注视估计, 多模态大语言模型, 思维链推理, 人机交互, 社会感知, 心智理论推理, 共同注意, 视觉提示, 可信度。

背景与问题

  • 问题/挑战: 多模态大语言模型(MLLMs)在理解非语言社会线索(尤其是人类注视)方面存在困难,主要由于其在细粒度视觉感知和空间推理上的局限性。这限制了其在多模态场景中进行社会智能推理的能力。
  • 重要性: 准确的注视感知对于理解人类注意力和意图至关重要,这些是人机交互、智能空间和共同注意分析等应用的基础。
  • 动机与相关工作: 尽管已有研究探索了在增强现实/虚拟现实(AR/VR)应用中将自我视角注视整合到MLLMs中,但由于缺乏真实场景中的注视数据,第三人称注视整合尚未被探索。注视估计模型的进展为解决这一空白提供了机会。

解决方案

  • 提出的方法: GazeCoT(基于注视的思维链),一个通过注视估计模型和混合视觉-文本提示策略将第三人称注视信息整合到MLLMs中的管道。
  • 创新点:
    1. 使用注视估计模型将第三人称注视引入MLLM推理上下文。
    2. 开发了GazeLLE-v3,这是一种利用DINOv3提高准确性的最先进注视估计器。
    3. 实现了混合视觉-文本提示,减少幻觉现象并增强社会推理能力。
    4. 提供了一个可插拔的管道,适用于多种人机交互(HCI)应用。
  • 流程与关键技术:
    • GazeLLE-v3使用DINOv3特征生成注视热图。
    • 视觉提示通过在图像上叠加边界框、注视线和注视点实现。
    • 文本提示描述注视点周围的感兴趣区域(ROI)。
    • 结构化推理上下文减少幻觉现象,并组织提示以提高MLLM处理效率。
    • 并行化管道设计将推理延迟降至最低。

结果

  • 具体发现:
    • GazeCoT在注视目标识别准确率上比基线MLLMs提高了25个百分点。
    • 在注视驱动的社会智能(GSI)基准上取得了10个百分点的提升,显示了增强的社会智能能力。
    • 用户研究表明,MLLM生成输出的准确性、全面性、实用性、可解释性和可信度显著提高。
  • 相较基线的优势:
    • GazeCoT在所有基准和用户研究中均显著优于单独的MLLMs。
    • 减少了幻觉现象,并使MLLM推理与人类社会感知和推理规范更加一致。
  • 实验/评估:
    • 基准测试: 注视目标识别(907个图像-问题对)和GSI(320个社会智能问题)。
    • 用户研究: 针对亲子联合媒体参与分析,10位专家根据6项指标对现场记录进行评分。
    • 评估指标: 准确性、全面性、实用性、可解释性、可信度、总体偏好。
  • 局限性与未来工作:
    • 与基线MLLMs相比,延迟和令牌成本更高,需要优化以适应实时应用。
    • 当前依赖面部检测,在某些摄像机角度下表现受限;头部检测模型可能解决这一问题。
    • 用户研究集中于单一场景;需要在多样化HCI应用中进行更广泛的评估。

总结

GazeCoT是一个可插拔的管道,通过基于注视的思维链推理将第三人称注视信息整合到MLLMs中,显著增强了其社会智能能力。通过利用最先进的GazeLLE-v3注视估计器和混合视觉-文本提示,GazeCoT改进了注视感知、社会推理和人机交互。在基准测试和用户研究中,GazeCoT在准确性、可解释性和可信度方面表现出显著提升。未来工作包括优化延迟、扩展注视估计能力,并将GazeCoT适配于多样化的HCI应用,同时解决伦理问题。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222165/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790922
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
眼动追踪与注视交互、大语言模型(LLM)的人机协作、AI 辅助决策与自动化系统、情感化人机对话
work
职业/产业
大学教授与研究人员、HCI 研究员、社会学家与人类学家
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文