面向基于条件的跨模态意图感知的人工智能在VR环境下的合作

VR 中的社交与协作AR 导航与情境感知大语言模型(LLM)的人机协作软件工程师与开发者UI/UX 设计师HCI 研究员

文献标题

Towards Building Condition-Based Cross-Modality Intention-Aware Human-AI Cooperation under VR Environment

文献信息

  • 主题领域: 人机协作,虚拟现实(VR),跨模态意图检测
  • 关键词: 虚拟现实, 人机协作, 意图检测, 动作生成, 多模态交互, 条件驱动, 大语言模型(LLM), 智能购物

研究背景与问题

  • 发现的问题与挑战:

    1. 用户表达的模糊性,例如“适合汽车后备箱的物品”或“我看到的那个物品”。
    2. 人工智能(AI)在识别用户意图和生成推荐时的准确性不足。
    3. 难以根据用户交互的变化,动态地调整响应内容。
  • 重要性: 在虚拟现实环境中,能够有效捕捉用户意图并根据意图生成高效的信息展示和建议,不仅可以提升用户体验,还能提高任务完成的效率。

  • 研究动机与相关工作:

    • 虚拟环境中基于多模态的用户意图检测已经取得一些进展,特别是在眼动追踪、手势识别和语音分析领域。
    • 在生成基于用户意图的虚拟响应方面,多模态反馈(如语音、视觉标签等)被证明比单一模态更有效,但当前方法多集中于单模态优化。
    • 利用大语言模型(LLMs)作为对话助手在虚拟场景中已有研究,但在任务效率和输出控制上存在诸多限制。

解决方案

  • 提出的方法或解决方案: 作者提出了一个基于条件的跨模态意图感知人机协作框架,包括以下核心组件:

    1. 意图元组 (Intent Tuples): 用于构造意图库,元组包含意图、条件、意图提示(intent prompt)、动作提示(action prompt)四个核心元素。
    2. 双LLM架构 (2-LLMs Framework): 使用两个不同的大语言模型分别负责意图识别(Intent LLM)和动作生成(Action LLM),以减少模型负担并提高输出一致性。
  • 创新点:

    1. 引入了以“条件”为核心的任务描述方法,显式表示任务的动态状态。
    2. 使用Intent LLM和Action LLM分别处理意图检测和动作生成,通过任务解耦减少提示的复杂性和长度。
    3. 基于多模态数据(用户的眼动、手势、语音输入)动态匹配用户意图,与现有方法相比更贴近日常交互情境。
  • 实施步骤与关键技术:

    1. 建立意图库,设计意图元组以涵盖常见任务需求。
    2. 在VR环境中实现一个智能家具购物系统,包括语音助手、漂浮标签、红箭头指示和控制器操作功能。
    3. 使用Intent LLM识别用户意图,包括对多模态输入的处理。
    4. 使用Action LLM生成基于意图的动态多模态响应,并向用户展示结果。

研究成果

  • 具体成果:

    1. 成功实现了支持条件驱动的VR家具购物系统。
    2. 在用户实验中验证了该方法的高效性。
    3. 用户主观看法表明,条件驱动的多模态协作框架能够带来更高的满意度和更低的身体操作负担。
  • 与现有解决方案的比较和优势:

    1. 将意图检测和动作生成分布到不同的LLM中,LLM的提示长度减少了82.54%-92.87%,从而提高了响应准确性。
    2. 与未使用条件驱动机制的系统相比,该方法提升任务时间效率30.15%,错误提交次数减少29.06%。
    3. 支持更加主动的用户交互方式,如动态更新的漂浮标签帮助用户快速过滤相关对象。
  • 实验或评估结果:

    1. 在用户任务完成时间和错误次数上,采用条件驱动的系统显著优于传统交互模式的系统。
    2. 系统能够更高效地识别用户的跨模态表达(64.7%的多模态表达被正确识别,相较于对照系统的12.5%)。
    3. 用户更倾向于与AI聊天,互动次数比对照组提升约48%。
  • 局限性与未来方向:

    1. 当前系统采用手工设计的意图库,未来可以探索自动化生成意图元组或条件提示的方法。
    2. 模态支持尚未完全覆盖,未来可结合生理信号(如EEG/EOG)识别隐性意图。
    3. 意图元组中的条件目前仅包含有限的产品属性,未来可加入更多元数据(如用户评分、销售量)以扩展使用场景。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/147782/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3613904.3642360
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
VR 中的社交与协作、AR 导航与情境感知、大语言模型(LLM)的人机协作
work
职业/产业
软件工程师与开发者、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文