量化延迟:虚拟现实中人-智能体交互的会话分析方法
作者
VR 中的社交与协作大语言模型(LLM)的人机协作情感化人机对话HCI 研究员AI/ML 研究员与工程师UI/UX 设计师
文献标题
Quantifying Latencies: A Conversation Analysis Approach to Human-Agent Interactions in Virtual Reality
出版信息
- 主题领域: 虚拟现实中人机交互,重点研究对话时序。
- 关键词: 延迟、虚拟现实、具身对话代理、人机交互、轮流发言、语音到语音模型、会话分析、重叠、间隙、修复策略。
背景与问题
- 问题/挑战: 当前的对话代理,尤其是使用大型语言模型(LLMs)的代理,存在技术延迟,破坏了自然的轮流发言模式,导致用户挫败感增加,采用率降低。现有研究缺乏对虚拟现实环境中人机交互延迟的实证量化分析。
- 意义: 理解并解决对话延迟问题对于提升用户体验、建立信任以及提高教育、医疗和社交虚拟现实等应用的有效性至关重要。
- 动机与相关工作: 之前的研究主要通过诱导实验条件或主观测量来探讨延迟对人际和人机交互的影响。然而,在虚拟现实中分析自然对话时序,尤其是基于语音到语音大型语言模型代理的交互,仍存在研究空白。
解决方案
- 提出的方法: 使用会话分析方法量化虚拟现实中人机交互的延迟,重点关注两个指标:Floor-Transfer Offset (FTO) 和 Post-Overlap Continuation (POC)。
- 创新点:
- 首次对基于语音到语音大型语言模型的虚拟现实人机交互延迟进行实证量化。
- 识别两种延迟模式:启动延迟(代理响应延迟)和结束延迟(代理在被打断后停止语音的延迟)。
- 提出设计建议和启发,用于改善代理的时序和响应能力。
- 流程与关键技术:
- 使用 Meta Quest 3 头显在 VRChat 中收集二人交互数据。
- 使用 pyannote/speaker-diarization-3.1 和 ELAN 软件提取语音特征(静默、重叠)。
- 通过统计分析和可视化量化 FTO 和 POC 指标。
- 使用 Jeffersonian 转录法对对话进行详细注释以进行会话分析。
结果
- 具体发现:
- 代理的 FTO 时长 (Mdn = 4050 ms) 显著长于用户的 FTO 时长 (Mdn = 1232 ms),表明存在启动延迟。
- 代理的 POC 时长 (Mdn = 931 ms) 显著长于用户的 POC 时长 (Mdn = 287 ms),表明存在结束延迟。
- 重叠仅占对话时间的 0.36%,而静默占 44.64%。
- 相比基线的优势:
- 对对话时序指标的实证量化提供了超越以往主观测量的可操作性见解。
- 识别具体的延迟模式,使得具身对话代理的设计改进更具针对性。
- 实验/评估:
- 数据集:在 VRChat 中记录的 8 小时 56 分钟的二人交互数据,涉及 20 名参与者。
- 指标:FTO 和 POC 时长、静默和重叠分布。
- 统计测试:使用 Mann–Whitney U 检验并计算效应量。
- 局限性与未来工作:
- 当前方法仅限于二人交互,未考虑网络延迟等技术性延迟影响。
- 用户人口统计特征(如讲话焦虑、非母语英语水平)可能对时序结果造成混淆。
- 未来研究应探索多发言者交互、个体差异以及跨模态比较。
摘要
本研究提出了一种新颖框架,用于量化虚拟现实环境中人机交互的对话延迟。通过分析 Floor-Transfer Offset 和 Post-Overlap Continuation 指标,作者识别了两种显著延迟模式——启动延迟和结束延迟,这些延迟破坏了自然的轮流发言模式。实证结果揭示了用户与代理之间显著的时序不对称性,突出了设计改进的重点领域。所提出的指标和方法为评估和提升具身对话代理的真实感提供了有价值的工具,并对教育、医疗和社交虚拟现实应用具有重要意义。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
虚拟智能体的智能与博学性研究
CHI '26· VR 中的社交与协作 +2
- 71%
人工智能展现的人格特质可通过对话影响人类的自我概念
CHI '26· 会话代理的人格与拟人化 +2
- 71%
共同破解谜案:人机协作解谜对话中的角色感知
CHI '26· 大语言模型(LLM)的人机协作 +2
- 71%
通过跨时序情感建模实现自然且陪伴型虚拟智能体
CHI '26· 会话代理的人格与拟人化 +2
- 67%
从HCI研究中映射机器学习进展以揭示设计创新的起点
CHI '18· 大语言模型(LLM)的人机协作
- 63%
通过生成式AI赋能XR:平衡超级能力与风险
CHI '26· 生成式AI(文本、图像、音乐、视频) +3
- 63%
FeelWave:通过抗噪声毫米波情绪感知实现情感感知语音交互
CHI '26· 情感化人机对话 +3
- 63%
“我们忽视她后我感到内疚”:理解界面驱动的社会显著性如何塑造与生成式AI的群体讨论
CHI '26· 大语言模型(LLM)的人机协作 +3
- 63%
从提示到临在:与生成式AI在VR中共创个性化情感避难所
IUI '26· 生成式AI(文本、图像、音乐、视频) +3
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790947
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
VR 中的社交与协作、大语言模型(LLM)的人机协作、情感化人机对话
work
职业/产业
HCI 研究员、AI/ML 研究员与工程师、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
9 篇相关论文