MoXaRt:XR中音频-视觉引导的物体导向声音交互

沉浸感与临场感研究空间音频与3D声音游戏开发者与设计师音乐人、DJ 与声音设计师

文献标题

MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR

出版信息

  • 主题领域: 扩展现实(XR)中的实时音频-视觉声音分离与交互。
  • 关键词: XR,音频-视觉分离,声音交互,实时处理,认知负荷,语音可懂度,级联架构,用户研究,声源定位。

背景与问题

  • 问题/挑战: XR系统缺乏对听觉环境的细粒度实时控制,用户容易被复杂的声音场景所淹没。现有的声音分离方法要么计算成本高,要么是离线处理,或者无法提供交互式控制。
  • 重要性: 解决这一限制可以提升XR中的场景感知、社交参与和用户体验,尤其是在嘈杂或多声源环境中。
  • 动机与相关工作: 以往的声音分离研究主要集中在离线处理或有限的实时能力上,且通常未利用视觉线索。HCI研究探索了全局声音过滤,但缺乏以对象为中心的交互式控制。机器学习方法虽然在分离质量上表现出色,但由于延迟和计算限制,不适合实时XR应用。

解决方案

  • 提出的方法: MoXaRt,一种实时XR系统,结合音频-视觉线索进行声源分离和交互式声音场景控制。
  • 创新点:
    1. 引入级联音频-视觉Transformer模型,用于实时、对象引导的声音分离。
    2. 开发用户界面,可交互式控制单个声源的音量。
    3. 创建一个包含复杂音频-视觉场景的新数据集用于评估。
    4. 显著提升语音可懂度、降低认知负荷,并改善用户体验。
  • 流程与关键技术:
    • 通过音频初步分离为一般类别(语音、音乐、噪声)。
    • 视觉检测面部和乐器以指导精细分离网络。
    • 采用级联架构实现对单个说话者和乐器的细粒度分离。
    • 实时处理管道,延迟约2秒,利用外部PC计算和无线数据传输。

结果

  • 具体发现:
    • MoXaRt在听力理解方面提升了36.2%(p = 0.0058),显著降低了认知负荷(p < 0.001)。
    • 实时模型的单词错误率(WER)为0.4990,优于其架构基线(AudioScopeV2,WER = 0.5263)。
    • DNSMOS评分表明其感知音频质量具有竞争力。
  • 相较基线的优势:
    • 在可懂度和交互能力方面优于最先进的模型,如AV-Mossformer2和AudioScopeV2。
    • 实现了实时、用户驱动的声音场景重混,而非被动或离线分离系统。
  • 实验/评估:
    • 在一个包含30个录音的自定义数据集上进行技术评估,每个录音最多包含五个同时声源。
    • 用户研究(N=22),涵盖六个XR场景,显示出显著的客观和主观优势。
  • 局限性与未来工作:
    • 视觉依赖性导致当声源被遮挡或不在视野范围内时性能受限。
    • 当前实现需要连接PC,需优化以支持独立XR设备。
    • 在扩展到超过四个同时说话者或动态声源跟踪的环境时面临挑战。

摘要

MoXaRt提出了一种用于XR中音频-视觉声音分离与交互的创新实时系统,利用级联架构隔离并重混单个声源。通过技术基准测试和22名参与者的用户研究验证,该系统显著提升了语音可懂度并降低了认知负荷。尽管目前依赖外部计算和视觉线索,MoXaRt展示了在XR中变革听觉体验的潜力,应用范围涵盖社交互动到AI辅助任务。未来工作将重点放在独立部署、可扩展性以及伦理考虑上。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222533/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791929
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
沉浸感与临场感研究、空间音频与3D声音
work
职业/产业
游戏开发者与设计师、音乐人、DJ 与声音设计师
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文