索诺拉:人类与AI共同创作的3D音频世界及其对焦虑和认知负荷的影响

生成式AI(文本、图像、音乐、视频)智能家居交互设计精神科医生与心理咨询师运动员与健身爱好者自由职业者(设计、写作、翻译)

研究背景与问题

  • 作者发现了哪些问题或挑战?
    声景广泛应用于放松和情绪调节,但其潜在的交互性和个性化体验尚未被充分探索。此外,传统舒缓技术往往存在“一刀切”的固定方案或过于复杂的选项,可能不适合特定用户,尤其是高焦虑人群。

  • 为什么这个问题很重要?
    焦虑是最常见的心理健康障碍之一,影响超过3亿人。个性化的心理健康干预被证明可以提高用户参与度和效果。探索创造动态、可定制的声音环境有助于提供更加有效的非侵入式治疗手段。

  • 研究动机与相关工作
    作者受现有的声音疗法启发,结合生成式AI技术(如大语言模型和扩散模型),提出解决方案以实现实时生成和个性化的声音场景,并通过用户交互改善体验。虽然已有一些研究探讨了声音对心理健康的好处,大多关注被动倾听,而非交互式体验。此外,生成式虚拟世界的研究多集中于视觉领域,本研究将其扩展到听觉维度。

解决方案

  • 作者提出了哪些方法或解决方案?
    作者开发了名为“Sonora”的AI驱动系统,允许用户通过语音命令创建和导航3D听觉世界。系统整合了大规模语言模型(LLMs)、音频扩散模型和Unity3D游戏引擎,支持声音的实时生成、空间化及按需个性化。

  • 该解决方案的创新之处是什么?

    • 无图形用户界面: 提供了完全基于语音的交互体验,避免过载的视觉刺激,适用于特定环境如睡眠辅助手段或驾驶中使用。
    • 实时生成和编辑: 用户可动态添加、移除或调整声音元素,保证体验的流畅性和个性化。
    • 系统架构创新: 集成了特定任务的LLM模块,包括声音选择、语义分组、声源3D定位等,使每个声音与用户期待的现实场景保持一致。
  • 实施步骤是什么?使用了哪些关键技术?

    • 用户输入语音命令,Prompt Interpreter模块纠正和解释输入;
    • Planner模块决定调用哪一LLM模块(如创建新场景或移除特定声音);
    • 使用SoundGroupCreator或SoundSingleCreator模块生成和空间化声音;
    • 为声音引入动态动画(如鸟在天空中盘旋)以增强沉浸感;
    • 通过Azure Speech转文本模块提供AI语音引导,保证用户交互流畅。
      系统使用了GPT-4o(LLM)和StabilityAI音频扩散模型生成独特的高质量声音。

研究成果

  • 取得了哪些具体成果?

    • 开发并验证了Sonora系统,首次将生成式AI用于构建可交互、可定制的3D声音场景。
    • 通过实验表明,Sonora的交互性和个性化功能显著提高娱乐性,同时不会增加用户的认知负荷。
    • 强调个性化体验对心理健康干预的价值,特别是对焦虑人群的吸引力。
  • 与现有解决方案相比,它有哪些优势?

    • 提供了真正的交互性:用户可创建独一无二的声音世界,而非被动倾听预设材料。
    • 简化了交互:语音驱动的界面无需复杂的图形操作,降低了认知门槛。
    • 实时性:声音生成和编辑实现了流畅的动态场景切换。
  • 实验或评估结果是什么?

    • 参与人数: 32人(包括高焦虑和低焦虑群体);
    • 焦虑变化: 无论是Sonora用户还是对照组,焦虑状态均显著减轻(特别是高焦虑用户);
    • 用户体验: Sonora在娱乐性方面得分显著高于被动声音场景,用户对个性化功能评价较高;
    • 认知负荷及生理测量: 两组在认知负荷、心率和心率变异性上的差异均不显著,说明Sonora虽具有交互功能,但未增加用户负担;
  • 局限性与未来方向

    • 声音质量: 某些扩散模型生成的声音(如音乐和人声)的真实性较低,未来优化生成质量是关键。
    • 交互优化: 提高语音识别准确性,尤其是面对复杂指令时的响应。
    • 采样规模: 当前样本较小,未来应扩大测试范围,尤其是高焦虑人群的长时间使用观察。
    • 进一步应用: 探索Sonora在教育、游戏和冥想等领域的潜力,及其在跨文化场景中的适用性。

总结

Sonora首次将LLMs和音频扩散模型结合用于交互式3D声音环境,显著推进了这一领域的技术和应用前景。其个性化功能和直观的语音交互在焦虑缓解中展示了潜力,也为未来在健康、教育和娱乐中的使用铺平了道路。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189494/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713316
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
生成式AI(文本、图像、音乐、视频)、智能家居交互设计
work
职业/产业
精神科医生与心理咨询师、运动员与健身爱好者、自由职业者(设计、写作、翻译)
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文