可听全景图:全景图像的自动空间音频生成

抬头显示(HUD)与驾驶辅助系统(ADAS)360° 视频与全景内容生成式AI(文本、图像、音乐、视频)

随着360度相机和虚拟现实头戴设备的普及,全景图像变得越来越普遍。虽然声音对于提供沉浸式和交互式的用户体验至关重要,但大多数全景图像却没有自带音频。本文中,我们提出了一种自动算法,通过真实的音频分配来增强静态全景图像。我们通过对象检测、场景分类、对象深度估计和音频源放置来实现这一目标。我们建立了一个由超过500个音频文件组成的数据库来促进这一过程。我们设计并进行了一项用户研究来验证我们流程中各个组件的有效性。我们在各种室内外全景图像上运行了我们的方法。通过分析统计数据,我们了解了这些组件的相对重要性,这可以用于在移动增强现实(AR)应用程序等对电源敏感的时间关键任务中进行优先级排序。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/5733/2019

广告推荐

学习 AI 编程到 CodeNow

一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2019
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
抬头显示(HUD)与驾驶辅助系统(ADAS)、360° 视频与全景内容、生成式AI(文本、图像、音乐、视频)
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文