Sound2Hap:从人类评分学习音频到触觉振动生成
最佳论文振动反馈与皮肤刺激声学传感与音频处理情感反馈与情绪调节界面UI/UX 设计师AI/ML 研究员与工程师HCI 研究员
文献标题
Sound2Hap: Learning Audio-to-Vibrotactile Haptic Generation from Human Ratings
出版信息
- 主题领域: 使用机器学习进行音频到触觉信号生成。
- 关键词: 音频到触觉、振动反馈、环境声音、CNN自动编码器、用户评分、触觉体验、信号处理、生成模型、可访问性、交互工具。
背景与问题
- 问题/挑战: 现有的音频到触觉方法依赖于针对特定场景(如音乐、游戏)优化的信号处理规则,无法在多样化的环境声音中实现泛化。这些方法缺乏适应性和与人类偏好感知的对齐。
- 重要性: 高质量的音频到触觉映射可以在虚拟现实、游戏和辅助技术等应用中增强真实感和可访问性。然而,目前的方法在处理多样化和复杂的声音场景方面存在局限性。
- 动机与相关工作: 之前的研究集中于音频到触觉转换的信号处理技术和机器学习模型,但这些方法要么是领域特定的,要么依赖于预定义的映射,缺乏灵活性。本研究旨在通过数据驱动的方法解决这些限制。
解决方案
- 提出的方法: Sound2Hap,一种基于CNN的自动编码器模型,通过人类评分的音频-振动对进行训练,从多样化的环境声音中生成具有感知意义的振动触觉信号。
- 创新点:
- 创建了迄今为止最大的用户评分数据集,包括4,000个音频-振动对,涵盖50类环境声音。
- 开发了Sound2Hap生成模型,采用两种训练方案(Top-Pair和Preference-Weighted)进行音频到振动的转换。
- 引入了一个交互式网页工具,用于数据集可视化和振动生成。
- 流程与关键技术:
- 使用四种信号处理算法从ESC-50数据集的1,000个声音片段生成振动。
- 收集了8,000个用户评分的音频-振动对,创建训练数据集。
- 训练了两种Sound2Hap变体:Top-Pair(基于每个片段评分最高的振动进行训练)和Preference-Weighted(基于所有评分振动的混合目标进行训练)。
- 进行了用户研究,将模型与信号处理基线进行比较。
- 开发了一个网页工具,用于探索数据集和生成振动。
结果
- 具体发现:
- Sound2Hap在音频-振动匹配评分中显著优于基线(Top-Pair为76.28,Preference-Weighted为73.27,基线为58.28)。
- 两种变体在触觉体验指数(HXI)上均优于基线,在和谐性、不和谐性和总体评分方面均有提升。
- 振动生成延迟低于1秒,适用于最长20秒的声音片段。
- 相较于基线的优势:
- Sound2Hap在多样化的环境声音中表现出更好的泛化能力,并捕捉了片段级的感知细节,优于每种声音类别的最佳信号处理算法。
- 用户更偏好Sound2Hap生成的振动,其准确性、节奏感和强度均获得认可。
- 实验/评估:
- 研究1:34名参与者对由四种信号处理算法生成的4,000个音频-振动对进行评分。
- 研究2:15名参与者使用ESC-50和BBC Sound Effects数据集中的600个新声音片段比较Sound2Hap变体与表现最佳的信号处理基线。
- 评估指标包括用户评分(0–100分)和HXI评分(1–7分)。
- 局限性与未来工作:
- 数据集仅限于单一、显著的声音源;未来工作可研究重叠声音和更广泛的声音领域。
- 评估集中于基于手指的感知;未来研究应探索其他身体部位和执行器类型。
- 评估使用了顺序播放;未来研究应测试音频-触觉的同步播放。
- 参与者样本存在人口统计学不平衡;未来研究应包括更多样化的人群。
总结
Sound2Hap是一种基于CNN的生成模型,用于将多样化的环境声音转换为感知对齐的振动触觉反馈。该模型通过一个由用户评分的音频-振动对组成的大型数据集进行训练,在用户研究中显著优于传统信号处理方法,在音频-振动匹配和触觉体验评分方面表现更佳。该模型在声音数据集中的泛化能力强,且保持低延迟。开发的交互式网页工具支持数据集探索和振动生成。未来工作将研究重叠声音、多模态播放和更广泛的人口统计学代表性。Sound2Hap在虚拟现实、游戏和可访问性领域具有潜在应用价值。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
暂无符合条件(≥60% 相似度)的相关论文
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790649
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
2 位作者
sell
研究子方向
振动反馈与皮肤刺激、声学传感与音频处理、情感反馈与情绪调节界面
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文