Sound2Hap:从人类评分学习音频到触觉振动生成

最佳论文
振动反馈与皮肤刺激声学传感与音频处理情感反馈与情绪调节界面UI/UX 设计师AI/ML 研究员与工程师HCI 研究员

文献标题

Sound2Hap: Learning Audio-to-Vibrotactile Haptic Generation from Human Ratings

出版信息

  • 主题领域: 使用机器学习进行音频到触觉信号生成。
  • 关键词: 音频到触觉、振动反馈、环境声音、CNN自动编码器、用户评分、触觉体验、信号处理、生成模型、可访问性、交互工具。

背景与问题

  • 问题/挑战: 现有的音频到触觉方法依赖于针对特定场景(如音乐、游戏)优化的信号处理规则,无法在多样化的环境声音中实现泛化。这些方法缺乏适应性和与人类偏好感知的对齐。
  • 重要性: 高质量的音频到触觉映射可以在虚拟现实、游戏和辅助技术等应用中增强真实感和可访问性。然而,目前的方法在处理多样化和复杂的声音场景方面存在局限性。
  • 动机与相关工作: 之前的研究集中于音频到触觉转换的信号处理技术和机器学习模型,但这些方法要么是领域特定的,要么依赖于预定义的映射,缺乏灵活性。本研究旨在通过数据驱动的方法解决这些限制。

解决方案

  • 提出的方法: Sound2Hap,一种基于CNN的自动编码器模型,通过人类评分的音频-振动对进行训练,从多样化的环境声音中生成具有感知意义的振动触觉信号。
  • 创新点:
    1. 创建了迄今为止最大的用户评分数据集,包括4,000个音频-振动对,涵盖50类环境声音。
    2. 开发了Sound2Hap生成模型,采用两种训练方案(Top-Pair和Preference-Weighted)进行音频到振动的转换。
    3. 引入了一个交互式网页工具,用于数据集可视化和振动生成。
  • 流程与关键技术:
    1. 使用四种信号处理算法从ESC-50数据集的1,000个声音片段生成振动。
    2. 收集了8,000个用户评分的音频-振动对,创建训练数据集。
    3. 训练了两种Sound2Hap变体:Top-Pair(基于每个片段评分最高的振动进行训练)和Preference-Weighted(基于所有评分振动的混合目标进行训练)。
    4. 进行了用户研究,将模型与信号处理基线进行比较。
    5. 开发了一个网页工具,用于探索数据集和生成振动。

结果

  • 具体发现:
    • Sound2Hap在音频-振动匹配评分中显著优于基线(Top-Pair为76.28,Preference-Weighted为73.27,基线为58.28)。
    • 两种变体在触觉体验指数(HXI)上均优于基线,在和谐性、不和谐性和总体评分方面均有提升。
    • 振动生成延迟低于1秒,适用于最长20秒的声音片段。
  • 相较于基线的优势:
    • Sound2Hap在多样化的环境声音中表现出更好的泛化能力,并捕捉了片段级的感知细节,优于每种声音类别的最佳信号处理算法。
    • 用户更偏好Sound2Hap生成的振动,其准确性、节奏感和强度均获得认可。
  • 实验/评估:
    • 研究1:34名参与者对由四种信号处理算法生成的4,000个音频-振动对进行评分。
    • 研究2:15名参与者使用ESC-50和BBC Sound Effects数据集中的600个新声音片段比较Sound2Hap变体与表现最佳的信号处理基线。
    • 评估指标包括用户评分(0–100分)和HXI评分(1–7分)。
  • 局限性与未来工作:
    • 数据集仅限于单一、显著的声音源;未来工作可研究重叠声音和更广泛的声音领域。
    • 评估集中于基于手指的感知;未来研究应探索其他身体部位和执行器类型。
    • 评估使用了顺序播放;未来研究应测试音频-触觉的同步播放。
    • 参与者样本存在人口统计学不平衡;未来研究应包括更多样化的人群。

总结

Sound2Hap是一种基于CNN的生成模型,用于将多样化的环境声音转换为感知对齐的振动触觉反馈。该模型通过一个由用户评分的音频-振动对组成的大型数据集进行训练,在用户研究中显著优于传统信号处理方法,在音频-振动匹配和触觉体验评分方面表现更佳。该模型在声音数据集中的泛化能力强,且保持低延迟。开发的交互式网页工具支持数据集探索和振动生成。未来工作将研究重叠声音、多模态播放和更广泛的人口统计学代表性。Sound2Hap在虚拟现实、游戏和可访问性领域具有潜在应用价值。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/222036/2026

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790649
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
最佳论文
group
作者
2 位作者
sell
研究子方向
振动反馈与皮肤刺激、声学传感与音频处理、情感反馈与情绪调节界面
work
职业/产业
UI/UX 设计师、AI/ML 研究员与工程师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
0 篇相关论文