HapticGen:用于简化触觉设计的生成式文本到振动模型

振动反馈与皮肤刺激生成式AI(文本、图像、音乐、视频)UI/UX 设计师产品设计师

研究背景与问题

  • 问题与挑战:

    • 振动触觉反馈能够增强虚拟现实(VR)、游戏和辅助技术中的用户体验,但设计这些触觉反馈需要专业化的技能、复杂工具,而且耗时。
    • 数据集中包含的触觉信号有限,通常只有几百个示例,无法支撑机器学习的全面训练。
    • 现有的设计工具缺乏支持自然语言输入的能力,设计者在尝试将真实世界的细腻感受转化为触觉信号时面临困难。
  • 重要性:

    • 振动触觉反馈已成为增强用户体验的关键,但目前的设计复杂性和数据匮乏严重限制了其应用推广。
    • 开发自动化生成触觉设计的方案可以降低设计门槛,使非专业用户也能进行触觉设计。
  • 相关工作:

    • 图像和音频生成领域的生成式人工智能(Generative AI)取得了显著进展,例如DALL-E和AudioGen等模型。
    • 将生成式AI应用于触觉领域鲜有前例,目前缺少生成触觉信号所需的大规模数据集和标准化方法。

解决方案

  • 提出方法:

    • 提出HapticGen,这是一种生成式文本到振动模型,用于从文本输入生成触觉信号。
    • 模型基于自回归Transformer,利用一个重新训练的EnCodec编码器来优化触觉数据的表示。
    • 采用生成音频到触觉信号的自动化转换方法从现有音频数据集中生成大规模的初始触觉数据。
  • 核心创新:

    1. 从文本生成触觉信号: HapticGen是首个能够从文本描述生成振动触觉信号的生成式AI模型。
    2. 数据增强: 使用大语言模型(LLM)对初始文本描述进行增强,生成具有触觉特点的多样化文本标签。
    3. 人类偏好对齐:
      • 人工精调触觉信号并收集用户评分,构建专家标注数据集。
      • 通过Direct Preference Optimization(DPO)方法进一步调整模型,以更好地反映用户的设计需求。
  • 实施步骤:

    • 数据预处理:
      1. 剔除无法在振动反馈中表现的语音相关音频数据。
      2. 使用LLM增强文本标签,生成多个触觉描述变体。
      3. 将音频信号转换为振动信号,通过控制频率和动态设置生成适合触觉设备呈现的信号。
    • 模型架构:
      • 采用基于MusicGen的自回归Transformer模型,调整编码器和解码器以处理触觉数据。
      • 训练过程中使用过滤后的初始数据及增强内容。
    • 界面开发:
      • 提供一个图形化用户界面支持文本输入、振动信号生成和信号回放,使用户可以通过Meta Quest控制器直接验证振动信号。

研究成果

  • 具体成果:

    1. 开发了HapticGen模型,可从文本输入快速生成多样化的振动触觉信号。
    2. 建立了两个大规模触觉数据集:
      • 专家投票数据集,包含1297对[文本提示、振动信号、用户评分]。
      • 用户投票数据集,包含3229对类似记录。
    3. 与基线方法(如基于音频生成的模型)相比,HapticGen显著提高了用户体验和触觉信号质量。
  • 实验结果:

    • 在与基线模型的A/B测试中,HapticGen在触觉体验(真实性、表现力)和系统可用性(工作负载、未来使用意向)方面均表现优异。
    • 用户对HapticGen生成信号的满意度高于基线模型,部分用户认为其生成的信号更自然且符合意图。
  • 优势:

    1. 设计效率提高: 通过快速生成振动触觉信号,显著降低设计时间。
    2. 内容多样性: 生成的触觉信号具有更高的表现力,用户认为其更能捕捉情景的动态与细节。
    3. 适用性: 该工具简化了触觉设计过程,使非专业用户也能参与触觉反馈的制作。
  • 局限性与未来方向:

    • 局限性:
      1. 模型无法有效处理高度复杂或多阶段的触觉描述(如“跑步然后步行”)。
      2. 部分用户提到信号的强度在硬件上不够明显。
      3. 缺乏编辑工具限制了用户对信号进一步精细化修改的能力。
    • 未来工作:
      1. 探索新的音频到触觉映射方法,提升信号的细节表现。
      2. 研究改进的优化方法(如KTO或BCO)来提升模型训练。
      3. 开发附加功能,允许用户直接编辑生成的触觉信号(例如调整时间或频率特性)。

HapticGen的成功不仅展示了生成式AI的跨领域拓展潜力,还为触觉设计建立了新范式,通过文本生成触觉信号实现了构建更直观、可扩展的设计工作流的可能性。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/189460/2025

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3706598.3713609
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2025
emoji_events
奖项
未标记奖项
group
作者
4 位作者
sell
研究子方向
振动反馈与皮肤刺激、生成式AI(文本、图像、音乐、视频)
work
职业/产业
UI/UX 设计师、产品设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文