FeelWave:通过抗噪声毫米波情绪感知实现情感感知语音交互
作者
情感化人机对话情绪识别与检测生成式AI(文本、图像、音乐、视频)大语言模型(LLM)的人机协作AI/ML 研究员与工程师UI/UX 设计师HCI 研究员
文献标题
FeelWave: Enabling Emotion-Aware Voice Interaction through Noise-Robust mmWave Emotion Sensing
出版信息
- 主题领域: 使用毫米波感知和LLMs实现情感感知语音交互。
- 关键词: 情感识别, 毫米波雷达, 语音交互, LLMs, 噪声鲁棒性, 情感化AI, 运动解调, 跨模态迁移, 用户体验, 真实场景部署。
背景与问题
- 问题/挑战: 当前的情感感知系统依赖于基于音频的感知,这种方法对噪声高度敏感,在真实场景中缺乏鲁棒性。此外,将情感状态整合到LLM推理中以生成具备同理心的响应仍然是一个未被充分探索的领域。
- 重要性: 情感感知系统能够通过在嘈杂环境或自然用户运动中实现具有同理心和情境相关的交互,从而提升用户体验。
- 动机与相关工作: 先前的研究探索了基于语音的情感感知和基于LLM的个人代理,但面临诸如噪声敏感性、情感标注数据有限以及情感推理表面化等挑战。本文通过利用毫米波雷达实现鲁棒的情感感知,并将其与LLMs整合以实现情感驱动的交互,填补了这些空白。
解决方案
- 提出的方法: FeelWave,一种结合噪声鲁棒毫米波情感感知和结构化LLM提示以生成具备同理心响应的情感感知语音交互系统。
- 创新点:
- 使用毫米波雷达的运动鲁棒语音信号提取算法,在动态条件下提取精细的语音信号。
- 用于情感识别的跨模态迁移管道,将音频知识提炼到毫米波特征中。
- 情感驱动的查询优化模块,使LLMs能够生成情境相关且具备同理心的响应。
- 在嘈杂和动态环境中对情感感知和交互效果进行真实场景验证。
- 过程与关键技术:
- 运动鲁棒语音信号提取: 动态选择语音密集的距离单元并解调运动引起的失真。
- 跨模态迁移管道: 使用混合层级损失将毫米波特征与音频表示对齐,实现轻量化且噪声鲁棒的情感推断。
- 情感驱动的LLM交互: 采用两阶段查询优化模块,将情感状态整合到LLM推理中以生成具备同理心的响应。
结果
- 具体发现:
- 实现了92.3%的情感识别准确率,在真实嘈杂环境中达到86.1%的准确率(相比音频模型的23.2%)。
- 74.3%的用户更喜欢FeelWave,相较于没有情感感知的基线系统,用户满意度更高(4.37 ± 1.23 vs. 3.22 ± 1.03)。
- 系统可用性量表(SUS)得分为88.3,表明可用性极佳。
- 相较基线的优势:
- 在嘈杂条件下,情感识别准确率比基于音频的模型高出62.9个百分点。
- 展现了对未见用户的优越泛化能力,以及对运动、距离、方向和衣物遮挡的鲁棒性。
- 实验/评估:
- 在27名参与者的六种情感数据集上进行实验,采用5折交叉验证。
- 在地铁、咖啡馆和驾驶场景中进行真实场景测试,环境具有强噪声和自然运动。
- 对比FeelWave与基线系统的用户研究,参与者数量为20人。
- 局限性与未来工作:
- 仅限于六种常见情感,尚无法区分更细粒度的状态(如“沮丧”与“愤怒”)。
- 在较远距离或显著遮挡情况下性能可能下降。
- 未来工作包括扩展情感分类体系,支持多用户场景,并在非典型语音条件下提高鲁棒性。
总结
FeelWave 引入了一种新颖的情感感知语音交互系统,通过毫米波雷达实现噪声鲁棒的情感感知,并通过LLMs生成具备同理心的响应。系统在情感识别中达到了92.3%的高准确率,并在真实嘈杂环境中表现出色。用户研究证实其能够提升交互质量,74.3%的参与者更喜欢它而非基线系统。系统展现了强大的可用性(SUS得分:88.3)以及对运动、距离和衣物遮挡的鲁棒性。尽管目前仅支持六种情感,FeelWave 为推进情感感知AI奠定了可扩展的基础,并在移动和固定设备场景中展现了广泛的应用前景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
- 71%
GANzilla:在生成对抗网络中实现用户驱动的方向发现
UIST '22· 生成式AI(文本、图像、音乐、视频) +1
- 63%
AI增强的头脑风暴:研究LLM在团队创意生成中的应用
CHI '24· 生成式AI(文本、图像、音乐、视频) +1
- 63%
生成式AI应用程序的设计原则
CHI '24· 生成式AI(文本、图像、音乐、视频) +2
- 63%
偏好引导的提示优化用于文生图生成
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
人工智能展现的人格特质可通过对话影响人类的自我概念
CHI '26· 会话代理的人格与拟人化 +2
- 63%
基于反事实回放和混合Wizard-of-Oz的多模态生成式AI实时代理原型设计
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
与生成式AI合作:模型主导和人类主导交互在人机共创中的实验评估
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
交互增强指令:建模人-GenAI协作中提示与交互的协同作用
CHI '26· 生成式AI(文本、图像、音乐、视频) +2
- 63%
量化延迟:虚拟现实中人-智能体交互的会话分析方法
CHI '26· VR 中的社交与协作 +2
- 63%
共同破解谜案:人机协作解谜对话中的角色感知
CHI '26· 大语言模型(LLM)的人机协作 +2
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3790631
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
情感化人机对话、情绪识别与检测、生成式AI(文本、图像、音乐、视频)、大语言模型(LLM)的人机协作
work
职业/产业
AI/ML 研究员与工程师、UI/UX 设计师、HCI 研究员
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文