Aware: 使用韵律进行自然语音交互的直观设备激活
语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)
文献标题
Aware: Intuitive Device Activation Using Prosody for Natural Voice Interactions
文献信息
- 主题领域: 人机交互、语音交互技术
- 关键词: Prosody, Intention, Device Activation, Keyword Spotting, Conversational Interface, Voice Interaction
研究背景与问题
- 问题描述: 当前语音交互设备通常使用关键字检测 (Keyword Spotting, KWS) 来触发设备激活,然而这种方法容易导致误激活。例如,设备可能会响应无意中提到的关键词或错误识别为相似发音的词语。
- 重要性: 误激活可能造成隐私泄露、用户体验受损,例如设备在不该响应时突然启动、记录敏感信息或错误操作(如意外购买)。语音交互设备的自然性和可靠性会因此受到影响。
- 研究动机: 作者受自然语言交流中语调(Prosody)影响意义传递的启发,提出通过分析语言的语音韵律特征来解决语音设备误激活问题,更自然直观地实现设备交互。
解决方案
- 方法与创新:
- 提出一种基于韵律特征(如语调变化、发声强度和语音持续时间)的设备激活方法,用以区分“呼叫设备”和“非呼叫设备”的语音模式。
- 开发了一个名为“Aware”的原型智能音箱,通过检测语调模式来决定是否对用户的语音请求做出响应,从而避免误激活。
- 使用机器学习模型,如卷积神经网络 (CNN),实现高准确率的语音分类。
- 实施步骤与技术:
- 数据收集: 通过多个麦克风阵列,收集呼叫设备/非呼叫设备的语音数据集,包括90,000多个样本,覆盖不同方向和距离。
- 语音特征分析: 提取韵律特征(如语调变化、持续时间、声音强度、HNR),并探讨呼叫与非呼叫语音之间的差异。
- 分类模型开发: 使用卷积神经网络对多维语音特征进行分类,验证模型的准确性与鲁棒性。
- 原型设备实现: 构建“Aware”智能音箱,集成语音识别、语音特征提取和分类模型。
- 用户体验评估: 通过用户实验,与传统关键字检测方法 (例如 Amazon Echo) 进行比较,验证其激活准确性和直观性。
研究成果
- 具体成果:
- 数据贡献: 收集并公开了包含呼叫/非呼叫设备语音样本的数据集(https://github.com/rkmtlab/Aware),以支持后续研究。
- 特征识别: 确定了韵律特征(如语调变化曲线、语音清晰度等)对用户呼叫意图的有效性。
- 分类准确性: Aware的分类模型在跨用户测试中实现了平均准确率86.9%,F1得分0.869。
- 原型验证: 用户实验表明,Aware在设备响应准确性(F1得分0.93)上明显优于Amazon Echo(F1得分0.56)。
- 优势:
- 更高的呼叫准确性,有效避免误激活。
- 不需要额外传感器,仅依赖单个麦克风即可实现,易于部署应用。
- 使用自然韵律,学习成本较低,用户更易接受。
- 实验与评估:
- 用户实验显示,Aware操作直观自然,易于学习和使用。
- 主观评价表明,参与者更倾向愿意在日常生活中应用基于韵律的设备激活方式,而非传统的关键字唤醒。
- 局限性与未来方向:
- 局限性:
- 呼叫语音可能受用户距离设备的远近和情绪影响,韵律模式存在多样性,模型对未见过的韵律模式识别能力有限。
- 目前用户实验为封闭场景模拟,未来需在更接近实际环境(如办公室或家庭)的使用场景下验证系统性能。
- 未来方向:
- 收集更多非正式语音数据(包括不同语境和情感下的呼叫语音样本)以提升模型鲁棒性。
- 探索更复杂的语言单位(如短语或句子)下韵律模式的应用,研究自由语音或基于韵律的设备激活方法。
- 开发针对个人的定制化语音分类器,进一步优化用户体验。
- 局限性:
总结
本文提出了一种基于韵律特征的设备激活方法,有效改善了当前智能音箱的误激活问题,验证了韵律模式在用户意图识别中的潜力,同时为语音交互设计领域提供了新的研究方向。未来工作需进一步拓展模型的通用性和实际场景适配性,推动研究成果在日常生活中的广泛应用。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用语音韵律特征(如音高变化、强度和语音时长)来区分“设备唤醒”语音和“非设备唤醒”语音?分类: 声学感知、活动识别与语音安全同类问题arrow_forward
- 基于韵律的设备激活方法在实际用户情境中能否显著改善语音设备的激活准确性和直观性?分类: 声学感知、活动识别与语音安全同类问题arrow_forward
- 相比传统关键词激活方法,基于韵律的智能音箱性能有哪些显著提升?分类: 声学感知、活动识别与语音安全同类问题arrow_forward
lightbulb
现实痛点
1- 语音设备常因意外触发而导致隐私泄露及用户体验下降。分类: 声学感知、活动识别与语音安全同类问题arrow_forward
- 100%
用户特征和偏好对使用不熟悉的声音用户界面性能的影响
CHI '19· 语音用户界面(VUI)设计 +1
- 100%
ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活
CHI '21· 语音用户界面(VUI)设计 +1
- 100%
Firefox Voice:一个基于网络的开放且可扩展的语音助手
CHI '21· 语音用户界面(VUI)设计 +1
- 100%
通过声音寻找灵魂伴侣:理解基于在线同步声音的移动约会应用的承诺与挑战
CHI '24· 语音用户界面(VUI)设计 +1
- 100%
重写脚本:为语音交互改编文字指令
DIS '23· 语音用户界面(VUI)设计 +1
- 100%
Radio2Text:使用毫米波射频信号的流式语音识别
UbiComp '23· 语音用户界面(VUI)设计 +1
- 100%
SilentVoice: 通过内吸语音实现不易察觉的语音输入
UIST '18· 语音用户界面(VUI)设计 +1
- 100%
仅需开口:使用智能语音助手减少文本编辑的认知负荷
UIST '21· 语音用户界面(VUI)设计 +1
- 100%
基于应用的任务快捷方式 for 虚拟助手
UIST '21· 语音用户界面(VUI)设计 +1
- 67%
比较智能手机语音识别和触摸屏输入法在创作和转录中的应用
CHI '20· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3517687
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
3 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文