DualVoice:一种可区分普通语音与低语输入的语音交互方法
作者
语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)软件工程师与开发者UI/UX 设计师
文献标题
DualVoice: Speech Interaction that Discriminates between Normal and Whispered Voice Input
文献信息
- 主题领域: 人机交互、语音识别
- 关键词: 语音交互, 偏声识别, 偏声分类, 神经网络, 自监督学习, 语音命令, 语音输入, 语音隐私
研究背景与问题
-
发现的问题或挑战:
- 当前的自动语音识别(ASR)系统在命令和文本识别间容易产生混淆,例如输入的特殊符号可能会被错误识别为普通文本。
- 编辑过程中识别错误需要手动校正,破坏了无手操作的便利性。
- 在文本输入中切换输入模式对用户不友好,也限制了语音交互的效率。
-
重要性:
- 自动语音识别系统广泛应用于文本输入、智能设备操作和导航系统等场景,但其误识别问题严重影响用户体验。
- 提供区分文本和命令的简单语音交互方式可以提升效率、减少用户困惑,同时还能加强隐私保护。
-
研究动机:
- 提供一种完全无手操作的语音交互解决方案,简化工作流。
- 充分利用普通麦克风即可实现无额外硬件投入的语音识别改进。
解决方案
-
方法或解决方案:
- 提出了DualVoice,一个用于语音交互的方法,采用“偏声”(whispering)输入命令,采用正常语音输入文本。
- 构建了2种神经网络:一种用于区分正常语音和偏声,另一种用于识别偏声语音。
-
创新点:
- 利用偏声语音作为命令输入手段,通过自然语音和偏声的切换实现文本与命令的区分。
- 解决公共场所中语音交互的隐私和社会适用性问题。
- 不需要额外硬件,只需标准麦克风即可实现。
-
实施步骤与关键技术:
- 通过自监督学习(如wav2vec 2.0和HuBERT神经网络)进行预训练,学习未标注语音数据的特征。
- 使用少量标注数据进行微调,以增强偏声语音识别的能力。
- 基于偏声和正常语音分类的方法,将语音流分别发送到对应的语音识别器。
- 设计用户界面示例,展示偏声和正常语音的实际交互应用场景。
研究成果
-
具体成果:
- 开发了语音界面,能够区分正常语音与偏声并执行对应操作。
- 构建了基于自监督学习的偏声识别器,并实现了高精度的偏声分类系统。
- 通过华丽直观的原型测试展示了方法的有效性。
-
优势:
- 基于偏声的命令输入不仅直观,自然且社会适应性好。
- 不需要特定硬件,成本低;全面支持无手交互。
- 在实验中实现了较高的分类与识别准确率(偏声分类达到96.7%的准确率)。
-
实验或评估结果:
- 训练的神经网络在微调后能够有效识别偏声(word error rate最低为0.38%)。
- 偏声分类模型在wTIMIT训练数据和用户自定义数据上的表现稳定,延展性强。
- 用户实验表明此系统学习成本低,用户对偏声和正常语音的切换易于接受。
-
局限性与未来方向:
- 当前的偏声识别依赖用户定制化训练,尚不能完全实现用户独立识别。
- 可探讨偏声识别的更多应用场景,如远程会议命令输入、虚拟环境中的多角色控制、与静默语音技术结合以扩展交互模式。
附加信息 (如果需要)
- 本研究是在广泛文献调研的基础上提出,与现有音频交互技术(如Google Cloud Speech-to-Text、SilentVoice等)形成了对比和补充。
- 第一作者对于未来偏声与静默语音、大众化偏声数据集等可能的探索显示了清晰的研究方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 如何利用耳语输入和正常语音输入区分命令和文本以改善语音交互效率?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 基于标准麦克风的耳语语音识别如何实现高精度分类和识别?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 耳语输入是否能够提高语音交互的隐私保护和社会接受度?分类: 无声语音、耳语与唇动交互同类问题arrow_forward
lightbulb
现实痛点
1- 语音识别系统易混淆命令和文本,手动改正繁琐且打断工作流程。分类: 无声语音、耳语与唇动交互同类问题arrow_forward
- 100%
Voicify Your UI:面向Android应用控制的语音命令研究
UbiComp '23· 语音用户界面(VUI)设计 +1
- 80%
专题讨论:语音助手,用户体验设计和研究
CHI '18· 语音用户界面(VUI)设计 +1
- 75%
简洁明了:语音助手响应行为的比较
CHI '22· 语音用户界面(VUI)设计 +1
- 75%
VOICON:语音用户界面中基于几何运动的视觉反馈
DIS '24· 语音用户界面(VUI)设计 +1
- 60%
语音和免提交互:神话、挑战与机遇
CHI '18· 语音用户界面(VUI)设计 +1
- 60%
单词、多词和句子输入对虚拟键盘解码性能的影响
CHI '18· 语音用户界面(VUI)设计 +1
- 60%
EYEditor:利用语音和手动输入实现即时抬头文本编辑
CHI '20· 抬头显示(HUD)与驾驶辅助系统(ADAS) +1
- 60%
收集和描述用于指定数据可视化的自然语言表达
CHI '21· 语音用户界面(VUI)设计 +1
- 60%
EmoWear: 探索智能手表上语音消息交互的情感提示
CHI '24· 触觉可穿戴设备 +2
- 60%
PonDeFlick:一种在智能手表上输入日文文本的方法,该方法将滑动操作与智能手机界面相结合
CHI '24· 足部与手腕交互 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3526113.3545685
一眼看懂
fact_check论文快照
dataset
来源
UIST
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
1 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文