Firefox Voice:一个基于网络的开放且可扩展的语音助手
作者
语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)
文献标题
Firefox Voice: An Open and Extensible Voice Assistant Built Upon the Web
文献信息
- 主题领域: 人机交互 (Human-Computer Interaction, HCI)
- 关键词: 声音助手, 对话式用户界面, 浏览器扩展, 开源, 用户研究
研究背景与问题
-
作者发现了哪些问题或挑战?
- 现有的语音助手(例如 Alexa、Google Assistant)只能访问互联网内容的极小部分,仅限于少数几个知识库网站(例如维基百科)。
- 扩展语音助手以支持更广泛的互联网内容需要开发者投入大量资源,并面临平台互操作性和功能发现的挑战。
- 商业语音助手生态系统的封闭性限制了创新的可能,并对用户长期使用造成挑战,例如用户在两周后放弃使用技能的现象。
-
为什么这个问题很重要?
- 语音交互作为一种高效的模态,已经成为用户访问信息的重要方式,占据了美国成人的广泛使用比例。
- 实现能够充分利用互联网规模和分散性的信息访问工具,可以突破现有语音助手的限制,充分发挥互联网的潜力。
-
研究动机与相关工作
- 开放生态系统的潜力:提供一个以浏览器为核心的开放平台,使用户无需额外配置即可访问互联网大部分内容。
- 与现有研究的关系:文章综述了当前语音助手在用户体验、挑战与技术实现方面的研究,并指出了设计语音助手在桌面应用环境中的新机会。
解决方案
-
作者提出了哪些方法或解决方案?
- 设计并实现了 Firefox Voice,这是一款基于开放网络的开源语音助手,作为浏览器扩展运行。
- Firefox Voice支持用户通过语音完成多种任务,例如浏览网页、控制浏览器功能和语音阅读页面内容。
- 采取了模块化设计和开放功能扩展,允许开发者通过简单的编码轻松添加新功能。
-
该解决方案的创新之处是什么?
- 不依赖专门的机器学习技术,而采用规则匹配解析和简单的基于 DOM 的操作。
- 支持语音执行浏览器专有功能(例如清理缓存、管理标签页)。
- 提供了开源代码,使社区能够直接参与开发和扩展现有功能。
- 推动语音助手从封闭生态系统向开放模型转变。
-
实施步骤是什么?使用了哪些关键技术?
- 通过浏览器扩展的开发技术(例如 JavaScript 和 React.js)实现。
- 使用 Google 云语音识别服务进行语言识别,并通过简单的意图解析器将用户的语音指令映射到具体动作。
- 提供 Wakeword(唤醒词)功能,以实现免触摸的操作,使用 TensorFlow.js 支持实时检测。
研究成果
-
取得了哪些具体成果?
- Firefox Voice在最终发布期间共有30,000次下载,收获超过12,000名活跃用户。
- 在真实部署中收集了用户反馈和使用统计数据,并从两方面优化系统:新功能开发(例如语音输出、Wakeword)、用户场景指导和功能发现系统。
-
与现有解决方案相比,它有哪些优势?
- 提升了用户对开放平台的信任度,减少了对数据隐私的担忧。
- 支持用户在浏览器中直接进行更深入的语音交互和导航,而不需要为每个任务额外安装技能。
- 可用于实验和开发的开源平台,允许学术和开发社区进行模块化系统扩展。
-
实验或评估结果是什么?
- 用户认为 Firefox Voice在某些浏览任务中效率更高,例如切换标签页和导航到具体页面。
- 识别功能发现和系统提醒方面的不足,提出了改进建议。
- 卸载调查揭示了技术故障、功能效用不足和系统学习曲线问题是影响长期使用的主要原因。
-
局限性与未来方向
-
局限性:
- 当前仅支持英文,且语音识别对非标准美式英语口音表现较差。
- 搜索结果的卡片展示对内容结构敏感,存在潜在的脆弱性。
- 用户研究未能深入挖掘长期使用情况,例如采用日记式研究方法。
-
未来方向:
- 提升语言本地化支持,以扩展用户群体的多样性。
- 开发更直观的功能发现和用户教育接口。
- 改进隐私保护架构,以及支持多样化语音引擎和非谷歌服务的选项。
-
总结
本文展示了一个基于浏览器的开放语音助手的设计、开发和部署过程,以及围绕用户需求、使用反馈和技术实现的迭代优化方法。Firefox Voice为探索现代语音助手技术提供了一个开放实验平台,并指出了未来在语言支持、用户体验优化和多模态界面开发方面的重要研究方向。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
help
研究问题
3- 现有的语音助手如何限制用户访问互联网内容的范围?分类: 语音助手通用设计与使用体验同类问题arrow_forward
- 基于开放生态的浏览器扩展语音助手是否可以克服现有语音助手的局限?分类: 语音助手通用设计与使用体验同类问题arrow_forward
- 用户是如何看待和使用开放源码的语音助手的,有哪些长短期行为模式?分类: 语音助手通用设计与使用体验同类问题arrow_forward
lightbulb
现实痛点
1- 用户在语音交互中难以全面访问互联网内容,且现有语音助手扩展性较差。分类: 语音助手通用设计与使用体验同类问题arrow_forward
- 100%
用户特征和偏好对使用不熟悉的声音用户界面性能的影响
CHI '19· 语音用户界面(VUI)设计 +1
- 100%
ProxiMic:通过单麦克风检测靠近麦克风的语音实现方便的语音激活
CHI '21· 语音用户界面(VUI)设计 +1
- 100%
Aware: 使用韵律进行自然语音交互的直观设备激活
CHI '22· 语音用户界面(VUI)设计 +1
- 100%
通过声音寻找灵魂伴侣:理解基于在线同步声音的移动约会应用的承诺与挑战
CHI '24· 语音用户界面(VUI)设计 +1
- 100%
重写脚本:为语音交互改编文字指令
DIS '23· 语音用户界面(VUI)设计 +1
- 100%
Radio2Text:使用毫米波射频信号的流式语音识别
UbiComp '23· 语音用户界面(VUI)设计 +1
- 100%
SilentVoice: 通过内吸语音实现不易察觉的语音输入
UIST '18· 语音用户界面(VUI)设计 +1
- 100%
仅需开口:使用智能语音助手减少文本编辑的认知负荷
UIST '21· 语音用户界面(VUI)设计 +1
- 100%
基于应用的任务快捷方式 for 虚拟助手
UIST '21· 语音用户界面(VUI)设计 +1
- 67%
比较智能手机语音识别和触摸屏输入法在创作和转录中的应用
CHI '20· 语音用户界面(VUI)设计 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445409
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文