Firefox Voice:一个基于网络的开放且可扩展的语音助手

语音用户界面(VUI)设计智能语音助手(Alexa、Siri 等)

文献标题

Firefox Voice: An Open and Extensible Voice Assistant Built Upon the Web

文献信息

  • 主题领域: 人机交互 (Human-Computer Interaction, HCI)
  • 关键词: 声音助手, 对话式用户界面, 浏览器扩展, 开源, 用户研究

研究背景与问题

  • 作者发现了哪些问题或挑战?

    • 现有的语音助手(例如 Alexa、Google Assistant)只能访问互联网内容的极小部分,仅限于少数几个知识库网站(例如维基百科)。
    • 扩展语音助手以支持更广泛的互联网内容需要开发者投入大量资源,并面临平台互操作性和功能发现的挑战。
    • 商业语音助手生态系统的封闭性限制了创新的可能,并对用户长期使用造成挑战,例如用户在两周后放弃使用技能的现象。
  • 为什么这个问题很重要?

    • 语音交互作为一种高效的模态,已经成为用户访问信息的重要方式,占据了美国成人的广泛使用比例。
    • 实现能够充分利用互联网规模和分散性的信息访问工具,可以突破现有语音助手的限制,充分发挥互联网的潜力。
  • 研究动机与相关工作

    • 开放生态系统的潜力:提供一个以浏览器为核心的开放平台,使用户无需额外配置即可访问互联网大部分内容。
    • 与现有研究的关系:文章综述了当前语音助手在用户体验、挑战与技术实现方面的研究,并指出了设计语音助手在桌面应用环境中的新机会。

解决方案

  • 作者提出了哪些方法或解决方案?

    • 设计并实现了 Firefox Voice,这是一款基于开放网络的开源语音助手,作为浏览器扩展运行。
    • Firefox Voice支持用户通过语音完成多种任务,例如浏览网页、控制浏览器功能和语音阅读页面内容。
    • 采取了模块化设计和开放功能扩展,允许开发者通过简单的编码轻松添加新功能。
  • 该解决方案的创新之处是什么?

    • 不依赖专门的机器学习技术,而采用规则匹配解析和简单的基于 DOM 的操作。
    • 支持语音执行浏览器专有功能(例如清理缓存、管理标签页)。
    • 提供了开源代码,使社区能够直接参与开发和扩展现有功能。
    • 推动语音助手从封闭生态系统向开放模型转变。
  • 实施步骤是什么?使用了哪些关键技术?

    • 通过浏览器扩展的开发技术(例如 JavaScript 和 React.js)实现。
    • 使用 Google 云语音识别服务进行语言识别,并通过简单的意图解析器将用户的语音指令映射到具体动作。
    • 提供 Wakeword(唤醒词)功能,以实现免触摸的操作,使用 TensorFlow.js 支持实时检测。

研究成果

  • 取得了哪些具体成果?

    • Firefox Voice在最终发布期间共有30,000次下载,收获超过12,000名活跃用户。
    • 在真实部署中收集了用户反馈和使用统计数据,并从两方面优化系统:新功能开发(例如语音输出、Wakeword)、用户场景指导和功能发现系统。
  • 与现有解决方案相比,它有哪些优势?

    • 提升了用户对开放平台的信任度,减少了对数据隐私的担忧。
    • 支持用户在浏览器中直接进行更深入的语音交互和导航,而不需要为每个任务额外安装技能。
    • 可用于实验和开发的开源平台,允许学术和开发社区进行模块化系统扩展。
  • 实验或评估结果是什么?

    • 用户认为 Firefox Voice在某些浏览任务中效率更高,例如切换标签页和导航到具体页面。
    • 识别功能发现和系统提醒方面的不足,提出了改进建议。
    • 卸载调查揭示了技术故障、功能效用不足和系统学习曲线问题是影响长期使用的主要原因。
  • 局限性与未来方向

    • 局限性:

      • 当前仅支持英文,且语音识别对非标准美式英语口音表现较差。
      • 搜索结果的卡片展示对内容结构敏感,存在潜在的脆弱性。
      • 用户研究未能深入挖掘长期使用情况,例如采用日记式研究方法。
    • 未来方向:

      • 提升语言本地化支持,以扩展用户群体的多样性。
      • 开发更直观的功能发现和用户教育接口。
      • 改进隐私保护架构,以及支持多样化语音引擎和非谷歌服务的选项。

总结

本文展示了一个基于浏览器的开放语音助手的设计、开发和部署过程,以及围绕用户需求、使用反馈和技术实现的迭代优化方法。Firefox Voice为探索现代语音助手技术提供了一个开放实验平台,并指出了未来在语言支持、用户体验优化和多模态界面开发方面的重要研究方向。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/47626/2021

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3411764.3445409
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2021
emoji_events
奖项
未标记奖项
group
作者
8 位作者
sell
研究子方向
语音用户界面(VUI)设计、智能语音助手(Alexa、Siri 等)
work
职业/产业
—
article
内容状态
已索引正文
hub
相关论文
10 篇相关论文