从智能手机的操作序列自动生成和改进语音命令界面

语音用户界面(VUI)设计大语言模型(LLM)的人机协作

文献标题

Automatically Generating and Improving Voice Command Interface from Operation Sequences on Smartphones

文献信息

  • 主题领域: 语音交互与用户界面设计
  • 关键词: 语音命令界面、用户操作序列、自然语言理解、任务自动化、对话系统、语义学习、编程演示、智能手机交互

研究背景与问题

  • 问题与挑战:

    • 使用语音命令自动化智能手机任务(如视频通话)能有效增强移动应用的互动性,但为多种应用创建任务导向的语音用户界面(VUI)非常困难。
    • 开发者需要收集大量语料库、创建手写规则或训练机器学习模型,这导致语音界面的开发工作量随任务数量增加而显著上升。
    • 当前的商用语音助手仅能支持有限的任务,而用户尤其是非程序员对能够创建自定义任务的语音界面需求强烈。
  • 重要性:

    • 任务自动化和语音交互能显著减少用户的操作负担,尤其对于年长用户而言,可以极大地提高设备的可用性和便捷性。
  • 研究动机与相关工作:

    • 当前的任务属性配置和用户命令理解方法需要大量手动标注工作,且无法适应自然语言命令的动态性。
    • 编程演示(Programming by Demonstration, PBD)系统存在较大的实现成本,且需要额外输入来提取具有参数的操作。

解决方案

  • 提出的方案:

    • 开发了一个名为 AutoVCI 的自动化系统,用于从智能手机操作序列生成语音命令界面。
    • AutoVCI 将用户的触屏操作序列转换为任务语义,并自动生成支持语音命令的界面。
    • 如果语音命令遇到歧义,AutoVCI 会通过设计问题最少的补充对话来解决。
  • 创新点:

    • 不依赖语料库、手写规则或已训练模型,仅利用操作序列和运行时 GUI 数据进行语义理解和任务映射。
    • 具有自我改进能力:通过积累历史交互数据,动态增强语义理解能力。
    • 提供了信息熵优化方法以最小化用户回答额外问答轮次的负担。
  • 实施步骤:

    1. 收集用户的操作序列并生成任务语义矢量(如词嵌入)。
    2. 通过直接语义匹配识别用户意图,从运行时 GUI 中确定任务参数。
    3. 辅助对话模块处理歧义并确认任务。
    4. 基于用户交互数据进行语义累积,优化后续命令的处理过程。

研究成果

  • 具体成果:

    • 在 Android 设备上实现了 AutoVCI,并生成支持 45 个任务、涵盖了 11 个应用程序的语音命令界面。
    • 提供了自动操作序列收集工具,显著简化了界面设计工作。
  • 与现有解决方案的比较:

    • 相较于现有的 PBD 系统,AutoVCI 不需要额外的输入,显著提升了可扩展性。
    • 在命令理解方面,避免了传统基于规则或静态 NLP 的系统中存在的语义动态适应性问题。
  • 实验与评估结果:

    • 用户测试:
      • 第一阶段用户研究(N=16)表明,用户能以 98.4% 的成功率通过 AutoVCI 自动化任务。语义累积显著减少了用户的交互负担,额外对话轮次从每次命令的平均 2.1 次降至 0.7 次。
      • 第二阶段在线用户研究(N=67)进一步验证了语义累积的有效性。最终,超过 70% 的命令可以直接触发,额外对话轮次平均仅为 0.4 次。
    • 离线评估:
      • 提示了该系统的语义理解策略(结合 NLP 算法和 GUI 编码的交互语义)的优越性。
  • 局限性与未来方向:

    • 系统在冷启动状态下的语义累积速度尚未得到充分优化。如何加速累积过程需进一步研究。
    • 额外问答可进一步减少,例如使用更先进的 NLP 技术优化确认和参数问题的设计。
    • 系统的用户体验特别是非实验室场景的测试尚有待完善,如评估用户对额外对话的容忍度。
    • 应用版本更新可能导致任务执行失败,未来可探索更好的任务维护和语义关系管理方案。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/72023/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/abs/10.1145/3491102.3517459
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
语音用户界面(VUI)设计、大语言模型(LLM)的人机协作
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
3 篇相关论文