自动驾驶移动办公室中语音转文本的多模态错误纠正:远程研究结果

自动驾驶界面与接管设计语音用户界面(VUI)设计大语言模型(LLM)的人机协作自动驾驶工程师与测试员软件工程师与开发者UI/UX 设计师

文献标题

Multimodal Error Correction for Speech-to-Text in a Mobile Office Automated Vehicle: Results From a Remote Study

文献信息

  • 主题领域: 人机交互,特别是自动驾驶车辆中的多模态语音到文本错误纠正技术
  • 关键词: 语音到文本、智能文本输入、错误纠正、多模态导航、用户研究、远程研究、奥兹巫术方法、自动驾驶、移动办公

研究背景与问题

  • 问题或挑战: 本文探讨了在未来自动驾驶车辆构建“移动办公”环境中,通过语音输入开展办公任务时,语音识别错误纠正(即“修正问题”)对用户体验的影响。现有语音输入系统仍然会面临识别错误问题,导致用户在修正错误上花费大量时间。
  • 重要性: 高级自动驾驶(L3<L4<L5)车辆的普及使得“移动办公”场景成为可能,这可以提升旅途中的效率,同时满足人们在车内开展非驾驶相关任务的需求。然而,用户体验(UX)不佳可能阻碍技术接受度和推广。
  • 研究动机与相关工作:
    • 语音作为主要的输入方式降低了对驾驶的视觉干扰,与此同时,可能带来脑力负荷增加的问题。
    • 尽管已有部分研究探讨多模态交互在提高语音到文本识别准确性和速度的潜力,对用户主观感受的研究仍较少。

解决方案

  • 提出方法或解决方案: 在自动驾驶的汽车中引入多模态的方法来解决语音识别错误问题。具体比较了三种交互模式:
    1. 仅语音(Voice-only,基线条件): 使用关键词激活语音助手并通过语音完成错误选择和更正。
    2. 语音+触摸板(Voice and Touchpad,VaT): 使用触摸板导航选取错误,再通过语音规定更正内容。
    3. 语音+手势(Voice and Gestures,VaG): 使用手势(例如手掌左右挥动选择单词),夹拳确认选择,然后使用语音更正。
  • 创新之处:
    • 引入触摸板和中空手势作为多模态交互,与语音结合,更贴近车载场景现有设备布局。
    • 通过远程“奥兹巫术”方法研究真实用户体验,同时避免疫情期间的健康风险。
  • 实施步骤和关键技术:
    • 实验基于远程视频会议软件(ZOOM)和交互式点击原型进行。
    • 设计包含三个实验条件的用户研究流程,使用了用户体验短问卷(UEQ-S)、技术接受模型(TAM)和半结构化访谈进行数据采集与分析。

研究成果

  • 具体成果:
    • 手势模式(VaG)在审美与愉悦性(hedonic quality)上评分最高,但在实用性(pragmatic quality)上得分较低。
    • 用语音与触摸板的结合(VaT)被认为速度快、易用性高,也是参与者最偏好的模式。
    • 仅语音模式(Voice-only)在技术接受度和任务易用性上表现与VaT相当。
  • 优势:
    • VaT结合了语音交互和精确目标选择的优点,提升了错误纠正的任务效率。
    • VaG展示了手势交互在愉悦性上的潜力,有助于娱乐或非任务导向的场景。
  • 实验或评估结果:
    • 大多数参与者更青睐于与触摸板结合的语音模式。
    • 被采访的用户更关心生产任务中的实用性,但在娱乐环境中可能偏好手势的趣味性。
    • 研究数据有效地通过远程收集方法避免了健康风险,但需要高保真设置进一步验证。
  • 局限性与未来方向:
    • 远程研究的保真度不足,例如用户无法体验真实的触觉反馈或驾驶模拟。
    • 未能深入探讨高度自动车辆中可能的紧急接管挑战下的技术表现。
    • 后续研究需在驾驶模拟环境中验证结果,并了解复杂语音任务场景(如文本格式编辑等)的用户体验。

总结与展望

  • 该研究确认,结合触摸板和语音的多模态方法比单一模式在生产性移动办公场景中更被接受,同时也验证了手势交互的潜在娱乐应用价值。在未来,高保真的测试平台和更广泛的用户群体验证对于丰富研究结论和推动应用至关重要,此外,移动办公场景带来的社会技术影响,如隐私、噪音污染等,也需深入讨论。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/iui/79996/2022

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3490099.3511131
一眼看懂

论文快照

fact_check
dataset
来源
IUI
calendar_month
年份
2022
emoji_events
奖项
未标记奖项
group
作者
2 位作者
sell
研究子方向
自动驾驶界面与接管设计、语音用户界面(VUI)设计、大语言模型(LLM)的人机协作
work
职业/产业
自动驾驶工程师与测试员、软件工程师与开发者、UI/UX 设计师
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文