文献标题

From User Perceptions to Technical Improvement: Enabling People Who Stutter to Better Use Speech Recognition

文献信息

  • 主题领域: 人机交互、语音识别、辅助技术与可访问性
  • 关键词: 语音输入, 可访问性, 口吃, 语音助手, 语音转录

研究背景与问题

  • 问题与挑战: 当前的消费级语音识别系统在处理口吃者的语音输入时表现不佳,包括语音被截断、识别错误以及转录结果无法反映用户意图。
  • 重要性: 语音识别系统已广泛应用于日常生活,但其可访问性不足会使口吃者难以使用语音助手和语音转录服务,进一步阻碍这一群体参与数字社会。
  • 研究动机与相关工作: 作者发现当前语音技术对口吃者的技术改进多集中于自动语音识别(ASR)模型优化,却缺乏基于用户体验的深入研究。此前研究初步揭示了语音助手的时间限制和社会压力可能影响口吃者使用系统的意愿,但尚未量化语音技术性能的不足,或探索相关技术解决方案。

解决方案

  • 提出的方法:

    1. 端点检测模型优化: 根据口吃者的语流特点调整模型的截断阈值,以减少语音被过早截断的现象。
    2. 优化ASR解码器参数: 调整解码器设置以降低因口吃语音产生的错误识别率。
    3. 输出后处理的语流优化: 针对转录结果的口吃现象,例如重复词语或插入语,用后处理算法进行改进。
  • 创新性: 作者提出的解决方案可以轻量化地整合到现有的语音识别系统中,避免重新训练耗时且数据需求大的ASR模型。同时,这些技术改善了对口吃者语音的适配性能。此外,研究结合定量性能分析与用户主观体验调查,填补了技术改善与用户体验之间的空白。

  • 实施步骤与技术:

    1. 使用口吃者录制的大量语音命令与转录数据,调整端点检测模型的阈值以平衡截断率和系统响应延迟。
    2. 通过语音解码器调优,增加语言模型的权重、减少语音插入错误,并基于语音任务定向优化。
    3. 应用语言模型对转录输出进行后处理,对重复词语进行过滤,并删除可能的插入语。

研究成果

  • 具体成果:

    • 在端点检测方面:通过对阈值的优化,语音截断率从基线的23.8%显著降低至2.5%(适用于中度口吃者),且响应延迟控制在可接受范围(1.7秒)。
    • 在ASR性能方面:解码器调优使转录的平均词错误率(WER)从25.4%减少至12.4%;结合语流优化后进一步降低至9.9%。
    • 对于语流优化:重复词和插入语处理后转录准确性显著改善,约64.7%的重复词被成功修正且几乎无负面影响。
    • 历史趋势分析显示,过去5年中语音识别模型在口吃语音上的性能已有所提升,但仍需要专门针对口吃语音特性的优化。
  • 比较优势: 相较于现有的语音系统,本研究的优化方案显著提高了口吃者在使用语音助手与转录系统时的识别准确性(IER从10.4%降至5.4%),并且算法易于融入现有系统。

  • 实验或评估结果:

    • 实验数据显示,口吃者的不同语流特点对识别精度的影响显著。例如,词插入错误强烈相关于部分词重复。
    • 三种技术改进结合使用,性能改善最大化,特别适用于中、重度口吃者群体。
  • 局限性与未来方向:

    • 局限性: 数据采集偏于个人安静环境,未涵盖社会情境中的交互复杂性。语音优化模型的适用性可能会随语音任务而变化。此外,一些用户可能不愿主动选择语言修正功能。
    • 未来方向: 开发可以根据用户实时反馈自适应调整的ASR模型,在语音助手中验证这些技术改进以评估实际交互影响。此外,探索对其他语言障碍(如言语失序、失语症)的广泛适配性,并优化社会语境下的交互体验。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/chi/95758/2023

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3544548.3581224
一眼看懂

论文快照

fact_check
dataset
来源
CHI
calendar_month
年份
2023
emoji_events
奖项
未标记奖项
group
作者
9 位作者
sell
研究子方向
智能语音助手(Alexa、Siri 等)、语音可访问性
work
职业/产业
article
内容状态
已索引正文
hub
相关论文
5 篇相关论文