认知障碍成年人自动语音识别的挑战
作者
语音可访问性老年人友好技术设计老年居家辅助系统医生、护士、临床医生老年护理人员家庭照顾者(Caregiver)
文献标题
Challenges in Automatic Speech Recognition for Adults with Cognitive Impairment
出版信息
- 主题领域: 针对认知障碍老年人自动语音识别(ASR)性能的研究。
- 关键词: ASR, 认知障碍, 痴呆, 轻度认知障碍(MCI), 语音助手, 声学分析, 人机交互(HCI), 居家养老, 基于能力的设计, Whisper。
背景与问题
- 问题/挑战: 自动语音识别系统在认知障碍老年人(尤其是痴呆患者)中的准确率较低,但导致这些差异的声学因素尚未被充分理解。
- 重要性: ASR错误会影响语音驱动的老龄技术(AgeTech)系统的可用性,从而影响用户的信任、满意度和采用率,尤其是对于依赖这些技术进行日常生活支持的认知障碍老年人。
- 动机与相关研究: 先前研究发现,老年人及患有神经系统疾病的个体的ASR准确率较低,但这些研究主要集中于描述性统计或将ASR错误作为认知障碍检测的输入。本研究旨在量化ASR差异并分析声学特征,以为包容性设计提供信息。
解决方案
- 提出的方法: 使用Whisper模型评估不同认知群体老年人的ASR性能,并结合语音特征的声学分析以识别转录准确率的预测因素。
- 创新点:
- 提供实证证据表明痴呆患者的ASR准确率显著低于认知正常的对照组。
- 通过声学分析将语音特征(如强度、闪变、停顿比率)与ASR错误率联系起来。
- 为个性化ASR模型、人机协作校正系统以及语音驱动的老龄技术系统的交互级适配提供设计启示。
- 研究程序与关键技术:
- 分析83位老年人向Amazon Echo设备朗读预设语音命令的语音数据。
- 比较Whisper“小型”和“中型”模型的ASR性能。
- 使用Praat提取语音特征(如语速、发音速率、闪变、强度)。
- 使用混合效应逻辑回归模型分析词错误率(WER),并识别ASR准确率的预测因素。
结果
- 具体发现:
- 痴呆患者的WER显著较高(约0.21),而认知正常老年人的WER较低(约0.08);认知正常组与MCI组之间无显著差异。
- 声学特征如较低的强度、较高的闪变以及较低的停顿比率与较高的WER相关。
- Whisper“中型”模型整体降低了WER,尤其是在痴呆患者中表现出更大的改进。
- 相较基线的优势:
- Whisper“中型”模型的WER显著低于“小型”模型,尤其是在痴呆患者和物联网(IoT)命令场景中。
- 实验/评估:
- 数据集: 语音助手系统(VAS)语料库,包含83位参与者,分为认知正常、MCI和痴呆组。
- 评估指标: ASR准确率的词错误率(WER);声学特征分析。
- 控制任务: 朗读预设语音命令,命令类别包括物联网(IoT)、提醒和问题。
- 局限性与未来工作:
- 研究集中于预设语音,限制了对自发语音交互的泛化能力。
- 数据集中缺乏MCI和痴呆病因的临床诊断信息。
- 研究仅限于美国的英语使用者,结果可能无法推广到其他语言或文化背景。
- 未来研究需关注自发语音、跨语言比较以及低资源语言的适配,以进一步解决认知障碍人群的ASR差异问题。
总结
本研究表明,与认知正常老年人相比,痴呆患者的ASR准确率显著较低,这种差异与语音特征(如强度、闪变和停顿比率)相关。Whisper“中型”模型在转录准确率方面表现出改进,尤其是在痴呆患者中。这些发现强调了开发个性化ASR模型、人机协作校正系统以及交互级适配的重要性,以支持认知障碍人群公平访问语音驱动的老龄技术系统。未来工作应进一步研究自发语音、临床诊断以及跨语言应用,以解决认知障碍人群的ASR差异问题。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
当前问题库还没有收录这篇论文的问题与痛点。
快捷操作
广告推荐
学习 AI 编程到 CodeNow
open_in_new打开DOI链接
DOI: https://doi.org/10.1145/3772318.3791581
一眼看懂
fact_check论文快照
dataset
来源
CHI
calendar_month
年份
2026
emoji_events
奖项
未标记奖项
group
作者
6 位作者
sell
研究子方向
语音可访问性、老年人友好技术设计、老年居家辅助系统
work
职业/产业
医生、护士、临床医生、老年护理人员、家庭照顾者(Caregiver)
article
内容状态
已索引正文
hub
相关论文
4 篇相关论文