相同性能真的相同吗?:理解听众如何根据说话者口音不同而对ASR结果产生差异化感知

研究表明,自动语音识别(ASR)系统能够自动将语音转换为文本,但其性能会因不同输入类别(如口音、年龄)而异,因而需要关注构建更加公平的AI系统,使其在各种输入类别下表现相似。然而,无论输入类别如何具有相同性能的AI系统是否真的会被认为是足够公平的?为此,我们研究了听众对于相同ASR结果如何根据说话者是母语者(NS)还是非母语者(NNS)而感知不同,这可能导致不公平的情况。我们开展了一项研究(n=420),向参与者提供10个不同口音的相同脚本语音录音及相同的字幕。我们发现,即使ASR输出相同,听众对ASR结果的感知也不同。他们发现非母语者语音的字幕更有用,且比母语者更多地责备非母语者造成的错误。基于这些发现,我们提出了设计启示,表明构建公平的ASR系统应该超越仅仅在不同输入类别间实现相同性能的范畴。

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/papers/cscw/178754/2024

广告推荐

学习 AI 编程到 CodeNow

open_in_new打开DOI链接
DOI: https://dl.acm.org/doi/10.1145/3641008
一眼看懂

论文快照

fact_check
dataset
来源
CSCW
calendar_month
年份
2024
emoji_events
奖项
未标记奖项
group
作者
5 位作者
sell
研究子方向
—
work
职业/产业
—
article
内容状态
仅摘要
hub
相关论文
0 篇相关论文