C7.05.2Speaker attribution in overlapping speech设计研究

多人同时说话时的归属问题

别名: 说话人归属 · cocktail party · overlapping speech · 声源分离

概念解释

房间里不止一个人出声时,麦克风收到的是叠加波形。系统要判断哪一段是对设备说的、哪一段是旁人对话,这是归属(attribution)问题。就算信噪比数字不差,把邻居的话执行成命令也是失败。鸡尾酒会效应描述人如何在重叠语音里选一路;机器没有默认的“我在对谁说话”标签。

机制

单通道混合把两个人的音素叠在同一帧上,普通 ASR 会解成一团词,或偏向前能量更大的那一路。远场阵列可以用到达方向大致分开声源,仍无法知道哪一路是主人。唤醒词、声纹(speaker verification)和“面向设备”的视觉线索被用来做归属:只有通过这些门的流才进入命令解析。重叠发生在命令中段时,后半句可能被另一人的音节污染,看起来像识别错误,根因是源被换了。归属失败还会把旁人的隐私内容送进云端识别,不只是功能错。

怎么研究

用双人重叠语料:目标指令与旁人闲聊按不同重叠比混合,测量命令是否仍被正确归属、旁人内容是否进入转写。自变量包括方位差、音量差、是否先说了唤醒词、是否有声纹注册。因变量分开报“执行了旁人的话”和“目标指令被污染”。只用稳态噪声加单人语音的测试,会把归属问题测没。

边界

通话降噪面对的是单人加噪声,不是两个言语源。会议转录的目标是留下所有说话人并做说话人日志(diarization),与设备命令的“只听主人”相反。儿童与电视人声在声纹上都不稳定。面对面点餐的柜台麦克风有时故意收任何人,归属策略与客厅音箱相反。

怎么落地

  • 命令类产品在重叠语音里默认不执行,除非唤醒或声纹把源标成当前用户。
  • 远场设备用阵列方向加上可见的“正在听哪一侧”,避免把对面沙发上的对话收成指令。
  • 验收放入“旁人先开口”和“命令中段被插话”,统计误执行次数,而不是只看单人 WER。

延伸

  • 同组C7.05.1 信噪比直接决定识别可用性 · C7.05.3 噪声场景必须有非语音路径
  • 相邻C7.07 语音输入的隐私可见性 · C7.08 误唤醒
  • 站内检索speaker attribution · overlapping speech · cocktail party

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/C7.05.2