K5.04.2far-field pickup in room noise设计
远场拾音受环境声干扰
别名: 远场拾音 · 客厅噪声 · cocktail-party TV mic · SNR
概念解释
电视麦克风离说话人通常有两三米,中间隔着正在播出的节目声、厨房、谈话、吸尘器。远场拾音受环境声干扰说的是这条物理通道:目标语音到达麦时已经被房间里的其他声源盖过,不是「识别引擎不够聪明」。客厅不是录音棚,阵列和回声消除能抬一点信噪比,不能把节目声从同一只喇叭里减成零。
机制
声强随距离下降,电视自己的扬声器却离麦克风很近。节目对白、片头曲、广告,频谱上和人声重叠,形成自声回授:麦听到的「用户」里有很大一块其实是电视刚放出去的。回声消除要估计这条通路再减掉,延迟一变、音量一跳、用户说话和台词叠在一起,估计就会残留。残留被当成查询,片名识别就漂到正在播放的那一句上。
房间里的第二说话人、儿童、宠物、开着的窗,是另一类干扰:方向上和用户接近,频谱也是人声,波束成形分不开就只能靠谁更响。遥控器上的近讲麦能缩短距离、躲开电视喇叭,但人必须把遥控举到嘴边;举不起来时,系统仍在用机身上的远场麦,干扰模型完全不同。
干扰不是均匀的噪声底板。它是突发的、和内容同步的、有时比用户还响。平均信噪比看起来能过的方案,会在高潮对白和广告时段整段失效。
边界
耳机、回音壁把节目声从电视机身挪走,机身麦的自声干扰会下降,但房间里的人声干扰还在。遥控器近讲、手机作麦,把问题从远场变成近讲,远场干扰的机制减弱。空房间、白天、把节目静音再搜索,是实验室常态,不是晚上一家人看电视的常态。唤醒词比查询短、能量更集中,能在较差信噪比下先被抓住;真正的查询句子更长,对干扰更敏感——唤醒成功不等于查询能听清。
怎么落地
- 用户一开始说话就立刻压低或暂停节目声,并给出「正在听」的明确屏幕状态,不要在全音量对白上抢识别。
- 同时支持机身远场和遥控近讲;近讲可用时优先走近讲,并在界面上让人知道现在听的是哪一只麦。
- 识别失败时区分「没听清」和「听清了但库里没有」,前者提示靠近遥控或暂时静音,后者进入修正,不要用同一句「请再说一遍」循环。
- 验证:在真实客厅音量下,用正在播放的对白片段、厨房噪声、第二说话人三个条件各录一批查询。按条件分开看成功率,不要看全天平均值——平均值会把广告时段的塌陷抹平。