K6.10.3in-cabin noise and multi-passenger voice设计研究

噪声与多乘客影响语音可用性

别名: 车内噪声 · cabin babble · 多说话人 · in-car ASR

概念解释

车舱里的语音不是安静房间里对着一只近场麦克风说话。轮胎、风噪、空调、打开的车窗、音响,以及后排小孩和副驾同时开口,都会把给车说的那一句埋进别的声波里。可用性在这里先垮在「系统听不到该听的人」,然后才垮在对话策略。多人在场时还多一个问题:这句话是对人说的还是对车说的。这条谈的是行驶中的舱内声场和乘客结构,不是远场电视语音,也不是通用的多用户账号识别。

机制

舱内噪声有稳态的(胎噪、HVAC)和突发的(旁边超车、后排笑声)。稳态噪声抬高识别阈值,人会不自觉加大音量、拉长字,而这又改变声学模型习惯的说话方式。突发噪声砸在唤醒词或关键词上,整句作废。多乘客把问题从信噪比变成声源分离:能量最大的不一定是驾驶员,副驾离中控麦克风可能更近。车若把最先听清的那一路当成指令,就会执行乘客的玩笑或儿童的模仿。开窗、天窗、不同座椅位置会改麦克风阵列的指向,实验室里「主驾波束」在真实座舱里并不稳定。

怎么研究

在可复现的舱内噪声里测同一套指令:转鼓或道路胎噪、规定风量的 HVAC、音响、再加一名或两名说话的乘客。

自变量:噪声类型与声压、开窗、乘客人数与座位、是否指定「只有方向盘唤醒键才对车说话」。 因变量:唤醒精度、指令字准确率、把乘客话当成指令的次数、驾驶员因此改去用手点屏幕的比例。

用停车态安静舱的识别率验收车载语音,会把噪声与多人条件当成边角。要把「没听懂」和「听成了别人的话」分开记,后者会执行错误动作,前者只是失败。儿童声与成人声不要混成一个「多人」条件。

边界

单人、关窗、低速的通勤里,噪声和多人都不构成主约束,语音可以按短指令来做。纯电动在某些速度下胎噪仍在、电机噪声却更低,不能把燃油车的噪声曲线直接当舱内条件。乘客明确被授权操作(「你帮我设导航」)时,系统应听副驾,而不是死守主驾波束。听力辅助设备、口罩、方言会与噪声叠加,失败看起来像噪声问题,其实是说话人条件。客厅电视的远场拾音没有安全带和前向驾驶任务,不能把电视语音的抗噪指标搬进车机。

怎么落地

  • 行车语音默认从方向盘上的按键开始听,不要只靠唤醒词在嘈杂聊天里抢触发。
  • 在副驾近、主驾远的阵列布局里,行驶中优先主驾波束,并把「刚执行的是哪一句、谁说的」做成可立刻撤销的回执。
  • 音响在监听指令时自动让路,空调最大档给出「现在听不清」而不是猜一条导航。
  • 验证:在规定胎噪加一名副驾说话的道路上跑常用指令,分开统计拒识、误识、以及执行了乘客语句的次数;后一项必须接近零。

延伸

  • 同组K6.10.1 语音是行车中分心最低的输入 · K6.10.2 手势不得要求视线确认
  • 相邻K6.07 副驾与后排 · C7.05 噪声环境 · C7.12 噪声环境下的识别退化
  • 站内检索cabin noise · in-car ASR · speaker separation · barge-in

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/K6.10.3