C7.07.2Bystander speech must not be treated as the user设计研究
旁人不应被当作用户
别名: 旁人语音 · bystander · 声纹门 · 误采集
概念解释
客厅、办公室和柜台前,麦克风听得到的人不止主人。把旁人的话语当成当前用户的输入,既是功能错误,也是把未同意的人拖进识别与可能的云端处理。旁人不应被当作用户:默认不注册、不执行、不把他们的音频当成一次合法会话。这是隐私边界,不是单纯的声源分离精度竞赛。
机制
远场设备的捕获范围大于社交上的“正在对机器说话”。唤醒词被电视或客人说中、会话窗还开着时客人插话、声纹未启用时谁大声谁就是用户,都会把旁人送进 ASR。一旦解码,文本可能写入历史、用于个性化、或按命令执行(改日程、发消息)。旁人没有做进入动作,却承担了用户的数据后果。声纹、方位和“面向设备”只能降低概率,不能在法律意义上代替同意。与多人重叠时的归属相比,这里强调的是未授权主体不应进入用户身份,而不是两路语音谁该执行。
怎么研究
布置客人说话、电视人声、窗外的人的条件,测量:是否形成会话、是否产生转写、是否执行、音频是否离开设备。比较开启/关闭说话人验证。访谈旁人是否知道自己被听进去了。不要只邀请主人完成任务,那会把旁人路径测没。
边界
柜台、课堂抢答、车内所有乘客都可以下导航指令的产品,有意把多人当合法用户,必须在场景上写明,并让在场的人看得见采集。儿童的声音常常过不了为成人训练的声纹,会被系统当成旁人拒之门外,或反过来被当成可执行用户——两种失败都要单独测。公共广播里的唤醒词是内容问题,也是旁人问题。
怎么落地
- 命令默认绑定已注册说话人或刚说过唤醒词的方位;未通过的源只做本地关键词检测,不上完整识别。
- 会话历史里标出来源不确定的条目,并允许主人删除,不要把客人的话写进个性化档案。
- 验收时请未注册的人在设备旁说话,确认不产生可执行命令、不产生可同步的转写。