M1.07.1ambiguous silence设计研究

沉默可能是思考也可能是离开

别名: 思考中的沉默 · 离席沉默 · thinking versus departure

概念解释

系统刚问完「盐放多少」,厨房里接下来几秒没有人声。人可能正盯着菜谱算克数,也可能已经端着盘子进了餐厅。麦克风录到的都是同一种东西:无语音。这种歧义沉默(ambiguous silence)把「还在对话里组织答案」和「已经退出对话」压成同一个观察。它不是端点检测里「一句话有没有说完」,也不是超时该设几秒;它问的是:这段空白究竟还算不算当前会话的一部分。

机制

问句把话轮交给用户之后,系统只看见能量低于阈值。生成这段空白的过程却有两条。一条是认知占用:读标签、心算、在通讯录里找名字,口还没张开,人仍面向设备、仍是受话人。另一条是离席:走向别的房间、被门口的人叫走、会话在心里已经结束。声学上两条路径不可分,因为缺的都是语音,不是两种不同的噪声。

把空白一律当成「人还在、只是慢」,设备会对着空房间继续说话;一律当成「人走了」,会切断正在组织句子的人。错的不是计时器快了慢了,是用单一标签覆盖了两个状态。能拆开这两态的,往往是语音以外的线索:房间里还有脚步、屏幕前还有脸、用户刚发出过填充音。没有这些线索时,第一次空白只能当未决,不能当判决。

怎么研究

搭一间能同步录像的房间,让一半试次在提问后继续看材料(菜谱、清单),另一半在提问后按指示离开。只把麦克风轨交给标注者,看他们把空白标成「思考」还是「离开」的正确率——这就是系统面对的信息上限。再把视频里的在场编码(是否仍在设备朝向的空间里)当作金标准,分别统计误判离席(切断还在想的人)和误判在场(对空房间说话)。

现场日志可以做弱监督:超时之后若很快出现「我在」或一句完整答案,更像思考;若直到会话被关都没有人声、且后续唤醒发生在别的房间,更像离开。不要用实验室里「请想三秒再答」来代替离席,那只复制了认知占用。

边界

手被占用、眼在读说明书时,长空白仍是在场,只是通道被主任务借走。通话中把手机扣在桌上,人可能还在,只是嘴离开了麦——在场不等于对着麦克风。多人房间里,被问的人没出声是因为旁边的人抢了话轮,不是走了。对运动障碍或构音慢的用户,用「几秒无声」推断离席会系统性误伤。能看见人脸的设备拥有声学没有的证据;把那套结论搬到纯扬声器上会高估可分性。

怎么落地

  • 第一次无语音不要写成「用户已离开」。先当未决:一句很短的探问(「还在吗」)或只点亮聆听态,而不是直接关会话或执行动作。
  • 有在场传感器就用:持续噪声、人体存在、屏幕前的脸,都可以把「离开」的置信度单独抬升;没有这些通道,就不要装成能判断。
  • 把「问句之后的无声」和「系统自己说完陈述句之后的无声」分开记。前者更像等人答,后者更像会话已经松弛。
  • 走查时并排看第一人称画面和麦克风:画面里人还在翻抽屉,系统却已经说「那我先不问了」,就是把思考标成了离开。

延伸

  • 同组M1.07.2 重提示需变换措辞 · M1.07.3 多次无响应后应结束而非持续等待
  • 相邻M1.11 沉默、超时与重提示 · M1.08 对话轮次与轮流机制 · C7.02 端点检测
  • 站内检索ambiguous silence · thinking versus departure · presence after a prompt

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M1.07.1