M4.01.1overheard dialogue content设计研究

说话会暴露内容给周围人

别名: 口说暴露 · 对话被旁听 · spoken disclosure · overhearing

概念解释

对对话系统开口,内容同时进入房间里每个人的耳朵。网约车后座说「导航到枫叶路 14 号 3B,到了给陈医生发消息」,司机和下一位拼车的人拿到的不只是「有人在用语音」,而是地址、门牌和社交关系。这叫对话内容被旁听(overheard dialogue content)。服务器加密、本地识别都挡不住空气里的那一句。它谈的是对话作为一次公开表演,不是麦克风指示亮没亮,也不是密码该不该设计成口述。

机制

口语没有视角锥:声波按距离和房间混响衰减,不按「只说给设备听」。对话系统还逼人把指代说全——对人可以点头、说「就那儿」,对机器必须把槽位念成可识别的名词短语。于是公共场合里最不该广播的那几项(地点、人名、时间、身体状况)恰恰是命令里最稳定的词。内容类别决定伤害:报一个路口转向几乎无代价;报家庭地址和收件人是把生活结构交给车厢。用户自己的音量可以压低,但任务成功仍要求可懂度超过识别门限,门限以上的音量对邻座通常也够。

怎么研究

公共场合语音使用的情境日记:每次打算开口时记下场所、一臂之内有谁、准备说的内容类别(地点 / 人名 / 日程 / 无敏感),以及最后有没有改口、改成指代还是改用打字。因变量是「说出的可识别槽位数」和「事后认为被谁听见」,不是实验室词错误率。

也可以在停稳的车厢或等效声景里做隐蔽可懂度:事先写好含槽位的命令,让不同距离的听写员复述,按内容类别计分。消声室里的识别率测不到这条。

边界

关着窗的单人驾驶、空电梯、已经把同一地址说给司机的行程,口说暴露接近于零或已经发生过。柜台点餐、课堂抢答本来就是说给在场的人听。耳语能降低可懂度,不能取消它,尤其对数字和专名。把所有语音都标成不适合公共场合,会否定「下一路口右转」这类本就公开的短指令。伤害跟的是内容类别和在场关系,不是「用了语音」这件事本身。

怎么落地

  • 按技能标内容类别:含家庭地址、联系人、日程细节、健康相关槽的,默认不要做成公共场所可唤醒的技能,或强制改走屏幕/耳机确认后再执行。
  • 允许含糊指代绑定到屏幕焦点或上一轮已确认对象,避免用户为了被听懂而把全称再广播一次。
  • 不要在提示语里示范「请说出完整家庭地址」这种例句;公共场景的例句用非识别性内容。
  • 验证:在真实网约车或等效拥挤座舱走查目标技能。若完成任务必须把门牌、人名或病况说清楚,这条技能就还不是可在公共场合用的对话。

延伸

  • 同组M4.01.2 对设备说话仍带有社交不适 · M4.01.3 社交成本使语音在公共场合被弃用 · M4.01.4 旁观者也承担被迫旁听的成本 · M4.01.5 语音输出比语音输入更容易暴露内容 · M4.01.6 耳机改变输出侧但不改变输入侧
  • 相邻C7.07 语音输入的隐私可见性 · M1.01 语音优先的适用场景 · M4.07 常开麦克风的隐私感受
  • 站内检索overheard dialogue content · spoken disclosure · bystander

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M4.01.1