M3.01.3naturalness inflates competence expectations设计研究

过度自然会抬高对理解能力的预期

别名: 拟人语音的能力预期 · over-natural TTS · 听起来像人就会当人问

概念解释

合成语音太像人,听者会把理解能力也按人来预期。酒店大堂的带屏助手用高度自然的礼宾音色说「您好,我来帮您」,住客接着就问「哪间房有浴缸、还要安静、能不能提前入住」——这是在跟员工说话,不是在填三个槽。后端若只是有限意图,失败会被算成「都这么会说话了怎么还不懂」,比明显的机器音更伤信任。这里抬高的是对对话能力的预期,不是可懂度分数本身。

机制

听者拿嗓音质量当社会与认知能力的代理,这是把计算机当社会行动者的那条路。高自然度再加上「好的,我看看」这类填充,等于发了一张开放域执照:长问句、多约束、需要常识的追问都被许可。槽填充后端接不住时,错不在声学,而在预期通道——人觉得对面有一个能推理的主体。机器音色会把覆盖范围预期压低,用户更早收成短命令;过度自然把同一套后端衬得更笨。第一轮接触时这个膨胀最狠,因为还没有失败样本来校准。

怎么研究

同一套理解后端,两副嗓音:高 MOS 的神经音,对上明显合成音。自变量是自然度,不要顺手改措辞或能力说明。因变量是用户后续话轮的长度与开放度、超出覆盖的比例,以及失败后的归责(「它该听懂」对「是我会错了指令」)。听完第一句提示立刻探询「你觉得它能干什么」,看回答是目录里的技能还是前台员工的职责。

Wizard-of-Oz 也可以只换音色、不换向导能力,用来在 NLU 定稿前先看预期有没有被嗓音抬起来。实验室若先发一张「本机只会订房」的说明书,测到的就不是嗓音在抬预期。

边界

品牌指定名人音色是营销约束,要用第一句能力边界去管,而不是假装后端已经跟人一样。重复用户会自己校准,膨胀主要发生在首访。命令集本来就写在墙上、用户是来点名的,自然度不太会改预期。儿童是否用「像人」当能力线索,和成人不是同一套。把每句都收成冷冰冰的电报,会压预期,也会压人格——那是另一笔账。

怎么落地

  • 让人格温度跟真实覆盖对齐。技能只有三个意图,就不要说「有任何需要尽管开口」。
  • 高自然度嗓音的第一句提示要划域:「我可以查房型和办理入住」,不要先做全能礼宾。
  • 失败回复避免「我没听懂您的意思」这种人本口吻,改成点名还能做什么。
  • 验证:抽首访会话,数第一轮用户话里有多少需要真人礼宾才能接。这个比例高,就是嗓音在超卖。

延伸

  • 同组M3.01.1 自然度与可懂度是两个指标 · M3.01.2 噪声环境下可懂度优先 · M3.01.4 专有名词与数字串是可懂度最先失守的地方 · M3.01.5 韵律错误比音色平淡更妨碍理解 · M3.01.6 长时间收听会累积听感疲劳
  • 相邻M2.10 人格设定与一致性 · M2.06 功能可发现性与帮助 · M2.05 人格
  • 站内检索naturalness inflates competence expectations · computers as social actors · TTS persona

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/M3.01.3