语音交互设计规范
面向设计师与工程师:让系统听得准、让用户随时打断得了、让话说得短到能记住、让忘了的能再问一遍、让声音的身份不含糊、让在场的人知道麦克风在做什么,并且始终留着一条不说话也能办成事的路。
7 条原则 · 47 条规则 · 必须 41 · 应当 6
目录
面向设计师与工程师:让系统听得准、让用户随时打断得了、让话说得短到能记住、让忘了的能再问一遍、让声音的身份不含糊、让在场的人知道麦克风在做什么,并且始终留着一条不说话也能办成事的路。
语音把交互压进了一条线性的、不可扫视、不可回看的通道。屏幕上用户可以先扫一眼再决定要不要读,语音里用户必须听完才知道该不该听;屏幕上信息留在那里等人回来看,语音里说过就没了。同时,麦克风前面往往不止一个人,喇叭外面也往往不止一个人。
因此语音交互的设计对象不是"话术"。设计对象是:系统对用户话语的接收与理解结果、话轮控制权的持有与让出、系统语音输出本身、听者的短时记忆、合成声音所承载的身份、麦克风所处的物理空间,以及语音这条通道的进入与退出。
本规范由七条原则和47 条规则组成:原则说明设计方向,规则规定适用情境、行为要求与验证方式。每条规则归属且仅归属一条原则,规则编号即原则编号(V3-2 就是第三条原则下的第二条规则)。
本规范约束的是产品在语音场景下对用户作出的体验承诺及其兑现机制的性质,不预设唯一的技术架构,不绑定任何一家的识别、合成或实时通话方案,也不区分级联管线与端到端语音模型——两种架构下的体验承诺相同,兑现方式不同。它不是话术手册,不是对话流程图模板,也不是语音引擎的调参指南。
采用本规范不能替代无障碍、隐私、安全与领域合规的专项评估。语音场景显著放大三类风险,这些专项评估比图形界面产品更必要而不是更次要:听觉是唯一通道时,认知与感知差异直接决定任务能否成立;麦克风采集的是物理空间,第三方从未同意;合成语音的身份披露在多个法域已是法定义务而非设计选择。
全文四章:第 1 章原则,第 2 章规则的读法与速查,第 3 章规则详解,第 4 章术语;验证清单、论据说明与完整任务示例见附录 A、B、C,完整来源见 reference.md。
1. 七条原则
七条原则按规范对象切分设计责任:每条原则管辖一类对象上的义务,每条规则按其义务的直接规范对象归属唯一原则。对象不同,原则就不会互相替代——这是切分的依据,也是检验切分的方式。
| 原则 | 规范对象 | 设计方向 | 管辖规则 |
|---|---|---|---|
| V1 听得准 | 系统对用户话语的接收与理解结果 | 不要把转写当事实。识别结果是带置信度的假设,误识的代价由后果大小决定;听见的不一定是用户说的,用户说的不一定是用户的说话方式有问题 | V1-1 ~ V1-7 |
| V2 轮次有主 | 话轮控制权的持有、让出与抢占 | 不要让系统霸着话头。用户随时打断得了,系统知道什么时候该闭嘴、什么时候算听完、等到什么时候为止,双方都知道现在轮到谁说 | V2-1 ~ V2-7 |
| V3 说得短 | 系统的语音输出本身 | 不要把屏幕上的文案念出来。听觉是线性的、不可回看的,信息密度受工作记忆约束;先给结论,关键值要能核对 | V3-1 ~ V3-7 |
| V4 记不住有救 | 听者的短时记忆与信息可及性 | 不要指望用户记住刚才那一串。重复要随时能要、退一步不必从头、时间不够要能延长——而且沉默从来不是同意 | V4-1 ~ V4-6 |
| V5 声音有主 | 合成声音所承载的身份与情感 | 不要让声音替产品撒谎。是不是 AI、是不是某个真人的声音、情感表达对不对得上事实、什么时候换成了真人,都要明确 | V5-1 ~ V5-6 |
| V6 在场可知 | 麦克风所处的物理空间与在场第三方 | 不要只对着用户设计。谁在听、听了多久、留了什么、旁边的人从没同意过、喇叭外面还站着别人 | V6-1 ~ V6-7 |
| V7 有退路 | 语音这条通道本身的进入与退出 | 不要把语音做成唯一的门。识别不了、说不出口、环境不允许、任务不适合的时候,用户去哪;停止说话之后,系统就该停 | V7-1 ~ V7-7 |
同一个场景可以触及多条原则——用户在客厅打断了正在播报余额的音箱,同时涉及打断的即刻生效与后果(V2-1、V2-2)、外放输出的呈现级别(V6-4)和被打断内容的补达(V4-1)——这不是分类错误:三条规则约束的是三个不同规范对象上的义务,一个是话轮控制权,一个是物理空间,一个是听者的信息可及性。互斥与穷尽是这套切分接受检验的主张,不是宣布即成立的事实:规则增删或归属存疑时,按附录 A 的分类检验验证。检验不过,修改的是原则的切分。
本切分中最需要持续检验的三处边界,在此明示:
- V1 与 V6——旁人的话该不该被当成指令是指令来源的问题(V1-6),旁人的声音能不能被留存和使用是隐私与同意的问题(V6-3)。同一段音频,两条规则约束的是两件事。
- V3 与 V4——说得短管的是输出本身(长度、结构、密度),记不住有救管的是听者事后的补救能力(重复、回退、延时)。前者做到位可以减少后者的使用频率,但不能替代它。
- V2 与 V7——打断是在语音通道内收回话轮,退路是离开语音通道。用户喊"停"和用户改用打字,是两件事。
这三处若在实践中反复出现归属争议,应当调整原则的切分而不是增设中间层。
原则用于理解规则与裁决归属,本身不作为单独的判定条目。当原则与具体条款的解读出现冲突时,以适用条款为准,并记录需要澄清的歧义。
规则归属唯一,不等于机制不能复用。同一计时设施可支撑端点判定(V2-3)与应答等待(V4-3),但两者的起算事件、重置与到期动作必须分开;一次"可见级别解析"既服务于外放输出(V6-4)也服务于转屏内容的裁决(V7-1)。同一机制一物多用是常态,写在哪条取决于义务的直接规范对象。
2. 规则的读法
2.1 每条规则的结构
| 部分 | 作用 |
|---|---|
| 一句话 | 规则的记忆版,不替代正文 |
| 适用 | 这条规则在什么情境下生效。不落在适用范围内的产品记录"不适用"即可,不必勉强套用 |
| 规则 | 规范正文,规定这条规则的要求 |
| 边界条件 | 与适用共同限定要求的适用范围:说明这条规则不要求什么、例外在什么条件下成立(仅部分规则有) |
| 设计应用 / 验证示例 / 反例 | 帮助落地的说明,不另行增加义务,也不指定唯一实现 |
| 依据与参考 | 失败记录与实现参考(仅部分规则有;论据类型与出处见附录 B 与 reference.md) |
一句话概括各部分的效力:规则正文规定要求;适用与边界条件共同限定要求的适用范围;设计应用、验证示例、反例与依据参考不另行增加义务。
规则写行为性质、不写实现方式:用户开口后系统在可感知的时间内停声是产品行为,用 VAD 加能量阈值还是端到端模型判定是工程方案——两者必须对得上,但不是同一份交付物。
本规范不规定跨产品通用的性能阈值。首音时延、静音阈值、单话轮长度、并列项上限这类参数,规则只要求"有明确定义、有依据、可验证"。这不是回避:这些数值随语言、任务类型、用户群体与部署环境差异极大,引用资料不足以支持跨场景的统一性能阈值。工程参数记录在 reference.md 第四节,作为实现映射参照而非合规依据。
2.2 约束词
规则正文使用三级约束词:
- 必须:不满足即不符合本规范。缺了它,某条对用户的承诺会在可预见的情境下失效——这是标「必须」的唯一依据。
- 禁止:与「必须」同等强度的反向表述,指明不得出现的行为;正文中的「不得」与「禁止」等价。
- 应当:默认遵循;确有理由偏离时,记录理由与替代做法,并接受同样的验证。偏离不需要审批,但需要留痕。「不应当」是「应当」的反向表述。
合规判定以正文中的独立义务子句为单位:无约束词的陈述句承接所在规则标题的强度;显式标注约束词的子句按其自身强度判定——【应当】规则内的「禁止/不得」子句仍是硬约束(V2-4、V3-2、V4-4、V5-5、V7-4 含此类子句),规则标题与速查表的强度标注不替代子句约束力。正文中的「不能」仅用于能力或事实陈述,不表达义务。
强度表示约束力,不表示重要性。
2.3 反例的两侧
反例分两侧:"做不到"是漏掉这条要求,"做过头"是为了满足它而堆确认、复述、提示音和兜底话术。两侧都算没做对——语音产品被做坏的方式高度集中在后者:每句话都复述一遍让用户确认、每个回答前先念一段能力声明与免责、为了不误打断把响应等到用户以为断线、为了"自然"往每句话里塞"嗯""好的呢""我明白您的心情"。语音里的冗余比屏幕上的冗余贵得多,因为它占用的是时间而不是空间。
2.4 规则速查:47 条
下表是全部规则的一句话记忆版,点击规则名可跳到第 3 章的完整正文。速查不替代各条的适用条件与完整要求;个别【应当】规则内含禁止级子句(V2-4、V3-2、V4-4、V5-5、V7-4),判定以正文为准(见 2.2)。
V1 听得准
| 规则 | 强度 | 一句话 |
|---|---|---|
| V1-1 识别结果是假设不是事实 | 必须 | 识别可能出错;没有可靠置信,也不能靠猜测执行不可逆动作。 |
| V1-2 确认强度与后果相称 | 必须 | 按后果可不可逆决定确认到什么程度,不是每句都复述一遍。 |
| V1-3 听不懂要换策略不是重复问 | 必须 | 连着听不懂就换问法、换模态、转人工,不把同一句提示念第三遍。 |
| V1-4 非典型语音不被排除 | 必须 | 口音、构音障碍、儿童与老年语音听不出来,是系统的问题不是用户的。 |
| V1-5 关键内容逐字保真 | 必须 | 人名、编号、金额不得被顺滑成更常见的文字。 |
| V1-6 听见的不等于用户说的 | 必须 | 电视声、旁人对话和系统自己的回声,都不是指令来源。 |
| V1-7 语言切换不改写用户的意思 | 必须 | 语言切换不改写用户的意思。 |
V2 轮次有主
| 规则 | 强度 | 一句话 |
|---|---|---|
| V2-1 打断随时可用且即刻生效 | 必须 | 用户发起打断时及时停声,不强迫用户等这句话说完。 |
| V2-2 打断的后果明确 | 必须 | 没播出去的不算已告知,已经做了的不因为闭嘴而消失。 |
| V2-3 说完的判定有依据有上限 | 必须 | 声明凭什么判定用户说完了,并且等待有尽头。 |
| V2-4 抢话与冷场都算失败 | 应当 | 换个气就被打断,和说完了等五秒没反应,是同一个问题的两侧。 |
| V2-5 现在轮到谁说是可知的 | 必须 | 让用户随时知道系统在听、在想、还是在说。 |
| V2-6 长时处理不静默 | 必须 | 实质回答预计不能及时开始时,在首反馈预算内说明真实等待,并允许取消。 |
| V2-7 多人在场时的话轮归属 | 应当 | 说清正在跟谁对话,别把旁人的半句话接进任务。 |
V3 说得短
| 规则 | 强度 | 一句话 |
|---|---|---|
| V3-1 单话轮有长度上限 | 必须 | 定义一次最多说多久,超了要分段,段间能打断。 |
| V3-2 结论先行 | 应当 | 先回答,再解释;免责声明不放在用户想听的东西前面。 |
| V3-3 并列项有上限且可导航 | 必须 | 一次别念八个选项,给"下一批""再说一遍""第几个"。 |
| V3-4 不朗读屏幕文案 | 必须 | 语音输出是为听重写的,不是把界面文字念出来。 |
| V3-5 关键值播报可核对 | 必须 | 金额、编号、时间要分组念,用户能要求逐字重复。 |
| V3-6 不确定与来源在语音里同样表达 | 必须 | 屏幕上会标的"依据/推断/未知",语音里不许吞掉。 |
| V3-7 听得清的参数由用户可控 | 必须 | 听得清的参数由用户可控。 |
V4 记不住有救
| 规则 | 强度 | 一句话 |
|---|---|---|
| V4-1 重复始终可用 | 必须 | "再说一遍"任何时候都有效,而且重复的是刚才那段。 |
| V4-2 回退一步不必从头 | 必须 | 说错一个字不该让用户从第一个问题重来。 |
| V4-3 时限可延长,超时不等于同意 | 必须 | 不催用户;催了也要能延,而且没回答绝不按同意处理。 |
| V4-4 一次只问一件事 | 应当 | 复合问题拆开问,别指望一句话回答三个问题。 |
| V4-5 已说过的不再问一遍 | 必须 | 用户交代过的信息,换个环节不必重说。 |
| V4-6 帮助与"我能说什么"随时可得 | 必须 | 用户不知道能说什么的时候,有地方问。 |
V5 声音有主
| 规则 | 强度 | 一句话 |
|---|---|---|
| V5-1 AI 身份首次交互即披露 | 必须 | AI 在回应时就说清这是 AI,用用户在用的那条通道说;用了合成音不等于对方是 AI。 |
| V5-2 合成语音可被机器识别 | 必须 | 合成音频带机器可读标识,不只靠人耳分辨。 |
| V5-3 用真人的声音要有本人授权 | 必须 | 谁的嗓子,谁说了算,范围和期限写清楚。 |
| V5-4 情感表达不制造虚假状态 | 必须 | 不用语气伪造共情、紧迫和确定性去促成决定。 |
| V5-5 人格不越过能力边界 | 应当 | 人设可以有,但不能声称产品做不到的事。 |
| V5-6 人机交接明示 | 必须 | 从 AI 转到真人、从真人转回 AI,都要说一声。 |
V6 在场可知
| 规则 | 强度 | 一句话 |
|---|---|---|
| V6-1 何时在听是可感知的 | 必须 | 采集状态让在场者随时可核对,包括中途进来的人。 |
| V6-2 常听范围显式且可退出 | 必须 | 说清什么在本地、什么上了云、留多久、怎么关。 |
| V6-3 旁人从未同意 | 必须 | 第三方的声音不默认用于个性化与训练。 |
| V6-4 外放输出按空间降级 | 必须 | 客厅音箱念的是"有一条新消息",不该念的连"有"都不念。 |
| V6-5 误唤醒可查可删 | 必须 | 被误触发录下的片段,用户看得到也删得掉。 |
| V6-6 声纹是便利不是凭据 | 必须 | 声音像不像本人,不能作为高后果操作的唯一认证。 |
| V6-7 声音推断用途单独说明 | 必须 | 完成语音指令的许可不自动覆盖个人属性推断。 |
V7 有退路
| 规则 | 强度 | 一句话 |
|---|---|---|
| V7-1 随时可切换输入方式 | 必须 | 对话进行到一半也能改用打字、按键或触屏。 |
| V7-2 转人工通道存在且可达 | 必须 | 代表机构办事的语音产品,必须留一条通向人的路。 |
| V7-3 对话中断不吞任务 | 必须 | 掉线、超时、说不下去了,进度还在,别处接得上。 |
| V7-4 无屏场景的必要告知有补达 | 应当 | 费用、法律和错误告知不能只靠念一遍就算送到;补不了就别在这条路上提交。 |
| V7-5 语音不是唯一路径 | 必须 | 能用语音办成的事,存在不用语音也能办成的路。 |
| V7-6 退出即停止 | 必须 | 用户结束对话之后,不再采集,也不再执行没确认的动作。 |
| V7-7 输入输出可以分别选择 | 必须 | 输入输出可以分别选择。 |
2.5 设计交付与运行事实
评审每条适用规则时都回答三问:产品选择什么行为,工程用什么事实证明它发生,用户怎样知道并纠正它。下面的表是设计与验证方法,不新增规则或要求独立交付物。
| 设计对象 | 实现需要提供的事实 | 用户需要知道的事 | 主要规则 |
|---|---|---|---|
| 采集入口 | 权限、设备就绪、采集实际起止、本地处理及上传范围 | 是否已开麦,何时可说,拒绝权限后如何继续 | V2-5、V6-1、V6-2 |
| 当前输入 | 话轮归属、临时/最终理解、关键值及修正 | 系统听成什么,哪里仍需核对,如何改一个值 | V1-1、V1-2、V1-5 |
| 系统输出 | 生成内容、待播队列、已播放范围及输出路由 | 正在说什么,停在哪,能否重听或继续 | V2-1、V2-2、V4-1 |
| 行动 | 确认绑定内容、提交时间、成功/失败/未知结果 | 停声是否也停了任务,哪些后果已发生 | V1-2、V2-2、V7-3 |
| 接续与退出 | 最小任务状态、到期事件、后台授权、补达回执 | 去哪里接着办,哪里可查,退出后什么仍继续 | V7-3、V7-4、V7-6 |
这些维度可以并行:系统播放时仍可接收打断,任务处理时麦克风也可能关闭。不能用一个互斥的“听/想/说”动画代替所有状态;用波形表达正在收音时,波形必须来自实际输入,不能用循环动画伪造采集。音频能量只证明输入活动,不证明来源、意思或授权。
控制与数据事件需关联同一任务、会话、话轮或输出片段,并记录发生时间与事实来源。迟到事件不能把新状态覆盖回旧状态:退出后的识别结果不得启动动作,停止后的旧音频不得重新入队,过期确认不得匹配到新问题。是否使用事件序号、取消标记或其他机制由工程决定,验证的是这些行为结果。
2.6 从任务到方案
先选择两三项真实任务,写清完成条件、关键值与不可逆后果,再比较按住说话、点击提交和自动端点的收益。用目标用户的实际停顿、环境噪声与可访问控制成本选择方案;不因“更像人”默认开启连续采集。
为每项任务画出开始、纠正、确认、执行、恢复与退出路径。对每个关键节点记录默认行为、用户控制、失败出口和需要的事实;有参数取舍时再使用 Design Token。正常路径与异常路径共用同一任务状态。附录 C 给出一条完整示例。
3. 规则详解
本章按七条原则展开全部 47 条规则。每条的结构与各部分的约束力见 2.1;其中的设计应用、验证示例与反例只是帮助落地的说明,不指定唯一组件,也不要求新增独立交付文档。
3.1 V1 听得准
语音产品最常见的第一层错误,是把语音识别的输出当成用户说的话。它不是——它是一个可能出错的假设,其质量需按口音、噪声、专有名词和非典型语音分别验证。本原则管辖这个假设如何成立、如何被核对、误了怎么办,以及"听到的声音"与"用户的指令"之间的分界。
V1-1识别结果是假设不是事实必须
一句话:识别可能出错;没有可靠置信,也不能靠猜测执行不可逆动作。
适用任何以语音作为输入的产品。
规则产品必须把语音识别结果作为带不确定性的假设处理,而不是确定的用户输入。系统必须能够区分"高置信理解"与"低置信理解",并以该区分作为后续处理的输入。低置信理解禁止直接触发不可逆动作(对外发送、支付、删除、公开发布、权限变更等,按产品实际后果界定,不能以识别准确率替代后果判断);此类情况下必须转为确认、澄清或改由其他模态完成。识别置信不可得时,按低置信处理。
用于区分置信档位的信号必须经过目标语言、用户群体与环境下的实测校准;禁止把模型自述“我听清了”、语句流畅度或总体成功率当作单次输入已正确理解的证据。流式转写的中间结果必须作为可修订内容处理,修订影响关键对象或后果时,先前基于旧内容的确认必须失效并重新核对。
边界条件本条不要求向用户展示置信度数值,也不要求每一次低置信都打断用户——V1-2 规定确认强度如何随后果变化,V1-3 规定连续失败时如何换策略。本条要求内部明确记录不确定性依据;无可靠依据时保留“未知”,不能伪造一个置信分数。
设计应用把"置信度"设计成一条贯穿链路的输入,而不是识别模块内部的调试信息。端到端语音模型不单独输出转写置信时,保留“置信未知”并按后果进入核对。重述率、澄清率和打断率用于评估系统质量,不能直接当作当前话语识别正确的概率。
验证示例
- 用户侧:在有背景噪声的环境中说一句会触发不可逆动作的指令,观察系统是直接执行还是转为确认。
- 实现侧:验证低置信路径确实存在且被触发,而不是阈值形同虚设;验证置信不可得时走的是保守分支。
反例做不到——嘈杂环境里听成"转给张伟"就直接转账;做过头——每一句都要求用户复述确认,包括"把灯关了"这种一秒可撤销的操作。
V1-2确认强度与后果相称必须
一句话:按后果可不可逆决定确认到什么程度,不是每句都复述一遍。
适用语音输入会触发状态改变或外部动作的产品。
规则产品必须为语音输入定义确认策略,且确认强度由后果的可逆性与影响范围决定,而不是由识别置信单独决定。策略至少区分三档:不确认(后果可立即撤销且影响仅限本次会话)、隐式确认(在下一句回应中带出已理解的关键要素,并在既有授权范围内继续)、显式确认(停下来等待用户明确应答)。不可逆动作必须至少采用显式确认,且确认的对象是行动与后果本身,不是"你刚才说的是不是这句话"。确认所依据的内容必须与实际将要执行的内容一致。
隐式确认不是授权方式,沉默不产生新的许可。显式应答必须关联本次已告知的具体行动与内容快照;播报尚未覆盖必要对象及后果时的一声“嗯”,不得直接作为该行动的同意。用户在同一句话中自我修正(“不是周四,是周五”)时,必须处理完整修正再核对,不得抓到前半句就提交。确认必须绑定具体对象、关键值、后果与有效条件;其中任一项改变后旧确认失效。含糊应答、背景声或已过期确认不得授权新的动作。
边界条件本条不要求为每一档确认设计独立话术模板;也不禁止在用户明确表达偏好后在低后果动作上关闭隐式确认。
设计应用隐式确认是语音里最省时间的一档,应当优先用它承担中间环节——"好,寄到公司地址,周三送到"既是确认也是进度。显式确认留给钱、对外、删除和权限。
验证示例
- 用户侧:让用户在显式确认点复述自己正在批准什么,检验其表述与系统即将执行的一致。
- 实现侧:遍历所有会产生外部影响的动作,检查其确认档位与后果分级的对应关系是否有缺口。
反例做不到——"删除全部录音"识别后直接执行;做过头——查询天气也要"您是说要查询今天的天气,对吗?"
V1-3听不懂要换策略不是重复问必须
一句话:连着听不懂就换问法、换模态、转人工,不把同一句提示念第三遍。
适用存在识别失败、无匹配意图或反复澄清的语音流程。
规则产品必须定义识别失败或无法理解时的升级序列,并规定每一级及当前问题的总最大尝试次数;达到次数上限必须进入下一级,禁止以相同措辞重复同一提示超过声明的次数,也禁止在没有新信息的情况下无限循环澄清。升级序列必须至少包含一次换措辞或缩小问题范围,并以换模态或转交人处理为终点(终点的可得性见 V7-2、V7-5)。每一次升级必须保留用户此前已提供的信息,不得因升级而清空进度。必须区分未收到输入、听到但无法识别、识别出文字但无法理解、以及权限或连接故障;不得在麦克风不可用时要求用户“再说一遍”。等待开口按 V4-3 处理,不消耗识别失败次数。计数以当前未解决问题为范围,成功解决、用户明确换任务或退出才重置;换措辞、模型或输入通道本身不重置总失败预算;达到总上限直接进入可用终点。用户主动请求换模态或转人工时立即处理,不必走完升级序列。
边界条件本条不要求所有产品都提供人工坐席——不代表机构办理事务的产品(如设备控制)可以把"换模态"或"明确告知无法完成并给出可行替代"作为终点,但必须显式声明这一终点,不得以静默失败代替。
设计应用例如在第二次失败时换问法,之后换模态或转人工;具体次数由场景验证决定。比较缩小范围与重复播报的完成率和用户负担,再确定升级策略。
验证示例
- 用户侧:连续给出无法识别的输入,记录到达可用出路所需的轮次,以及此前提供的信息是否还在。
- 实现侧:检查升级计数器的重置条件;验证达到上限后确实换级而不是回到第一级。
反例做不到——"抱歉,我没有听清,请再说一遍"循环七次直至用户挂断;做过头——第一次没听清就立刻转人工,把可自助的事全部推给坐席。
依据与参考W3C COGA 语音模块明确指出"简单的错误恢复应转向人工,而不是制造令人沮丧的循环"(见 reference.md 第二节)。
V1-4非典型语音不被排除必须
一句话:口音、构音障碍、儿童与老年语音听不出来,是系统的问题不是用户的。
适用面向一般公众的语音产品;企业内部产品在用户群体已知的前提下按实际构成解析。
规则产品必须为识别质量系统性偏低的用户群体提供不依赖识别质量的完成路径(按键输入、文字输入或可访问的人工渠道之一以上),且该路径的可达性不得低于语音路径。禁止因识别置信持续偏低而缩减该用户可用的功能范围,也禁止把识别失败表述为用户的表达问题。产品必须声明其识别能力覆盖的语言与口音范围——单语言产品同样需要声明,"只支持一种语言"本身就是需要写明的覆盖范围;范围外的用户必须在进入语音流程前或首次失败时即可得到替代路径,而不是在多轮失败之后。
边界条件本条不要求产品宣称已经对所有语言与口音达到同等识别率;它要求的是识别率的差异不转化为可用功能的差异。
设计应用把替代路径做成入口而不是兜底:在流程开始处就能选择"改用按键",而不是失败三次后才出现。语音生物特征相关的能力(V6-6)尤其不能成为唯一门槛。
验证示例
- 用户侧:招募带明显口音、构音障碍或非母语的参与者完成同一任务,比较完成率与到达替代路径的成本。
- 实现侧:验证替代路径不需要先经历失败即可进入;验证功能范围不随置信度变化。
反例做不到——系统听不懂就反复要求"请说标准普通话",无其他出路;做过头——一检测到口音就直接跳过语音强制改为按键,剥夺用户本可以完成的语音交互。
依据与参考W3C NAUR 要求为非典型语音、聋人与言语障碍用户提供非语音替代(见 reference.md 第二节)。覆盖范围和效果仍须通过目标用户完成任务的证据判断。
V1-5关键内容逐字保真必须
一句话:人名、编号、金额不得被顺滑成更常见的文字。
适用语音输入包含专有名词、标识符、数值或需要精确记录内容的产品。
规则产品必须定义逐字保真域——人名、地名、机构名、订单号与各类编号、金额、日期时间、地址等,其实际含义在从识别到执行的全链路中不得被语言模型或后处理静默改写、纠正或“顺滑”。原始表达、规范化值与已确认值必须可区分;格式规范化只能采用已声明、语义不变的规则,存在歧义时先核对。落在保真域内且置信不足的内容,必须转入核对或拼读流程,禁止以更常见的同音词静默替换。产品必须提供逐字核对手段(逐字重复、拼读、分组播报之一以上),其可得性见 V3-5。
边界条件订单号、日期等业务值与密码、支付口令等认证秘密不同。认证秘密不得被要求进入普通对话、转写或模型上下文;须通过可访问的专用认证入口处理,语音流程只接收认证结果。
本条不禁止在保真域外对口语进行整理(去除填充词、断句、书面化);也不禁止在明确告知的前提下提供纠正建议——建议与替换的区别在于用户是否知情并可拒绝。
设计应用保真域应当在意图与槽位设计阶段就标注出来,而不是在输出前才判断。生成式后处理链路尤其需要显式围栏:模型倾向于把不常见的名字改成常见的。
验证示例
- 用户侧:让用户说出不常见的人名与一串编号,核对系统最终记录的内容与用户所说是否逐字一致。
- 实现侧:对保真域字段做端到端比对,验证不存在静默替换;检查生成式环节是否有围栏。
反例做不到——用户说的收款人"李昱"被改成"李玉",转账照常进行;做过头——把整段自由描述都当作保真域逐字复述给用户确认。
V1-6听见的不等于用户说的必须
一句话:电视声、旁人对话和系统自己的回声,都不是指令来源。
适用在开放声学环境中运行的语音产品,包括音箱、车载、可穿戴与免提通话场景。
规则产品必须区分采集到的音频与来自当前用户的指令。系统自身的语音输出、环境中的媒体播放声、以及未被确认为当前对话方的他人语音,禁止作为指令来源触发动作;来源无法判定时按非指令处理。音频内容中出现的指令性文本(广播、录音、他人朗读的内容)不因为被听见而获得指令权威;听到的内容不能扩大操作权限,也不得替用户授权。
边界条件本条不要求产品具备说话人识别能力;不具备时,可用显式触发与连续对话窗口界定候选输入范围,但窗口内的声音不因此都成为本人指令;来源仍有歧义时,必须通过定向输入或可访问的非语音方式核对,边界必须明确(见 V2-7)。本条也不禁止用户显式授权多人共同参与同一次对话。用户主动通过辅助沟通设备(AAC)发出的合成语音可以作为其表达;须按输入归属核对,不能仅因声音是合成的就排除。背景媒体与用户有意使用的辅助输入必须区分。
设计应用把"回声消除"从纯音频问题上升为设计问题——系统被自己的播报唤醒并执行动作,是可复现的产品事故而不是偶发噪声。对来源不明的高后果指令,宁可要求一次显式确认。
验证示例
- 用户侧:在电视播放含唤醒词与指令的内容时,观察设备是否被触发并执行。
- 实现侧:构造包含指令性语句的音频(广播、他人朗读、系统自身播报回灌),验证其被作为数据处理而非指令;验证来源不明时走保守分支。
反例做不到——电视广告里念出唤醒词加下单指令,音箱照单全收;做过头——为杜绝误触发要求每次指令前都先做一次声纹验证,把日常控制变成安检。
V1-7语言切换不改写用户的意思必须
一句话:语言切换不改写用户的意思。
适用适用于多语言、方言或中外文混说用户的产品。
规则产品必须分别声明识别、端点判定与合成输出所覆盖的语言及地区,不得把识别支持某种语言推定为整条语音链路都支持。用户明确选择的语言必须可修改;自动识别与其冲突时,必须保留用户选择并提供纠正入口。中途切换语言不得清空已收集信息或改变关键值,无法可靠处理时按 V1-3 提供出路。
边界条件本条不要求支持所有语言,也不要求自动检测语言;是否支持句内混说必须明确并实测。
设计应用中文任务可覆盖“把 meeting 改到周五”、多音姓名、汉字与字母编号等输入;“李昱,日字旁的昱”需核对最终汉字,不能只读同音字。数字本地化按 V3-5 处理。
验证示例
- 用户侧:同一任务中切换中文、英文及声明支持的混说,核对信息、日期和对象是否保持一致。
- 实现侧:按语言分别检查 ASR、端点与 TTS 能力和回退路径,不以单一总体准确率替代。
反例做不到——只因为用户说了一个英文产品名,就把整个流程切成英文并重问地址;做过头——每轮都询问用户要用什么语言。
依据与参考语言覆盖的需求见 reference.md 第二节;具体中文样例为本规范的设计推导,须由目标任务实测验证。
3.2 V2 轮次有主
语音通常围绕一个主要话轮展开,也可能出现附和、重叠发言或全双工交互。谁在说话、什么时候可以插话、什么时候算说完、说完之后等多久——这些在面对面交流里由无数细微信号协商完成的事,在产品里必须被显式设计。做不好的两个方向同样常见:系统霸着话头说完为止,或者用户还在思考就被抢答。本原则管辖话轮控制权本身。
V2-1打断随时可用且即刻生效必须
一句话:用户发起打断时及时停声,不强迫用户等这句话说完。
适用任何会主动播放语音输出的产品。
规则在已启用语音输入的交互中,用户必须能够在系统语音输出的任意时刻通过说话将其打断,产品必须声明从检测到用户开口到系统实际停止发声的时间上限,并使其在真实环境下可达。除法定或安全必需、且必须完整播出的片段外,禁止存在用户无法打断的语音输出;存在此类片段时,其范围、原因与时长必须事先声明,且片段结束后立即恢复可打断。在语音之外,产品还必须提供至少一种不依赖说话的停止方式(按键、触屏或手势),供无法及时出声或身处不便出声环境的用户使用。
语音输入已由用户关闭、麦克风权限被撤销,或使用按键开启输入的模式时,必须保留立即可用的非语音停止入口,并说明如何重新进入语音输入;禁止为满足语音打断而擅自重新打开麦克风。停声验证必须覆盖播放端的已缓冲音频,不能只验证服务端停止生成;同时记录用户实际开口至检测到开口的耗时,避免用延迟检测掩盖实际停声过慢。
边界条件要求完成告知不等于要求强制听完。不可语音打断的例外必须有明确的领域依据,只覆盖必要片段;停止播放的非语音入口、退出与撤销采集权限仍可用,未完成告知按实际状态补达,不能以例外阻止退出。
本条不要求把一切非语音声响(提示音、通话中的对方语音)都设为可打断;它约束的是产品自身的语音输出。本条也不规定打断的判定灵敏度——那是 V2-4 的范围。
设计应用把打断做成基础控制:播放端清理缓冲,任务端单独处理取消,并分别给出回执。只停止模型生成,不足以兑现停声承诺。
验证示例
- 用户侧:在系统播报长段内容时打断,测量实际停声时间与用户的主观感受。
- 实现侧:在弱网、高负载与长文本合成条件下重复测量停声时延,验证仍在承诺上限内。
反例做不到——用户喊了三次"停",系统把整段两分钟的条款念完;做过头——把打断阈值调到极低,用户一咳嗽播报就中断,反复重来。
V2-2打断的后果明确必须
一句话:没播出去的不算已告知,已经做了的不因为闭嘴而消失。
适用语音输出承载告知义务,或语音播报与实际动作并行的产品。
规则被打断而未播出的内容禁止计为已送达用户;产品必须能够区分"已播出"与"已生成但未播出",并据此决定该内容是否需要补达(补达路径见 V4-1、V7-4)。打断只终止语音输出,不自动撤销已经执行的动作——已产生外部影响的动作必须在打断后的首次回应中被如实说明,撤销前必须核对实际结果与可撤销范围;无法撤销时说明已发生的后果和可行的补救。产品必须区分“停止说话”与“停止任务”这两种意图。用户在行动推进中说“停”等范围不明的控制语时,必须先停声并暂停尚未提交的受影响动作,再澄清停止范围;禁止一边追问一边继续提交。明确只停止朗读时按原有效授权处理任务,明确取消时进入任务停止路径。
后续对话上下文必须同步实际播放进度,禁止把已生成、已发送或进入播放队列的内容当作用户已听到的共同信息。未播放部分可为重复与补达暂存,但必须与“已播放”区分。播放回执最多证明设备播放了某段内容,不证明用户听懂或同意;播放位置不可得时必须保留送达未知,不能推定完整送达。控制、播放与识别事件必须关联具体话轮或输出片段;停止或退出后迟到的转写、生成结果和旧播放队列不得重启已停止的输出或推进任务。
边界条件本条不要求为每一次打断都生成一段"刚才没说完的是什么"的摘要;补达义务只覆盖必要告知与用户主动索取的内容。
设计应用把"停"和"别做了"设计成两件事并在回执中明确区分——"好,我不念了,但转账已经发出去了"是一句合格的回应;"好的"不是。
验证示例
- 用户侧:在系统播报"正在为您提交"的同时打断,检验用户能否从后续回应中判断提交是否已经发生。
- 实现侧:验证未播出内容不被记为已告知;验证打断事件与动作执行状态各自独立记录。
反例做不到——打断后系统安静了,用户以为取消了,订单其实已经提交;做过头——每次打断都完整复述"以下内容尚未播报"清单。
V2-3说完的判定有依据有上限必须
一句话:声明凭什么判定用户说完了,并且等待有尽头。
适用需要判断用户话轮结束以决定何时响应的产品。
规则产品必须声明话轮结束的判定方式(静音时长、语义完整度、专用端点模型或其组合)及其可解析的参数来源,并必须设定端点判定的最长等待上限。该时限从检测到语音活动暂停时起算,用户继续说话后重置;达到上限时,系统必须给出可继续输入的询问或状态反馈,禁止无限期悬置判定,也禁止在用户仍持续表达时因该计时器到期而抢话。达到等待上限本身不构成"用户已说完"的证据,禁止据此直接执行不可逆动作;此类情况必须转为确认或询问。判定为结束但用户实际未说完时,用户必须能够续说而不必从头重述,已说出的部分不得被丢弃。
等待用户开始回答的时限按 V4-3 处理,会话空闲收尾按 V7-6 处理,两者不得与端点时限共用含混的“超时”定义。按键开始/结束或按住说话等显式提交模式可以不用自动端点判定,但必须声明开始、提交与取消的区别,并提供不依赖持续按压的可访问方式。
边界条件本条不规定具体阈值(见 2.1 的数值说明),也不预设不同场景的阈值之间存在固定大小关系——听写是否应当比问答等更久,由目标任务与目标用户的停顿分布实测决定。本条不要求所有场景使用同一判定方式,但每一种都必须有声明。采用会输出分数的端点机制时,必须同时声明该分数的含义(高分表示"已说完"还是"尚未说完")、比较方向与所属模型与分数定义;机制不暴露分数的,记为不适用并按其原生参数声明,不得补造一个概率值。
设计应用单纯缩短静音阈值可能增加抢话,拉长则可能增加等待;语义端点或显式提交是可比较的方案。地址、描述、听写等场景应单独测试停顿容忍度,并让用户知道可以续说。
验证示例
- 用户侧:让用户说一句中间带思考停顿的长指令,观察是否被截断;截断后观察续说能否接上。
- 实现侧:验证等待上限确实生效且触发保守分支;验证续说时前半句被保留。
- 实现侧:对输出分数的端点机制,验证比较方向与分数含义一致——把"高分=已说完"的模型配成"高分=未说完"应当被检出;引擎或模型升级改变分数含义时,旧阈值与旧验证证据一并失效。
反例做不到——用户报地址报到一半停顿两秒,系统抢答"好的,已为您下单";做过头——为了不打断把等待拉到六秒,每一轮都像断线。
依据与参考行业现行参数与端点模型的实现形态见 reference.md 第四节,作为实现映射参照而非合规依据。
V2-4抢话与冷场都算失败应当
一句话:换个气就被打断,和说完了等五秒没反应,是同一个问题的两侧。
适用以连续对话为主要形态的语音产品。
规则产品应当把"系统在用户未说完时插话"与"用户说完后长时间无响应"作为同一组质量指标的两端进行度量与调优,并分别设定可接受范围。产品应当结合上下文区分附和、思考停顿、纠正与打断;“嗯”“好”等表述不得仅凭词表在所有情境中一律忽略,同一表述可能是对当前问题的回答。附和词表如被使用,应当按语言和情境配置,不得屏蔽明确的停止、否定与纠正。度量应当基于真实使用数据而非仅基于实验室录音。
产品应当声明误打断后的恢复方式。自动续播前必须确认不存在待处理的停止、纠正或新输入;转写为空不等于没有有效表达,言语障碍、短词或掉包造成的漏识不得直接归为噪声。恢复应当从实际停播位置或最近完整语义边界继续,不重启整个任务、不重复执行。
边界条件本条不要求达到某个具体的抢话率或响应时延数值;它要求的是这两个方向被同时度量,而不是只优化其中一个。
设计应用调低等待门槛可能减少延迟却增加抢话;调高可能产生相反影响。把两项放在一起观察,同时检查误打断后的恢复,不能只根据其中一个指标决定效果。
验证示例
- 用户侧:在真实环境中记录一批完整对话,标注抢话与冷场事件,分别统计发生率。
- 实现侧:验证附和词集合确实生效;验证参数调整后两项指标的变化被同时观察。
反例做不到——上线后只跟踪平均响应时延,抢话事故靠用户投诉发现;做过头——为压低抢话率把所有场景的等待统一拉长,牺牲了短指令的流畅度。
V2-5现在轮到谁说是可知的必须
一句话:让用户随时知道系统在听、在想、还是在说。
适用任何语音交互产品。
规则产品必须让用户能够随时判断系统当前处于在听、在处理、在说、已结束等状态及其合法组合,指示方式至少一种不依赖视觉(提示音、语音、灯效之外的触觉,或语音本身的节奏)。状态指示必须反映真实的系统状态,禁止在未实际采集时呈现"在听",也禁止在无实际处理时呈现"在处理"。在纯语音、驾驶、视障使用等无法依赖视觉的场景中,非视觉指示是唯一手段而非补充。
全双工中“在说”可以同时保持采集,后台任务也可以在听用户输入时继续处理;状态呈现必须区分输入接收、任务处理与输出播放,不得强行用互斥四态掩盖并行事实。麦克风静音、权限不可用或连接异常导致无法收音时,必须呈现该限制而非继续显示“在听”。开始采集必须等待设备成功回执;拒绝授权、硬件占用、设备拔出与系统来电中断不得被显示为用户沉默。恢复连接不自动重新取得已撤销的采集许可,未完成输入须保留已可靠接收部分并说明缺口,不能默认为完整指令。
边界条件本条不要求四种状态各有一个独立的提示音;用可区分的方式表达即可。也不要求持续发声——静默本身在有明确约定时可以是一种状态表达。
设计应用起音与收音提示音可以界定交互区间,但仍需验证其可辨识性;不能依赖视觉的场景须提供其他可用反馈。
验证示例
- 用户侧:蒙眼或在驾驶模拟中完成一次对话,让用户在多个时刻报告"现在轮到谁",统计正确率。
- 实现侧:验证状态指示由真实运行事实驱动,而非按预估时长播放。
反例做不到——音箱静默三秒,用户不知道是在想还是没听见,于是重说一遍造成双重输入;做过头——每次状态切换都播一段语音说明"我正在思考"。
V2-6长时处理不静默必须
一句话:实质回答预计不能及时开始时,在首反馈预算内说明真实等待,并允许取消。
适用存在需要检索、调用工具或多步执行从而超出常规响应时延的语音产品。
规则产品必须声明首音时延的承诺值;实质回应不能及时开始时,必须在该上限内提供真实的处理信号(非语言提示音、简短填充语或进度播报)。超过上限仍无反馈时记录为超限并给出降级或退出手段,不能以稍后补播提示音取消这次超限记录。处理中的表述禁止被表述为动作已完成或已执行,也禁止使用与实际运行状态不符的进度描述。处理超出声明时长时,用户必须能够取消,取消必须有回执并说明已经产生的影响。
时延必须区分首个反馈与实质回答开始,分别声明起止事件、测量位置与超限处置。提示音、填充语不得计为实质回答。测试事件至少区分用户实际结束表达、端点成立、首个反馈开始播放与实质回答开始播放;端点判定的等待属于用户感受到的等待,不得从统计中扣除。某一事件无法取得时标为缺测,不填零,也不改用生成完成时刻代替。验证必须覆盖端点等待、处理、传输和播放缓冲,记录典型与尾部时延、超限比例及测试条件;不能只用服务端首包时间或平均值代表用户等待。取消入口必须在处理期间持续可用,不必等到超限后才出现。
边界条件本条不要求为所有等待都播报进度;要求预计不能及时开始实质回答的等待在首反馈预算内被说明;若回答已开始,不另播冗余提示。达到预算仍无反馈须记录超限,事后补播不使本次测量通过。也不禁止使用填充语——禁止的是内容不实的填充语。
设计应用填充语的内容要么与任务相关且真实("正在查三家的价格"),要么保持中性;用"好的,马上为您办好了"填充等待是把等待变成虚假回执。
验证示例
- 用户侧:人为拉长后端响应,观察用户在多长时间后开始重复指令或认为断线。
- 实现侧:验证处理中信号由真实运行事实触发;验证取消路径可用且回执如实。
反例做不到——问一句复杂问题,音箱沉默八秒,用户以为没听见又说了一遍,触发两次执行;做过头——每次查询都先播一段"让我想想哦,这个问题很有意思"。
V2-7多人在场时的话轮归属应当
一句话:说清正在跟谁对话,别把旁人的半句话接进任务。
适用可能在多人环境中使用的语音产品(家庭音箱、车载、会议、公共场所设备)。
规则多人可能同时在场时,产品应当明确当前对话的归属方,并使该归属对在场的人可知。归属方之外的语音不应当被并入当前任务的输入;确实需要接纳多人输入时,应当由当前归属方或产品显式声明进入多人模式,而不是默认合并。对话归属发生转移(另一位用户接手)时,应当有可感知的标识,且原对话的个性化信息仅在新对话方有权使用时携带,第三方数据处理仍须满足 V6-3,不因为在同一次对话中就自动共享。
边界条件本条不要求产品具备说话人分离或声纹能力;不具备时须说明归属的不确定性;连续对话窗口只限定接收时段,不能证明声音来自同一个人,指令来源仍按 V1-6 裁决。本条也不适用于明确设计为多人共同使用的场景(如会议记录),但那类场景需要另行声明其输入范围。
设计应用车内是最典型的失败场景——副驾的一句闲聊被并进主驾正在进行的导航修改。把"当前对话方"做成可解析的状态,而不是隐含假设。
验证示例
- 用户侧:在一位用户对话过程中让另一人插入一句无关语句,观察其是否进入任务。
- 实现侧:验证归属判定的边界与有效期;验证归属转移时个性化信息不被自动继承。
反例做不到——家庭音箱把孩子随口的一句话加进了家长正在确认的购物清单;做过头——每一轮对话前都要求用户先自报身份。
3.3 V3 说得短
屏幕上的信息是并置的,用户可以扫视、跳读、回看;语音里的信息是串行的,用户只能按系统给的顺序、按系统给的速度,听一遍。同样一段内容,放在屏幕上叫"完整",念出来叫"冗长"。本原则管辖系统语音输出本身的长度、结构与密度——它约束的是说出去的东西,听者事后的补救能力由 V4 管辖。
V3-1单话轮有长度上限必须
一句话:定义一次最多说多久,超了要分段,段间能打断。
适用任何会输出语音的产品。
规则产品必须为单次话轮的语音输出定义长度上限(以时长或等效度量表示),并按场景分别声明——查询应答、流程引导、长内容朗读的上限可以不同。超过上限的内容必须分段输出,段与段之间必须存在可被打断与可被中止的间隙,且用户必须能够知道还有后续("还有三条"或等效表达)。禁止以单个不可分割的长话轮输出可分段的内容。
边界条件本条不适用于用户显式请求的连续朗读(有声内容播放、长文朗读),但那类场景仍受 V2-1 的可打断要求约束,且必须提供暂停与定位手段。
设计应用上限不是文本字数上限,是听觉时长上限——合成语速、停顿与用户所处场景共同决定它。驾驶、运动和居家场景应分别验证注意力负担,不直接复用同一个长度上限。
验证示例
- 用户侧:让用户听完一段达到上限的输出后复述要点,观察记忆保持与不耐感出现的位置。
- 实现侧:遍历各场景的输出路径,验证不存在绕过上限的分支;验证分段间隙确实可打断。
反例做不到——问一句退货政策,系统开始朗读整段条款;做过头——把一句完整的两句话答复硬拆成两个话轮,中间插一句"还要继续听吗"。
V3-2结论先行应当
一句话:先回答,再解释;免责声明不放在用户想听的东西前面。
适用语音应答类交互。
规则系统的语音回应应当把用户所问的结论、结果或下一步动作放在最前,理由、来源与补充说明置后。禁止把免责声明、能力说明、品牌用语或寒暄置于用户所问的结论之前——这些内容如确有必要,应当置后或在首次交互时一次性给出(AI 身份披露按 V5-1 处理,属于必须前置的例外)。回应中应当能明确区分"直接回答"与"附加信息",使用户在听到答案后即可打断而不损失关键内容。应当使用用户熟悉的词,解释必要术语,并支持“说简单点”;简化只能改变表达,不能去掉否定、限制、费用或关键条件。
边界条件本条不适用于结论本身依赖前置条件才成立的情形(如"如果您指的是上周的订单,那么……");此时前置条件属于结论的一部分。安全告警与法定必须前置的告知不受本条约束。
设计应用这条规则的经济价值在于配合 V2-1——结论在前,用户听到答案就能打断,从而有机会减少实际交互耗时。结论在后则用户必须听完全部。
验证示例
- 用户侧:统计用户在回应开始后多少秒可以打断而不损失关键信息。
- 实现侧:抽样检查生成式回应的开头,验证前置的不是套话与免责。
反例做不到——"感谢您使用我们的服务。请注意以下信息仅供参考,具体以实际为准。关于您咨询的余额问题……";做过头——为了简短把必要的限定条件全部删掉,给出一个孤立而误导的结论。
V3-3并列项有上限且可导航必须
一句话:一次别念八个选项,给"下一批""再说一遍""第几个"。
适用会以语音输出列表、选项或多个候选结果的产品。
规则产品必须为一次语音输出中的并列项数量设定上限,并使超出部分可分批获取。列表输出必须提供导航手段:至少支持获取下一批、重复当前批,以及按位置或名称选择其中一项。禁止要求用户记住超过上限数量的选项后再作选择,也禁止在未给出总数或范围提示的情况下开始逐项播报。每一项的表述必须能被单独识别与引用,不得只有序号。
边界条件本条不要求所有列表都先播报总数——总数不可知时给出范围或"还有更多"的表达即可。本条也不禁止在有屏场景中同时展示完整列表(见 V3-4 的伴随呈现)。
设计应用语音里的可承载项数低于图形界面的经验值。把"缩小范围"设计成列表过长时的默认动作,而不是继续念下去——"有十七个结果,要不要先按距离筛一下"通常比念前五个更有用。
验证示例
- 用户侧:播报达到上限数量的选项后请用户选择,统计需要重复播报的比例与选错率。
- 实现侧:验证导航指令在列表任意位置均可用;验证每项可被独立引用。
反例做不到——"为您找到以下航班:第一,……第二,……"一口气念完九条,用户什么也没记住;做过头——每念一项就问一次"是这个吗"。
依据与参考W3C COGA 语音模块要求限制菜单选项数量、把列表分块,并按"先说用途再说编号"的顺序表述以降低记忆负担(见 reference.md 第二节)。
V3-4不朗读屏幕文案必须
一句话:语音输出是为听重写的,不是把界面文字念出来。
适用同时存在图形界面与语音输出,或复用同一内容源的产品。
规则语音输出必须是面向听觉重写的内容,而不是图形界面文案、结构化标记或开发者输出的直接朗读。禁止默认逐字朗读 Markdown 标记、URL、文件路径、代码、表格结构与括号注释等不适合听觉承载的内容;这类内容必须转写为可听的表述,或通过伴随的可视化通道呈现(见下)。当产品具备可用屏幕时,必须定义哪些内容必须同时可见而不得只靠听:长列表、金额与账号、链接与地址、法律与费用告知至少属于此类。无屏时这类内容的处置见 V7-4。
用户明确请求逐字读取链接、路径、代码或标点,或通过屏幕阅读器核对精确内容时,必须允许按请求读取并提供定位、分组和重复;不得因默认简化而删除用户需要核对的原文。有屏不等于屏幕可访问,伴随呈现不能强迫无法看屏或操作屏幕的用户中途换通道。
边界条件本条不要求语音与屏幕的内容完全一致——两者承载不同的信息密度是正常的;它要求的是不适合听觉的内容不被硬塞进听觉通道。
设计应用把语音输出当作独立的内容层来设计,而不是渲染层的一个变体。生成式回应尤其需要显式约束:模型默认输出的是给屏幕看的格式。
验证示例
- 用户侧:让用户仅通过听觉完成一次含链接或长编号的任务,观察成功率。
- 实现侧:对默认输出做格式扫描,并分别验证用户请求精确朗读时原文可得;最后检查实际音频。
反例做不到——助手念出"井号井号 结果 星号星号 重点 星号星号";做过头——为了适配听觉把所有数字与专名都省略,让用户听完不知道具体是什么。
V3-5关键值播报可核对必须
一句话:金额、编号、时间要分组念,用户能要求逐字重复。
适用语音输出包含金额、账号、编号、日期时间、地址或其他需要精确核对的值的产品。
规则关键值的语音播报必须采用便于核对的形式(分组、停顿、单位显式),且用户必须能够要求对该值进行逐字或分段重复,其可得性不因对话已经进入下一环节而失效。涉及不可逆动作时,被确认的关键值必须以上述形式播报至少一次,禁止仅以概括表述代替("给张伟转两千"中的收款账号不得只以姓名代替,除非该姓名已可唯一解析且用户可核对到具体对象)。播报的值必须与实际将要执行的值一致。
日期、时间、币种、单位、前导零和小数位必须按当前任务的语言及地区格式保留语义。相对日期参与关键行动时必须解析为明确日期,跨地区时间还须明确时区;同音姓名不得仅靠再次读出同一发音完成消歧。产品必须提供可唯一核对对象的补充信息或非语音核对方式。
边界条件本条不要求所有数值都逐位播报——低后果的数值(气温、步数)按自然表述即可。
设计应用分组方式按内容类型与当地习惯确定:电话号码按号码结构、金额明确币种与小数位、编号按核对任务分段,不把四位一组作为通用要求。把"逐字重复"设计成一个随时可用的指令,而不是某个环节的特有选项。
验证示例
- 用户侧:播报一串编号后让用户复述,统计准确率;在下一环节请求逐字重复,验证仍可用。
- 实现侧:验证播报值与执行值同源;验证重复请求返回的是同一个值而不是重新生成的表述。
反例做不到——"将向尾号一二三四的账户转账两千三百五十元"一口气念完,用户没听清也没法再听一遍;做过头——每一个数字都逐位播报两遍,包括查询类的无后果数值。
V3-6不确定与来源在语音里同样表达必须
一句话:屏幕上会标的"依据/推断/未知",语音里不许吞掉。
适用语音输出包含检索结果、推断结论或存在已知不确定性的内容的产品。
规则在图形界面中会以标记、脚注或视觉层级表达的来源、时效与不确定性,在语音通道中必须以听觉可承载的方式同样表达,禁止因为语音需要简短而省略。至少必须做到:区分"来自可核对来源的内容"与"系统的推断",并在信息可能已过时时说明其时点。用户必须能够就任一结论追问其依据,且追问的答复不得以概括的可靠性表述("来自权威渠道")代替具体来源。
边界条件本条不要求为每一句话附加来源说明——那会摧毁语音的可用性;它要求的是这一区分在需要时可得,且在结论可能被用于决策时主动给出。
设计应用语音里表达不确定性靠措辞而不是符号:"查到的是……"与"我估计……"是两种不同的开头。把这两类开头做成受约束的表述集合,而不是交给生成式自由发挥。
验证示例
- 用户侧:给出一个系统只能推断的问题,检验用户听完后能否正确判断这是推断而非查证结果。
- 实现侧:验证推断类回应确实走了不同的表述路径;验证追问返回具体来源。
反例做不到——把模型推测的营业时间用与查证结果完全相同的语气播报;做过头——每句话后面都跟一段"此信息可能不准确,建议您自行核实"。
V3-7听得清的参数由用户可控必须
一句话:听得清的参数由用户可控。
适用任何以合成语音承载任务信息的产品。
规则产品必须提供可访问的语速与音量调整方式,并在支持音高调节时提供相应入口;可由系统或辅助技术承担,但在当前使用路径中必须真实可达。“慢一点”“大声一点”等请求必须只改变输出方式,不重启任务或重新执行动作。用户选定的可懂度设置必须延续到同一任务的后续播报,变化受设备能力或安全限制影响时必须说明。产品必须验证关键专名、数字与多音词的实际发音,而不得只检查合成前的文本。
边界条件本条不规定统一语速、音高或声压,也不允许为满足音量请求突破设备安全限制。声线与情感身份仍由 V5 管辖。
设计应用把语速、音量入口放在播放控制附近;电话可使用设备音量键,语速调整需有可用的会话指令或替代路径。
验证示例
- 用户侧:播报中请求放慢并重听编号,再进入下一轮,检查是否仍能听清且设置被沿用。
- 实现侧:验证最终音频的时长、发音与可懂度;引擎不支持某项韵律控制时,不展示无效控件。
反例做不到——按钮显示已放慢,实际音频毫无变化;做过头——每次播报前都要求用户重新选择语速。
依据与参考W3C NAUR,REQ 14、23列出调整语音与正确发音需求;它是用户需求草案。SSML 仅提供一种实现语义,见 reference.md 第四节。
3.4 V4 记不住有救
语音交互对听者的工作记忆提出了图形界面不会提出的要求:选项要记住、刚才说的数字要记住、已经回答过什么要记住。这类负担对所有人都存在,对认知障碍、疲劳状态、非母语与分心场景的用户则直接决定任务能否完成。V3 通过减少输出来降低这类负担,本原则管辖负担仍然发生时听者手上有什么补救手段。
V4-1重复始终可用必须
一句话:"再说一遍"任何时候都有效,而且重复的是刚才那段。
适用任何会输出语音的产品。
规则用户必须能够在任意时刻请求重复系统最近一次的语音输出,在会话有效、内容仍处于已声明可重听范围且输入方式可用时,该能力不得依赖特定环节或唯一措辞;麦克风已关闭时通过非语音入口请求,不得暗中采集。重复的内容必须是上一次实际播出的内容,而不是就同一意图重新生成的另一段表述;被打断而未播出的部分必须可通过继续或重听完整段落获取,不得混称为此前已经播过的内容。产品应当支持对更早内容的重复或摘要("刚才说的第二个选项是什么"),但至少必须保证对最近一次输出的重复。重复必须可以多次请求,不得在若干次后失效或改为其他行为。
重复与继续必须重新核对当前输出通道的私密性(V6-4)。缓存已过保留期、被用户删除或无法精确重现时,必须如实说明;禁止重新编造一句“刚才说过的话”,也禁止为支持重听而无限保留原始音频。
边界条件本条不要求逐字保存所有历史音频;保留可重现最近输出所需的内容即可。
设计应用这是语音里最基础的一条补救通道,成本极低而缺失代价极高。生成式链路要特别注意:重新调用模型得到的是一段"意思差不多"的新话,对正在核对编号的用户毫无用处。
验证示例
- 用户侧:在播报关键值后请求重复,核对两次内容是否逐字一致;在被打断后请求重复,验证未播出部分可得。
- 实现侧:验证重复读取的是已播出内容的缓存而非重新生成。
反例做不到——用户说"再说一遍",系统换了一种说法重新解释了一遍,编号还是没听清;做过头——每段输出结束都主动问一次"需要我再说一遍吗"。
依据与参考W3C NAUR 要求系统遵从用户对重复语音输出的请求(见 reference.md 第二节)。
V4-2回退一步不必从头必须
一句话:说错一个字不该让用户从第一个问题重来。
适用包含多步语音流程(表单填写、预约、办理、配置)的产品。
规则用户必须能够在多步语音流程中回退到上一步或已完成的指定步骤并修改其输入,禁止只提供"重新开始"作为纠错手段。回退必须保留其他步骤已提供的信息,不得因回退而清空全部进度。修改某一步的输入导致后续步骤失效时,必须告知哪些内容需要重新确认,而不是静默作废。用户必须能够知道当前处于流程的哪一步以及还剩什么。
边界条件本条不要求支持任意跳转到任意步骤;至少支持回退一步并能定位到明确列举的已完成步骤即可。
设计应用把"改一下"设计成随时可用的指令而不是某一步的选项。语音流程中用户想改的往往不是上一步,而是三步前说错的那个日期。
验证示例
- 用户侧:在流程末尾请求修改中途的一项,观察是否需要重新回答全部问题。
- 实现侧:验证回退后其他步骤的数据仍在;验证级联失效的步骤被显式告知。
反例做不到——预约到最后一步说错了日期,系统回到第一步重问姓名;做过头——每一步之后都确认一次"这一步没问题吧,要不要修改"。
依据与参考W3C COGA 语音模块把"出错后能轻松返回而不必从头开始"列为明确需求(见 reference.md 第二节)。
V4-3时限可延长,超时不等于同意必须
一句话:不催用户;催了也要能延,而且没回答绝不按同意处理。
适用会等待用户语音应答的产品。
规则产品不应当限制用户作出语音应答的时间;确因业务或技术原因必须设置时限时,必须事先告知该时限、必须提供延长手段(用户请求延长、或系统在检测到用户仍在尝试时自动延长),且该手段本身不得依赖快速反应。超时禁止被作为用户同意、确认或选择默认项的依据;超时后的行为必须限于重述问题、降级到其他模态或保存进度后结束,且已提供的信息必须保留。
边界条件安全相关实时控制可按适用领域要求采用不能延长的时限与后备动作,必须记录具体依据并明确后果;例外只涉及计时和安全行为,不允许把无响应记录为用户同意。会话空闲收尾须停止对应采集,不以“应答不限时”为由无限常听。
设计应用使用辅助沟通设备、构音障碍、老年与非母语用户组织一句应答所需的时间远超默认设定。把"还需要一点时间"做成可识别的表达,而不是靠用户抢在超时前说完。
验证示例
- 用户侧:邀请需要更长应答时间的用户完成同一任务,统计因超时而失败的比例。
- 实现侧:遍历所有超时分支,验证不存在把超时映射为同意或默认值的路径。
反例做不到——"请在五秒内说出您的选择",超时后系统按默认项继续办理;做过头——取消所有时限,用户离开后会话无限挂起并持续占用采集。
依据与参考W3C NAUR 要求不限制用户的应答时间,确有限制时须提前告知并可调整;COGA 语音模块指出处理速度与言语组织需要显著额外时间(见 reference.md 第二节)。
V4-4一次只问一件事应当
一句话:复合问题拆开问,别指望一句话回答三个问题。
适用以语音向用户提问或索取信息的产品。
规则系统在一个话轮中应当只提出一个需要用户回答的问题。禁止在同一话轮中提出两个以上需分别作答的问题而仅接受一次应答——用户只回答其中一个时,未被回答的部分不得被按默认值填充,必须重新单独提出。需要一次性收集多项信息时,应当允许用户自然地一次说完,但产品应当按项核对而不是整体接受或整体拒绝。
边界条件本条不禁止用户主动一次提供多项信息;它约束的是系统提问的方式。也不适用于确认类话轮(复述多项内容请用户确认整体正确性)。
设计应用当复合问题频繁造成遗漏时,可以将姓名、电话、时间分别收集,并比较完成率与总轮次;用户主动一次说全时仍应接纳,避免为分步而重复问。
验证示例
- 用户侧:提出一个含三项的复合问题,统计用户完整回答的比例与遗漏项的处理方式。
- 实现侧:验证未回答项不被静默填充默认值。
反例做不到——"请告诉我您的姓名、联系电话和希望的时间",用户只说了名字,系统按今天下午下单;做过头——把本可以一次说完的地址拆成省、市、区、街道四个话轮。
依据与参考W3C COGA 语音模块要求把信息分块、每个列表项一个概念(见 reference.md 第二节)。
V4-5已说过的不再问一遍必须
一句话:用户交代过的信息,换个环节不必重说。
适用跨环节、跨话轮或跨会话延续的语音流程。
规则用户在本次任务中已经提供且仍然有效的信息,禁止在同一任务内再次索取,除非需要核对其正确性且该核对的必要性可以说明。跨会话复用此前提供的信息时,必须让用户知道系统正在沿用什么,并且能够更正;必须保留信息来源、适用任务与有效条件;过期或冲突的信息先核对,长期个性化信息须可查看、更正和删除。历史偏好禁止覆盖用户在本次对话中的明确表述。
边界条件本条不禁止出于安全目的的重新验证(身份、支付授权),但重新验证必须说明原因。
设计应用语音里重复索取的代价远高于表单——用户必须重新组织并说出全部内容。转人工与转模态时的信息传递尤其容易断裂,那是这条规则最常失效的地方(与 V7-2、V7-3 一并检验)。
验证示例
- 用户侧:在流程中途转人工或转屏,观察此前提供的信息是否需要重说。
- 实现侧:验证任务级信息在环节切换时被携带;验证历史偏好不覆盖本次明确表述。
反例做不到——用户对语音助手报了三遍订单号,转到人工后又被要求报一遍;做过头——把两年前一次性的临时地址当作长期默认并直接沿用。
V4-6帮助与"我能说什么"随时可得必须
一句话:用户不知道能说什么的时候,有地方问。
适用任何语音交互产品。
规则用户必须能够在任意时刻获知当前可以说什么或可以做什么,该能力不依赖特定环节。产品在提问时应当采用开放式或给出示例的方式建立共同基础,而不是要求用户猜测可接受的措辞;禁止在用户表述不被接受时仅返回失败而不给出可用表述的线索。帮助内容必须与当前所处的环节相关,不得只提供一份与情境无关的通用能力清单。开始使用时须能获知可办理事项、能力限制和退出方式;帮助按当前任务给出,不用长篇能力清单占满每个话轮。
边界条件本条不要求每个话轮都主动播报可用指令;要求的是用户索取时可得,以及失败时给出线索。
设计应用给示例比给规则有效——"比如说'改到下周三下午'"胜过"您可以修改预约时间"。示例应当来自该环节的真实可用表述。
验证示例
- 用户侧:在流程中途请求帮助,检验返回内容是否针对当前环节;给出不被接受的表述,检验是否获得可用线索。
- 实现侧:验证帮助入口在所有环节可用;验证帮助内容随环节解析。
反例做不到——"抱歉,我不能帮您处理这个",没有任何关于能处理什么的线索;做过头——每次进入新环节都完整播报一遍可用指令清单。
3.5 V5 声音有主
合成语音已经越过了"听得出是机器"的阶段。这带来一个图形界面没有的问题:声音本身在传递身份信息——是不是人、是不是某个特定的人、是不是真的在共情。这些信息在用户还没听清内容之前就已经生效了。本原则管辖合成声音所承载的身份与情感,它同时是本规范中受法定义务约束最直接的一组规则。
V5-1AI 身份首次交互即披露必须
一句话:AI 在回应时就说清这是 AI,用用户在用的那条通道说;用了合成音不等于对方是 AI。
适用AI 实际承担对话回应的产品,尤其是外呼、接听、客服与代表机构与用户沟通的场景。判据是"谁在作出回应",不是"声音是否由合成产生":真人坐席借助 TTS、用户使用 AAC 以个人音色表达、单纯朗读由人撰写的固定内容,均不因使用了合成语音而落入本条的"AI 对话"范围;这类情形按本条末段如实说明。合成音频本身的标识义务另由 V5-2 承担。
规则用户必须在首次交互时即得知正在与 AI 系统对话,披露必须通过用户当前实际使用的、可访问的输出通道给出:启用语音播报且用户依赖听觉时即为可听的表述,禁止仅以视觉标识、条款说明或事后告知代替;用户已选择文字输出或使用辅助技术时,披露随该通道提供,禁止为完成披露而强行开启声音输出(承接 V7-7 的输入输出分别选择)。披露不得因为合成语音自然度提高或对话简短而省略。已完成披露且身份连续可知的同一对话无需逐轮重播;新外呼、对话方变更或身份连续性丢失时重新披露。用户在对话中询问对方是否为人时,必须得到如实回答,禁止回避、含糊或否认。产品还必须使该披露在对话中可被再次获取(用户随时可以问)。真人借助合成方式表达时,必须如实说明真人参与与合成方式,禁止将其标注为 AI 对话;反之也禁止以"有真人参与"为由免除 AI 承担回应时的披露,或免除 V5-2 的合成内容标识。
边界条件本条规定的是体验承诺,不构成对任何法域法定义务的合规判定;适用法规可能提出更严格或更具体的要求(如披露的时点、措辞与留证),以其为准。
设计应用把披露做成一句自然的开场而不是一段法务声明——冗长的合规话术会被用户直接打断,反而降低实际到达率。这是 V3-2「结论先行」的明示例外:身份披露属于必须前置的内容。
验证示例
- 用户侧:让未被告知的参与者与系统交互一轮,随后询问他们认为对方是谁,统计误认率。
- 实现侧:遍历所有可发起对话的入口(外呼、接听、唤醒、深链),验证披露在每一条路径上都发生;验证"你是真人吗"的应答路径如实。
反例做不到——外呼机器人用高度拟人的声音自称"我是小李",全程不说明是 AI;做过头——每一轮回应前都重复一次"我是人工智能助手,我的回答仅供参考"。
V5-2合成语音可被机器识别必须
一句话:合成音频带机器可读标识,不只靠人耳分辨。
适用产生可被录制、转发或存档的合成语音输出的产品。
规则产品生成的合成语音必须携带可被机器识别为合成内容的标识(音频水印、元数据或等效机制之一以上),且该标识在常规的传输、录制与转码后应当尽可能保留。标识的存在与形式必须可被说明,禁止以"人耳听得出来"作为替代。标识机制不得附带与标识目的无关的个人信息;法定制作要素应按适用要求保留,其余内容必须最小化。
产品必须分别验证原始输出、下载导出、平台转发、转码及扬声器重录等声明支持的链路。元数据在扬声器重录中不会随声波保留,不得仅配置元数据就承诺“录下来仍可识别”;不可覆盖的链路必须说明限制。适用法规要求特定文件元数据或显式标识时,不得以其他单一机制替代。
边界条件本条不要求标识在任意程度的对抗性处理后仍然存活——现有技术做不到;它要求的是标识存在、机制明确、常规链路下有效。
设计应用这一层与 V5-1 分工明确:V5-1 面向当下正在对话的人,本条面向这段音频之后的流转。两者不能互相替代。
验证示例
- 实现侧:对输出音频做标识检出验证;测试常见录制与转码链路后的留存率并记录实际结果。
反例做不到——生成的语音在任何环节都无法被判定为合成;做过头——在标识中嵌入用户标识符或会话内容,制造新的隐私风险。
依据与参考合成内容标识的法定要求见 reference.md 第五节(区分适用主体、内容类型与例外)。
V5-3用真人的声音要有本人授权必须
一句话:谁的嗓子,谁说了算,范围和期限写清楚。
适用使用基于真实人声训练或克隆的语音的产品,包括声库、定制音色与用户自建音色。
规则使用可识别为特定真人的合成声音,必须具备该本人的明确授权,且授权必须可解析到用途范围、内容范围与有效期限。禁止在授权范围之外使用,禁止以已获得录音素材为由推定授权。授权撤回后必须停止新的生成;已生成内容的处置必须有明确规则并告知本人。用户为自己创建的个人音色属于其个人数据,必须可查看、可删除,删除后不得继续用于生成。
边界条件本条不涉及授权的法律形式与效力认定,那属于合规范围;本条要求的是产品侧存在可解析的授权记录与可执行的撤回机制。
设计应用把"音色"做成有主体、有期限的对象,而不是一个配置项里的枚举值。
验证示例
- 实现侧:抽取在用音色,验证每一个都可解析到授权主体、范围与期限;执行一次撤回,验证新生成被阻断。
反例做不到——拿公开演讲录音训练音色用于商业外呼;做过头——把用户为无障碍目的自建的个人音色也纳入繁琐的逐次授权流程,使其无法实际使用。
V5-4情感表达不制造虚假状态必须
一句话:不用语气伪造共情、紧迫和确定性去促成决定。
适用具备情感、语气或风格控制能力的语音输出产品。
规则情感与韵律不得使输出声称超出实际证据的确定性,不得虚构紧迫时限或后果,也不得以系统模拟的担忧、失望或依恋为理由要求用户让步。必要的“不确定”“尚未提交”等限定必须在最终音频中清晰可辨,不能被音量、重音、语速或音效掩盖。友善、关切与有起伏的语音本身不被禁止。
评审判据:先核对事实,再检查表达,最后检验用户是否理解;三类证据不可相互替代。
| 判据 | 通过需要的证据 | 失败情形 |
|---|---|---|
| 事实真实 | 查证、推断、截止时间和执行状态均有对应依据或明确的未知 | 把推断说成核实结果,虚构期限或已完成状态 |
| 限定可感知 | 最终音频保留必要限定,关键内容未被快读、压低音量或背景音掩盖 | 文本有“可能”,实际播放吞掉或难以听清 |
| 不以情绪施压 | 请求与事实、用户目标有关,不以系统情绪索取同意 | “如果你取消,我会很失望”成为用户应当继续的理由 |
边界条件不要求推断与查证结果必须采用不同音高或韵律,也不以“中性语调”直接判合格。对语调是否造成误导仍有争议时,记录目标语言、用户群体、对照音频、理解问题和预先约定的通过条件;证据不足标为待验证,不凭风格标签裁决。
设计应用先让“预计周五到,尚未收到承运方确认”在最终音频中完整可懂,再选择合适的语气。用户可要求平缓风格,但关闭情感风格不能删除事实限定。
验证示例
- 用户侧:听取查证/推断、真实期限/虚构催促的成对材料,回答“现在知道什么、还不能确定什么、是否必须立刻行动”;按预设理解目标评估,不以转化率代替。
- 实现侧:将音频和事实依据逐项核对;包含错误状态、不可感知限定或情绪施压的输出不能通过。
反例做不到——用“最后一分钟”催促用户办理,实际没有截止时间;做过头——强制所有推断改成同一种低沉语调,却不说出真实的不确定性。
依据与参考可理解表达的需求见 reference.md 第二节;以上判据是本规范的设计要求,资料不提供通用的语调诚信阈值。
V5-5人格不越过能力边界应当
一句话:人设可以有,但不能声称产品做不到的事。
适用为语音助手设定名称、性格或人格设定的产品。
规则语音人格的表述应当与产品的实际能力与身份一致。人格禁止声称产品实际不具备的能力、身份或权限(自称能够办理实际无法办理的事项、自称具有并不具有的职务或资质、自称记得实际未被保存的内容)。人格设定不应当被用于回避能力披露义务:用户询问能做什么时,应当得到基于实际能力的回答,而不是符合人设的回答。人格在跨会话中应当保持一致,其变化应当可被用户感知。
边界条件本条不禁止人格化的表达方式、名字与语气风格;约束的是人格所声称的事实。
设计应用人设的边界应当与能力清单同源维护——能力变了,人设能说的话也要跟着变,而不是各自维护两份文档。
验证示例
- 用户侧:让用户依据一轮对话推测系统能做什么,与实际能力清单比对。
- 实现侧:审查人格提示与能力清单的一致性;构造超出能力的请求,验证回应不以人设话术掩盖无法完成的事实。
反例做不到——助手自称"您的专属顾问,什么都能帮您办",实际只能查询;做过头——每次交互都先声明一遍能力边界清单。
V5-6人机交接明示必须
一句话:从 AI 转到真人、从真人转回 AI,都要说一声。
适用同时存在 AI 与人工坐席,或存在人工介入 AI 对话能力的产品。
规则对话方在 AI 与人之间切换时,必须明确告知用户,禁止在用户不知情的情况下由 AI 接替人或由人接替 AI。人工介入 AI 对话(人在幕后审阅或改写 AI 回应)时,必须让用户知道这一安排的存在。交接时此前提供的信息必须被携带(承接 V4-5),交接失败时的处置按 V7-3 处理。交接后的责任归属与记录归属必须可解析——用户事后应当能够知道某一段对话由谁作出。
边界条件本条不要求披露具体坐席的个人身份;要求的是"人还是 AI"这一区分可知。
设计应用交接是语音服务里信息与信任最容易同时丢失的一处。把"我现在把您转给同事,您刚才说的订单号我已经同步过去了"做成标准交接语,同时解决身份告知与信息携带两件事。
验证示例
- 用户侧:完成一次含交接的对话,检验用户能否正确指出交接发生的时点与前后各是谁。
- 实现侧:验证交接事件被记录且对话归属可解析;验证交接时任务信息被携带。
反例做不到——用户以为一直在和人说话,其实前半段是 AI;做过头——每次坐席内部转接都完整播报一遍身份与工号说明。
3.6 V6 在场可知
麦克风采集的不是"用户的输入",是一段物理空间里的声音。喇叭播出的也不是"给用户的输出",是这段空间里所有人都能听到的内容。这个差别使语音产品天然涉及从未同意过的第三方,也使"私密内容"的判定不能只看设备归属。本原则管辖麦克风与扬声器所处的空间。
V6-1何时在听是可感知的必须
一句话:采集状态让在场者随时可核对,包括中途进来的人。
适用具备语音采集能力的产品。
规则音频正在被采集时,产品必须以下列两种方式之一使采集状态可被在场者核对:
- 持续指示:提供在采集全程持续可感知的指示;至少一种方式不依赖用户注视屏幕。
- 等效替代(仅限经验证确实无法提供持续指示的设备形态):可靠的起止告知、任意时刻可查询当前采集状态、以及中途进入者可发现的说明或伴随指示,三者必须齐备。
指示必须真实反映采集状态:未采集时禁止呈现采集中,采集时禁止无指示。指示不得被应用层静默关闭;用户可调整其形式(如从声音改为灯效),但不得取消到无任何可感知指示的状态。状态查询不得以开启采集为前提,查询本身也不构成重新开麦的授权。
边界条件本条不要求持续发声——持续的视觉或灯效指示对有屏与有灯设备即可满足。采用等效替代的设备必须登记其形态与验证记录;若在目标场景中,错过起音者、开机即常听的情形或中途进入的第三方无法据此判断采集状态,则等效替代不成立,产品不得承诺在开放空间常听。
设计应用把"采集中"与"在听(等待指令)"设计成可区分的两件事:前者是隐私事实,后者是话轮状态(V2-5)。二者常被合并,导致用户以为不在听的时候其实在采集。
验证示例
- 用户侧:请用户在一段使用过程中标记他们认为设备在采集的区间,与真实采集区间比对。
- 实现侧:验证指示由真实采集状态驱动;验证应用层无法关闭指示。
反例做不到——唤醒时亮一下随后熄灭,实际持续采集数十秒;做过头——每一次唤醒词检测(包括本地未上传的)都发出提示音,设备整天响个不停。
V6-2常听范围显式且可退出必须
一句话:说清什么在本地、什么上了云、留多久、怎么关。
适用具备唤醒词检测或常态监听能力的产品。
规则产品必须显式声明其常态监听的范围:哪些处理在设备本地完成、哪些音频离开设备、离开的音频保留多久、用于什么用途。用户必须能够关闭常态监听(可以以功能受限为代价),关闭后必须实际停止采集而不仅是停止响应。声明必须以用户可获取的形式提供,禁止仅以隐私政策条款满足本条——产品内必须有可达的说明。用途发生变化时必须重新告知。
待机本地检测、唤醒前缓冲、会话采集、上传处理与持久保留必须分别说明。采集模式与处理位置是两个独立维度,不得合并为一个"监听档位"来声明:持续本地识别等不离开设备的音频处理同样必须写明,不因其在本地而略去。关闭的作用范围(本设备/本账号/全部关联设备)必须一并声明。产品声称“关闭麦克风”或用户撤销采集权限时,所有依赖该入口的采集必须停止;仅结束本次会话是否恢复已获授权的本地唤醒检测,按 V7-6 明示,不得把两种关闭操作混为一谈。
边界条件本条不要求披露唤醒词检测的技术实现;要求的是数据边界(本地/离开设备)、保留期限与用途这三项可知。
设计应用把"关闭"做成真实的采集停止而不是响应屏蔽——两者对用户的承诺完全不同,混淆会直接构成虚假陈述。
验证示例
- 用户侧:让用户依据产品内的说明回答"设备什么时候会把声音传出去",统计正确率。
- 实现侧:关闭常态监听后验证无音频采集与上传;验证声明的保留期限与实际存储一致。
反例做不到——"为了提供更好的服务,我们可能会收集语音数据",无范围无期限;做过头——每次唤醒都弹出一次数据处理说明要求确认。
V6-3旁人从未同意必须
一句话:第三方的声音不默认用于个性化与训练。
适用可能在多人环境中采集音频的产品。
规则采集到的非用户本人的语音,禁止默认用于个性化、画像构建或模型训练;确需此类用途时必须具备相应的同意基础,且该基础不得由设备所有者代第三方给出。第三方语音的保留期限必须不长于完成当前任务所必需,禁止以"无法区分说话人"为由把全部音频按用户本人数据处理——不具备区分能力时应当对整体采取更保守的处理,而不是更宽松的处理。产品必须说明其对第三方语音的处理方式。
边界条件本条不要求产品具备说话人分离能力;不具备时按上述保守方向处理即可。本条也不禁止为完成当前任务而处理第三方语音(如会议中的多人发言,前提是该场景本身已获得相应同意)。
设计应用这是语音产品与图形界面产品最根本的差异之一:图形界面的输入来自用户的手,语音的输入来自房间。与 V1-6 的分工:本条管这段声音能不能被留存和使用,V1-6 管它算不算指令。
验证示例
- 实现侧:验证非本人语音不进入个性化与训练管线;验证不具备区分能力时走的是保守分支而非默认合并。
反例做不到——家中访客的对话被纳入用户画像;做过头——因担心第三方数据而关闭全部语音改进机制,产品长期无法修正识别错误。
V6-4外放输出按空间降级必须
一句话:客厅音箱念的是"有一条新消息",不该念的连"有"都不念。
适用通过扬声器外放语音输出,且输出可能包含私密内容的产品。
规则语音输出的呈现级别必须以所处空间的私密性为输入解析,至少区分完整播报、摘要播报、仅告知存在性、不播报四档。先取得目标端允许范围,再按语音空间限制收紧;两者无共同允许范围、或目标端裁决结果为"不呈现"时,结果是"不播报",不得回退到"仅存在性"。"不播报"时不得暴露该事项的存在、类别或来源;必要的控制回执通过已获准、可访问的其他方式提供。设备私密级别未知、或设备属于共享类别时,必须仅输出已经确认可公开的内容,禁止默认完整播报;摘要或存在性本身仍敏感时取不播报。验证码、金额与收款方、健康信息、私人消息正文属于必须受此约束的内容,且这类内容的保守处理不因用户的通用配置而放宽(见配套字典第十节)。用户接入私人收听设备(耳机)时可解析为更高的呈现级别;接入状态未知时按外放处理。
收听路径在播报中变化时,必须在新的输出端开始播放私密内容前暂停并重新裁决,清理可能转至外放的缓存。耳机断连、蓝牙切换、音频焦点丢失和设备重连都必须纳入验证;不能等到下一条回答才应用新的私密级别。
边界条件本条不要求产品自行判定房间里有没有人——技术上不可靠;它要求的是以设备类别与收听方式这两个可解析的输入作出保守裁决。
设计应用将内容敏感性、当前操作者权限、设备共享属性与收听方式共同作为播报依据。摘要也可能泄密;无法生成符合当前许可的摘要时直接不播报,不机械地“降一级”。耳机接入只改变收听方式,不证明操作者有权查看内容。
验证示例
- 用户侧:向客厅音箱发送含验证码的消息,观察默认播报内容。
- 实现侧:验证未知设备走共享分支;验证耳机接入状态变化触发重新解析。
反例做不到——音箱在客人面前朗读完整的银行验证短信;做过头——用户独自在家戴着耳机,系统仍然只肯说"您有一条新消息"。
V6-5误唤醒可查可删必须
一句话:被误触发录下的片段,用户看得到也删得掉。
适用具备唤醒词触发采集能力的产品。
规则因唤醒判定而产生的采集记录必须可由用户查看与删除,误唤醒产生的记录不得被排除在可查看范围之外。删除必须实际生效于可由产品控制的副本,且必须说明哪些部分(如已进入不可逆的聚合统计)无法删除及其原因,禁止以"已匿名化"为由笼统拒绝。产品应当提供减少误唤醒的手段(灵敏度调整、唤醒词更换或替换为按键触发)。录音、转写、任务状态与长期个性化信息必须分别说明用途和删除范围,不能以删除其中一类冒充全部删除。
边界条件本条不要求保留全部音频以供查看——产品可以选择不保留;不保留时须如实说明,此时"可查看"的对象为记录的存在与时间而非音频内容。"不保留音频"仅指音频这一类数据,不等于不保留任务事实:任务进度与已提供信息的保留按 V7-3 独立成立,删除音频不连带删除接续所需的任务状态,保留音频也不延长该状态的承诺期。
设计应用误唤醒是可测量的产品指标而不是意外。把误唤醒记录的可见性与灵敏度调整放在一起,用户在发现问题的地方就能处理问题。
验证示例
- 用户侧:制造一次误唤醒,检验用户能否在记录中找到并删除它。
- 实现侧:验证删除操作在各存储副本上生效;验证不可删除部分被显式说明。
反例做不到——记录里只列出用户主动发起的对话,误唤醒的片段不出现也删不掉;做过头——把每一次本地唤醒词检测都记录为条目,列表长到无法使用。
V6-6声纹是便利不是凭据必须
一句话:声音像不像本人,不能作为高后果操作的唯一认证。
适用使用语音生物特征进行识别、个性化或身份验证的产品。
规则语音生物特征禁止作为不可逆或高后果操作的唯一认证依据;此类操作必须具备额外的验证要素。声纹用于识别使用者以提供个性化时,必须提供不依赖声纹的等效路径,禁止因声纹不匹配而使用户无法完成本可完成的任务(承接 V1-4)。声纹数据的采集必须经用户明确同意,可被查看与删除,删除后不得继续用于识别。声纹不匹配时的处置必须给出可执行的下一步,而不是仅拒绝。
边界条件本条不作声纹可用于认证的普遍许可。采用 NIST SP 800-63B-4 的认证体系禁止基于声音进行生物特征比对,不能以另加一个要素绕过;其他体系须按其适用标准判断。低后果便利识别(如音乐偏好)仍受同意与非语音替代要求约束。
设计应用声纹在噪声、感冒、变声期与老龄化下的稳定性不足以承担单独认证。把它定位为"减少输入"的便利手段,而不是"替代验证"的安全手段。
验证示例
- 用户侧:模拟声音变化(感冒、噪声环境)后尝试完成任务,验证替代路径可用且成本可接受。
- 实现侧:遍历高后果操作,验证不存在仅凭声纹放行的路径。
反例做不到——仅凭声纹匹配即可语音转账;做过头——把所有语音功能都置于声纹注册之后,未注册者无法使用基础能力。
依据与参考W3C NAUR 的用户需求草案提出非语音替代;认证采用的 NIST SP 800-63B-4另有更严格的声音比对禁用要求(见 reference.md 第二、五节)。
V6-7声音推断用途单独说明必须
一句话:允许听清指令,不等于允许从声音判断情绪、健康或身份特征。
适用从音高、韵律、语速或其他声学特征推断情绪、健康、年龄等个人属性,并据此改变服务或保留画像的产品。
规则产品必须把这类推断与完成当前指令所需的识别分开说明,明确推断什么、为什么使用、会改变什么,以及是否保存或提供给其他方。不得仅凭麦克风权限或语音服务开启状态推定用户同意附加推断;启用前须满足适用的许可条件和独立选择要求。用户须能够拒绝或关闭非任务必需的推断,并继续使用基本语音功能。推断结果必须保留不确定性,不得当作用户已陈述或已确认的事实;不得仅凭声音推断作出影响权益的决定,必须有可核对依据和可纠正路径。派生特征与推断记录须纳入查看、删除与用途限制,原始录音删除不代表这些记录已删除。
边界条件检测语音活动、抑制噪声或按用户明确请求调整语速,不因使用声学特征就自动属于本条;只要结果被用于个人属性判断或画像,就不能以“音频优化”规避。是否允许具体推断用途须独立判断,告知与同意并不能使被禁止的用途成立。
设计应用用户说话较慢时,可以提供“需要更多时间吗”的控制;不要直接记录其健康状况。调节应答时间与给用户贴标签是不同决定。
验证示例
- 用户侧:关闭附加推断后仍能办理同一任务,并能了解已形成记录如何更正和删除。
- 实现侧:检查原始音频、派生特征与下游决策各条路径;未启用时不产生对应画像,关闭后不继续使用缓存推断。
反例做不到——以通话录音许可为由自动生成情绪画像;做过头——关闭情绪推断也一起禁用基本降噪或语速控制。
依据与参考个人属性推断与语音任务的用途区分是本规范的设计要求;适用透明度义务与范围限制见 reference.md 第五节。
3.7 V7 有退路
语音会失败。环境太吵、用户不便出声、识别不了这个口音、这件事本来就不适合用说的办。V2 管的是在语音通道内收回话轮,本原则管的是离开这条通道:还能去哪、进度还在不在、必要的话有没有真的送到,以及用户说完"不聊了"之后系统是不是真的停了。
V7-1随时可切换输入方式必须
一句话:对话进行到一半也能改用打字、按键或触屏。
适用具备一种以上输入方式的产品,或可与具备其他输入方式的设备协同的产品。
规则用户必须能够在语音对话进行中的任意时刻切换到其他输入方式,禁止要求用户先结束或放弃当前对话才能切换。切换后此前提供的信息必须保留并可继续使用(承接 V4-5)。产品必须使切换手段可被发现,且其发现不依赖用户先经历失败。切换的目标模态不可用时,必须如实说明并给出其他出路,而不是静默维持在语音。
边界条件本条不要求产品必须具备多种输入方式——纯语音设备可以没有;此时本条通过与其他设备的协同满足(转到手机继续),接续前核对目标入口的操作者与查看权限,携带仍有效的任务信息,接续失败保留原进度且不重复提交。确实不存在任何其他模态时,产品必须在 V7-5 下声明这一限制及其影响范围。
设计应用把"改用打字"做成入口而不是错误恢复的分支。在办理类流程中,需要输入地址、编号与自由文本的环节是切换需求最集中的地方,应当主动提供。
验证示例
- 用户侧:在流程中途请求改用其他输入方式,观察是否需要重新开始与重复已提供信息。
- 实现侧:验证切换在所有环节可用;验证任务状态跨模态携带。
反例做不到——语音办理到一半想改用打字,只能挂断重来;做过头——每个环节都同时呈现四种输入方式的提示,把简单问答变成模态选择菜单。
依据与参考W3C NAUR 明确要求"允许用户在任何时候决定切换输入方式,即使语音对话已在进行中"(见 reference.md 第二节)。
V7-2转人工通道存在且可达必须
一句话:代表机构办事的语音产品,必须留一条通向人的路。
适用代表机构与用户处理事务的语音产品(客服、办理、预约、投诉、催收、售后等)。
规则此类产品必须存在通向人工处理的路径,该路径必须可被发现、可在任意环节到达,且不以先完成若干轮自助尝试为前提。禁止把转人工入口隐藏在深层菜单、要求特定措辞才能触发,或在识别失败时反而失去该入口——识别失败恰恰是最需要它的时刻。人工不可得时(非工作时间、排队超限)必须如实告知并给出可执行的替代(回拨、留言、其他渠道),且用户已提供的信息必须被保留并携带至该替代路径。
转人工必须保留用户当前可用的沟通方式;用户以文字办理时,不得把只能说话和听电话的坐席当作唯一终点。转接后仍需重复口述的替代渠道不满足非语音路径要求(V7-5、V7-7)。
边界条件不代表机构处理事务的产品(设备控制、内容播放、个人助理)不适用本条,但仍受 V1-3 的升级序列终点要求与 V7-5 的非语音路径要求约束;此类产品必须在其升级序列中显式声明终点形态,不得以静默失败代替。
设计应用把转人工做成常驻能力而不是失败兜底。用户主动要求转人工时不应当被要求先说明理由或先尝试自助。
验证示例
- 用户侧:在流程的多个环节(含识别失败状态)请求转人工,统计到达所需轮次与失败率。
- 实现侧:验证入口在识别失败分支中仍然存在;验证转接时已收集信息被携带。
反例做不到——自助语音菜单里没有转人工选项,说"转人工"被回答"抱歉我没有理解";做过头——每一轮都主动提示"需要转人工吗",让本可自助完成的事全部涌向坐席。
依据与参考W3C COGA 语音模块要求保留固定路径(通常为某个单一按键)用于到达人工,并把"简单的错误恢复应转向人工而非制造挫败循环"列为明确需求(见 reference.md 第二节)。
V7-3对话中断不吞任务必须
一句话:掉线、超时、说不下去了,进度还在,别处接得上。
适用语音对话承载多步任务、产生外部影响或需要跨会话延续的产品。
规则语音对话因掉线、超时、用户中止或转接失败而结束时,任务的进度与已提供的信息必须被保存,用户必须能够在重新接入时(同一通道或其他通道)接续,禁止出现任务既未完成也无处可查的状态。中断时已经产生的外部影响必须可被用户获知,重新接入后禁止重复已经发生的外部影响。恢复时必须核对当前实际状态而不是仅凭对话记录推测。结果缺失或超时标为“未知”,先查询原操作的真实结果;确认未生效且可安全重试后才重试。播放重复、用户重说和重新连接都不得单独触发重复提交。产品必须声明进度的保留期限,且该期限自"进入等待、暂停、中断或本次运行结束"起算,不自"语音侧最后一次状态写入"起算;执行中持续保有必要状态,读取不续期。一次连续非运行区间只从首次进入等待、暂停、中断或结束起算,状态之间切换不反复续期;恢复实际执行后再次进入该区间,按新起点计算。用户明确删除进度时说明不可接续的后果,法定留存的事实与可继续办理的状态分别处理。声明的是最短保障,不是最长保存上限。存储用途上限不足以覆盖拟作出的承诺时,必须在用户依赖该承诺前缩窄声明或提供其他接续方式;已经作出的承诺不得静默缩短,禁止静默删除。承接任务状态保留策略时,直接沿用该策略的起算与到期语义,不另立时钟。
边界条件本条不要求为纯查询类的一次性交互保存进度;适用范围限于会改变状态或需多步完成的任务。
设计应用电话掉线、静音和转接失败都可能中断办理,应把进度保存纳入任务主路径。与 V7-2 的转人工、V7-1 的转模态共用同一份任务状态。
验证示例
- 用户侧:在流程中途挂断后重新接入,观察是否需要从头开始、是否出现重复扣款或重复提交。
- 实现侧:验证中断点的状态被持久化;验证恢复路径核对外部实际状态。
反例做不到——办理到最后一步掉线,重打进来一切从头,而上一次的提交其实已经生效;做过头——为每一次未完成的查询都建立待办并反复提醒用户回来完成。
V7-4无屏场景的必要告知有补达应当
一句话:费用、法律和错误告知不能只靠念一遍就算送到;补不了就别在这条路上提交。
适用无可用屏幕或用户不便查看屏幕,且交互涉及费用、法律义务、权利告知或错误后果的产品。
规则此类告知禁止仅以一次性语音播报作为送达手段。产品应当提供可留存、可复查的补达形式(短信、邮件、应用内记录、账单条目之一以上),并使用户知道补达将以何种方式在何时到达。补达内容应当与语音播报的实质一致,不得以补达形式承载语音中被省略的关键条件。无法提供补达渠道时,告知该限制不构成豁免:以该告知为前提的办理动作不得在当前路径提交;产品必须在动作发生前告知限制、提供可完成的替代渠道并保留已有进度(承接 V7-1、V7-3)。错误后果已经发生时,无法事先阻断,产品必须如实说明影响范围与补达失败的事实,并提供可查询记录或可访问的人工处理路径,禁止把"已安排发送"表述为"用户已收到"。受限的是需要该告知的办理动作,不是整个服务:不受影响的其他路径应当保持可用。
边界条件本条不要求把每一句系统输出都留存;覆盖范围限于费用、法律义务、权利告知与错误后果这四类。本条为【应当】级,但其中的"禁止仅以一次性语音播报作为送达手段""无补达渠道时不得提交以该告知为前提的动作""禁止声称已完成送达"是硬约束。补达也不得成为额外收集联系方式的理由:用户拒绝提供联系方式时,按上述替代渠道处理。
设计应用语音里的告知义务和屏幕上的不同:屏幕上内容留在那里,语音里说过就没了,而且可能被打断(V2-2 已规定未播出内容不计为已送达)。补达是这两条规则共同的落点。
验证示例
- 用户侧:完成一次涉及费用的语音办理,检验用户事后能否找到费用条款的可复查记录。
- 实现侧:验证被打断的必要告知触发补达;验证补达内容与语音实质一致。
反例做不到——语音开通一项收费服务,费用条款只在通话中念过一遍,用户手上什么也没有;做过头——每一次普通查询都发送一条内容冗长的确认短信。
依据与参考V2-2 规定播放事实,V7-4 规定必要告知的可复查路径。
V7-5语音不是唯一路径必须
一句话:能用语音办成的事,存在不用语音也能办成的路。
适用面向一般公众的产品与服务。
规则可以通过语音完成的任务,必须存在不依赖说话与不依赖听觉的完成路径;该路径可以在其他设备或其他渠道上,但必须可被发现且其成本不显著高于语音路径。禁止把语音作为某项服务的唯一可用入口。产品形态确实只有语音时(纯语音硬件),必须声明这一限制,并说明用户通过何种其他渠道完成同类事务。无障碍相关的法定要求以适用的无障碍标准与法规为准,本条不替代其判定(见附录 B)。
边界条件本条不要求每一项功能在每一个渠道上都可用;要求的是任务可完成,而不是界面等价。
设计应用这一条是 V1-4、V6-6、V7-1、V7-2 的共同底线:它们各自提供的替代路径,最终都汇入这一条。
验证示例
- 用户侧:邀请无法使用语音的参与者(聋人、言语障碍、身处禁声环境)完成同一任务,比较可完成性与成本。
- 实现侧:遍历主要任务,验证每一项都存在非语音完成路径且入口可被发现。
反例做不到——某项业务只能通过语音客服办理,网页与应用内均无入口;做过头——为保证等价而在纯语音设备上强行塞入一套难以使用的按键交互,替代路径名存实亡。
V7-6退出即停止必须
一句话:用户结束对话之后,不再采集,也不再执行没确认的动作。
适用任何语音交互产品。
规则用户结束对话或退出语音交互后,产品必须停止音频采集(常态监听按用户在 V6-2 下的设置解析),并停止执行尚未获得确认的动作;已提交且无法撤销的动作必须让用户知道。禁止在对话结束后继续推进用户未确认的流程,也禁止把对话结束理解为对未决事项的默认同意(承接 V4-3)。退出必须有可感知的回执,使用户知道系统确实已经结束而不是仍在等待。用户可以要求保留进度以便之后接续(V7-3),但保留进度不等于继续执行。
边界条件本条不禁止在用户明确授权的前提下继续后台执行已确认的任务;必须事先说明离开后继续的工作、范围、结束条件与查询或取消入口;实际进度和结果可查,退出不得扩大已获授权。
设计应用"结束"在语音里比在图形界面里模糊得多——用户走开、不说话、说"就这样吧",都可能意味着结束。把结束设计成有明确回执的事件,而不是靠超时推断。
验证示例
- 用户侧:在一项未确认的操作待决时结束对话,验证该操作未被执行且用户得到明确回执。
- 实现侧:验证退出后采集实际停止;验证未确认动作不进入执行队列。
反例做不到——用户说"算了不订了"就挂断,订单在后台照常提交;做过头——每次结束都要求用户逐项确认放弃了哪些未完成事项。
V7-7输入输出可以分别选择必须
一句话:输入输出可以分别选择。
适用具备语音与文字能力,或可借助辅助技术提供这两类能力的产品。
规则产品必须允许分别选择输入与输出方式,使“说话输入、文字接收”和“文字输入、语音接收”在实际支持的组合中可用;不得把关闭播报等同于关闭输入,或把开启字幕等同于重新开启麦克风。承诺同步文本时,必须区分临时转写、最终转写与任务确认结果,修订与播放中断必须反映到相应呈现中。文字与语音可详略不同,但关键对象、金额、否定、条件与执行结果必须一致。关闭声音后,必要状态、控制回执和错误不得只通过声音给出。
边界条件本条只处理通道选择与语音对应文本的一致性,不规定手势、注视等多模态融合。无屏产品可通过可访问的协同渠道满足;不得承诺实际不可用的组合。
设计应用语音输入可保留而播报关闭;用户可用字幕读结果。屏幕阅读器使用时可关闭重复的产品播报,避免两路声音同时争夺听觉。
验证示例
- 用户侧:分别使用两种混合组合完成任务,在播报中关闭声音或修订转写,核对关键值和回执是否仍可访问。
- 实现侧:注入字幕先到、音频延迟和中途打断,检查未播内容不被标为已播放;确认文字通道不会丢失错误反馈。
反例做不到——“静音”按钮顺带关闭麦克风,却仍显示可以说话;做过头——为了同步强迫用户同时开启字幕、麦克风与播报。
依据与参考W3C NAUR,REQ 3–9支持输入输出组合与同步文本;本条的状态区分为防止流式输出误导而作的设计推导。
4. 术语和定义
| 术语 | 定义 |
|---|---|
| 话轮 | 一方主导表达的一段时间,可包含附和或重叠发言;不等于只有一个音频通道处于活动状态。 |
| 话轮控制权 | 当前有权发声的一方;其持有、让出与被抢占构成 V2 的规范对象。 |
| 打断 | 一方在另一方持有话轮期间开始表达,从而收回控制权的动作。 |
| 端点判定 | 系统对"用户本次话轮已结束"作出的判断,可基于静音时长、语义完整度、专用模型或其组合。 |
| 首音时延 | 从用户实际结束表达至播放端首个可听反馈的时间,包含端点判定、处理、传输与缓冲;与实质回答开始时延分别记录。 |
| 播放进度 | 播放端已实际输出的音频范围;不同于已生成、已发送或用户已理解的内容。 |
| 识别置信 | 系统对本次转写或理解结果正确性的估计;不可得时按低置信处理。 |
| 逐字保真域 | 含义在全链路中不得被静默改写,原始表达与规范化值可核对的字段类别(人名、编号、金额、日期、地址等)。 |
| 隐式确认 | 在回应中带出已理解的关键要素以供纠正,在既有授权内继续;不把沉默当作新授权。 |
| 显式确认 | 停下来等待用户明确应答的确认方式。 |
| 升级序列 | 识别或理解失败时依次采取的处置层级及其终点。 |
| 常态监听 | 设备在未被显式唤醒时持续进行的音频采集或唤醒词检测。 |
| 采集指示 | 表明音频正在被采集的可感知信号,区别于表明话轮状态的指示。 |
| 呈现级别 | 语音输出的详略档位(完整/摘要/仅存在性/不播报),按所处空间的私密性解析。 |
| 合成标识 | 使音频可被机器识别为合成内容的水印或元数据。 |
| 补达 | 语音播报之外,以可留存形式再次送达必要告知的行为。 |
| 会话 | 一段连续交互及其连接;连接结束不代表任务完成。 |
| 任务状态 | 目标、已确认信息、未决事项、外部动作与结果、接续所需最小数据。 |
| 动作结果 | 由实际执行回执确定的成功、失败或未知;超时本身不能确定成败。 |
| 控制回执 | 区分控制请求已接收与实际生效,并说明范围及未能取消的影响。 |
| 内容快照 | 某次确认所绑定的行动对象、关键值、条件和后果;关键内容改变后旧确认失效。 |
| 运行事实 | 实际采集、路由、播放位置、权限或提交结果等观察结果,不是可由用户填写的偏好。 |
附录 A:故障注入验证清单
按原则给出可执行的故障注入项。每项验证的是规则在失败条件下是否仍然成立——通过不代表符合全部要求,不通过即存在明确缺口。
V1 识别
- 在背景噪声下发出会触发不可逆动作的指令,验证系统转为确认而非直接执行。
- 连续给出无法识别的输入,记录到达可用出路所需的轮次,以及此前信息是否保留。
- 由带明显口音、构音障碍或非母语的参与者完成同一任务,比较完成率与替代路径成本。
- 说出不常见的人名与一串编号,核对系统最终记录是否逐字一致、有无同音替换。
- 播放含唤醒词与指令的媒体音频,验证设备未被触发执行。
- 将系统自身播报回灌至麦克风,验证不产生自触发。
V2 轮次
- 在长段播报中打断,在弱网与高负载下重复测量停声时延是否仍在承诺内。
- 在"正在提交"播报中打断,验证用户能否得知提交是否已发生。
- 说一句中间带思考停顿的长指令,验证未被截断;截断后验证可续说且前半句保留。
- 制造后端长延迟,验证处理中信号被触发、内容不实的填充语不出现、取消可用。
- 蒙眼或在驾驶模拟中完成一次对话,多次询问"现在轮到谁说",统计正确率。
- 在一位用户对话中由另一人插入一句无关语句,验证其未进入任务。
V3 输出
- 遍历各场景输出路径,验证不存在绕过单话轮长度上限的分支;V3-1 明示的"用户主动请求连续朗读"不计为绕过,对该路径改为验证暂停与定位可用。(V3-1)
- 播报达到上限数量的选项后请用户选择,统计重复播报比例与选错率。
- 对语音输出做格式扫描:默认模式验证不含标记、路径、表格结构等不可听内容;用户明确请求精确朗读时(V3-4)验证保真输出确实可得且未被简化。两侧分别记录,缺任一侧不算通过。(V3-4)
- 播报一串编号后请用户复述;在下一环节请求逐字重复,验证仍可用且值一致。
- 给出一个只能推断的问题,检验用户听完能否正确判断这是推断而非查证结果。
V4 记忆
- 在被打断后分别验证四项:已播出片段可重听且逐字一致;未播出片段可得且未被计为已送达;私密级别在重听时重新裁决(V6-4);缓存删除后系统如实说明不可得,而不是静默略过。"重复"与"继续"分别测试,不混为一项。(V2-2、V4-1、V6-4)
- 在流程末尾请求修改中途某一项,验证无需重新回答全部问题。
- 由需要更长应答时间的用户完成同一任务,统计因超时失败的比例;遍历超时分支,验证不存在"超时即同意"的路径。
- 提出一个含三项的复合问题,用户只答其一,验证未答项不被填充默认值。
- 在流程中途转人工或转屏,验证此前提供的信息无需重说。
V5 声音
- 让未被告知的参与者交互一轮后指认对方是谁,统计误认率;遍历所有发起入口验证披露均发生。
- 询问"你是真人吗",验证如实回答。
- 对输出音频做合成标识检出;测试常见录制与转码链路后的留存率。
- 抽取在用音色:可识别真人音色(V5-3)验证可解析到授权主体、范围与期限,并执行一次撤回验证新生成被阻断;完全合成音色验证
persona.source的来源类别真实,不要求提供真人授权主体。(V5-3) - 按 V5-4 分别核对事实依据、最终音频的限定可感知性与情绪施压;以用户理解测试评估争议样例,不以韵律是否不同判定通过。
- 构造超出能力的请求,验证回应不以人设话术掩盖无法完成的事实。
- 完成一次含人机交接的对话,检验用户能否指出交接时点与前后各是谁。
V6 在场
- 请用户标记他们认为设备在采集的区间,与真实采集区间比对。
- 关闭常态监听后,验证无音频采集与上传,而不仅是停止响应。
- 在多人环境中采集后,按 V6-3 分三种基础情形验证:无有效同意基础时第三方语音被拒绝进入个性化与训练管线;具备相应同意基础时按已声明范围处理且范围可解析;无法区分说话人时按更保守方向整体处理。不以"一律不得进入训练"为单一判据。(V6-3)
- 向共享设备发送含验证码的消息,验证默认播报为保守档;切换耳机接入状态,验证重新解析。
- 制造一次误唤醒,验证记录可见且可删除,删除在各副本生效。
- 模拟声音变化后尝试高后果操作,验证不存在仅凭声纹放行的路径且替代路径可用。另按产品声明的适用体系分支检查:声明采用 NIST SP 800-63 体系的,验证声音比对未被用作该体系下的认证要素——包括"声纹+其他因素"的组合;未声明该体系的,按其实际声明的适用要求检查并记录依据。(V6-6)
V7 退路
- 在流程中途请求改用其他输入方式,验证无需重新开始。
- 在识别失败状态下请求转人工,验证入口仍存在且已收集信息被携带。
- 在流程中途挂断后重新接入,验证进度保留且无重复扣款或重复提交。
- 打断一段费用告知,验证触发补达且补达内容与语音实质一致。
- 遍历主要任务,验证每一项都存在非语音完成路径且入口可被发现。
- 在一项未确认操作待决时结束对话,验证该操作未被执行、采集已停止、回执明确。
补充场景:
-
将临时转写中的收款人或日期修订,验证旧确认失效;未知置信不能被模型自评分替代。
-
用户在“提交订单”期间说“停”,验证先暂停未提交动作,再澄清停止范围;播放缓冲随之清理。
-
输入带思考停顿的长句与仅有“嗯”的短回答,分别核对端点计时、附和分类和误打断恢复。
-
提示音立即到达但实质回答延迟,验证两项时延分开记录;按语言、设备和网络检查尾部表现。
-
测试中英混说、同音姓名、前导零编号和跨时区日期;请求逐字朗读链接与放慢语速。
-
播报私密信息时拔出耳机,验证先暂停、清理缓存,再裁决外放内容;重听也重新裁决。
-
分别用语音输入/文字接收、文字输入/语音接收完成任务,并在转人工后保持可用沟通方式。
-
撤销麦克风权限后请求停止或重听,验证非语音控制可用且采集不被暗中恢复。
-
麦克风被拒绝授权、被其他应用占用或中途拔出时,验证“在听”不成立,用户不被要求反复重说;恢复权限后也不自动提交残缺输入。(V1-3、V2-5)
-
确认“是的,不对,改到周五”这样的整句,验证只处理完整修正;旧确认、退出后的迟到转写和旧音频回包不能推进新任务。(V1-1、V1-2、V2-2、V7-6)
-
提交成功但回执丢失时断线重连,验证先查询原动作,结果未知不盲目重试;播报重听不再次预约。(V7-3)
-
关闭声音属性推断后,验证基本任务仍可用、缓存画像不再影响决策;分别删除录音与派生数据,确认效果与声明一致。(V6-7)
-
长等待后中断,核对保留起点;等待转暂停不续期,恢复实际执行后再次挂起按新起点计算。用户明确删除进度后不假称仍可接续。(V7-3)
-
安全时限到期只触发有依据的后备动作,不记录为用户同意;必要告知被中断不计为已送达,也不阻止退出。(V2-1、V4-3)
-
改用更慢语速后检查输出时长重新分段,并请求“说简单点”;关键条件仍在,音频、字幕和真实执行值一致。(V3-1、V3-2、V3-7、V7-7)
清单使用约定:每一项检查都绑定其规则 ID 与该规则的适用条件与边界;规则明示的合法例外必须作为正向用例进入清单,不得被检查项判为失败。蒙眼、静音等模拟条件可用于验证无视觉路径,但不替代目标视障、认知或言语障碍用户的实际参与。
分类检验(检验原则切分的一致性):随机抽取产品中的 10 条具体要求,由三名以上未参与本规范撰写的评审者独立判断其归属的原则。分歧比例的分母为抽取的条目数(10 条),一条要求只要存在评审者之间的归属分歧即计为一条分歧条目;分歧条目超过三成(即 4 条及以上)时,检验不通过——此时应当调整原则的切分或规则的粒度,而不是增设中间层或映射说明。该三成为试行的维护触发线,按实际使用情况复核,不作为通过率承诺。本规范已知的三处高风险边界(V1/V6、V3/V4、V2/V7,见第 1 章)应当在抽样中被覆盖。
完整任务走查(检验覆盖的完整性——分类检验不承担这一职责):选取两到三条贯通 V1–V7 的真实任务(例如一次含费用告知的语音办理、一次多人环境中的私密消息播报),逐步记录每一步所依据的规则;出现无处归属的需求时,记录该需求并作为规则缺口处理,不就近塞入某条现有规则。归属一致率高不等于覆盖完整,两项检验分别记录结论。
附录 B:论据边界与来源类型
本规范的条款依据分为四类,分别记录约束效力与证据用途,不按发布机构简单排序,全部条目见 reference.md:
| 类型 | 说明 | 在本规范中的作用 |
|---|---|---|
| 规范性标准与法规 | 由标准组织或立法机构发布、规定适用条件和符合性判定的文件(无障碍标准、AI 透明度法规、语音合成标记语言) | 作为下限引用(如 V5-1 的身份披露、V7-5 的无障碍下限),本规范不重述其内容也不替代其判定 |
| 无障碍用户需求文件 | W3C 面向自然语言接口与认知无障碍发布的用户需求文档 | V1-4、V4-1、V4-3、V4-4、V7-1、V7-2 等的需求依据;NAUR 与 COGA Voice 均为草案类 Note,非 W3C Recommendation,不直接产生合规义务 |
| 学术研究与元分析 | 同行评议的语音交互研究与准则综述 | 作为问题空间的划分依据与失败模式来源;综述提供覆盖度参照,不直接产生义务条款 |
| 工程实现与行业实践 | 语音代理框架的公开配置、平台设计指南、行业实践总结 | 作为"这类机制在真实产品中可行"的证据与实现映射参照;单一实现的默认值不构成推荐值 |
本规范尚未收敛的部分,在此显式声明,不以条款语气掩盖:
- 不设通用性能阈值。首音时延(V2-6)、端点静音阈值与最大等待(V2-3)、单话轮长度上限(V3-1)、并列项上限(V3-3)、进度保留期限(V7-3)——规范只要求"有明确定义、有依据、可验证"。这些数值随语言、任务类型、用户群体与部署环境差异极大,现有引用资料不足以支持通用性能阈值。工程参数记录在 reference.md 第四节,是机制参照,不是推荐值,更不是合规依据。
- 韵律效果依赖情境。V5-4 可核对事实与限定是否真实、可感知,但不能给音高或情感标签设置通用诚信分数;仍需目标语言和用户研究支持。
- 多模态融合不在范围内。本规范只管语音这一通道。语音与屏幕、手势、注视的融合语义,跨模态的时间同步(唇音同步、触觉延迟),以及模态间的冲突裁决,均未被覆盖。V3-4、V7-1 与 V7-7 只触及了通道之间的边界,不构成融合规范。
- 车载语音未单独处理。驾驶场景的视觉—手动干扰、注意力预算与接管时限由领域标准与法规规定,本规范让位于它们;V2 与 V3 在车载场景下的参数解析必须以那些标准为准。
- V1/V6、V3/V4、V2/V7 三处边界:见第 1 章的明示。若在实践中反复出现归属争议,应当调整原则的切分。
配套的 Token 词汇表见 Design Token.md;本规范不通过 Token 字典产生新的义务,字典也不替代本规范。
附录 C:完整任务示例与验收记录
以下为设计示例,不是已完成的产品实验;其中任务信息仅用于说明交互,不能作为性能或能力证据。
C.1 办理预约:从查询到可复查结果
场景:用户在带屏手机上预约机构服务,可用语音或文字,费用需留存确认,支持人工文字服务。任务完成的条件是:日期、地点和费用被正确理解并确认,机构返回唯一预约结果,用户能查到记录;一声“好的”不表示预约完成。
| 步骤与输入 | 设计行为与反馈示例 | 实现事实/控制 | 规则与关键 Token |
|---|---|---|---|
| 进入并点击说话 | 一次说明 AI 身份;设备就绪后表示“可以说了”,文字入口可见 | 权限和采集回执;拒绝权限仍可输入文字 | V5-1、V2-5;voice.turn.input.mode、voice.fallback.io.combinations |
| “查下周四下午的时间” | 将相对日期解析为明确日期,返回有限候选并可继续筛选 | 当前日期及时区、查询结果;没有提交动作 | V1-5、V3-3;voice.utterance.locale.format、voice.utterance.list.max_items |
| “不是周四,改周五,还是下午” | 只更新日期,保留下午与地点;“周五下午有两档” | 输入修正更新关键值;关联的旧确认失效 | V1-2、V4-2;voice.recall.back.granularity |
| 用户选择一档,要求“说慢点” | 按选择的语速播报明确日期、地点和费用;必要条件同时可复查 | 最终音频与待提交值一致;调整语速不重新查询或预约 | V3-5、V3-7、V7-4;voice.persona.prosody.rate、voice.fallback.no_screen.deliver |
| 用户听清后确认 | 确认绑定本次预约内容;“正在提交”,可随时取消未提交动作 | 有效确认记录、唯一操作关联、提交阶段 | V1-2、V2-2;voice.utterance.confirm.style |
| 提交回执暂未到达 | “暂时还没查到提交结果,我会先核对”;不说失败,也不再次提交 | 结果未知;查询原操作,不从聊天猜测结果 | V2-6、V7-3;voice.latency.answer.max_ms、voice.fallback.resume.mode |
| 机构确认预约成功,短信失败 | 说明“预约已成功,短信没发出”;提供已验证可访问的应用内记录 | 预约结果与补达结果分开;应用记录确实可查 | V7-4;voice.fallback.no_screen.deliver |
| 用户退出后重新进入 | 显示已有预约及未完成的补达事项;可以查询、改约或转人工 | 核对同一用户权限和机构结果;不重复预约 | V7-3、V7-6;voice.fallback.resume.retention、voice.fallback.to_human.path |
对照分支:低后果的时间查询不加确认;用户一次说全日期和地点不拆开重问;最终确认前改值只重核受影响内容;没有可访问的费用记录路径时不提交预约。这样同时检查遗漏和过度确认。
C.2 一张可执行的验收记录
| 项 | 示例 |
|---|---|
| 规则与前提 | V2-2、V7-3;预约请求已提交,客户端尚未收到结果 |
| 注入事件 | 丢弃回执,断开连接;重连后用户说“再试一下” |
| 预期事实 | 原动作结果先标为未知;查询后若已成功,只恢复结果,不产生第二次预约 |
| 用户反馈 | 明确“正在核对”及核对后的真实结果;不以静音或超时暗示已取消 |
| 禁止结果 | 未核对就重试;显示失败但实际预约成功;重复播报导致重复执行 |
| 正向对照 | 请求确实未提交、且重试安全时可继续,不把所有恢复都永久阻断 |
| 证据 | 测试操作关联、执行端回执、播放事件与界面记录;按最小必要范围保存 |
| 判定 | 通过/不通过/不适用(写理由)/待验证(写缺口);无运行证据不能填通过 |
C.3 指标与通过条件
以下是测量口径。数值门槛由项目在测试前设定;不同指标不加权平均成一个“语音质量分”。
| 指标 | 分子与分母/起止事件 | 同时观察 |
|---|---|---|
| 任务完成率 | 达到真实业务完成条件的任务数/有效任务尝试数 | 失败、放弃与转人工单列,不能从分母删除困难任务 |
| 关键值正确率 | 最终与用户意图一致的关键字段数/被检验关键字段数 | 静默替换、错误确认、后果严重程度;不能只报词错率 |
| 抢话率 | 人工标注用户尚未表达完就开始系统回应的话轮数/标注的用户话轮数 | 系统响应变慢的代价,非典型语音和思考停顿分组 |
| 打断停声时延 | 用户实际开口→检测→扬声器实际停声,两段分别测量 | 漏检率、误打断率、用户停止后误续播次数 |
| 首反馈/实质回答时延 | 实际表达结束→首个反馈/实质回答开始 | 中位数、尾部分位数、超限次数/有效样本数;缺测单列 |
| 纠错与替代成本 | 从提出纠正/换通道到可继续原任务的耗时、话轮、重填字段数 | 与正常路径及纯文字路径比较,避免用复杂防错增加总成本 |
| 可理解性 | 正确说出关键结果、限制与下一步的参与者数/有效参与者数 | 不能用“喜欢这声音”或自然度评分替代 |
| 来源防护与误唤醒 | 非用户音频触发次数/声明的测试音频次数或设备小时数 | 漏唤醒、AAC 被误拒;分母口径固定,二者不能混报 |
按语言/口音、听说或认知需求、设备及收听方式、噪声和网络分组报告样本量与不确定性;小样本标明不足,不由总体高分推断各组达标。性能样本中没有观察到错误不证明错误永不发生。
验收分三路:内容和规则的静态检查;采集、路由、停声、提交与恢复的系统实验;目标用户的可理解性和完成成本研究。硬底线失败不得被速度、满意度或总分抵消。证据不足时明确限制支持范围或保留待验证结论;模型、声线、处理用途或环境变化后,只沿用仍覆盖实际条件的证据。
实施验收场景
以下场景把已有条款转成可复核的验收输入,不另设通用性能阈值。按产品适用能力选取,补充真实设备、用户、输入序列和证据;不适用记录原因,未执行不得记为通过。
| 条款 | 测试输入与异常 | 预期行为与失败判据 |
|---|---|---|
| V2-6 | 实质回答迟迟未开始,但处理中提示在首反馈预算内播放。 | 首反馈与实质回答分别判定,不把提示算作答案。 |
| V2-1 | 合成服务已停,但设备播放缓冲仍有音频。 | 按实际停声测量,不用服务端停止回执代替。 |
| V7-3 | 预约提交结果未知时语音断线,用户改用文字继续。 | 读取同一任务和原动作,核对后再执行,不重新提交。 |
每个场景分别核对配置的有效值、执行记录与用户可理解的结果。保留版本、目标、事件时点、失败范围和恢复结果;外部结果未知不填作成功或失败。
使用说明
本字典是行为词汇表,不是视觉词汇表,也不是话术模板。它规定的是"凭什么判定用户说完了、打断后多久闭嘴、一次最多说多长、超时算不算同意、什么时候必须说明这是 AI、什么在本地什么上云"这类决策的表达方式。
本字典配套《语音交互设计规范》使用,承接其适用要求;字典不替代整套规范,也不构成安全、隐私或合规证明。字段名一律以 voice. 为前缀。每项决定均在本字典内说明值域、适用条件与依赖。
与工程配置的映射:voice.turn、voice.latency 两类中的多数字段,在现有语音代理框架中已经存在对应的工程参数(端点静音时长、打断词数阈值、打断后静默期、端点置信阈值等)。本字典不发明新的参数名去替代它们,而是将它们与三项产品决定关联:这项参数承担的是哪一条体验承诺、取值凭什么、以及怎么验证它生效。落地时应当把本字典的字段映射到产品实际使用的框架参数上并记录该映射,而不是另建一套平行配置。工程机制与测量对照见 reference.md 第四节。
八类速览
| 类别 | 前缀 | 必选 | 可选 | 合计 | 负责什么 |
|---|---|---|---|---|---|
| 识别 | voice.asr | 3 | 5 | 8 | 听到的算不算数、听不懂了怎么办 |
| 轮次 | voice.turn | 4 | 7 | 11 | 谁在说、能不能打断、什么算说完 |
| 时延 | voice.latency | 2 | 5 | 7 | 多久必须出声、出不了声怎么说 |
| 输出 | voice.utterance | 3 | 6 | 9 | 一次说多长、说多少、怎么确认 |
| 声音 | voice.persona | 3 | 4 | 7 | 这是谁的声音、是不是 AI、能有多少情绪 |
| 复述 | voice.recall | 3 | 3 | 6 | 重复、回退、给多长时间回答 |
| 退路 | voice.fallback | 3 | 6 | 9 | 不说话怎么办、找人怎么找、断了去哪接 |
| 在场 | voice.privacy | 3 | 5 | 8 | 什么时候在听、留多久、旁边的人怎么办 |
速览按设计决定行计数,共 65 项;同一行中的韵律字段组计为一项。固定值是不可关闭的契约表达,不能渲染为用户可关闭的开关。
必选与可选
| 级别 | 含义 | 配置方式 |
|---|---|---|
| 必选 | 适用的产品或场景必须明确的基础决策。 | 可以继承产品预设,也可以用合法的关闭、空范围或显式声明不适用来表达限制;声明不适用须给出理由。不要求用户逐项填写。 |
| 可选 | 仅在特定能力或差异化需求下采用的参数。 | 无对应能力时不配置;启用能力后,必要依赖必须有明确值或可执行的继承规则(见第九节)。 |
话轮、会话、任务与音频的边界
| 对象 | 负责什么 | 关键边界 |
|---|---|---|
| 话轮 | 一方主导表达的一段时间,可有附和或重叠语音。 | 话轮结束不等于任务推进;系统判定用户说完了,不等于用户确实说完了(对应 V2-3)。 |
| 会话 | 一次连续的语音交互过程。 | 会话结束不等于任务结束,也不等于对未决事项的同意(对应 V7-6)。任务状态由目标、已确认信息、未决事项及实际动作结果构成,不能只从聊天推测。 |
| 任务 | 一项工作的目标、约束、进度与成果。 | 跨话轮、跨会话、跨模态接续;语音只是它的一条通道,通道断开不等于任务失败(对应 V7-3)。 |
| 音频 | 被麦克风采集到的一段声音。 | 不等于"用户的输入"——它是一段物理空间的记录,可能含系统自身回声、媒体声与第三方语音(对应 V1-6、V6-3)。 |
| 转写 | 系统对音频的文字化理解结果。 | 是带不确定性的假设,不是用户说的话(对应 V1-1)。端到端模型的内部理解与辅助转写分别记录;没有转写或置信分数时不伪造等价对象。 |
"系统听见了"与"用户说了"是两件事(V1-6)。"系统判定说完了"与"用户说完了"是两件事(V2-3)。"播出去了"与"用户听到了"是两件事(V2-2)。"没有回答"与"同意"是两件事(V4-3)。这四组区分贯穿全部八类,任何配置不得把其中一侧折叠成另一侧。
字段读取约定
每节前缀与表中的字段拼接为完整名称,例如 voice.turn 与 barge_in.stop_within_ms 组成 voice.turn.barge_in.stop_within_ms。八类统一使用 级别、设计决定、字段、类型与合法取值、适用条件与作用 五列。
时长带单位(字段名含 _ms 为毫秒、_s 或 seconds 为秒,其他时长字段采用含数值与单位的结构);范围引用可解析到明确的场景、设备类别或数据类。集合不默认全选。时长类字段必须声明其适用场景——问答、听写、办理流程的合理取值不同,单一全局值通常意味着其中至少一类被做坏了。
多个硬限制同时生效时取共同允许的范围,不按"后配置覆盖前配置"放宽保护。用户的无障碍选择应在设备能力与安全限值内保留;隐私限制不得被场景级或设备级配置放宽。未知收听方式按外放与共享解析;内容是否可公开未知时不播报;识别置信不可得时走低置信处置,不伪造分数。
参数、事实与界面表达
| 类型 | 示例 | 使用方式 |
|---|---|---|
| 行为 Token | 停声时限、确认强度、允许推断用途 | 决定产品承诺与解析规则,可以复用。 |
| 运行事实 | 实际采集状态、路由、转写假设、播放位置、确认记录、提交结果 | 由设备、输入处理或业务执行回执提供;不可在设置里填写“已停声”“高置信”。 |
| 用户表达 | “已暂停朗读,预约尚未提交” | 来自可核对事实,不能由动画或生成文案反向定义事实。 |
每个有效值随附适用范围、决定者、依据、实现映射、生效点和缺失处置。这些是配置记录的公共元数据,不是新的 voice.* 字段。策略引用不是一句自然语言占位词,必须能解析到下表要求的结构和可执行分支。
集合默认不选中;空集合仅在字段明确允许时合法。null 不同时表示关闭、不适用或未知;缺失处理见第九节。布尔固定值仅用于表达不可关闭的行为,不生成同名用户开关。产品可以用稳定枚举键保存中文选项,但须附一一对应的词表,不能把同义词当作额外状态。
一、识别:听到的算不算数、听不懂了怎么办
前缀:voice.asr
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 低置信处置 | confidence.policy | 枚举:低后果且可即时撤销时直接采用/低置信转显式确认/低置信转澄清。不可逆动作不得直接采用;置信未知走低置信分支。判据须实测校准,模型自评与总体澄清率不充当单次置信。 | 按任务后果选择有效策略,不能用低后果配置放行不可逆动作(对应 V1-1、V1-2)。 |
| 必选 | 失败升级序列 | nomatch.escalation | 有序集合:重述/换措辞或缩小范围/换模态/转交人处理/说明不可完成并给出可行替代。须含"换措辞或缩小范围";终点须为"换模态""转交人处理"或"说明不可完成并给出可行替代",末者仅适用于 V1-3 边界所指的不代表机构办理事务的产品,且须显式声明,不得以静默失败代替;它不免除另行适用的 V7-5。类型为有序策略条目,每级含触发原因、动作和正整数最大尝试次数;还须有当前问题的正整数总次数上限和可用终点。先区分无输入、无法识别、无法理解与设备/权限/连接故障;故障先提示修复或换通道,不要求反复重说。无输入按响应时限处理,不计入识别失败。成功解决问题、明确换任务或退出才重置计数;换措辞或通道不重置总次数。达到总上限直接进入可用终点;用户可提前请求终点。 | 决定听不懂之后往哪走;达到次数即换级,不得原地重复(对应 V1-3)。 |
| 必选 | 不依赖识别的完成路径 | atypical.fallback | 集合:按键输入/文字输入/可访问的人工渠道。至少一项不依赖语音识别与听觉,且无需先失败。拼读可辅助消歧,但仍依赖语音,不能单独充当非语音替代。 | 保证识别质量系统性偏低的用户仍能完成任务(对应 V1-4、V7-5)。 |
| 可选 | 逐字保真域 | verbatim.fields | 集合:人名/地名/机构名/编号/金额/日期时间/地址。域内含义禁止被静默改写;原始表达与规范化值可核对,语义不变的格式规范化可按已声明规则执行,歧义先核对。 | 存在专有名词或标识符输入时配置(对应 V1-5)。 |
| 可选 | 拼读模式 | spelling.mode | 枚举:不提供/用户可请求/低置信自动进入。 | 需要精确采集专名或编号时配置。 |
| 可选 | 语言与口音范围 | locale.scope | 集合,每项含语言/地区、声明覆盖的口音与场景、证据来源;单语言产品同样须可解析(写明其唯一覆盖范围),不因"只有一种语言"而免于声明。可继承自能力声明,不要求新增用户设置。范围不得用于缩减用户可用的功能集合,只用于决定何时提供替代路径。 | 适用 V1-4 时必须可解析(面向一般公众的语音产品),不限于多语言或多口音场景。 |
| 可选 | 语言切换策略 | locale.switch | 枚举:用户显式选择/自动建议后由用户选择/在已声明范围内自动切换且可纠正。用户显式语言选择优先;声明句内混说覆盖,分别核对识别、端点与合成能力,不改变关键值或清空进度。 | 面向多语言或混说场景时配置(对应 V1-7)。 |
| 可选 | 非用户音频处理 | source.guard | 集合:自身输出回声/外部媒体声/未归属当前对话方的语音。在开放环境适用时必须覆盖全部三类,不可通过删减集合允许其触发动作;来源未知时不推定授权。 | 在开放声学环境中运行时配置(对应 V1-6)。 |
边界:置信决定这句话能不能被直接用,升级序列决定用不了之后往哪走,替代路径决定用不了的人还能不能办成事。三者分别成立,不可互相替代。
二、轮次:谁在说、能不能打断、什么算说完
前缀:voice.turn
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 可打断 | barge_in.enabled | 布尔;语音输入有效的交互固定为 true。仅法定或安全必需且必须完整播出的特定片段可取 false,须声明依据、范围与期限。用户关闭输入或权限不可用不属于该开关;此时保留非语音停止且不暗中开麦。 | 决定用户能不能收回话轮(对应 V2-1)。 |
| 必选 | 停声时限 | barge_in.stop_within_ms | 正时长;从检测到用户开口至播放端实际停声,含已缓冲音频。还须记录实际开口至检测的耗时;不能只验证停止生成。适用语音打断时必须有效。 | 让"打断"成为可验证的承诺而不是意图(对应 V2-1)。 |
| 必选 | 端点判定方式 | endpoint.mode | 枚举:静音时长/语义完成/混合/专用端点模型/用户显式提交。明确机制、分数定义与语言;显式提交须关联 input.mode,不依赖自动端点。 | 决定凭什么判定用户说完了(对应 V2-3)。 |
| 必选 | 最大等待上限 | endpoint.max_wait_ms | 正时长;自动端点判定时必选,从检测到语音活动暂停起算,续说时重置;到期反馈不提交仍未确认的输入。到期进入可继续输入的询问或状态反馈,不打断持续表达、不推定确认;显式提交模式记录不适用。 | 保证等待有尽头,同时不把等尽了当作确认(对应 V2-3)。 |
| 可选 | 静音阈值 | endpoint.silence_ms | 正时长,不大于同场景的 endpoint.max_wait_ms,按场景分别取值,取值依据为目标任务与目标用户的停顿分布实测。听写、地址、短指令、问答须分别测试并记录条件;不预设各场景取值之间存在固定大小关系。 | 采用静音或混合判定时配置。需记录引擎参数与单位映射;不沿用未验证的框架默认值。 |
| 可选 | 端点置信阈值 | endpoint.confidence | 仅当所选端点机制实际暴露一个已定义的分数时才配置。配置须同时可解析到:分数事件的含义(高分表示"已说完"还是"尚未说完")、值域、触发比较符(≥ 或 ≤)、分数更新时机、引擎/模型标识与适用语言;是否经过校准须如实标注,未校准不得按概率解释。机制不暴露分数时记为不适用,按该机制的原生参数映射,不得补造概率。须与 max_wait_ms 同时生效,不得以阈值取代上限,也不得取消续说恢复。 | 采用语义完成或专用端点模型时配置。引擎升级改变分数含义时,本字段配置与相关验证证据一并失效,须重新验证。 |
| 可选 | 不触发打断的表述 | barge_in.ignore_phrases | 按语言与情境解析的附和候选集合,空集合表示不使用词表抑制。不得仅按词命中忽略应答、否定或纠正;明确停止指令不被屏蔽。 | 连续对话中减少误打断时配置(对应 V2-4)。 |
| 可选 | 打断后静默期 | barge_in.backoff_ms | 非负时长;打断后系统不发声的时长。不得长到使用户认为系统未响应,与 voice.latency.first_audio.max_ms 共同解析。 | 存在误打断风险时配置。 |
| 可选 | 话轮状态指示 | floor.indicator | 集合:提示音/语音/灯效/触觉/视觉状态。适用 V2-5 时至少一项不依赖视觉;区分接收输入、任务处理、播放输出及不可用状态,支持同时在听和在说。与采集指示分别成立。本字段的适用条件是"适用 V2-5 的交互",包含单轮问答与按键提交模式;连续对话能力降级后,状态表达义务不随之取消。 | 任何适用 V2-5 的语音交互均应配置(对应 V2-5)。 |
| 可选 | 话轮提交方式 | input.mode | 枚举:自动端点/按住说话松开提交/点击开始再点击提交。声明开始、提交与取消,按住模式须另有不依赖持续按压的可访问方式。 | 需要显式控制收音或端点不稳定时配置(对应 V2-3);不配置则从 endpoint.mode 推导:显式端点必须选一种显式提交方式,其他端点取自动;冲突按缺失处理。 |
| 可选 | 误打断后恢复 | barge_in.false_interrupt.mode | 对象:mode 取保持暂停/条件满足后续播;后者还含可解析判据引用与正时长 wait_ms(从检测到本次打断起算,新输入使该恢复候选失效),运行时须有真实播放位置;空转写本身不足以判定误打断。明确停止或新输入优先处理。 | 具备误打断检测时配置(对应 V2-4);不得通过恢复重做动作。 |
边界:打断管的是用户收回话轮,端点管的是系统判定用户让出话轮,指示管的是双方都知道现在轮到谁。三者是同一条通道上的三个不同事实。
三、时延:多久必须出声、出不了声怎么说
前缀:voice.latency
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 首音时延承诺 | first_audio.max_ms | 正时长;从用户实际结束表达至播放端首个可听反馈,包含端点、处理、网络与缓冲。在实质回答不能及时开始时,应在此上限内开始真实的处理中反馈;达到上限仍未出声即记为超限并降级,不因稍后补提示音抹去超限。提示音不计入 answer.max_ms 的实质回答。 | 定义"多久算没反应"(对应 V2-6)。 |
| 可选 | 实质回答等待上限 | answer.max_ms | 正时长,不小于同场景的 first_audio.max_ms;从用户实际结束表达至实质回答开始在播放端输出。超过时按 on_degrade 提供取消、继续等待或可访问的替代;不以提示音或“正在查”满足此值。 | 承诺对话响应或有长时工具处理时配置(对应 V2-6)。 |
| 可选 | 时延测量口径 | measurement.profile | 可解析的指标定义引用:实际表达结束、端点成立、反馈播放、实质回答播放等事件,测量端、目标分位数、超限率和语言/设备/网络分组。无可靠事件时记录缺测,不以零代替。 | 声明时延承诺时必须有明确配置或继承值(对应 V2-6)。 |
| 必选 | 处理中信号 | thinking.signal | 枚举:非语言提示音/简短填充语/进度播报。适用长时处理时不得取“无”;实质回答在首音上限内已开始时无需另播。内容不能暗示尚未发生的完成或提交,关闭声音时提供可访问的等效反馈。 | 预计实质回答不能及时开始时,在首反馈预算内让用户知道真实处理状态(对应 V2-6)。 |
| 可选 | 长任务进度间隔 | progress.interval_s | 正时长;从上一次有效反馈结束起算,用户发言或关闭声音时暂停语音提示,避免提示音遮挡输入;进度内容须来自真实运行事实。按同一任务的真实进度触发,多个播报入口合并去重;没有新事实时不编造阶段。 | 存在需要数十秒以上的工具调用或多步执行时配置。 |
| 可选 | 处理中可取消 | long_running.cancellable | 布尔,适用处理期间固定为 true;取消无需等到超限。须有回执并说明已经产生的影响;无法撤销的已提交动作如实说明。 | 处理时间可能超出用户等待意愿时配置。 |
| 可选 | 降级行为 | on_degrade | 枚举:延长等待并告知/降级为更快的响应形态/转其他模态/如实告知不可用。不含"静默继续等待"。 | 网络或模型不可用、时延显著劣化时配置。 |
边界:首反馈预算约束第一次可听反馈,实质回答预算约束有效内容开始播放,处理中信号用于在首反馈预算内说明真实等待。实质回答已及时开始时,不另加信号;达到预算仍无反馈属于超限,后补信号不能抹去记录。用户在等待中始终有可用取消入口,不必等到超限。
四、输出:一次说多长、说多少、怎么确认
前缀:voice.utterance
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 单话轮长度上限 | max_seconds | 正时长,按场景分别声明(问答/流程引导/长内容朗读)。用户主动请求连续朗读时可不适用,但仍须有暂停与定位。按实际播放语速和停顿计算,超出须分段,段间须存在可打断的间隙并告知尚有后续。 | 约束一次说多久(对应 V3-1)。 |
| 必选 | 并列项上限 | list.max_items | 正整数;超出须分批并提供导航(下一批/重复本批/按位置或名称选择)。禁止在未给出总数或范围提示的情况下开始逐项播报。 | 约束一次说多少(对应 V3-3)。 |
| 必选 | 确认强度 | confirm.style | 枚举:不确认/隐式确认/显式确认。按后果解析,不可逆动作至少显式确认。隐式确认只承接既有授权;逐字复述是内容核对格式,不是第四种授权强度。显式应答绑定行动、内容快照与有效条件,实际应答和授权记录属于运行事实,不能由配置预先生成。 | 决定哪些话需要用户点头(对应 V1-2)。 |
| 可选 | 结论位置 | answer_first | 布尔;默认 true。仅按 V3-2 的适用范围与边界解释例外,false 不取消正文禁止级要求;AI 身份、安全告警及必要前置条件可前置。 | 应答类交互应配置(对应 V3-2)。 |
| 可选 | 关键值播报格式 | critical.readout | 集合:金额/编号/日期时间/地址/账号。列入项须以便于核对的形式播报(分组、停顿、单位显式),且逐字重复随时可请求。 | 输出含需精确核对的值时配置(对应 V3-5)。 |
| 可选 | 专名发音规则 | pronunciation.lexicon | 经核验的词条、语境、语言与读音引用;空集合使用引擎原能力,但不能免除实际发音验证。引擎不支持词典时采用可验证的替代方式。 | 有专名、多音词或专业词汇时配置(对应 V3-7)。 |
| 可选 | 关键值本地化 | locale.format | 可解析规则引用:语言与地区、币种、单位、日期及时区、编号前导零与分组。只改变表达,不改值;歧义进入核对。 | 播报关键数值或跨地区信息时配置(对应 V3-5、V1-7)。 |
| 可选 | 不确定性表达 | uncertainty.style | 枚举:措辞区分并可追问/随结论说明依据与未知。按 V3-6 的适用范围与决策后果解析,不提供“不区分”以关闭必要信息。 | 输出含推断或检索结果时配置(对应 V3-6)。 |
| 可选 | 必须伴随可见的内容 | screen.companion | 集合:长列表/金额与账号/链接与地址/法律与费用告知;有屏且可访问时至少覆盖适用必需项。不能用删减集合取消 V3-4,不能强迫用户中途改为无法使用的视觉通道。 | 产品具备可用屏幕或可协同设备时配置(对应 V3-4、V7-4)。 |
边界:长度与项数管的是听觉负担,确认强度管的是后果,可见伴随管的是听觉承载不了的内容。三者的取值依据各不相同,不得由同一个"详略开关"统一控制。
五、声音:这是谁的声音、是不是 AI、能有多少情绪
前缀:voice.persona
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | AI 身份披露 | identity.disclosure | 固定规则引用,触发条件为"AI 实际承担对话回应",而非"产生了合成音频":首次交互以用户当前可访问的输出通道披露,对话中可再次获取,被问及时如实回答。启用语音播报且用户依赖听觉时不得仅以视觉标识替代;用户选择文字输出或使用辅助技术时,披露随该通道提供,不为披露强行开声。身份连续可知的同一对话不逐轮重播;新外呼或对话方变化重新披露。无关闭值。合成内容标识另由 synthetic.marking 承担,两者不互相替代。 | 让用户知道在跟什么说话(对应 V5-1)。适用法规可能提出更严格要求,以其为准。 |
| 必选 | 合成标识 | synthetic.marking | 机制集合及适用链路:音频水印/音频元数据/等效机制,至少一项。明确生成、导出、转码及重录的可检测范围;适用法规要求的元数据与显式标识不得被单一其他机制替代。禁止附带无关个人信息。 | 让这段音频离开当前对话后仍可被判定为合成(对应 V5-2)。 |
| 必选 | 声音来源 | source | 对象:kind 取完全合成/已授权真人声库/用户本人音色,authorization 为适用时的授权记录引用。本字段只记录声音来源类别与授权引用,不表示对话主体——实际由谁作出回应、单条音频的贡献归属属于运行事实,不由本字段推导。取后两项须可解析到授权主体、用途范围、内容范围与有效期限;授权撤回后新生成即阻断。 | 明确这把嗓子归谁(对应 V5-3)。真人借助合成方式表达时,按 V5-1 如实说明真人参与与合成方式。 |
| 可选 | 韵律参数 | prosody.rate · prosody.pitch · prosody.volume | 三个独立字段分别记录标量或引擎枚举、单位、基线、允许范围和步长;支持 SSML 时采用其对应合法语法,未支持时记录引擎实际语义与转换关系,不宣称等效。语速倍数、音高偏移和设备音量档位不可互换;软件音量不代表耳侧声压。有效值在设备能力和安全限值内尊重用户选择;适用 V3-7 的可访问语速、音量控制始终存在,可由平台承担。 | 具备对应韵律参数能力时配置(对应 V3-7);原生语音模型不必实现 SSML,但不得呈现无效调节控件。 |
| 可选 | 情感与风格范围 | affect.range | 集合,须逐项可解析到适用情境。禁止用于表达系统不具备的确定性、制造并不存在的紧迫性,或以模拟情绪换取用户让步。 | 具备情感或风格控制能力时配置(对应 V5-4)。 |
| 可选 | 人格可声称范围 | persona.claims | 集合:名称/语气风格/服务范围表述。禁止声称产品实际不具备的能力、身份或权限。须与能力清单同源维护。 | 设定语音人格时配置(对应 V5-5)。 |
| 可选 | 人机交接标识 | hand_to_human.announce | 布尔,AI 与人之间切换时固定为 true;须同时携带已收集信息(见 voice.fallback)。人在幕后审阅或改写 AI 回应的安排须一并告知。 | 存在人工坐席或人工介入能力时配置(对应 V5-6)。 |
边界:披露面向当下对话的人,标识面向这段音频之后的流转,来源面向声音本身的归属,情感与人格面向表达与事实的对应关系。四者分别成立,任何一项不替代其他三项。
六、复述:重复、回退、给多长时间回答
前缀:voice.recall
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 重复 | repeat.enabled | 布尔,适用时固定 true。重现最近实际播出的内容,不重新生成近似话;未播部分可继续或重听完整段落。缓存受保留与删除限制,重播重新裁决隐私;麦克风关闭时使用非语音入口。 | 语音里最基础的补救通道(对应 V4-1、V2-2)。 |
| 必选 | 回退粒度 | back.granularity | 枚举:上一问/上一步/可定位到已完成的指定步骤。不提供"仅能从头开始"。回退须保留其他步骤已提供的信息;级联失效的步骤须显式告知。 | 让说错一个字不必推倒重来(对应 V4-2)。 |
| 必选 | 响应时限 | response.timeout_s | 正时长或"不限制";从当前问题在用户选定输出通道完整可得、输入已就绪后起算,用户开始回答后转由端点规则处理;重听当前问题或获准延长后重新起算,不被无关提示刷新。设有时限时须事先告知、须可延长,且延长手段本身不依赖快速反应。到时禁止按同意、确认或默认选择处理。 | 决定给用户多长时间开口,以及不开口意味着什么(对应 V4-3)。 |
| 可选 | 超时行为 | on_timeout | 枚举:重述问题/降级为其他模态/保存进度后结束。不含"按默认值继续"与"视为确认"。已提供的信息须保留。 | 设有响应时限时配置。 |
| 可选 | 帮助可得性 | help.availability | 枚举:任意时刻可请求/任意时刻可请求并在失败时主动提示。两者均依当前环节返回可用线索;不提供“仅在系统提示后”。 | 任何多环节语音流程均应配置(对应 V4-6)。 |
| 可选 | 已知信息复用 | known_info.reuse | 枚举:任务内复用/任务内复用且跨会话沿用。跨会话沿用须让用户知道正在沿用什么并可更正;历史偏好不得覆盖本次对话中的明确表述。安全目的的重新验证须说明原因。 | 存在多环节或跨会话流程时配置(对应 V4-5)。 |
边界:重复管的是刚才说过的,回退管的是刚才做过的,时限管的是接下来要说的。三者共同承担"听者记不住"这一事实,缺任一项,另外两项都会被用来补它的缺口。
七、退路:不说话怎么办、找人怎么找、断了去哪接
前缀:voice.fallback
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 切换输入方式 | switch_input.when | 固定为任意时刻;适用 V7-1 时必选,无可切换通道时显式不适用,但不免除 V7-5 的替代完成路径;执行切换可以遵守必要的短暂状态同步,但不得要求用户等到话轮结束。目标不可用时如实说明并保留进度(对应 V7-1)。 | 让用户中途改用打字、按键或触屏(对应 V7-1)。 |
| 可选 | 输入输出组合 | io.combinations | 可用组合集合:语音入文字出/文字入语音出/语音入语音出/文字入文字出。双通道能力适用时须覆盖 V7-7 要求的组合,分别控制麦克风与播报,尊重辅助技术设置。 | 同时有语音与文字能力时配置(对应 V7-7);不可用组合不展示为可选。 |
| 可选 | 同步文本方式 | transcript.mode | 枚举:不提供/仅最终文本/流式临时文本与最终文本。仅最终文本不得称为同步字幕;临时内容有标识,修订与播放状态分别记录,关键值与语音一致。 | 提供文字伴随输出时配置(对应 V7-7);关闭不取消非语音完成路径。 |
| 必选 | 非语音完成路径 | non_voice.path | 路径集合,须可解析到具体渠道与入口,且成本不显著高于语音路径。产品形态仅有语音时,须声明这一限制并说明用户通过何种其他渠道完成同类事务。 | 保证"能用语音办成的事也能不用语音办成"(对应 V7-5)。 |
| 必选 | 转交人处理 | to_human.path | 路径与可达时段,须可在任意环节到达且不以先完成若干轮自助为前提;识别失败分支中须仍然存在。不代表机构处理事务的产品可显式声明不适用,但须同时声明其升级序列终点(见 voice.asr.nomatch.escalation)。 | 代表机构办事的语音产品的底线出口(对应 V7-2、V1-3)。 |
| 可选 | 转屏 | to_screen.mode | 枚举:不提供/推送摘要/推送完整内容与操作入口。推送内容的可见范围按目标设备重新裁决,不沿用当前裁决;接续前核对操作者与查看权限,失败不清空原进度。 | 存在可协同的有屏设备时配置。 |
| 可选 | 中断后接续 | resume.mode | 枚举:同通道接续/跨通道接续/同通道与跨通道接续。适用多步或有外部影响任务时不提供“不接续”;纯一次查询可记录不适用。恢复核对实际状态与授权,不重复提交;提交结果未知时先查询原动作,不直接重试。 | 语音承载多步任务时配置(对应 V7-3)。 |
| 可选 | 接续状态保留期 | resume.retention | 含数值与单位的正时长,表示进入等待、暂停、中断或本次运行结束后,接续所需最小工作状态的承诺保留期(最短保障,非最长保存上限);执行中持续保有必要状态,读取不续期。不以语音侧"最后写入时间"提前过期。同一任务在语音和文字入口共用一个起算事件与到期时刻,不建立更早到期的语音副本。连续非运行区间从首次进入起算,区间内切换状态不续期;恢复实际执行后再次进入时重新起算。用途保存上限不足时,须在用户依赖承诺前缩窄承诺或提供其他接续方式;已经作出的承诺不得静默缩短。用户明确删除进度时说明不可接续的后果,不得静默删除。到期后的可查询事实与不可恢复内容须明确。 | 启用任务接续时配置或继承任务状态保留策略(对应 V7-3);不等于录音保留。 |
| 可选 | 无屏必要告知补达 | no_screen.deliver | 集合:短信/邮件/应用内记录/账单条目。覆盖费用、法律义务、权利告知与错误后果四类。这四类禁止仅以一次性语音播报作为送达手段;补达内容须与语音实质一致。无补达渠道时,告知限制不构成豁免:以该告知为前提的办理动作不得在当前路径提交,须在动作发生前告知限制、提供可完成的替代渠道并保留进度。错误后果已发生时,如实说明影响与补达失败,提供可查询记录或可访问的人工处理路径,禁止声称已完成送达。 | 无屏或用户不便查看屏幕,且交互涉及上述四类内容(费用/法律义务/权利告知/错误后果)时配置(对应 V7-4、V2-2)。 |
边界:切换是换一条通道,转人是换一个处理方,接续是换一个时间点,补达是换一种送达形式。四者解决的是四种不同的"语音不够用",不可互相顶替。
八、在场:什么时候在听、留多久、旁边的人怎么办
前缀:voice.privacy
| 级别 | 设计决定 | Token 字段 | 类型与合法取值 | 适用条件与作用 |
|---|---|---|---|---|
| 必选 | 采集指示 | capture.indicator | 集合:灯效/提示音/视觉状态/触觉。满足方式二选一:(a) 至少一项在采集全程可感知,且至少一项不依赖注视屏幕;(b) 仅对经验证的无屏无灯设备形态,采用"可靠起止告知 + 任意时刻可查询当前采集状态 + 中途在场者可发现的说明或伴随指示"三者齐备。采用 (b) 时须登记该设备形态与验证记录;状态查询本身不得构成重新开麦的授权,也不得要求先开启采集才能查询。不得被应用层关闭到无任何可感知指示的状态;用户可更改形式,不可取消。与话轮指示(voice.turn.floor.indicator)分别成立。 | 让"在不在听"成为可核对的事实(对应 V6-1)。(b) 不能让目标场景中的在场者识别采集状态时,不承诺开放空间常听。 |
| 必选 | 常态监听范围 | always_listening.scope | 数据流策略引用,采集模式与处理位置分别记录,不合成一个枚举轴。须可解析到五项:①采集阶段(不采集/待机缓冲/触发后采集/持续采集);②本地处理(无/唤醒词检测/持续本地识别/其他本地音频处理,逐项说明);③离端条件(是否离开设备、在何种触发下离开、离开的是音频、转写还是派生特征);④保留引用(指向 recording.retention 中的对应条目;仅暂存则写明不持久保留及清除事件);⑤用途。"本地处理"不得因其在本地而略去声明。须可由用户关闭,关闭后实际停止采集而非仅停止响应;须声明关闭的作用范围(本设备/本账号/全部关联设备)。 | 数据边界的显式声明(对应 V6-2 分别说明待机、缓冲、采集、上传与持久保留的要求)。 |
| 必选 | 外放呈现级别 | speaker.output_level | 枚举:完整/摘要/仅存在性/不播报。根据内容敏感性、操作者权限、设备共享属性与收听方式解析。解析顺序:先取得目标端允许范围,再按语音空间限制收紧;未知一律按外放与共享解析;无共同允许范围(交集为空)或目标端拒绝时取"不播报",不得回退到"仅存在性";摘要或存在性本身仍敏感时也不播报。不播报不得暴露敏感事项的存在、类别或来源;必要的控制回执通过已获准、可访问的其他方式提供。 | 决定共享空间里念出什么(对应 V6-4)。 |
| 可选 | 采集数据保留 | recording.retention | 条目集合,每条绑定一个数据类别(原始音频/转写文本/误唤醒事件记录/派生特征),逐条可解析到:用途;起算事件(采集结束/会话结束/任务结束);保留时长为正时长或 不持久保留(零保留的显式表示,不得用 0 或留空代替);到期处置(删除/匿名化,匿名化须说明方法);本字段始终表示最长保存上限,不以同一数值同时表达最短恢复承诺。仅在内存暂存也须注明清除事件,不得写成无数据处理。须可由用户查看与删除,删除在可由产品控制的副本上生效,不可删除的部分须说明原因。删除音频不等于删除任务事实:fallback.resume.retention 承诺的任务状态另行解析,不因音频删除而一并消失,也不因音频保留而延长。 | 保留音频、转写、事件或派生特征时配置(对应 V6-5、V6-7);未持久保留也须在数据流策略中写明。 |
| 可选 | 误唤醒记录 | false_wake.review | 布尔,具备唤醒词触发能力时固定 true。包含误唤醒事件,不保留音频时显示存在与时间;不以启用此项为由新增全量录音。 | 具备唤醒词触发能力时配置(对应 V6-5)。 |
| 可选 | 第三方语音处理 | bystander.mode | 策略对象:mode 取无法区分而整体保守处理/可区分并限制第三方用途/按逐项有效许可处理;后者须有许可依据、用途和有效范围的可解析引用。"无法区分说话人"不得作为按用户本人数据处理的理由。 | 可能在多人环境中采集时配置(对应 V6-3)。 |
| 可选 | 声纹用途 | voiceprint.use | 集合:个性化/便利识别/经适用认证规范明确允许的认证用途。采用 NIST SP 800-63B-4 时不得含任何基于声音比对的认证用途,另加因素不能豁免。须有同意、删除与不依赖声纹的等效路径。 | 使用语音生物特征时配置(对应 V6-6、V1-4)。 |
| 可选 | 声音属性推断用途 | inference.scope | 策略条目集合;空集合表示关闭附加推断。每项含推断对象、用途、会改变的行为、许可条件、保留条目引用、退出与纠正路径。麦克风授权不是此项许可;运行中的实际推断结果不属于 Token。关闭后停止后续推断与缓存结果复用,基本语音功能仍可用。 | 由声音推断情绪、健康或年龄等属性时配置(对应 V6-7);未声明用途不得启用。 |
边界:采集指示说明此刻是否收音,数据流与保留策略说明去向和用途,呈现级别决定能否播出,第三方语音、声纹与属性推断分别处理主体和附加用途。开麦许可不替代其他用途的许可。
九、可选项的联动要求
能力可以不启用;启用后,依赖必须完整。常态监听、声音属性推断等能力被关闭时仍须保留不依赖该能力的基础完成路径。下表不新增字段或第三种级别,相关值可由产品规则继承。表内省略共同前缀 voice.。
| 能力或承诺 | 必须明确的依赖 | 未满足时 |
|---|---|---|
| 连续对话(非按住说话) | turn.endpoint.mode 与适用的 turn.endpoint.max_wait_ms 有效。 | 不承诺连续对话;回到显式触发的单轮交互。 |
| 任何适用 V2-5 的语音交互(含单轮与按键输入) | turn.floor.indicator 有等效的状态表达,至少一项不依赖视觉;区分接收输入、处理、播放与不可用。 | 话轮状态指示是 V2-5 的独立义务,不随连续对话能力一并降级;无法提供任何等效表达时,不以语音承载该交互。 |
| 打断 | turn.barge_in.enabled 为真时,turn.barge_in.stop_within_ms 须有经真实测量支撑的值,且未播出内容不计为已送达。 | 不提供不满足 V2-1 的语音对话;分段不能替代已启用语音输入时的打断能力。 |
| 不可逆动作可经语音发起 | utterance.confirm.style 为显式确认;asr.confidence.policy 走确认或澄清;utterance.critical.readout 覆盖相关值;确认与当前行动对象、关键值、后果及有效条件一致;关键内容变化使旧确认失效。 | 该动作不经语音直接完成,转其他模态或转交人处理。 |
| 合成语音输出 | persona.identity.disclosure 有效;persona.synthetic.marking 至少一项;使用真人音色时 persona.source 可解析到授权与期限。 | 不输出合成语音,或仅输出已明确标识的固定提示音。 |
| 情感或风格控制 | persona.affect.range 逐项可解析到适用情境,且与内容的事实状态对应;按 V5-4 的事实、限定可感知性与情绪施压判据逐项留有裁决记录。 | 使用中性韵律;不启用情感控制。中性韵律不构成对 V5-4 其余判据的免责。 |
| 多步语音流程 | recall.back.granularity 不为"仅能从头开始";recall.known_info.reuse 有效;fallback.resume.mode 与真实的状态保存能力一致,fallback.resume.retention 可解析。 | 不承诺多步办理;拆为可独立完成的单步交互。 |
| 设置响应时限 | recall.response.timeout_s 须同时具备告知与延长手段;recall.on_timeout 不含"按默认值继续"。 | 不设时限;等待由用户结束或由会话级规则收尾。 |
| 代表机构处理事务 | fallback.to_human.path 有效且在任意环节(含识别失败分支)持续可达;asr.nomatch.escalation 以"转交人处理"或"可完成该事务的换模态路径"为终点。人工可达是独立义务,不等于失败序列必须以转人结束;若产品选择强制以转人为终点,作为产品预设显式说明。 | 不以语音作为该事务的办理渠道。 |
| 涉及费用、法律义务、权利告知或错误后果 | fallback.no_screen.deliver 有效并覆盖上述四类,或 utterance.screen.companion 覆盖该内容且屏幕确实可用。 | 以该告知为前提的办理动作不在当前路径提交:在动作发生前告知限制、提供可完成的替代渠道并保留进度。错误后果已发生的,如实说明影响与补达失败,提供可查询记录或人工路径,不得声称已送达。 |
| 常态监听或唤醒词 | privacy.always_listening.scope 与真实的数据流向一致;privacy.capture.indicator 按设备形态覆盖采集区间且不可被应用层关闭;privacy.false_wake.review 为 true 且与实际保留策略一致。 | 不启用常态监听;改为显式触发。 |
| 保留采集或派生数据 | privacy.recording.retention 逐类明确最长时长、用途、起点与处置,且可查看、可删除。 | 不保留;仅在完成当前任务所必需的时间内处理。 |
| 声音属性推断 | privacy.inference.scope 与 privacy.recording.retention 按用途解析,许可独立于开麦,退出和纠正可达。 | 关闭附加推断,保留基本语音;不能仅告知风险后继续推断。 |
| 语音生物识别 | privacy.voiceprint.use 明确用途,认证用途符合适用标准;存在不依赖声纹的等效路径;asr.atypical.fallback 有效。 | 不使用声纹;以其他方式识别或验证。 |
| 多人环境使用 | privacy.bystander.mode 有效;asr.source.guard 覆盖未归属当前对话方的语音;话轮归属的边界与有效期可解析。 | 按不区分说话人的最保守方向整体处理。 |
| 跨设备协同(转屏、接续、提醒) | fallback.to_screen.mode 或 fallback.resume.mode 与真实能力一致;重新核对目标端操作者、查看权限与呈现范围;同一结果或提示在各入口按任务与事件去重,接续不重做动作。 | 不承诺跨设备接续;语音通道内自行收尾并如实告知。 |
| 时延承诺 | latency.measurement.profile、实质回答的 latency.answer.max_ms 与 latency.on_degrade 可解析;统计含播放端与端点等待。 | 不以首包时间或提示音证明达标;说明实际可验证的承诺。 |
| 误打断自动续播 | turn.barge_in.false_interrupt.mode 的判据、时限与播放位置有效;停止与新输入优先。 | 保持暂停,提供继续或重听;不重做任务。 |
| 语音与文字组合 | fallback.io.combinations 和适用的 fallback.transcript.mode 明确,字幕修订、播放状态、静音后的回执可访问。 | 不承诺不可用组合,按 V7-5 提供可完成任务的替代。 |
"继承默认"必须能解析到明确的值、来源与适用条件,不能只是一句说明。时长类字段的"继承默认"还必须解析到具体场景——一个不区分问答与听写的全局静音阈值,不构成有效的继承。
9.1 四种配置状态,不可混用同一种空值
| 状态 | 含义 | 记录要求 | 处置 |
|---|---|---|---|
| 已解析 | 可解析到明确的值、来源与适用条件 | 值 + 来源 + 适用条件 | 正常生效 |
| 不适用且有理由 | 该能力在本产品或本机制下不存在 | 理由 + 判定依据 | 不生效,不计为缺失 |
| 显式关闭且值域允许 | 产品主动选择不启用,且该字段允许此取值 | 取值 + 决定人 | 按该取值生效 |
| 缺失或不可解析 | 未配置、引用悬空、适用条件缺失或取值非法 | 缺口记录 | 见下 |
运行观察中另有 未知(如置信不可得、收听方式未知),属运行事实,不写入配置状态,按各字段的保守分支处理。
缺失或不可解析时:停止承诺对应能力,不得用引擎默认值顶替,不得因缺值而扩大采集范围、放宽呈现级别、缩短已承诺的保留期或取消已承诺的替代路径。
9.2 预设记录:先记录决定,再证明可用
以下为填写模板,不是实测案例或推荐值。尖括号表示项目待填内容;保留占位符的记录不能标为已解析。
| 项 | 填写内容 |
|---|---|
| 场景与任务 | <短指令/问答/听写/办理,及目标用户、语言、设备与网络> |
| 字段与取值 | <完整 voice.* 字段、合法取值、单位> |
| 决定者 | <产品负责人;参数映射与验证负责人> |
| 来源与证据 | <实际测试记录或已验证产品预设;样本、条件与失败范围> |
| 实现映射 | <真实引擎字段、单位换算、实际能力;固定行为写规则或机制引用> |
| 生效点 | <立即/下一段播放/下一话轮/新会话,及范围> |
| 依赖与冲突 | <关联字段、固定底线及冲突后的可用出口> |
| 失效条件 | <语言、声线、端点机制或目标用户范围改变等> |
| 缺失处置 | <可实际执行的回退;不能填“自动优化”> |
| 状态 | <已解析/不适用且有理由/显式关闭/缺失或不可解析> |
当模型、声线、语言或音频链路变化使证据不再覆盖当前条件时,重验受影响的端点、停声、发音、可懂度与置信校准;未取得证据前采用已经验证的模式或缩小承诺,不凭配置值未变宣称体验不变。
9.3 解析顺序与冲突处置
- 确认产品实际启用的能力及规则适用范围;固定底线始终生效。
- 载入与任务、语言、设备相符的产品预设;继承引用须可达、无循环,并解析到具体值和依据。
- 在允许范围内应用用户的语速、音量、应答时间及通道选择;同范围下,本次明确选择优于历史偏好。
- 用当前权限、采集能力和收听路径等运行事实限制可执行结果;不能把未知事实补成有利假设。
- 检查依赖与取值组合,输出有效值、来源、生效点与回退。无共同可用范围则停止受影响能力,保留合法替代;不由解析器随意改值“修好”。
| 组合检查 | 合法条件或处理 |
|---|---|
endpoint.mode × input.mode | 显式端点必须对应显式提交;自动端点不可在未完成提交时抢先执行。 |
endpoint.silence_ms × endpoint.max_wait_ms | 静音阈值不大于等待上限;相等时上限保护分支优先,不靠竞态触发提交。 |
first_audio.max_ms × answer.max_ms | 同场景首个反馈上限不大于实质回答上限;用户选择无声输出时按等效可访问反馈测量,记录口径,不伪报首音。 |
barge_in.backoff_ms × 首个反馈承诺 | 起点不同,不能直接比数值;通过完整时间线验证静默结束与后续反馈仍满足承诺。 |
输出长度 × prosody.rate | 放慢后按最终音频重新分段,不通过加速抵消用户选择。 |
| 接续保障 × 数据保存上限 | 最短保障不得超过允许保存的上限;在作出承诺前解决冲突,既有承诺不得静默缩短。 |
speaker.output_level × 转屏/重听 | 每次按当前操作者和通道重算;拒绝播放时也不能泄露存在性。 |
9.4 决定权与生效时点
| 决定 | 谁可决定 | 对进行中交互的效果 |
|---|---|---|
| 停声、退出、撤销采集权限 | 用户直接操作,系统执行 | 控制路径立即处理并给真实回执,不等话轮结束;已提交动作另核对结果。 |
| 收听路径变化与隐私收紧 | 实际路由、权限与内容策略共同决定 | 新输出前暂停、清缓存并重算;耳机接入不自动取得查看权限。 |
| 语速、音量、表达风格 | 用户在能力与安全范围内选择 | 当前播放可调整则立即调整,否则下一可替换音频段生效并允许重听;不重做任务。 |
| 端点机制与失败预算 | 产品与语音工程依据实测制定 | 在话轮边界或新会话生效,避免一句话用两套端点规则;不能重置当前问题的总失败计数。 |
| 声音属性推断 | 用户独立选择,产品校验许可 | 关闭后停止新推断和对应缓存复用;已有数据删除按已声明范围单独处理。 |
| 接续保留期 | 产品承诺与用途限制共同约束 | 不以更短的新预设静默覆盖正在受保障的任务;用户主动删除另行说明后果。 |
十、固定底线:不能通过配置关闭
听与说。临时转写可修订,关键值修订使相关旧确认失效;隐式确认不产生新授权。识别结果是带不确定性的假设,置信不可得时按低置信处理;低置信不直接触发不可逆动作。系统自身回声、外部媒体声与未归属当前对话方的语音不作为指令来源;音频中出现的指令性内容不因被听见而获得指令权威。用户可以停止系统的语音输出;语音输入有效时除法定或安全必需且已声明范围的片段外不存在不可语音打断的输出;输入关闭时仍保留非语音停止;被打断而未播出的内容不计为已送达,已执行的动作不因打断而消失且须如实说明。自动话轮结束判定的起算事件、重置条件与等待上限明确,不截断持续表达;到达等待上限不构成用户已说完的证据。
可懂度与通道。语速和音量有可访问的控制;专名与关键值验证最终发音。用户可请求精确朗读,不因默认简短丢失内容。具备双通道能力时输入与输出分别选择;字幕、播报与任务结果的关键值一致。语言覆盖分别落实到识别、端点和合成,不以切换语言清空任务。
记与忘。重复最近一次实际播出的内容随时可用且可多次请求;多步流程可回退且不必从头开始;用户已提供且仍有效的信息不在同一任务内被重复索取,历史偏好不覆盖本次对话中的明确表述。没有回答不是同意:响应时限须可延长,超时不得被作为同意、确认或选择默认项的依据;对话结束不推进用户未确认的流程。
身份与声音。AI 实际承担回应时,用户在首次交互时即通过其当前可访问的输出通道得知正在与 AI 对话(依赖听觉时不得仅以视觉标识替代,也不为披露强行开声),被问及时如实回答;真人借助合成方式表达时不被标注为 AI 对话;合成语音携带可被机器识别的标识。可识别为特定真人的声音须有该本人的授权且可解析到范围与期限,撤回后停止新的生成。情感与韵律不表达系统不具备的确定性、不制造并不存在的紧迫性、不以模拟情绪换取用户让步;人格不声称产品实际不具备的能力、身份或权限。AI 与人之间的交接必须明示。
在场与空间。音频被采集时,在场者可核对采集状态——持续可感知的指示,或经验证设备形态上"可靠起止告知+任意时刻可查询+中途在场者可发现"的等效替代;该指示不可被应用层关闭到无,状态查询不构成重新开麦的授权。常态监听的本地/离开设备边界、保留期限与用途可知,且可由用户关闭并实际停止采集。误唤醒产生的记录不被排除在可查看范围之外。非本人语音不默认用于个性化与训练,"无法区分说话人"不作为按本人数据处理的理由。共享空间与外放场景下,私密内容仅输出已确认可公开的部分,摘要或存在性仍敏感则不播报;收听方式未知按外放解析;目标端裁决为不呈现、或与语音侧无共同允许范围时不播报,且不暴露该事项的存在、类别或来源。声音来源防护不排除用户主动使用的辅助沟通设备输入。声音属性推断须按独立用途与许可处理,不以开麦推定同意;推断不当作用户已确认事实,关闭后保留基本语音功能。语音生物特征不作为高后果操作的唯一认证依据;采用禁止声音比对的认证标准时完全禁用该认证用途。耳机断连或输出路径改变时先暂停私密播报,再重新裁决。
退路。用户可在对话进行中的任意时刻切换输入方式,切换后已提供的信息保留。可经语音完成的任务存在不依赖说话与听觉的完成路径。代表机构处理事务的产品存在可在任意环节到达的人工路径,识别失败时该路径不消失。识别或理解连续失败时换策略而非重复同一提示。对话中断时任务进度与已提供信息保留、可获知、可接续,且恢复不重复已发生的外部影响。费用、法律义务、权利告知与错误后果不以一次性语音播报作为唯一送达手段;无补达渠道时,以该告知为前提的动作不在当前路径提交,且不得声称已完成送达。
以上承接《语音交互设计规范》的适用要求;本字典不替代整套规范,也不构成安全、隐私或法律合规证明。适用法规对 AI 身份披露、合成内容标识、生物特征与录音留存可能提出更严格或更具体的要求,以其为准(见 reference.md 第四、五节)。
配置交付与校验
两个时限均从用户实际结束表达起算,以播放端事件结束;实质回答上限不小于同场景首反馈上限。处理中信号不能计作实质回答,补播不能改写超限结果。此处示例毫秒值仅检验大小关系,不作为任何语言、任务或框架的推荐性能。
随附的可执行样例只覆盖 voice.latency.first_audio.max_ms、voice.latency.answer.max_ms,其余字段按本字典逐项校验;未覆盖不等于不适用或已通过。样例是所选字段的格式正反例,不是可直接启用全部能力的产品预设。完整产品交付另外包含适用性、依赖、证据、执行映射及进行中操作的生效边界。
字段名、类型或含义变更时更新引用方与验收样例;仅修改说明且不改变合法行为的,保留已有字段名。调用方读取解析后的有效配置,不由 UI 控件、动画或模型文字反推权限、测量或完成事实。参见对应场景。
参考来源
配套 设计规范 与 Design Token。来源支持具体需求或机制,不自动决定本规范的约束强度;下列规范性要求还包含针对语音失败场景的设计推导。
网页查阅日期:2026-09-16。阅读范围限于表中所列章节;未进行产品性能实验、用户研究或完整法律适用审查。
一、如何使用证据
| 来源类型 | 可以支持 | 不能推出 |
|---|---|---|
| 正式法规与标准 | 在适用主体、产品、地域和情境内的具体要求 | 把局部要求当作所有语音产品的通用法律义务 |
| 用户需求与研究草案 | 真实需求、可能的障碍与验证方向 | 把需求文件当作认证清单,或把建议秒数当作普适阈值 |
| 官方工程文档 | 特定机制、事件和配置的实现方式 | 引擎默认值能直接保证端到端体验 |
| 平台设计指南 | 确认、纠正、表达结构等设计方法 | 所有行业必须采用同一种话术或交互流程 |
“必须”表示本规范对适用产品提出的要求。项目需记录其行为选择、可核对事实和用户反馈;引用数量不等于证据强度。
二、无障碍与可理解表达
| 来源 | 阅读范围与性质 | 用于哪些设计判断 |
|---|---|---|
| W3C Natural Language Interface Accessibility User Requirements | 文档状态、§6.2、§6.4、§6.6;Group Draft Note,非 W3C Recommendation | 输入输出可独立选择,识别置信需校准,语速音量可调,重复、帮助、应答时间和发音需要可用;对应 V1-1、V3-7、V4、V7-7。 |
| W3C Cognitive Accessibility Research Modules — Voice Systems and Conversational Interfaces | 文档状态、§3 用户需求、§4 可能方案;早期 Group Note Draft | 避免记忆负担、复杂词汇和错误循环,提供返回与人工入口;对应 V1-3、V3-2、V3-3、V4-2、V7-2。 |
这些资料不证明一个产品已经可访问。模拟蒙眼、静音或口音输入可以发现机制缺口,不能替代目标用户参与。中文混说、同音姓名、前导零、跨时区日期及非典型语音的具体测试,是本规范据任务风险提出的验证设计,不宣称存在通用准确率。
三、对话确认与纠正
Google Conversation Design — Confirmations区分确认方式,强调在误解成本较高时核对关键参数,并支持一步纠正,不应让用户因修改一项信息而重新开始。
用于 V1-2、V4-2 的设计依据。它是平台设计资料;页面可访问不表示其相关平台能力仍可部署。本规范进一步要求确认绑定行动内容与后果、关键值变化后失效,这属于产品行为要求,不能仅靠复述话术实现。
四、工程机制与测量
4.1 话轮与打断
LiveKit Turns overview的检测模式、手动话轮、打断及误打断段落提供实现参考:自动端点与显式提交有不同输入路径;误打断可以配置暂停或续播。资料描述的一类误打断依据是没有转写结果,本规范要求另外核对停止、新输入和漏识风险,不能直接把空转写视为无有效表达。
| 工程能力 | 对应决定 | 映射时必须核对 |
|---|---|---|
| 静音检测、语义或专用端点 | voice.turn.endpoint.mode 及适用参数 | 真实机制、输入语言、起算事件和上限;没有分数时不填置信概率 |
| 手动话轮提交 | voice.turn.input.mode | 按下、松开、提交、取消的区别;显式提交不能被自动端点抢先执行 |
resume_false_interruption 与 false_interruption_timeout | voice.turn.barge_in.false_interrupt.mode | 实际等待单位与判据;该文档中 Python 用秒、Node.js 用毫秒,落地需核对所用接口 |
| 中断与播放控制 | voice.turn.barge_in.stop_within_ms | 引擎取消不等于播放端停声;需清理客户端和设备缓冲 |
只记录实际支持的映射;没有直接对应工程参数的 Token 可以由多项机制共同兑现,但必须通过实际输出验证。不要为方便填表而虚构一个一对一配置键。
4.2 输入与采集事实
W3C Media Capture and Streams的媒体流生命周期、权限和 §15 采集指示要求,为区分设备可用、权限允许与实际采集提供参考。它面向浏览器实现,不能直接证明开放空间中旁观者已获知采集。
V2-5、V6-1、V6-2 将这一事实区分用于产品交互:拒绝权限、设备被占用、连接断开和用户未发声分别处理,界面指示必须与实际数据流一致。
4.3 韵律与最终音频
W3C Speech Synthesis Markup Language的 prosody 定义提供语速、音高和音量的语法与相对基线;同一个数值在不同处理器中不保证相同听感。
用于 V3-7 和 voice.persona.prosody.*。不支持 SSML 的引擎应记录自身单位与能力。文本、参数和最终音频要分别检查,尤其注意否定、专名、数字和限制条件。
4.4 测量不是配置
| 事实 | 测量口径 | 不可替代物 |
|---|---|---|
| 实际表达结束 | 测试人员标注的表达完成时刻;线上估计须说明误差 | 引擎端点事件 |
| 首反馈、实质回答 | 分别测量用户表达结束至播放端开始反馈、开始有效回答 | 服务端首包、提示音或填充语 |
| 打断停声 | 实际开口→检测、检测→实际停声两段 | 单个取消回执 |
| 播放与理解 | 播放日志只能证明已输出;理解由用户研究检验 | 已生成内容或完整文本 |
| 业务结果 | 原操作的实际执行回执或状态查询 | 语音里的“已完成” |
具体指标、分母、样本分组与缺测处理见规范附录 C。本规范不提供跨场景通用的毫秒、语速、列表项数或样本量默认值。
五、声音身份、数据用途与认证
| 来源 | 阅读范围 | 支持及限制 |
|---|---|---|
| 欧盟人工智能法案,第 50 条 | 直接交互披露、合成内容标识、部分推断系统的告知与适用边界 | 对话主体、合成音频与声音属性推断属于不同问题。义务按系统类型和主体分别判断;披露不使被禁止的用途合法。对应 V5-1、V5-2、V6-7。 |
| 国家网信办等《人工智能生成合成内容标识办法》 | 第 2–5 条及导出相关内容 | 区分显式标识与文件元数据隐式标识,音频标识形式需按适用场景判断;不能以“采用水印”代替所有标识要求。对应 V5-1、V5-2。 |
| NIST SP 800-63B-4 | §3.2.3,尤其声音生物特征比对条款 | 采用该认证体系时不得使用基于声音的生物特征比对,另加验证要素不能豁免;不把此要求扩大成所有低后果声音个性化功能的禁令。对应 V6-6。 |
这些来源不提供“只要告知或取得同意,就可以使用任何声音推断”的许可。V6-7 中用途分离、拒绝附加推断后保留基本功能、推断不冒充用户事实,是本规范的独立设计要求。
六、需要项目补充的证据
- 性能与可访问性:目标语言、设备、网络、噪声、听说及认知需求的真实样本;分别验证典型和尾部表现。
- 来源归属:电视、回声、旁人、重放与 AAC 输入的实际混淆;唤醒窗口与声纹都不能单独证明授权。
- 最终音频:专名、数字、限定与语速调节;情感风格不能用一个“中性”标签证明不误导。
- 标识链路:生成、下载、转发、转码及声明支持的扬声器重录,逐段测可检测性;元数据不会随声波自动保留。
- 具体法律与领域条件:录音同意、生物特征、儿童、医疗、驾驶和外呼等须按真实用途判断,本文不提供整体合规结论。
规则、字段和示例的文档检查,与真实系统测试、目标用户研究分开记录。来源证明机制或需求存在,不证明当前产品已经兑现承诺。