D2.06.1Speech for meaning, not structure设计研究
语音适合传达含义,不适合传达结构
别名: speech output · auditory structure · TTS
概念解释
语音擅长传达含义,不擅长传达结构。一句话把内容说清楚很容易,但把「这句话在整个信息层级中的位置」说清楚很难。层级、并列、分组这些结构信息在屏幕上一目了然,转为语音后必须被逐句念出,才勉强存在。
机制
原因在于语音是严格流式的。听者无法停在某处回看,也无法在听到第五项时把它与第一项并排比较;工作记忆必须在脑中暂存前面听过的内容,才能建立关系。当结构复杂时,需要暂存的项目数超过工作记忆容量,理解就会崩塌。屏幕则把结构外化在空间里,浏览时无需记忆负担。等价地,语音中的结构提示(「第一项」「以下三点」)之所以重要,是因为它们把空间关系临时编码进时间序列。
怎么研究
可通过复述与检索任务比较同一内容的口头与书面呈现:给定层级列表或表格,测量用户能否正确复述条数、指出某项所属的组,以及定位特定条目所需时间。自变量常包括列表长度、层级深度与是否提供结构提示语。研究应报告听觉呈现速率,因为语速直接决定工作记忆的负荷窗口。
边界
长度很短、顺序不重要、且用户只关心单一含义时,语音的结构劣势不明显,例如「已保存」「有五条新消息」。当内容本身就是一个序列(操作步骤、时间线)时,语音与结构反而不冲突,因为时间顺序即语义顺序。因此这条限制针对的是层级与并置关系,而不是一切多项目内容。
怎么落地
- 语音只承载需要被理解的结论、确认与提示,把层级、并列与分组交给屏幕。
- 必须口头呈现列表时,用显式的序号与分组提示语,并把长度控制在可暂存的范围内。
- 为语音内容提供可回看的文本等价物,让结构能在空间里被重新检查。
- 验证方式:让用户听完一段内容后复述条目数量与所属分组,若结构复述错误率明显高于内容复述错误率,说明结构承担过重。