同时发声的多个来源需要依赖起始时间差异才能被分离
别名: 起始时间差 · 起音异步 · common onset
概念解释
前面几条讲的都是先后出现的声音怎么归到不同流里,这条讲同时发声的情况:如果几个声音成分完全同时开始,听觉系统很容易把它们当成一个整体听成单一的声音;只要其中一个成分的起始时刻比其余成分早或晚出来那么几十毫秒,哪怕差异小到几乎察觉不到,这个成分也会被从整体中"拽出来",被单独听成一个独立的声音。这个起始时刻上的差异叫起始时间差异(onset asynchrony),是听觉系统分离同时发声来源最有力的线索之一。
它和前面讲的"先后声音怎么连成一条流"是两回事:那几条处理的是序列中的归属问题,这条处理的是同一时刻叠在一起的声音怎么被拆开。
机制
真实世界里,同一个物理事件产生的所有声音成分几乎总是同时开始振动——一根弦被拨动,它的基频和各次谐波是同一时刻一起启动的。听觉系统把"完全同步起音"当成"这些成分来自同一个事件"的默认证据,于是倾向于把同步开始的成分合并处理,当成一个整体的音色去识别。
一旦某个成分的起始时刻和其余成分不同步,这条默认证据就被打破:不同步起音意味着这个成分很可能来自另一个独立的振动过程,即便它的频率恰好和其余成分构成整齐的谐波关系(本来最容易被当成同一来源的强证据),只要起始时间对不上,听觉系统仍然倾向于把它单独摘出来。这说明起始时间差异这条线索的权重相当高,能够压过频率关系带来的融合倾向。
怎么研究
经典做法是构造一组谐波复合音(基频与若干次谐波同时呈现),让其中一个谐波分量的起始时间比其余分量提前或推迟一段时间,操纵这个起始时间差的大小,测量被试能否把这个分量单独"听出来"(报告为一个独立的音色成分),或测量它对整体音色识别的影响强度随起始时间差增大如何变化。
在界面研究里,这套逻辑常用于评估多路声音同时触发时,是否需要人为错开它们的起始时刻,才能保证每一路都被听成独立、可辨认的事件,而不是糊成一团。
边界
- 起始时间差异只是众多同时性分组线索之一,当其他线索(比如空间位置、明显不成谐波关系的音色)已经很强时,起始时间差异的作用会被削弱或掩盖,不能孤立看待。
- 差异过大时,效应会转化为另一种知觉——不再是"从整体里被拽出的一个独立音色成分",而是彼此完全无关的两个先后事件,二者的知觉体验并不相同。
- 混响环境会模糊起始时刻本身(声音的起音边缘被拖尾拉平),这条线索在强混响场景下的可用性会明显下降,不能假定它在任意声学环境里都同样有效。
- 这条讲的是能不能被听成独立的声音成分,不涉及这几个同时响起的声音谁盖过谁、谁听不见——那是响度层面的另一个问题,判断标准不同,不要混为一谈。
怎么落地
- 多路提示音有可能被同时触发时(多个通知、多个警报叠加),把它们的起始时刻错开几十毫秒,比单纯改变音色更能保证每一路仍然被听成一个独立、可识别的事件。
- 需要设计一组"叠加播放却要求各自可辨"的声音时,避免让所有分量严格同步启动,哪怕它们的频率、音色已经区分得很清楚,同步起音仍然会拉低可分辨性。
- 验证办法:把候选声音以完全同步和错开若干毫秒两种方式分别播放给听众,让他们说出听到了几个独立的声音成分,用报告数量而不是设计者自己的判断来确认错开量是否足够。