A3.12.1Timbre研究设计

音色由基频之上的谐波结构决定,是区分声源的主要线索

别名: 音色 · 谐波结构 · 频谱包络 · spectral envelope · harmonic structure

概念解释

钢琴和小提琴演奏同一个音高、同样响度,仍然一听就能分辨出是哪种乐器,靠的既不是音高也不是响度,而是音色(timbre)。音色由基频之上一整套谐波(泛音)的相对强弱构成的频谱形状决定,这个形状叫频谱包络(spectral envelope)。只要两个声音的基频和总能量相同,唯一能透露"这是什么声源"的信息就藏在这套谐波结构里。

音色常被笼统理解成"音质好不好",其实它首先是一种分类线索——是人耳用来把声音归到不同来源类别的主要依据,音质好坏只是它的一个应用侧面(见相邻条目)。

机制

一个振动物体很少只发出单一频率,它会同时以基频和一系列整数倍于基频的泛音振动,各次泛音的相对强弱由振动体的材质、形状、激励方式共同决定——木质共鸣箱和金属簧片会以完全不同的比例放大或压制某些泛音。这套各次泛音强弱的分布,就是频谱包络,它相当于声源的一份"频谱指纹":基频决定了音高,指纹本身则携带声源身份信息,两者是正交的两套信息,互不干扰。

听觉系统对频谱包络的形状高度敏感,能在音高、响度都固定的情况下,仅凭谐波强弱分布的差异把不同来源分开识别。此外,声音起始瞬间(attack)的谐波变化速度往往比稳态阶段携带更多身份信息——真实乐器和人声的起音阶段谐波结构变化很快,这也是为什么截去起音只保留稳态谐波,音色辨识会明显变难。

怎么研究

常见做法是构造一组基频与总能量都固定、仅谐波振幅分布不同的合成音,让被试做相似性判断或分类任务,再用多维尺度分析(multidimensional scaling)把主观相似度投射到几个连续维度上,考察这些维度与频谱质心、谐波衰减速率等物理量的对应关系,这套方法通常被称为音色空间建模。

常见自变量:各次谐波的相对振幅、频谱质心(能量分布的重心位置)、起音阶段谐波变化的速度。 常见因变量:相似性评分、分类正确率、音色空间中的维度坐标。

边界

  • 稳态谐波结构不是音色的全部:把一段真实乐器录音的起音部分剪掉、只保留稳态谐波循环播放,识别准确率会明显下降,说明起音阶段的瞬态变化单独携带着不小一部分身份信息,仅分析稳态频谱包络会低估真实的辨识难度。
  • 纯音(只有基频、没有谐波)之间没有音色差异可言,这条机制只在包含谐波结构的复合音上成立。
  • 音色空间的维度划分依赖具体测试用的声音集合,换一批差异更大或更相近的声源,提炼出的维度数量和含义会变化,不存在一套放之四海而皆准的"音色维度"清单。

怎么落地

  • 需要设计一组"一听就知道是同一类事件"的提示音(比如同一应用内所有确认类操作),保持谐波结构的整体轮廓一致,即使改变音高也能维持类别辨识度;反之要让两类事件听起来分属不同来源,改变谐波结构比只改变响度更可靠。
  • 不要只截取声音的稳态部分做压缩或裁剪来省资源,起音阶段的谐波变化是身份识别的重要部分,裁掉它会让声音变得难以归类,即使频谱包络的稳态部分保留完整。
  • 验证办法:制作同一基频、同一响度但谐波结构不同的几个候选音效,请听众在盲听条件下做分类或相似性排序,确认设计意图中的"应该听起来不同/相同"的声源确实被听众按预期归类,而不是想当然认为改了音色听众就能分辨。

延伸

  • 同组A3.12.2 压缩编码丢失的谐波细节会改变音色而非仅降低响度 · A3.12.3 拟真音效通过匹配材质的谐波特征暗示物理属性 · A3.12.4 语音的音质特征会影响用户对内容可信度的主观判断
  • 相邻A3.11 音高辨别 · A3.07 警报声的可辨识性
  • 站内检索timbre · spectral envelope · harmonic structure · multidimensional scaling of timbre

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/A3.12.1