A3.12.2Lossy audio compression alters timbre研究设计

压缩编码丢失的谐波细节会改变音色而非仅降低响度

别名: 有损压缩 · 感知音频编码 · 比特率 · codec artifacts

概念解释

一段语音或音乐经过低码率的有损压缩(比如老式的语音编解码器、压缩比很高的音频格式,或者蓝牙传输里降级使用的编解码方案)后,听起来会变"薄"、变"闷"、带一点金属感——这些描述指向的都是音色发生了改变,而不是单纯的音量变小。压缩带来的失真首先动的是谐波结构,不是整体响度。

这一点容易被误判:设备音量调低和压缩损耗听起来都会让声音"不够响亮",但压缩造成的是声音性质上的改变,调大音量并不能把丢失的谐波细节找回来。

机制

主流的感知音频编码方案依赖一套心理声学掩蔽模型:算法预测哪些频段的能量即使被丢弃或粗略量化,也会被同时存在的更强频段掩蔽掉、人耳察觉不到,从而把码率预算集中在"听得出来"的部分。码率越低,这套模型能保留的谐波细节就越少,通常从高次谐波、以及被判定为不显著的中间谐波开始被截断或粗糙量化。

问题在于,谐波结构正是决定音色的那套频谱指纹(见相邻条目):高次谐波被砍掉之后,声源原本的频谱包络形状被截断变窄,听感上的直接结果就是音色变化——声音失去原有的丰满度和材质感,而不是简单地"声音小了"。响度感知主要由声音的总能量决定,压缩通常不大幅改变总能量,所以响度基本维持原样,改变的是能量在频谱上的分布方式。

怎么研究

常见做法是对同一段素材分别用不同码率或不同编解码方案压缩,让被试在主观质量评分(如平均意见分,mean opinion score)任务中打分,或做ABX 判别任务(判断 A、B 两个版本哪个和参照 X 一致)来测出人耳能否分辨出差异;同时用频谱分析比较压缩前后的谐波振幅分布,把主观评分下降和客观谐波丢失量对应起来。

常见自变量:编码码率、编解码算法类型、素材本身的谐波丰富程度。 常见因变量:主观质量评分、ABX 正确辨别率、压缩前后频谱包络的差异量。

边界

  • 在当前主流的较高码率编码(如常见格式的中高码率设置)下,谐波损失通常已经小到大多数听众难以在盲听中可靠辨别,这条机制最明显地体现在低码率场景,比如早期或简化的语音通话编解码器、为省流量而大幅降低码率的音频、或蓝牙传输中因带宽受限而降级使用的编解码方案。
  • 谐波结构本身越丰富、越依赖高频细节的声音(弦乐、镲片一类的打击乐)在压缩中的音色变化通常比谐波结构简单的声音更容易被察觉,不能用一种素材的测试结果去代表所有素材。
  • 这条讲的是压缩对音色的改变,如果压缩方案本身还引入了明显的响度归一化或动态范围压缩处理,响度层面的变化需要单独判断,不要把两种失真混为一谈。

怎么落地

  • 为承担身份识别功能的声音资产(品牌提示音、需要一听就分清类别的通知音)选择编解码格式和码率时,不能只看文件体积或整体音量是否达标,需要专门检查压缩后谐波结构是否仍能维持原有的辨识度。
  • 如果产品的音频必须经过已知会大幅降级的传输链路(低带宽语音通话、某些蓝牙编解码模式),应当针对这条链路重新测试关键提示音是否还能被正确归类,而不是只在未压缩的设计稿阶段验收。
  • 验证办法:把设计好的提示音分别用目标传输链路实际会用到的编解码参数处理一遍,请听众在盲听条件下判断压缩后的版本能否仍和未压缩版本对应同一类事件,用识别正确率而不是"听起来还行"作为验收标准。

延伸

  • 同组A3.12.1 音色由基频之上的谐波结构决定,是区分声源的主要线索 · A3.12.3 拟真音效通过匹配材质的谐波特征暗示物理属性 · A3.12.4 语音的音质特征会影响用户对内容可信度的主观判断
  • 相邻A3.04 听觉掩蔽 · A3.09 环境噪声与信噪比
  • 站内检索lossy audio compression · perceptual audio coding · mean opinion score · codec artifacts

同组卡片

快捷操作

分享

分享当前页面

ios_share

https://hci.top/zh/handbook/A3.12.2