自然界中的声音本质上是连续变化的机械波。声源振动引起空气分子疏密交替传播,声波在时间和幅度两个维度上都是连续变化的。用数学语言描述,声音信号是一个时间连续、幅度也连续的模拟信号。
计算机只能处理离散的二进制数据,既无法表示无限细分的时间点,也无法表示无限精度的幅度值。将模拟音频存入计算机,必须在两个维度上同时离散化:在时间轴上按固定间隔抽取信号瞬时值,这一操作称为采样;在每个采样点上将连续幅度值映射到有限个离散等级,这一操作称为量化。两者共同构成模拟到数字转换的完整技术链路,缺一不可。多媒体应用设计师考试中,对采样和量化的区分是一个基本考点,要求考生能准确说出每个操作处理的是哪个维度。
采样过程的实质是对连续信号的时间离散化。采样器每隔固定时间间隔获取一个信号幅度值,该间隔的倒数即为采样频率,单位是赫兹,表示每秒采集的样本点数。采样频率越高,单位时间内获取的样本点越多,对原始波形的还原就越精确。反之,采样频率过低会导致样本点之间丢失过多信息,重建波形与原始信号产生严重偏差。采样的数学本质可以理解为用周期冲激序列与原始信号相乘,在时域上每隔一段固定距离截取一个点,在频域上则表现为原始信号频谱以采样频率为周期进行复制延拓。
量化过程处理的是幅度维度的离散化。量化器将连续幅度值划分到有限个量化等级上,每个等级对应一个二进制编码,量化等级总数决定了每个采样点用多少比特表示。若量化位数为B位,量化等级总数为2的B次方个。量化位数越高,幅度分辨率越精细,引入的误差越小,信噪比越高。
模拟到数字转换的硬件核心是模数转换器,简称ADC芯片。其内部集成了采样保持电路和量化编码电路。采样保持电路在采样脉冲到来时捕获模拟信号的瞬时幅度值并保持稳定,随后量化编码电路将幅度值与参考电压比较,输出对应的二进制数字码。现代音频ADC的采样率可达192kHz,量化精度可达24位或32位。
采样和量化虽是两个独立维度,但共同决定了数字音频的总数据量。每秒数据率等于采样频率乘以量化位数乘以声道数,这是多媒体应用设计师考试中最核心的计算关系,几乎所有涉及音频参数的题目最终都要回到这个公式上来。需要特别强调的是,数据率公式中的量化位数必须是每个采样点的比特数,若题目给出的量化等级数而非位数,需先用对数换算。
香农采样定理,也称奈奎斯特采样定理,是整个数字信号处理领域的基石结论。定理的完整表述是:对于一个频带受限的连续时间信号,若其最高频率分量为f,则当采样频率大于2f时,可从采样后的离散信号中无失真地重建出原始连续信号。这个临界频率2f被称为奈奎斯特率。需要注意定理的两个关键前提:信号必须是频带受限的,即存在确定的最高频率分量;采样频率必须严格大于2f而不是大于等于2f。恰好等于2f时,采样序列可能丢失相位信息,无法唯一确定原始信号。
直观理解:每个正弦波周期至少需要两个采样点才能确定其频率和幅度。若采样点不足,离散点会错误地表现为一个更低频率的正弦波,这种现象称为混叠。混叠一旦发生就无法纠正,因为高频分量已不可逆地折叠到低频区域,与原本的低频信号混淆。因此ADC之前必须用抗混叠低通滤波器将超过采样频率一半的频率成分全部滤除。
人耳听觉频率范围约为20Hz到20kHz,绝大多数成年人对15kHz以上已不太敏感。根据奈奎斯特定理,要完整保留20kHz以内所有可听频率信息,采样频率至少需要40kHz。实际CD标准采样率为44.1kHz,比理论最低值多出约百分之十的余量,用于容纳抗混叠滤波器的过渡带。滤波器从通带到阻带的衰减需要过渡频率区间,不可能在20kHz处突然截断。多出的4.1kHz避免了滤波器特性过于陡峭带来的相位失真和振铃效应。
44.1kHz的历史由来与早期数字音频存储介质密切相关。二十世纪七十年代末,索尼和飞利浦联合开发数字音频唱片,需将数字音频记录在视频录像带上。当时PAL和NTSC制式录像机每条视频扫描线可存储特定数量的采样点,为了让两种制式兼容,采样率被确定为44.1kHz。这一参数随后写入红皮书标准,成为CD规范采样率并沿用至今。
专业音频领域常见采样率还有48kHz、96kHz和192kHz等。48kHz是DVD和广播行业标准,与视频帧率有更好的同步关系。88.2kHz和96kHz分别是44.1kHz和48kHz的两倍,176.4kHz和192kHz用于专业录音和母带制作。考试中对采样率的考查通常聚焦于44.1kHz和48kHz这两个标准值及其与数据率计算的关系。
混叠在频谱上有清晰的数学表现。设采样频率为f,信号中包含一个频率为f的高频分量。当f大于f的一半时,高频分量在采样后的频谱中对称折叠,产生一个频率为f减去f的虚假分量。若该虚假分量恰好落在可听频率范围内,人耳就会听到原本不存在的噪声或失真音。这就是频谱混叠的数学机理。
理想抗混叠滤波器应在通带内完全平坦,在截止频率处瞬间衰减到零,但这种滤波器在物理上无法实现。实际滤波器从通带到阻带需要一定过渡带宽,过渡带越窄,滤波器阶数越高,相位失真越大。44.1kHz相对于人耳20kHz上限的余量,正是为滤波器过渡带留出足够的频率空间。若强行使用40kHz采样率,滤波器需在20kHz处实现极陡峭衰减,反而导致严重相位非线性影响音质。
量化是将每个采样点的连续幅度值近似为最近离散等级的过程。量化器将模拟信号幅度范围等分为若干量化区间,每个区间用一个二进制编码表示。量化位数为B时,量化等级总数等于2的B次方。8位量化提供256个等级,16位量化提供65536个等级,24位量化则提供约1678万个等级。等级数量越多,量化引入的近似误差越小,但随之而来的数据量也成倍增长。考试中经常考查量化等级数与量化位数的换算,以及不同量化精度下数据率的对比计算。
量化误差是数字音频无法完全避免的固有缺陷。连续幅度值不可能恰好落在量化等级上,量化过程总会引入舍入误差,在听觉上表现为低电平随机噪声即量化噪声。量化步长等于满幅度范围除以量化等级总数。在均匀分布假设下,量化噪声平均功率近似等于量化步长的平方除以十二。由此推导出量化信噪比理论公式:信噪比约等于六倍量化位数加一个固定常数,具体值为6.02乘以B加上1.76,单位为分贝。16位量化理论信噪比约98分贝,24位约146分贝。量化噪声虽然是理论上的干扰源,但在高精度量化下通常人耳无法直接分辨。
CD标准采用16位量化精度,每个采样点的取值有65536种可能。对于绝大多数音乐内容,16位的动态范围足以覆盖从最微弱细节到最响亮峰值之间的全部变化。人耳能承受的声压级动态范围约120分贝,16位量化的理论动态范围约96分贝,接近但略低于人耳极限。24位量化将动态范围扩展到144分贝以上,完全超出人耳感知范围,主要用于专业录音和混音场景提供充足的动态余量。
量化方式除了线性量化外还有非线性量化方案。线性量化中各区间步长完全相等,对所有幅度范围的信号一视同仁。非线性量化针对人耳听觉特性进行优化,在小信号幅度区域使用更密集的量化等级,大信号区域使用较稀疏的等级。语音通信中广泛使用的A律和μ律压扩编码就是典型方案,用8位非线性量化达到相当于12到13位线性量化的主观音质。多媒体应用设计师考试中可能考查线性量化与非线性量化的适用场景对比,考生需理解两者在复杂度、音质和带宽效率上的差异。
人耳的主观听感不等于客观信噪比指标。心理声学研究发现,当一个较强声音与较弱量化噪声同时存在时,强声会掩蔽量化噪声使其变得不可听。这种听觉掩蔽效应是MP3、AAC等感知音频编码的核心原理。编码器通过计算每个频带的掩蔽阈值,将低于阈值的量化噪声直接丢弃,在远低于PCM的数据率下实现接近透明的音质。