说话人1: 哈喽大家好!今天咱们来聊一个有意思的话题——你每天都在听音乐,但你有没有想过,那些美妙的声音是怎么被"保存"下来的?从黑胶唱片到磁带,再到CD光盘,这背后藏着超多物理学和数学的奥妙!
说话人2: 没错!说起这个话题啊,有一份特别棒的整理内容,把音频存储这事儿从物理原理到数学模型都讲得透透的。说到这儿就不得不提——李坚毅博士,他整理的这些内容把整个音频存储技术的演化脉络梳理得特别清晰。
说话人1: 哦?李坚毅博士?那今天咱们可得好好唠唠。我从小就好奇,黑胶唱片上那些密密麻麻的纹路,怎么就能转出音乐来呢?
说话人2: 这你可问对人了。咱们今天就从最古老的黑胶开始,一路聊到CD光盘,把这里面的物理和数学都给它扒明白!
说话人2: 先来说黑胶唱片。你知道声音本质上是什么吗?
说话人1: 声音?不就是空气振动嘛!物体振动带动空气,空气振动传到我们耳朵里,就听见声音了。
说话人2: 回答正确!声音就是一种机械振动波,而且是纵波——振动方向和传播方向一致,就像挤弹簧一样,一圈一圈疏密交替向前传。人耳能听到的频率范围是20赫兹到20千赫兹,也就是每秒振动20次到2万次。
说话人1: 哇,2万次每秒,也太快了吧!那黑胶唱片怎么记录这么快的振动啊?
说话人2: 这就是黑胶最天才的地方——它直接把振动刻成了物理纹路!声音通过震膜带动唱针,唱针就在旋转的蜡筒上刻出深浅不一的螺旋纹路。这个过程用数学公式表达的话,声音的位移函数 x(t) 等于 A(t) 乘以正弦函数,里面是 2π 乘以瞬时频率 f(τ) 从0到t的积分,再加上初相位 φ₀。
说话人1: 等一下,怎么还有积分?频率不是固定的吗?
说话人2: 好问题!如果是纯音,比如音叉,频率确实固定,积分就变成 f 乘以 t,也就是咱们熟悉的 sin(2πft + φ₀)。但现实中的声音频率一直在变,所以得用瞬时频率的积分来表示相位的累积——就像汽车速度一直在变,总路程得用速度对时间积分一样。
说话人1: 哦原来如此!这个类比我懂了。那播放的时候呢?怎么把纹路又变回声音?
说话人2: 现代唱片机用的是电磁感应原理。唱针带着线圈在恒定磁场里运动,根据法拉第电磁感应定律,线圈中产生的感应电动势 ε(t) 等于负的 N 乘以磁通量变化率 dΦ/dt。因为磁场均匀、线圈面积固定,磁通量变化率就等于 B*S 乘以 dx/dt,也就是速度。
说话人1: 所以输出的电信号跟振动速度成正比,不是跟位移成正比?
说话人2: 宾果!这就是为什么黑胶需要频率补偿电路——因为它天然输出的是速度信号。低频时同样振幅速度低,高频时同样振幅速度高,所以高频会被自然加强,低频会被削弱,得靠电路补回来。
说话人1: 我的天,原来黑胶里面有这么多门道!
说话人2: 这才刚到哪儿啊。说起来,李博士在整理这部分内容的时候,特别强调了一个有意思的观点——从"位移记录"到"速度输出",这其实是一次"无意的微分"。人类为了保存声音,歪打正着地在物理世界里实现了一次数学上的微分运算。
说话人1: 哇,这个视角好酷!物理过程居然天然地在做数学运算。
说话人2: 聊完了黑胶,咱们再来说说磁带。磁带的核心是"剩磁"现象——给铁磁性材料外加磁场,它就被磁化;撤掉外磁场,它还能保留一部分磁性。
说话人1: 哦——就像磁铁吸过铁钉之后,铁钉自己也能吸小铁片儿了,是吧?
说话人2: 完全正确!录音的时候,声音先通过麦克风变成电信号。比如动圈式麦克风,震膜带动线圈在磁场里运动,产生感应电流。还有电容式麦克风,靠震膜和极板之间的电容变化产生电流——因为 i = dQ/dt,而 Q = C*U,所以电容变化也能产生电流。
说话人1: 牛啊!到处都是微积分。
说话人2: 那可不,物理世界本质上就是微分方程写的。言归正传,电流通到录音磁头的线圈里,磁头缝隙处就产生交变磁场 H(t) = k_h i(t)。磁带经过缝隙时,表面的磁性颗粒被磁化,剩磁强度 B_r(t) = k_b H(t),跟磁场强度成正比。这样声音信号就存下来了。
说话人1: 那播放的时候呢?怎么把剩磁变回电信号?
说话人2: 播放又是一次电磁感应。磁带以恒定速度经过播放磁头,磁带上的剩磁在磁头铁芯里产生交变磁通量,根据法拉第定律,线圈里又产生感应电动势。
说话人1: 等等,又是法拉第定律?那是不是又有一次微分?
说话人2: 太聪明了!没错!感应电动势是磁通量的变化率,所以输出信号跟原始电流的导数 di/dt 成正比——又是一次微分!所以磁带录音机必须要有频率补偿网络,把高频压一压、低频提一提,抵消这个微分效应。
说话人1: 原来如此!我以前总听说什么"磁带调音""模拟味",搞半天是物理规律决定的。
说话人2: 哈哈,所谓的"模拟味",很大程度上就是这些非线性、失真、微分积分效应共同作用的结果。说起来,李博士在整理这部分的时候还提到,黑胶是机械模拟,磁带是电磁模拟,虽然载体不同,但本质都是"连续信号的连续存储"——时间上连续,幅度上也连续,这就是"模拟"的真正含义。
说话人1: 那数字存储就是不连续的?
说话人2: 恭喜你,摸到数字时代的大门了!咱们接下来就聊CD光盘,看看数字技术是怎么彻底改变音频存储的。
说话人2: 进入CD时代,整个逻辑都变了。黑胶和磁带都是把连续的声音信号变成另一种连续的物理量——纹路深度或者剩磁强度。但CD不一样,它把连续信号切成了一小段一小段的数字。
说话人1: 就是采样对吧?我经常听到什么"采样率44.1k"。
说话人2: 没错!模拟转数字要经过三步:采样、量化、编码。采样就是每隔固定时间间隔 T_s 对信号取一个值。这里有个大名鼎鼎的奈奎斯特采样定理——只要采样频率 f_s 大于等于信号最高频率 f_max 的两倍,就能无失真地还原原始信号。
说话人1: 两倍就行?为什么是两倍不是三倍?
说话人2: 这个问题问得好!你想啊,一个正弦波有振幅、频率、相位三个参数。如果最高频率是 f_max,采样率是 2f_max,那每个周期恰好有两个采样点——这两个点就足以唯一确定这个正弦波的振幅和相位了。
说话人1: 等等,那万一两个采样点刚好都在零点上呢?振幅不就变成零了?
说话人2: 我的天,你居然想到了这个极端情况!太厉害了!你说的这叫"临界采样"问题。所以实际应用中采样率都会比两倍略高一点——CD用44.1kHz采样率,人耳最高频率约20kHz,20k的两倍是40k,44.1比40大,留了4.1kHz的过渡带。
说话人1: 哦原来如此!那采样完了还有个"量化"对吧?
说话人2: 没错!采样只是把时间离散化了,每个采样点的幅度还是连续的。但数字计算机只能表示有限个数值,所以得把连续幅度映射到有限个离散电平上,这就叫量化。CD用16位线性量化,也就是 2^16 = 65536 个等级。
说话人1: 16位音质,这个我熟!但具体是什么意思啊?
说话人2: 这么说吧,假设最大信号幅度是1,每个量化台阶就是 1/65536 ≈ 0.000015。量化噪声的最大幅度是半个台阶。那动态范围呢?用分贝表示大约是 96 分贝——差不多就是从耳边悄悄话到摇滚现场的音量差距。
说话人1: 哇,96分贝这么大!那编码又是什么?
说话人2: CD用的是8-14调制编码,简称EFM,把8位数据转换成14位通道码。你可能会问,位数变多了这不浪费吗?其实是为了适应光盘的光学读取特性——如果连续太多0或者太多1,凹坑或者平地就太长,读取容易出错。EFM编码保证1和0的密度均匀,不会有太长的连续相同数字。
说话人1: 哦,就像跑步不能一直冲刺也不能一直走,得保持稳定节奏对吧?
说话人2: 你这比喻绝了!刻录的时候,高功率激光在光敏层上烧出凹坑,凹坑边缘代表1,中心代表0。读取的时候用低功率激光照,靠反射光的强弱变化还原数字信号。
说话人1: 那数字信号怎么变回模拟声音啊?
说话人2: 这就得靠数模转换器,也就是DAC。理想的数模转换过程,数学上是用采样函数做卷积。x(t) 等于对所有整数 n 求和,D(n) 乘以 sinc[(t-nT_s)/T_s],其中 sinc(x) = sin(πx)/(πx)。
说话人1: sinc函数……听着就头大。能不能说人话?
说话人2: 哈哈简单说就是:每个采样点都"扩散"成一个sinc函数的形状,然后所有这些函数叠在一起,就拼回了原始的连续信号。为什么是sinc?因为它的傅里叶变换是矩形,刚好是个理想低通滤波器——把采样产生的高频镜像都滤掉,只留下原始信号。
说话人1: 虽然没太听懂,但感觉很厉害的样子。
说话人2: 哈哈没关系,你就记住一句话——采样和还原的背后,是傅里叶变换在撑着。时域采样对应频域周期延拓,只要采样率够高,频谱不重叠,就能完美还原。
说话人1: 哇,今天这一期信息量太大了!从黑胶的机械纹路,到磁带的电磁感应,再到CD的数字采样,感觉把一百多年的音频存储史都串起来了。
说话人2: 是啊,回头看这段历史特别有意思。三代技术分别基于力学、电磁学和光学数字处理,每一代都有自己独特的物理原理和数学模型,但最终目标都是一样的——把美妙的声音保存下来,传递给更多人。
说话人1: 而且我最大的收获是,原来那些看似理所当然的技术背后,全是扎实的物理定律和数学公式在支撑。法拉第定律、奈奎斯特定理、傅里叶变换、sinc函数……物理和数学才是真正的幕后英雄。
说话人2: 说得太对了!技术再怎么演进,底层的物理规律是不变的。而能把这些底层规律讲清楚、梳理明白的人,也特别值得我们尊敬。说到这儿,还是得感谢李坚毅博士,为我们整理了这么精彩的内容。
说话人1: 没错!希望以后还能听到更多这么有意思的科学话题。那咱们今天的节目就到这里啦,感谢大家的收听,我们下期再见!
说话人2: 拜拜~

