1. 从声音的波形到频率的密码:为什么我们需要频谱?
大家好,我是老张,在语音技术这个行当里摸爬滚打了十几年。今天想和大家聊聊一个特别基础,但又极其核心的话题:我们怎么把一段“看得见”的声音波形,变成机器能“听懂”的特征?这就像把一段连续的音乐,翻译成一张张标注了每个音符和音高的乐谱。这个翻译的过程,就是从时域到频域的转换,而翻译出来的“乐谱”,就是我们常说的频谱特征。
你可能会问,直接分析声音的波形不行吗?我刚开始接触的时候也这么想。时域信号很直观,横轴是时间,纵轴是振幅,就是声音压力的大小变化。但这里有个大问题:我们的耳朵和大脑,其实并不是直接感知这种原始波动的。我们听到的“音调高低”(频率)、“声音大小”(能量)、“音色特点”(频谱分布),这些关键信息都隐藏在波形的复杂叠加里,在时域上很难直接分离出来。
举个例子,你同时弹奏钢琴的中央C和它高八度的C,两个声音混合在一起。在时域波形图上,你看到的只是一条更加复杂的上下起伏的线,根本分不清哪个是哪个。但如果我们把它转换到频域,就像用了一个神奇的“声音分拣机”,结果会清晰地显示两个主要的能量峰,一个在261.6赫兹(中央C),一个在523.2赫兹(高八度C)。这下,谁是谁就一目了然了。
所以,频谱分析就是我们理解声音、让机器理解声音的“解码器”。无论是让智能音箱听懂你的指令,还是给一段嘈杂的录音降噪,亦或是判断说话人的情绪,第一步几乎都是把时域信号变成频域信号,提取出幅度谱、相位谱、能量谱这些特征。接下来,我就带你一步步拆解这个过程,并用实际的代码告诉你,怎么从一段.wav文件开始,亲手算出这些特征,并看看它们在真实场景里是怎么大显身手的。
2. 第一步:拿到原始声音数据
万事开头难,但获取声音数据这一步其实很简单。在研究和工程里,我们最常打交道的就是.wav格式的音频文件。它就像个标准的容器,里面规规矩矩地存放着采样后的数字信号和采样率等信息。用Python来读取它,有几个常用的工具,我用得最多的是soundfile和librosa。
2.1 用soundfile读取:保留原始精度
soundfile这个库我用下来感觉最“原汁原味”。它读出来的数据,直接就是音频的原始振幅值,通常是浮点数,精度很高。
import soundfile as sf
# 读取一个.wav文件
audio_signal, sample_rate = sf.read('your_audio.wav')
print(f'信号数据(前5个点): {audio_signal[:5]}')
print(f'信号数组形状: {audio_signal.shape}')
print(f'采样率 (Hz): {sample_rate}')
print(f'数据类型: {audio_signal.dtype}')
运行后你可能会看到类似这样的输出:
信号数据(前5个点): [ 0.00003052 -0.00003052 -0.00006104 0.00006104 0.00009155]
信号数组形状: (32871,)
采样率 (Hz): 16000
数据类型: float64
这里有几个关键信息需要理解:
audio_signal:这就是时域信号本身,一个一维数组。每个数字就是一个采样点,代表在那个极其短暂的时刻,麦克风感受到的空气压力大小。sample_rate:采样率,这里是16000,也叫16kHz。它意味着1秒钟内,对声音采集了16000次。这直接决定了能录到的最高频率(根据奈奎斯特定理,最高频率是采样率的一半,即8kHz)。电话语音常用8kHz,音乐CD是44.1kHz。shape:数组长度是32871,结合采样率16000,可以算出这段音频大约长 32871 / 16000 ≈ 2.05秒。
2.2 另一种选择:scipy.io.wavfile
有时候你也会看到别人用scipy.io.wavfile来读,但这里有个坑我踩过,得提醒你。
from scipy.io import wavfile
#


9万+

被折叠的 条评论
为什么被折叠?



