音频的特征有哪些?
·
音频特征总览
分为时域特征、频域特征、时‑频特征(最常用AI音频)、感知特征、高阶统计特征;故障诊断、语音识别、音频分类基本都用这套。
一、时域特征(原始波形直接算,速度最快)
原始时间序列 x(n)x(n)x(n)
- 幅值 / 绝对幅值:波形高低,代表音量
- RMS均方根能量:最常用音量,RMS=1N∑x(n)2\mathrm{RMS}=\sqrt{\frac1N\sum x(n)^2}RMS=N1∑x(n)2
- 过零率 ZCR:单位时间穿过0轴次数;噪音、尖锐高频声音过零率高;低沉声音低
- 峰值、峰峰值:最大最小差值;冲击噪声看峰值
- 短时能量:分帧后每帧的能量,区分静音/有声段
- 方差、标准差:波形波动剧烈程度
局限:看不出频率成分,只能看时间上强弱变化。
二、频域特征(FFT快速傅里叶变换得到频谱)
对一帧做FFT得到频谱X(f)X(f)X(f)
- 频谱幅度谱:各个频率分量大小
- 功率谱:幅度平方,能量分布
- 频谱质心 Centroid:频谱“重心”,数值越高声音越尖锐明亮
- 频谱带宽 Bandwidth:频率扩散宽度
- 频谱滚降点 Rolloff:85%能量集中在该频率以下,区分高低频
- 频谱通量 Spectral Flux:相邻帧频谱变化量,检测突变、撞击、故障冲击
- 频谱平坦度 Flatness:0~1;噪声接近1,纯音调接近0
- 谐波/基频F0:基音频率,周期性声音;机器旋转音频对应转频
三、时‑频特征(AI、故障诊断最核心!)
把音频分帧+FFT,随时间变化的频谱矩阵
- 梅尔频谱 Mel‑Spectrogram
模仿人耳听觉,对低频分辨高、高频压缩;绝大多数音频模型输入。 - 梅尔倒谱系数 MFCC
梅尔频谱再做DCT离散余弦变换,降维;语音、设备故障音频经典特征,一般取12‑40维。 - STFT短时傅里叶谱:原始时频图
- CQT常数Q变换:对数频率轴,适合音乐、旋转机械谐波分析
- 小波时频图:适合非平稳、冲击瞬态故障信号(变压器异响、撞击)
四、感知特征(模拟人耳主观感受)
- 响度 Loudness:主观音量,不等同RMS
- 锐度 Sharpness:尖锐刺耳程度
- 粗糙度 Roughness:声音抖动粗糙感
- 音调 Tonality:音调显著程度
五、机器故障音频常用工程特征(你做变压器故障音频会用到)
- 转频及其谐波幅值(旋转设备)
- 包络谱特征:解调,提取微弱冲击故障
- 谱峭度 Kurtosis:检测瞬态冲击!故障点放电、局部放电音频峭度显著变大
- 峭度、偏度:波形统计量,冲击故障专用
简单选用建议
- 简单阈值判断:只用时域(RMS、ZCR、峭度)
- 传统机器学习SVM/XGBoost:MFCC + 频谱统计特征
- 深度学习模型输入:梅尔频谱图
- 放电、瞬态冲击故障:包络谱 + 谱峭度 + 小波
更多推荐


所有评论(0)