跳转至

一、三要素/语音的基本参数

声音的特性可由三个要素来描述,即响度、音调和音色。来源 响度对应振幅,音调对应频率。 由声音波形的谐波频谱和包络决定。声音波形的基频所产生的听得最清楚的音称为基音,各次谐波的微小振动所产生的声音称泛音。单一频率的音称为纯音,具有谐波的音称为复音。每个基音都有固有的频率和不同响度的泛音,借此可以区别其它具有相同响度和音调的声音。

一个世纪的研究表明人的听力范围在20~20KHz之间[1],更高的频率记录下来人类也是听不到的。

二、声学模型

来源 生成模型

气流(由肺部排出) → 声带(气流通过声门时对声带造成的冲击) → 声道(喉咙、咽头、口腔、鼻腔等,通过改变声道形状调制出不同声音)

接收模型: 空气传播 → 入耳 → 鼓膜获取 → 传递给小骨 → 耳蜗 → 转换为神经电信号 → 传送大脑的中枢听觉系统。

2.1 声音传播

声速随湿度和温度的增加而增大。空气中的声速随着温度的升高而增加。在迎风情况下,风会使声波的传播速度稍微变慢一些。多普勒效应也会影响声音传播速度。来源

三、语音基础分析

3.1 音素

音素是语音的最小单位,对应一个最小的发音动作,如汉语音节ā(啊)只有一个音素,ài(爱) 有两个音素,dai(呆)则有三个音素。

3.2 音节

音节(Syllable)是语言中单个元音音素和辅音音素组合发音的最小语音单位,单个元音音素也可自成音节。

声母(Initials),即是韵母前的辅音,与韵母一起构成一个完整的音节。

元音:元音和双元音的声音强度较大,共振峰频率是元音感知最重要的特征,尤其是前三个共振峰频率(\(F_1、F_2、F_3\)),持续时间长短也可用于区分不同音节,噪声对元音的共振峰\(F_1\)的影响比$F_2小。元音的频谱共振峰特征明显,这是因为声道的形状(舌头、牙齿)能用短时功率谱的包络表示出来。 辅音:发音时气流受到发音器官阻碍,从肺里出来的气流不一定振动声带,通过口腔时受到口腔或咽喉一定的阻碍,这种主要依靠阻碍发出的不够清晰也不够响亮的音叫辅音。

3.3 三个共振峰

共振峰是指在声音的频谱中能量相对集中的一些区域,共振峰不但是音质的决定因素,而且反映了声道(共振腔)的物理特征。

基音:一种主观心理量,人耳感受到声音的高低。对应的物理量为基频(F0) 基音轨迹:横轴为时间,纵轴为基频。随着时间的变化,信号的基频本身也可能出现变化,一半基音轨迹与汉语的声调有关。

前两个共振峰(F1&F2)与元音的舌位有关系,F1为元音舌位的高低;F2为元音舌位的前后。

四、听觉的非线性

来源 听觉对于不同频率、不同声压级的信号,其分辨能力是不同的。当这些信号连续或者不连续变化的时候,分辨阈又有所不同。

4.1 频率/音高/音调

20231218_140450

来源 对频率感知的非线性,对声强感知的非线性,好的音频信号处理系统需要考虑这两方面。

20231113_114534

4.1.1 巴克刻度

巴克刻度(Bark scale)是于1961年由德国声学家Eberhard Zwicker提出的一种心理声学的尺度。它以Heinrich Barkhausen的名字命名。 1961 年:

\[ Bark = 13 \arctan(0.00076f) + 3.5 \arctan((f/7500)^2) \]

1992 年:

\[ Bark = 6 \sinh^{-1}(f/600) \]

Bark(巴克)频率尺度是以Hz为单位,把频率映射到心理声学的24个临界频带上,第25个临界频带占据约:16K~20kHz的频率,1个临界频带的宽度等于一个Bark,简单的说,Bark尺度是把物理频率转换到心理声学的频率。来源

4.1.2 梅尔刻度

人们对声音高低的一种主观感受,梅尔刻度是音调的主观测量。与物理两频率对应。

音高:是声音频率的客观物理量度,通常用赫兹(Hz)来表示,指的是声波每秒钟振动的次数。它是可以精确测量和计算的物理量。比如,国际标准音A的频率被定义为440Hz,这就是一个明确的音高数值。

音调:是声音频率的一个主观属性,是人们对声音高低的一种主观感受。它描述的是声音听起来是“高”还是“低” ,是一种感知层面的概念。例如,当我们听到钢琴上从左到右依次弹奏的琴键发出的声音时,会明显感觉到声音从“低”逐渐变“高”,这就是音调在听觉上的体现。

梅尔刻度(Mel scale)是一种由听众判断不同频率 音高(pitch)彼此相等的感知刻度,表示人耳对等距音高(pitch)变化的感知。mel 刻度和正常频率(Hz)之间的参考点是将1 kHz,且高于人耳听阈值40分贝以上的基音,定为1000 mel。在大约500 Hz以上,听者判断越来越大的音程(interval)产生相等的pitch增量,人耳每感觉到等量的音高变化,所需要的频率变化随频率增加而愈来愈大。

\[ m=2595 \cdot log_{10}(f/700) \]

20231113_114546

Why the logarithm and not a cube root? The logarithm allows us to use cepstral mean subtraction, which is a channel normalisation technique.

4.1.3 对比bark和mel

维度 梅尔刻度 巴克刻度
理论基础 音高的非线性 音调的离散性
数学模型 对数转换公式 反双曲正切组合公式
频带划分 未显式划分频带 显式划分24-25个临界频带
适用场景 语音识别、音乐分析 噪声抑制、音频编码
感知精度 低频敏感,高频压缩 全频段感知一致性更高

4.1.4 掩蔽效应

掩蔽效应分为同时掩蔽(也称为频域掩蔽)和异时掩蔽(也称为时域掩蔽)。

对于同时掩蔽,掩蔽声越强,掩蔽作用越强(同一个Bark内的掩蔽强;间隔的Bark越宽,掩蔽效应越弱);掩蔽声与被掩蔽声频率靠得越近,掩蔽效果越显著。

对于异时掩蔽,分为前掩蔽和后掩蔽两种。前掩蔽持续20ms,后掩蔽持续100ms。

利用掩蔽效应,对抑制因时间分辨率不够而造成的预回声起着重要的作用。如过长的帧会使得时间分辨率下降,产生严重的预回声。当帧长缩短到2~5ms时,由于前掩蔽效应,预回声会随之而来的冲击响应所掩蔽。

掩蔽阈值取决于音调性、频率、声压级、持续时间。

掩蔽效应根据分掩蔽声和被掩蔽声分为三种情形: * 纯音调信号间的掩蔽 * 宽带噪声对纯音调的掩蔽 * 窄带噪声对纯音调的掩蔽:24Bark频带之间的掩蔽关系。一个纯音可以被以它为中心频率,具有一定带宽的连续噪声所掩蔽(临界带宽)。

4.2 声压/强度/响度

语音信号是声压波。

强度和响度:强度是一个物理测量值,以dB IL(声强级)、dB SPL(声压级)、dB HL(听力级)或dB SL(感觉级)为单位。来源 响度为心理范畴。单位为phone(方)。在数值上1方等于1kHz的纯音的声强级(如1kHz纯音下,响度为10方时相当于10dB的声压级),而零方对应人耳的听阈。

4.2.1 dB

大气压实验来源

分贝最初使用是在电信行业,是为了量化长导线传输电报和电话信号时的功率损失而开发出来的。是为了纪念美国电话发明家亚历山大·格雷厄姆·贝尔(Alexander Graham Bell),以他的名字命名的。虽然分贝定义为1/10贝尔,但单位“贝尔”(Bel)却很少用,更多使用的是十分之一贝尔,即dB(Decibel)。来源

\[ dB_{SIL} = 10 \cdot log_{10}{I_{in}/I_{ref}} \]
\[ B_{SIL} = log_{10}{I_{in}/I_{ref}} \]

半功率点(-3dB点), 在两音频完全一直的情况下,60dB+60dB=63dB

4.2.2 SPL

1标准大气压=\(1.01325×105 N/m^2 = 1.01325×105 Pa\)

声压是大气压受到声波扰动后产生的变化,即为大气压强的余压。它相当于在大气压强上的叠加一个声波扰动引起的压强变化。具体来说,当媒质(如空气)中的某点(体积元)受到声波扰动后,其压强会超过原先的静压力,这个超过的值就称为声压。

相比于大气压,声压幅值波动非常小。人耳可听的声压幅值波动范围为 \(2×10^{-5}Pa → 20\mu Pa\) ,这个声压幅值波动区间很大,二者的比值达到了\(10^6\)。用幅值dB表示对应的分贝数为0~120dB。

表 2021年WHO听力损失程度分级标准

20250428_100931

在相同强度下,人耳对1000~4000Hz的声音感知最为敏感,响度感觉最为明显。在空气中,参考声压一般取为20μPa(频率为1kHz时),这是正常人耳能够刚刚觉察到的声音所对应的声压值。

声压的相关概念: * 瞬时声压:声场中某一瞬时的声压值称为瞬时声压。 * 有效声压(总计RMS振幅):指在一定的时间间隔内,某点的瞬时声压(p)对时间的均方根值。 * 峰值声压(峰值振幅,一般比有效声压大15dB左右):在一定时间间隔中最大的瞬间声压值称为峰值声压。 参考:Adboe Audition 分析相位、频率和振幅

定义人耳在安静环境下能够感知到的最小声压水平(\(20 \mu Pa\))为参考声压/基准声压。并规定参考声压下的声压级(Sound Pressure Level, SPL)为0dB,因此声压级的定义为:

\[ dB_{SPL} = 20 \cdot log{\frac{p_{RMS}}{2\times10^{-5}}} \]

注:任何对声音大小的感知和声压不是线性的,而是平方关系,所以乘20而非10。 注:有些人能听到-5dB声音,有些人0dB都听不到。因此0dB只是统计意义上的最小。

20231127_184028

注:94dB对应1Pa。

4.2.3 dBFS

数字化过程主要关注于声音的采样、量化和编码,以确保声音信号能够准确地被转换为数字信号,并便于后续的存储、传输和处理。dBFS用于表征信号的相对强度。而dBSPL和dBA等参数更多地用于声音信号的分析、评估和质量控制等方面,与dBFS无关。

dBFS是一种音频电平测量单位,用于衡量数字音频中的信号强度。它是相对于数字音频系统的最大可能电平的单位,通常在0dBFS表示最大的可表示电平。当信号达到或者超过0dBFS时,被称为超出范围或者过载,会导致信号失真。

麦克风的最大声压级(Acoustic Overload Point)是指失真达到10%时的声压级。其输出信号产生一定百分比(如10%)的总谐波失真(THD)时对应的声压级。这个指标用于评估麦克风在高声压级环境下的性能表现。

16bit音频的dBFS:

dBFS 赋值(采样值)
0 dBFS 32767
-1 dBFS 约31465
-3 dBFS 约26214
-6 dBFS 约16384
-9 dBFS 约10159 ,约10K
-12 dBFS 约6349
-15 dBFS 约3981
-18 dBFS 约2484
-21 dBFS 约1553
-24 dBFS 约970, 约1k
-30 dBFS 约316
-40 dBFS 约32
-50 dBFS 约3
-60 dBFS 约0.3
-90 dBFS 约0.0003
-96 dBFS 约0.0001(最小可量化噪声水平,接近量化噪声)
注:关键节点:9、13、24,对应1k\5k\10k。

4.2.3.1 麦克风采集的数字信号如何转换为dBSPL?

需要一种方法将数字信号的电平值与声压联系起来。这通常涉及麦克风的校准过程,即测量麦克风在不同声压下的输出电平,并建立电平值与声压之间的对应关系(即灵敏度曲线)。

灵敏度(S, Sensitivity):在94dB SPL@1kHz的测试环境下,获取的dBV/Pa或dBFS/Pa。来源

根据灵敏度和最大声压级的定义,我看手册时,一般会有\(AOP - 94dB = S\)

模拟麦克风的灵敏度大部分的规格为-38dBV/Pa,蓝牙耳机灵敏度为-42dBV。

调音时对灵敏度的要求: 描述 55db 人声下的实际幅值,要求 200-500。 最大音乐音量下(<98db)的实际 mic 幅值(30K 左右)及参考信号幅值(25k 左右)。 注:人声大音量80~85dBSPL

4.2.4 dbA

dBA的后缀“ A”是因为该测量使用了仅捕获人耳的加权滤波器 20至20,000 Hz之间的频率 并在 50厘米 。 因此,能够测量任何声音强度是可靠和客观的大小。来源

人耳不是对所有频率的敏感度都相同。正常人耳最敏感的频带是 3000 Hz 到 6000 Hz,它的频响会随着声音大小的变化而变化。通常,低频段和高频段声音感知能力不如中频段,效果是在低声压级更明显,在高声压级时会被压平,

20231127_183944

如图中各条曲线(等响曲线)所示,声压级越小的区间,曲线越陡峭,声压级越大的区段,曲线越平坦。

20231127_183950

Phon(音轮廓),

Mostly because of the shape of the ear, you can also see from the graph that we hear the 3-4 kHz range the best, which happens to be on the slightly higher end of human speech. If you lost it, you’d have a hard time understanding people.

与其他测量单位的区别 * dBSPL:声压级的单位,用于直接测量声音的强度,而不考虑人类听觉的频率敏感度。它常用于测量环境噪音、声音的输出功率以及声学设备的性能指标等。 * dBB和dBC:也是声音级别的单位,但分别使用B频率权重和C频率权重进行测量。B频率权重更适合于低频声音的测量,而C频率权重则提供了更平坦的频率响应,适用于需要广泛频率覆盖的测量。

20240724_175721

A计权的实现方式: A计权可以理解为一个以人耳为模型的滤波器。如果DIY的话也是可以的,使用一个常用的双运放和精度较高的电容电阻就可以实现,当然校准是个问题。A计权模拟实现方式。来源

计权放在对数域上即为加减来源

\[ dBA_{freqx} = max\{dBSPL - W_{freqx}, 0\} \]

其中\(W_{freqx}\)为频率为freqx时的A权值。

除了dBA和其它三种计权之外,其实在其他领域还有dBm,dBW,dBu,dBv,dBi,dBd,dBc等等,但在NVH领域还是dBA最常用。

注意,dBA虽然与音频有关系,但本质还是对声强的一种描述。

4.2.5 从强度到响度,响度与频率之间的关系

响度为心理范畴。单位为phone(方)。在数值上1方等于1kHz的纯音的声强级(如1kHz纯音下,响度为10方时相当于10dB的声压级),而零方对应人耳的听阈。

人耳感知的声音响度是频率和声压级的函数,通过比较不同频率的声音的响应可以得到主观等响曲线。下图为 ISO 226-2003 中给出的等响曲线,声振之家-详解人耳听觉等响曲线!

20250505_113418

从图中可以看出3~4kHz附近略有下降,意味着感知灵敏度有提升,这是由于外耳道的共振引起的。

4.2.6 概念比较

https://blog.csdn.net/danteLiujie/article/details/100569490 https://blog.csdn.net/haima1998/article/details/54599621 * Loudness 响度: 由于人类的耳朵不能在同一水平上听到每个频率,当我们在频率上上下移动时,感知的响度是不同的。响度可用dBA表示,单位Phon。 * Level 音级/电平:用来描述声音的大小,更具体地说,我们用声压级来描述声波。可以认为就是声压级SPL的简称。 * Volume 音量:用来描述信号功率水平, 指用放大器来放大信号时所用的功率的量。

when you turn up the “master volume” knob on your amp, it simply means you’re increasing the amount of power used by the amp to increase the signal. This term is quite ambiguous since it’s used in so many different places, mainly to mean the actual sound you perceive in your ears, which is not exactly true. Use with caution.

  • gain 增益:指的是传输增益, 指的是信号功率的增加。这个增加通常用dB (分贝)表示。一般在mixer board和 guitar amp使用。

Level vs Volume 测试项:通过调节音量,检查每个音量下的音级线性度和总谐波失真度(THD)。

Headunit volume level: Start with maximum volume step and decrease to minimum volume step

4.2.6.1 dbA vs phone:

  • 在需要描述人耳对声音响度的主观感受时,使用“phone”更为合适。
  • 在需要客观测量和评估声音强度时,使用“dB A”更为准确。

五、麦克风其他性能参数

来源

灵敏度S和最大声压级AOP以及在上文中说明,这里不再重复阐述。

术语 定义
灵敏度(S) 将麦克风置于声场的规定位置,其开路输出电压与无干扰时校准位置处声压的比值。
等效噪声级 麦克风的受声面上无任何声波作用,但仍有一定的噪声电压输出,即固有噪声,常用等效噪声级衡量,一般采用 A 计权。
信噪比(SNR) 麦克风输出信号中目标信号与噪声信号或干扰源信号的能量比。
频率响应(FR) 麦克风灵敏度随频率的变化关系曲线为频率响应曲线。
频响一致性 麦克风阵列各通道间的频响差异,指多个通道间的频率响应均值误差,反映各通道频率特性的偏差。
总谐波失真(THD) 麦克风的开路输出电压中谐波余量的有效值与测量包含基频的总电压的比值。
时延一致性 麦克风阵列任意两个通道间的时延(采样点差)。
通道相关性 麦克风阵列任意两通道间信号的相关程度。
相位一致性 麦克风各通道间的相位偏差。
密封性 分为内部密封性测试和外部密封性测试。内部密封性测试指堵住音频孔,待测设备扬声器播放音频与不播放音频,麦克风阵列接收到的音频声压级差,目的是检测内部腔体中声音的传递;外部密封性测试是外部扬声器播放音频文件,堵住与开放音频孔,麦克风阵列接收到的音频声压级差,目的是检测腔体收音孔密封性问题。
截幅 声源播放音频,麦克风出现截幅时的声压级大小。
混响 当设备采集信号时可能与真实环境中混响时间不同,需要跟真实数据对比分析混响或 EDT(早期衰变时间)值。
麦克风阵列数据完整性 麦克风阵列接收到的数据都是有效准确的值,并且不丢失数据。

麦克风阵列测试项与参考范围:

序号 测试项 测试参数 测试条件 参考范围 单位
1 灵敏度 S 94dBSPL @1kHz ref ±3 dB
2 噪声级 Noise level quiet(0~16000Hz) ≤-70 dB
3 频响 FR frequency sweep(100~8000Hz) 曲线平直
4 频响一致性 FR tolerance frequency sweep(100~8000Hz) <±4 dB
5 总谐波失真 THD 94dBSPL @1kHz <2 %
6 时延一致性 Sample point difference White noise <±2/fs s
7 相位一致性 Phase difference frequency sweep(log) 相位曲线相似性大,DOA 结果趋势准确
8 相关性 Correlation coefficient White noise average > 0.80
9 截幅 Clipping 112dBSPL White noise
10 外部密封性 FR difference frequency sweep(log) ≥35 dB
11 参考 correctness White noise AEC 效果收敛效果可接受 ~

麦克风的分析的都是静态特性,动态的平稳性很少看到有要求。 下文无特别说明的引用指标和图片为客户 APQM 的麦克风输入

5.1 截幅

Digital level for maximum electric level or acoustic level of microphone should reach-6~0dBFS.

线性度一般是可以保证的,很少做具体的要求。

Linearity of digital level vs electric level should be ensured.

20241104_171005

5.2 灵敏度

灵敏度越高麦克风就越好吗? 当然是不是,灵敏度越高,那么在输入很小声音时,音频也会被放大,很多对我们没有用的底噪是很小的声压,这就无形中增加了我们的底噪,没有实际的意义。

但是灵敏度过低也不好,灵敏度太低的话,输入很大,输出可能也很小,对我们实际是使用是不利的。

麦克风灵敏度通常以分贝伏特(dBV)为单位表示,用于量化麦克风在特定声压级下输出的电压大小。公式 \(\text{dBV} = 20 \cdot \log_{10}\left(\frac{V_{\text{rms}}}{1\,\text{V}}\right)\) 描述了如何将麦克风的均方根(RMS)输出电压 \(V_{\text{rms}}\) 转换为以分贝伏特为单位的灵敏度。以下是对该公式的详细解释:

\[ \text{dBV} = 20 \cdot \log_{10}\left(\frac{V_{\text{rms}}}{1\,\text{V}}\right) \]
  • \(V_{\text{rms}}\):麦克风在特定声压级(如94 dB SPL,对应1帕斯卡声压)下的输出电压(均方根值)。
  • \(1\,\text{V}\):参考电压,即1伏特。
  • \(\log_{10}\):以10为底的对数函数。
  • 20:系数,用于将电压比转换为分贝(dB)单位。

分贝的定义基于功率比:

\[ \text{dB} = 10 \cdot \log_{10}\left(\frac{P}{P_{\text{ref}}}\right) \]

对于电压比,由于功率与电压的平方成正比(\(P \propto V^2\)):

\[ \text{dB} = 10 \cdot \log_{10}\left(\frac{V^2}{V_{\text{ref}}^2}\right) = 20 \cdot \log_{10}\left(\frac{V}{V_{\text{ref}}}\right) \]

因此,电压比的分贝公式中系数为 20。

举个例子:

The Microphone sensitivity is-10±1 dBV/Pa. Thus, the maximum electric signal level at TP_M2_A1 was set as 2dBV,which is corresponding to 106dBSPL.

这里的 2dBV 约等于 1.2589 V。

5.3 SNR

SNR,信噪比,如94dB SPL @1kHz, A-weighted, f_{clock}=2.4MHz 's SNR = 64.3 dBA

5.4 THD

THD(Total Harmonic Distortion,总谐波失真)是指音频设备(包括麦克风)在输出信号中产生的谐波失真,通常用百分比表示,表示原始信号与失真信号的比例。在麦克风中,THD衡量了在给定纯单音输入信号下输出信号的失真水平,是麦克风拾音精确度的指标。

测量与计算 测量范围:通常在一定的声压级范围内测量,如94~100dB SPL(声压级)范围内。对于某些MEMS麦克风,测试输入信号可能会更高,如105 dB SPL。 计算方法:THD的计算主要有百分比法和分贝法两种。百分比法是最常用的方法,计算公式为:

\[ THD(\%) = \frac{\sqrt{V_2^2+V_3^2+...+V_n^2}}{V_1} \times 100\% \]

其中V1为基波电压,V2、V3、...、Vn分别为各个谐波的电压。分贝法则通过计算各个谐波电压的分贝值来求解THD。

谐波失真频谱图如下:

20240725_095734

播放一个频率递增的音频,在频谱图上应该也是一条线,而不是出现劈叉。

20240725_095913

下图是低频下轻微谐波失真,是可接受的:

20240725_100212

中频段通常被认为是音频信号的主要能量集中区域,也是人耳最为敏感的区域之一。在中频段,音频设备通常具有较好的谐波抑制能力,使得中频失真相对较低。但这同样取决于设备的具体性能和电路设计。高频段是谐波失真较为敏感的区域之一。由于高频信号的快速变化和高频元器件的非线性特性,高频段容易出现较大的谐波失真。因此,在设计音频设备时,需要特别注意高频段的谐波抑制能力。

在音频设备中,除了电子元器件的非线性导致的谐波失真,还有器件的噪声造成的影响,通常用THD+N表示,它是音频设备的一个重要性能指标。

\[ THD(\%) = \frac{\sqrt{V_2^2+V_3^2+...+V_n^2+V_{noise}^2}}{V_1} \times 100\% \]

THD+Nforalllevels up tomaximumSPLor electriclevel should < 1%

5.5 IMD

交调失真(Intermodulation Distortion, IMD)来源 交调失真来源 但现实的音乐信号,不是这样单频率信号,而是由各种频率叠加的信号。运放本身的线性特性并不非常良好,所以加入音乐信号后,容易产生交调失真现象。

交调失真图

20240725_102643

5.6 相位

对于麦克风来说,我们通常更关注相位的一致性,特别是对于多麦克风阵列的设计。以下是典型的驻极体麦克风和硅麦克风的相位,硅麦克风的相位一致性好于驻极体麦克风。

在信号处理和通信领域,相位通常指的是信号相对于某一参考信号的延迟。 相关滤波器介绍

音频标定项:前排麦克风延迟时间约 3ms,小于 10ms, 满足要求。

20240725_103024

5.7 指向性

全向或定向,定向也分各种谱图。

5.8 频响曲线

音响系统或音箱产品的频响曲线是否要求平直?很多人在这个问题上争论,争论的焦点往往在于:好听的不一定平直,平直的不一定好听。来源

Energy of imagng components shall be suppressed by at least 50 dB below the level of 1kHz sinusoid.

5.8.1 麦克风的频响曲线

多麦一致性一般作为频响一致性的一部分:

No frequency responsed ifference between microphone channels.

20241104_183544

5.8.2 扬声器的频响曲线

20241104_183936

Energy of imaging components shall be suppressed by at least 70 dB below the level of 1kHz sinusoid.

上图未达标。TODO:

5.8.3 参考的频响曲线

20241104_184623

Frequency response curve is recommended to fit into the tolerance limit. And it is required to be similar shape off requency response curve for speaker output path.

TODO: 回声路为什么会有那边大的差异?第一反应应该是透传回去的,以这个思路上看,参考的频率曲线应该是最好的。

5.8.4 信号完整性(Signal Integrity)

20241104_173400

The Mic In signal shall not show any dropouts or other irregular distortions.

频域和时域该连连,该段段,有点类似于AA认证中的1kHz项。

5.8.5 静态噪声

The electric SNR shall be above 70 dB relative to the level corresponding to 0 dBFSpk.

从寄存器中读取:

20241104_173720

上电后噪声会有所变化。

5.8.6 多麦一致性 (Inter Channel Delay and Gain Difference)

EachMicIn signals shall not show any delay or delay variations between all microphone channels There shall be no gain difference > 1 dB between allchannels without variation.

5.8.7 通道间串扰( Inter Channel Cross talk)

TODO:

5.8.8 Channel Order

The channel order shall be correct that the physical channel number is matching to the digital channel number.

5.8.9 音频质量

理想情况下,音质指的是实际声波与原始波形的接近程度,即回放出来的实际声波与原音频文件所保存的波形越接近,则音质越好。

实际评价标准为:

No abnormal sound or noise can be heard.

六、音频编码属性

6.1 采样率

44.1kHz, 48kHz和96kHz采样率的区别:来源 1. ADC/DAC和插件中可能的采样率优化。即硬件在特定采样率下的算法处理更优。 2. 高采样率采样出的信号非常适合处理。例如96kHz在0.5倍速下比较不会失真。

CD的标准采样率为44.1kHz。 另一种最为常见的采样率便是48kHz,它是电影以及视频声音的主要标准。

6.2 44.1kHz计算

PAL电视(Phase Alteration Line):场频50Hz,适应欧洲电网频率(50Hz),减少电源干扰。 NTSC电视(National Television System Committee):场频59.94Hz,与美国电网频率(60Hz)略有不同,设计上考虑了彩色电视的兼容性。

场频的概念源于早期的隔行扫描(Interlaced Scanning)电视技术。在PAL制式中,帧频为25Hz,场频为50Hz;在NTSC制式中,帧频为29.97Hz,场频为59.94Hz。

PAL制式的标准分辨率为720×576像素,NTSC制式的标准分辨率为720×480像素。

在模拟电视信号中,一帧图像由多条水平扫描线组成。PAL制式每帧有625行(576有效显示行数+49消隐期行数),NTSC制式每帧有525行(480有效显示行数+45消隐期行数)。(而扫描线是垂直方向的,因此用“行”更准确。)

对于NTSC制式(北美、日本),每帧525行,每秒29.97帧,每行可存储3个音频样本。计算得:29.97帧×525行×3样本≈44.056kHz,但为简化计算和实现整数倍关系,最终调整为44.1kHz。 对于PAL制式(欧洲),每帧625行,每秒25帧,每行同样存储3个样本。计算得:25帧×625行×3样本=46.875kHz,但为与NTSC制式兼容并简化设计,最终也调整为44.1kHz。

4.1kHz的采样率比20kHz的两倍稍高,能够确保完整捕捉人类听觉范围内的所有频率,并为滤波器的设计提供缓冲空间,确保人耳敏感的高频段保真度。

44.1kHz采样率使得同一设备可在PAL和NTSC制式下工作,无需为不同制式设计不同的音频处理电路。

6.3 重采样

[1]韩涛.音频重采样算法设计与实现[D].西安电子科技大学[2025-06-05].DOI:CNKI:CDMD:2.1013.124942.

由于抽取可能产生混叠,内插零值产生镜像,所以需要在抽取前进行抗混叠滤波,在内插零值后进行抗镜像滤波。这两种滤波都是以原始音频的截止频率处的低通滤波器。

补零后的滤波可能会引入信号的失真。因此,根据原始音频信号的相邻采样点,利用一定的插值算法(如线性插值、样条插值、多项式插值等)计算出新插入采样点的值,使插值后的信号在时间和幅度上都能更好地逼近原始信号。

重采样还分为整数倍采样和分数倍采样。三种音频重采样算法:线性重采样、拉格朗日重采样、正弦重采样

拉格朗日重采样和正弦重采样比线性重采样更适合进行上采样; 在下采样时,拉格朗日重采样 和正弦重采样算法的信噪比相对于线性重采样的优势没有上采样时明显。

拉格朗日重采样、正弦重采样的阶数w=5和w=10时,没明显区别。

20250606_170353

七、比特深度/位宽

来源

4-bit:16个数值,24dB的动态范围。有时也会用于极低保真的“bitcrushed”效果器上。 8-bit:256个数值,48dB的动态范围。经常用于早期的经典的视频游戏系统。 16-bit:65536个数值,96dB的动态范围,CD音频的标准比特深度。 24-bit:16777216个数值,145dB的动态范围,最常用的比特深度。 32或者 64-bit:“浮点”,目前可以做到提供最佳信噪比的数值,但是尚未被广泛采用。

采样点16bit 2^16=65536,即+- 32768 ≈ +-32k

7.1 声道

是指声音在录制或播放时在不同空间位置采集或回放的相互独立的音频信号,所以声道数也就是声音录制时的音源数量或回放时相应的扬声器数量。

立体声 Stereo:比如左声道+右声道组合起来就是立体声,低音没有单独分离。 多声道:超过2个声道的话统称为多声道(Multi-Channel)。 2.1声道:在2.0声道的基础上加上低音炮就是2.1声道。 3.1声道:在2.1声道上增加了一个中置声道, 中置声道用于人声对白。

7.2 编码

编解码可分为有损和无损两类,有损情况下,取语音中少量冗余信息,丢掉其他不重要的信息。语音编码分为: * 波形编码 * 时域编码:PCM编码 * 频域编码 * 参数编码:用若干参数对发声过程建模,接收端根据这些参数将接收到的信号恢复为原始语音信号,如LPC、MELP编码,在低比特率下参数编码的效果比波形编码好。参数编码不同的语音编码器在比特率、 复杂度、延迟和解码后的语音感知质量等方面有差异。 * 混合编码

根据编码语音的带宽,可以分为窄带、宽带、 超宽带和全通带四种带宽编码,其对应的采样率如表所示。

带宽 窄带 宽带 超宽带 全通带
频率 8kHz 16kHz 32kHz 48kHz

7.2.1 ffmpeg进行格式转换

编码查询:ffmpeg -codecs ffmpeg -y -f s16le -ac 6 -ar 16000 -i input.pcm -ss 00:00:23 -t 00:00:15 -y -f s16le -ac 6 -ar 16000 output.pcm

7.2.2 云端音频压缩

Speex压缩性能来源: 压缩率在0.39~0.06之间。压缩质量越高,需要的耗时越大。高质量压缩下,压缩耗时比较重,建议采用队列把录音和压缩操作分离。

7.2.3 预回声

预回声(Pre-echo)是语音和音频编码领域中常见的一种失真现象。

下面的内容为大模型直接产生: 预回声的产生原理 预回声通常出现在音频编码(如MP3、AAC等有损压缩算法)中,尤其是在处理瞬态信号(如打击乐、鼓点、爆破音等)时。其产生原因主要与编码算法的时间-频率转换量化误差有关:

  1. 时间-频率转换
  2. 音频编码器通常会将时域信号转换为频域信号(如通过MDCT、FFT等变换),以便对不同频率成分进行压缩。
  3. 瞬态信号在时域上非常短暂,但在频域上会扩散到较宽的时间窗口内。这种时间-频率的“模糊性”会导致瞬态信号的能量分散到其前后的时间片段中。

  4. 量化误差

  5. 在频域中,编码器会对信号进行量化(减少数据精度),量化误差会在逆变换回时域时引入失真。
  6. 对于瞬态信号,量化误差会在其发生前的时间片段中产生可听见的回声,即预回声。

预回声的特点 - 位置:预回声出现在瞬态信号发生之前,通常距离瞬态信号非常近(几毫秒到几十毫秒)。 - 强度:预回声的强度通常比瞬态信号本身弱,但在安静的环境中仍然可以被察觉。 - 频率特性:预回声的频率特性与瞬态信号相似,因为它是由瞬态信号的频域量化误差引起的。

示例: - 假设有一段鼓点音频,在鼓点敲击前的几毫秒内,突然出现了一段微弱的、与鼓点声音相似的“前奏”,这就是预回声。

预回声的影响 - 听觉质量下降:预回声会破坏音频的自然感和清晰度,尤其是在处理瞬态信号丰富的音乐(如古典音乐、电子音乐)时。 - 编码参数权衡:编码器需要在压缩比和预回声之间进行权衡。更高的压缩比可能导致更明显的预回声,而更低的压缩比会减少预回声但增加文件大小。

如何减少或避免预回声 编码器通过多种技术来减少预回声: 1. 自适应时间窗口: - 使用更短的时间窗口来处理瞬态信号,减少频域扩散。 - 例如,MP3编码器中的“窗口切换”技术会在检测到瞬态信号时切换到更短的窗口。 2. 心理声学模型: - 利用人耳对瞬态信号的掩蔽效应,允许在瞬态信号前后引入更大的量化误差而不被察觉。 3. 后处理技术: - 在解码端对预回声进行滤波或抑制,但这种方法可能增加计算复杂度。

总结 预回声是音频编码中由于时间-频率转换和量化误差导致的一种失真现象,尤其在处理瞬态信号时明显。它表现为瞬态信号发生前的微弱回声,会降低音频质量。编码器通过自适应时间窗口、心理声学模型等技术来减少预回声,但需要在压缩比和失真之间进行权衡。理解预回声有助于更好地评估音频编码算法的性能,并在实际应用中优化编码参数。

八、参考资料

Zhihu-封狼居胥:声学设计 github-python_speech_features