清晰的音频不仅仅取决于使用灵敏度更高的麦克风。在实际应用中,采集到的信号中往往包含背景噪声、电气噪声、混响、干扰以及来自其他方向的杂音。.
音频降噪 是指在保留重要语音、音乐或声学信息的同时,消除不需要的成分的过程。.
现代降噪系统可以结合多种技术,包括数字信号处理(DSP)、频谱分析、自适应滤波、统计估计、深度学习和多麦克风处理。.
本指南阐述了音频降噪背后的主要原理,以及各种方法在实际麦克风和声学系统中的应用。.
什么是音频降噪?
音频降噪是一种信号处理技术,用于在保持所需信号的同时,抑制录制或传输的音频信号中的不需要的噪声。.
一个简化的音频模型可以表示为:
y(t) = x(t) + n(t)
其中:
- y(t) 是观测到的含噪声信号
- x(t) 是目标信号
- n(t) 是指不需要的噪音
目标是从含噪声的观测数据中估计目标信号。.
然而,在实际系统中,噪声很少如此简单。一个麦克风可能会同时拾取:
- 麦克风本底噪声
- 电子电路噪声
- 风扇和空调的噪音
- 发动机和路噪
- 键盘声和敲击声
- 他人的讲话
- 扬声器漏音
- 混响
- 风噪
- 电磁干扰
正因如此,有效的音频降噪通常是一个系统层面的问题,而非单一算法所能解决的。.
为什么降噪对麦克风系统如此重要?
进入音频处理系统的声学信号的质量,对后续的所有环节都产生重大影响。.
例如
声学环境 → MEMS 麦克风 → 模拟/数字前端 → DSP → 降噪 → 语音增强 → AI 识别
如果原始麦克风信号的信噪比(SNR)较低、存在削波、失真或过多的背景噪声,后续算法所能处理的有用信息就会减少。.
这对以下情况尤为重要:
- 语音控制设备
- 会议麦克风
- 远场语音拾取
- 智能扬声器
- AI语音终端
- 教室音响系统
- 汽车语音系统
- 助听器及辅助设备
- 专业网络音频
- 声学传感系统
因此,一个设计良好的降噪系统,在应用复杂的算法之前,首先要确保良好的声学拾音效果和麦克风选择。.
音频噪声的主要类型
了解噪声的特性是选择降噪方法的第一步之一。.
1. 静态噪声
平稳噪声具有随时间推移相对稳定的统计特性。.
这方面的例子包括
- 风扇噪音
- 空调噪音
- 某些电子背景噪音
- 某些类型的宽带背景噪声
由于噪声特性变化缓慢,系统能够持续估计噪声谱并对其进行抑制。.
在这些条件下,频谱减法和维纳滤波等经典方法效果良好。.
2. 非平稳噪声
非平稳噪声会随着时间发生显著变化。.
这方面的例子包括
- 键盘点击声
- 门关闭
- 汽车喇叭
- 人们在交谈
- 突如其来的撞击声
- 变化的交通噪音
使用固定的噪声分布模型来模拟此类噪声要困难得多。.
现代系统可能会使用:
- 自适应噪声估计
- 语音活动检测
- 自适应滤波
- 麦克风阵列
- 波束成形
- 深度神经网络
以应对不断变化的声学条件。.
3. 白噪声
白噪声在整个频率范围内具有大致恒定的功率谱密度。.
由于其频谱特性定义明确,因此对算法测试很有帮助。.
然而,现实世界中的声学环境极少包含纯白噪声。实际噪声的频率分布往往更为复杂。.
4. 粉红噪声
粉红噪声的功率谱密度大致随频率的增加而减小。.
它常用于声学测试,因为其频谱特性比理想白噪声更接近某些真实环境。.
5. 脉冲噪声
脉冲噪声由持续时间短、振幅大的事件组成。.
这方面的例子包括
- 点击量
- 影响
- 键盘敲击声
- 电气瞬态
对于脉冲噪声,可能需要专门的检测和抑制措施,而不仅仅是简单地应用宽带降噪算法。.
为什么频域处理很重要
音频信号既可以在时域中分析,也可以在频域中分析。.
时域波形显示了信号振幅随时间的变化情况。.
频域表示法展示了信号能量在各频率上的分布情况。.
这一区分很重要,因为许多类型的噪声都分布在特定的频率范围内。.
例如,在频域中识别低频电子元件可能比在原始波形中更容易。.
傅里叶变换在这些两种表示形式之间架起了一座数学桥梁。.
在实际的数字音频处理中,工程师通常使用 快速傅立叶变换 (FFT) 以高效地计算频域信息。.
为什么短时傅里叶变换(STFT)在音频降噪中被广泛应用
语音以及许多其他声学信号都是非平稳的。它们的频谱成分会持续变化。.
因此,对整段语音录音仅进行一次FFT分析,无法提供足够的信息来反映频谱随时间的变化情况。.
SISTC的 短时傅立叶变换 (STFT) 该方法通过将信号划分为短的、通常相互重叠的帧,并为每帧计算频率表示,从而解决了这个问题。这样就得到了信号的时间-频率表示。.
一个典型的基于STFT的处理流程如下:
音频输入 → 分帧 → 窗口化 → FFT → 噪声估计 → 增益/掩蔽计算 → IFFT → 重叠加法
许多经典和现代的音频增强算法都采用了这一框架。.
经典音频降噪算法
在深度学习兴起之前,工程师们已经开发出了许多有效的统计和信号处理方法来降低噪声。.
其中一些技术至今仍很有用,特别是在低延迟、低功耗和可预测的计算需求至关重要的情况下。.
光谱减法
频谱减法是最简单的频域降噪技术之一。.
基本思路是:
- 计算带噪声信号的频谱。.
- 估计噪声谱。.
- 从含噪声频谱中减去估计的噪声。.
- 应用适当的约束和平滑处理。.
- 重建时域信号。.
功率谱的简化表达式为:
P̂x(f) = max[Py(f) − αPn(f), Pmin(f)]
其中:
- Py(f) 是噪声信号的功率谱
- Pn(f) 是估计的噪声功率谱
- α 是一个超减因子
- Pmin(f) 是一个谱底
该方法计算效率高,且相对容易实现。.
其主要局限在于可能出现 音乐噪音, ,这是由于对个别时频分量的抑制不稳定而产生的人为残余噪声。.
因此,实际实现中通常会采用频域平滑、时域平滑、增益下限或更先进的噪声估计方法。.
维纳滤波
维纳滤波采用统计方法进行信号估计。.
简化的频域维纳增益可表示为:
H(f) = Ps(f) / [Ps(f) + Pn(f)]
其中:
- Ps(f) 表示估计的信号功率
- Pn(f) 表示估计的噪声功率
当信号在某个频率范围内占主导地位时,增益趋近于1。.
当噪声占主导地位时,增益会变小。.
维纳滤波相比基本的频谱减法能提供更平滑的抑制效果,但其性能在很大程度上取决于信号和噪声功率估计的准确性。.
这使得 噪声功率谱密度估计 实用维纳滤波系统的一个关键组成部分。.
自适应噪音消除
当存在与不需要的噪声相关的参考信号时,自适应滤波就派上用场了。.
一个典型的自适应降噪系统包含:
主麦克风 → 目标信号 + 噪声
与
参考麦克风 → 噪声参考
自适应滤波器会估算主信号中包含的噪声分量,并将其扣除。.
常见的算法包括:
- LMS
- NLMS
- RLS
当参考信号的振幅发生显著变化时,NLMS 特别有用,因为它会根据输入信号的能量对适应步骤进行归一化处理。.
自适应滤波在以下应用中具有广泛的相关性:
- 汽车语音采集
- 耳机系统
- 声回波控制
- 多传感器降噪
然而,参考信号必须经过精心设计。如果其中包含过多的目标语音,算法可能会无意中压制目标信号。.
NMF及其他统计方法
非负矩阵分解(NMF) 可以将谱图表示为非负基分量与激活模式的组合。.
这使得能够分别对语音和噪声中的周期性结构进行建模。.
其他经典方法包括:
- 基于子空间的方法
- 小波去噪
- 统计语音增强
- 最小统计量噪声估计
- 递归噪声跟踪
在计算效率和可解释性至关重要的应用场景中,这些方法仍然很有用。.
基于人工智能的音频降噪
深度学习极大地拓展了现代语音增强系统的功能。.
与完全依赖人工设计的数学噪声模型不同,神经网络可以从训练数据中学习噪声音频与干净音频之间的关系。.
一种简化的监督学习方法是:
有噪音的音频 → 神经网络 → 增强后的音频
或者:
噪声音频 → 神经网络 → 时频掩码 → 音频重建
常见的网络架构包括:
- DNN
- CNN
- RNN
- LSTM
- GRU
- U-Net
- GAN
- 基于Transformer的模型
基于深度神经网络的降噪
深度神经网络(DNN)能够处理谱特征并估计:
- 干净的幅度谱
- 理想比例面具
- 二进制掩码
- 噪声谱
- 增强的语音表示
与更复杂的架构相比,基于深度神经网络(DNN)的方法相对简单,但它们在建模长时序关系方面的能力可能有限。.
基于CNN的降噪
卷积神经网络(CNN)能够分析时频表示中的局部模式。.
这使得它们在识别以下结构时非常有用:
- 语音谐波
- 共振峰
- 瞬态噪声
- 光谱图
当架构设计得当,基于CNN的模型也可以针对实时处理进行优化。.
RNN、LSTM 和 GRU
言语本质上具有时间性。.
因此,基于RNN的架构在估计当前音频帧时,可以利用前一帧的信息。.
LSTM 和 GRU 架构通常用于改善对时间依赖性的处理,同时克服基本 RNN 的一些局限性。.
这使得递归模型在时间上下文至关重要的、噪声不断变化的环境中非常有用。.
基于Transformer的音频增强
Transformer 架构利用注意力机制来建模序列之间的关系。.
与许多传统的逐帧方法相比,它们能够捕捉更长距离的依赖关系。.
然而,在将基于Transformer的模型部署到嵌入式或实时音频产品中时,必须仔细考虑计算复杂度、内存需求、模型大小和延迟。.
最先进的模型并不一定就是最合适的模型。.
经典DSP与AI降噪技术对比
一个实际的比较如下:
| 因子 | 经典DSP | 基于人工智能的处理 |
|---|---|---|
| 计算需求 | 通常较低 | 通常较高 |
| 模型可解释性 | 高 | 较低 |
| 训练数据 | 非必填项 | 通常需要 |
| 对复杂噪声的适应性 | 受车型限制 | 可能很强 |
| 延迟控制 | 可预见的 | 取决于体系结构 |
| 嵌入式部署 | 通常更容易 | 需要优化 |
| 参数调优 | 基于人工/工程 | 基于数据/模型的 |
| 概括 | 基于信号假设 | 这在很大程度上取决于训练数据 |
这并不意味着人工智能应该取代DSP。.
在许多实际产品中,最有效的架构是 混合动力系统 该技术融合了声学设计、经典DSP、空间处理和人工智能。.
为什么麦克风阵列能提升降噪效果
单个麦克风主要提供关于某个空间位置处声学信号的信息。.
麦克风阵列还提供了更多功能:
空间信息。.
假设由于位置不同,几支麦克风在略有时间差的情况下接收到了同一说话者的声音。.
这些差异可用于估算声源方向,并增强来自目标方向的声音。.
这就是其背后的基本思路 波束成形.
简化的波束成形输出可表示为:
y(t) = Σ wm xm(t − Δm)
其中:
- xm(t) 是来自麦克风 m 的信号
- wm 是麦克风的重量吗
- Δm 是相应的延迟补偿
当天线阵列设计正确时,来自目标方向的信号可以发生 constructive 叠加,而来自其他方向的信号则会被衰减。.
这与单通道降噪在根本上有所不同。.
麦克风阵列降噪
现代多麦克风系统可以结合以下几个阶段:
MEMS 麦克风
↓
同步
↓
空间滤波/波束成形
↓
噪声估计
↓
后处理
↓
AI增强
↓
AEC / AGC / 附加处理
↓
增强型语音输出
这种架构在以下方面尤其有用:
- 会议室
- 教室
- 智能扬声器
- 远场语音接口
- 会议室系统
- AI语音终端
- 专业音响系统
麦克风阵列并不能自动消除噪声。其性能取决于麦克风匹配、阵列几何结构、麦克风间距、同步性、声学环境、波束成形设计以及后续处理。.
一个麦克风阵列需要多少个麦克风?
没有一个放之四海皆准的数字。.
具体数量取决于:
- 目标拾取距离
- 频率范围
- 所需的指向性
- 物理尺寸
- 波束宽度
- 干扰源的数量
- 功耗
- 处理能力
- 产品成本
双麦克风系统可以提供有用的空间信息。.
四麦克风阵列可以提供更大的灵活性。.
虽然八麦克风阵列会增加对硬件、同步、处理和功耗的要求,但它也能提供更多的空间信息,并带来更先进的波束成形可能性。.
因此,应根据声学要求确定正确的阵列配置,而不是简单地选择麦克风数量最多的方案。.
实时音频降噪
一种降噪算法在离线实验中可能表现良好,但在实际产品中却仍会失败。.
实时系统必须满足以下额外约束条件:
延迟
音频处理必须在可用的帧预算内完成。.
计算负荷
处理器必须以足够快的速度完成FFT、滤波、神经网络推理及其他运算,以防止缓冲区溢出。.
记忆
缓冲区、模型参数、中间结果和音频帧都会占用内存和存储空间。.
耗电量
对于电池供电的设备而言,这一点尤为重要。.
稳定性
该算法必须在不同的噪声水平和声学环境下均保持可靠性。.
音质
过度的噪声抑制可能会导致出现伪影、语音失真或声音不自然。.
因此,实时降噪是一项 音频系统工程问题, ,而不仅仅是一个算法选择问题。.
应如何评估音频降噪性能?
没有任何一项指标能够全面描述降噪性能的各个方面。.
常见的评估方法包括:
信噪比
测量信号功率与噪声功率之比。.
有助于理解噪声抑制,但并不能完全描述感知质量。.
STOI
STOI 旨在评估语音可懂度,当目标是保持语音理解能力时,该方法会很有用。.
PESQ 与现代客观质量衡量标准
PESQ 历来被广泛用于语音质量评估。然而,ITU-T P.862 已于 2024 年被撤销,目前 ITU-T 建议书系列已将客观听感质量预测的参考标准指向 P.863 及相关建议书。.
MOS
平均意见评分(Mean Opinion Score)通过人类听众来评估感知质量。.
在产品验证方面,主观聆听依然很重要,因为数值指标无法捕捉到所有的失真现象或感知上的权衡。.
因此,一个切实可行的评估流程应将以下方面结合起来:
客观指标 + 听感测试 + 应用层性能
例如,一款专为语音识别设计的麦克风,不应仅凭波形听起来有多“干净”来评估其性能。在真实环境中的识别准确率、可懂度、延迟以及鲁棒性也可能至关重要。.
麦克风前端的重要性
降噪领域最重要的工程原理之一是:
不要指望算法能解决声学和硬件前端造成的所有问题。.
一个完整的音频链可能包括:
声学环境
→ 麦克风
→ 模拟前端 / ADC
→ 数字音频接口
→ DSP
→ 降低噪音
→ 语音增强
→ AI处理
如果麦克风发生过载、ADC饱和、信号信噪比(SNR)较差,或者麦克风阵列匹配不良,那么在DSP开始处理之前,信息可能就已经丢失了。.
正因如此,应将麦克风选型、声学设计、信号调理、同步以及算法设计作为一个整体来综合考虑。.
实用的音频降噪工作流程
对于新的麦克风或声学传感项目,一个结构化的工作流程会很有帮助。.
步骤 1:定义声学环境
识别:
- 所需声源
- 距离
- 背景噪音
- 混响
- 相互竞争的发言者
- 预期声压级范围
步骤 2:选择麦克风架构
确定该应用程序是否需要:
步骤 3:测量原始信号
评估:
- 信噪比
- 灵敏度
- 频率响应
- 失真
- 自噪声
- 通道匹配
第 4 步:分析噪声
判断该噪声属于:
- 静止的
- 非平稳
- 宽带
- 窄带
- 冲动
- 空间相关
第 5 步:选择处理架构
可能的方法包括:
- 光谱减法
- 维纳滤波
- 自适应滤波
- 波束成形
- 后处理
- DNN/CNN/RNN 处理
- 混合式 DSP + AI
第 6 步:针对目标平台进行优化
考虑一下
- CPU/DSP/NPU 资源
- 记忆
- 延迟
- 功率
- 采样率
- 帧尺寸
第 7 步:使用真实录音进行验证
实验室测试虽然有用,但真实环境才是关键。.
测试环境:
- 安静的环境
- 中等噪音
- 高噪声
- 变化的噪音
- 多人交谈
- 有回声的环境
- 不同的光源位置
音频降噪技术未来将走向何方?
音频处理技术的发展正日益朝着……的方向发展 混合声学智能.
现代系统不再将麦克风、DSP、AI模型和声学环境视为独立的组件,而是越来越多地将它们结合在一起:
高品质 MEMS 麦克风
麦克风阵列
空间信号处理
DSP
人工智能降噪
实时嵌入式处理
这种方法使系统能够同时使用 空间信息 与 时频信息.
例如,麦克风阵列可以先增强包含目标说话者的空间区域,随后由DSP或AI模型进一步抑制残留噪声。.
这种组合在远场人声拾音、会议、课堂音频、智能设备以及其他目标人声与麦克风距离较远的应用场景中,尤其具有价值。.
结论
音频降噪技术已从相对简单的滤波技术发展成为一个融合了声学、数字信号处理(DSP)、统计信号处理、麦克风阵列、嵌入式计算和人工智能等多学科的领域。.
诸如谱减法、维纳滤波和自适应滤波等经典方法仍然很有用,因为它们计算成本低且行为可预测。.
基于人工智能的方法能够应对更复杂的声学条件,但同时也对训练数据、模型优化、计算资源和验证提出了新的要求。.
麦克风阵列还增添了另一个重要维度: 空间信息.
因此,最实用的解决方案并不总是最复杂的算法。一个设计良好的音频系统应从声学前端和麦克风架构入手,然后根据应用需求,合理组合空间处理、DSP和AI技术。.
对于麦克风制造商和音频系统开发商而言,关键在于将 麦克风硬件、声学设计、信号处理和软件作为一个集成系统.
常见问题
什么是音频降噪?
音频降噪是指在保留所需语音、音乐或声学信号的同时,减少不需要的声学或电子噪声的过程。.
最常见的音频降噪算法有哪些?
常见的方法包括频谱减法、维纳滤波、自适应滤波、子空间方法、基于小波的处理、NMF以及基于深度学习的语音增强。.
降噪和降噪有什么区别?
降噪通常指抑制音频信号中的不需要成分。而降噪技术则更具体地指生成或估计一个反向信号,例如在主动降噪或自适应降噪中。具体术语的选用取决于具体应用场景。.
麦克风阵列能降低背景噪音吗?
是的。麦克风阵列可以利用空间信息来提高指向性,并抑制来自不需要方向的声音。其性能取决于麦克风的布置、间距、同步性、波束成形设计以及声学环境。.
AI降噪比传统的DSP更好吗?
人工智能和传统数字信号处理(DSP)各有优势。人工智能能够对复杂且非平稳的声学模式进行建模,而传统数字信号处理则具有计算需求低、行为可预测以及在资源受限系统中更易于部署等特点。混合架构可以结合这两种方法。.
降噪需要多少个麦克风?
没有一个放之四海皆准的数值。合适的数量取决于所需的拾音范围、指向性、阵列几何结构、频率范围、处理能力、功耗预算以及具体应用。.
信噪比(SNR)对麦克风系统为何重要?
信噪比(SNR)反映了有用信号功率与噪声功率之间的关系。质量更高的声学前端通常能为下游的DSP和AI算法提供更多有用的信息。.
在音频处理中,短时傅里叶变换(STFT)有什么用途?
STFT 通过分析音频信号中短暂且相互重叠的片段,提供一种时频表示。它被广泛应用于频谱分析、噪声估计、语音增强以及许多频域音频算法中。.
关于 SISTC
无锡硅源科技有限公司(SISTC)致力于开发MEMS麦克风和声学传感解决方案,适用于需要可靠音频采集、降噪、麦克风阵列及智能声学处理的应用场景。.
我们的产品开发融合了 MEMS 麦克风技术、麦克风阵列设计、信号处理、基于人工智能的音频增强以及软硬件集成 以适应不同的声学环境和系统要求。.
权威参考资料
ITU-T P.863 / 客观语音质量
ITU-T P.862 / PESQ 历史参考
SciPy 短时傅里叶变换文档