音频降噪:DSP、AI 和麦克风阵列方法的完整指南

清晰的音频不仅仅取决于使用灵敏度更高的麦克风。在实际应用中,采集到的信号中往往包含背景噪声、电气噪声、混响、干扰以及来自其他方向的杂音。.

音频降噪 是指在保留重要语音、音乐或声学信息的同时,消除不需要的成分的过程。.

现代降噪系统可以结合多种技术,包括数字信号处理(DSP)、频谱分析、自适应滤波、统计估计、深度学习和多麦克风处理。.

本指南阐述了音频降噪背后的主要原理,以及各种方法在实际麦克风和声学系统中的应用。.


什么是音频降噪?

音频降噪是一种信号处理技术,用于在保持所需信号的同时,抑制录制或传输的音频信号中的不需要的噪声。.

一个简化的音频模型可以表示为:

y(t) = x(t) + n(t)

其中:

  • y(t) 是观测到的含噪声信号
  • x(t) 是目标信号
  • n(t) 是指不需要的噪音

目标是从含噪声的观测数据中估计目标信号。.

然而,在实际系统中,噪声很少如此简单。一个麦克风可能会同时拾取:

  • 麦克风本底噪声
  • 电子电路噪声
  • 风扇和空调的噪音
  • 发动机和路噪
  • 键盘声和敲击声
  • 他人的讲话
  • 扬声器漏音
  • 混响
  • 风噪
  • 电磁干扰

正因如此,有效的音频降噪通常是一个系统层面的问题,而非单一算法所能解决的。.


为什么降噪对麦克风系统如此重要?

进入音频处理系统的声学信号的质量,对后续的所有环节都产生重大影响。.

例如

声学环境 → MEMS 麦克风 → 模拟/数字前端 → DSP → 降噪 → 语音增强 → AI 识别

如果原始麦克风信号的信噪比(SNR)较低、存在削波、失真或过多的背景噪声,后续算法所能处理的有用信息就会减少。.

这对以下情况尤为重要:

  • 语音控制设备
  • 会议麦克风
  • 远场语音拾取
  • 智能扬声器
  • AI语音终端
  • 教室音响系统
  • 汽车语音系统
  • 助听器及辅助设备
  • 专业网络音频
  • 声学传感系统

因此,一个设计良好的降噪系统,在应用复杂的算法之前,首先要确保良好的声学拾音效果和麦克风选择。.


音频噪声的主要类型

了解噪声的特性是选择降噪方法的第一步之一。.

1. 静态噪声

平稳噪声具有随时间推移相对稳定的统计特性。.

这方面的例子包括

  • 风扇噪音
  • 空调噪音
  • 某些电子背景噪音
  • 某些类型的宽带背景噪声

由于噪声特性变化缓慢,系统能够持续估计噪声谱并对其进行抑制。.

在这些条件下,频谱减法和维纳滤波等经典方法效果良好。.


2. 非平稳噪声

非平稳噪声会随着时间发生显著变化。.

这方面的例子包括

  • 键盘点击声
  • 门关闭
  • 汽车喇叭
  • 人们在交谈
  • 突如其来的撞击声
  • 变化的交通噪音

使用固定的噪声分布模型来模拟此类噪声要困难得多。.

现代系统可能会使用:

  • 自适应噪声估计
  • 语音活动检测
  • 自适应滤波
  • 麦克风阵列
  • 波束成形
  • 深度神经网络

以应对不断变化的声学条件。.


3. 白噪声

白噪声在整个频率范围内具有大致恒定的功率谱密度。.

由于其频谱特性定义明确,因此对算法测试很有帮助。.

然而,现实世界中的声学环境极少包含纯白噪声。实际噪声的频率分布往往更为复杂。.


4. 粉红噪声

粉红噪声的功率谱密度大致随频率的增加而减小。.

它常用于声学测试,因为其频谱特性比理想白噪声更接近某些真实环境。.


5. 脉冲噪声

脉冲噪声由持续时间短、振幅大的事件组成。.

这方面的例子包括

  • 点击量
  • 影响
  • 键盘敲击声
  • 电气瞬态

对于脉冲噪声,可能需要专门的检测和抑制措施,而不仅仅是简单地应用宽带降噪算法。.


为什么频域处理很重要

音频信号既可以在时域中分析,也可以在频域中分析。.

时域波形显示了信号振幅随时间的变化情况。.

频域表示法展示了信号能量在各频率上的分布情况。.

这一区分很重要,因为许多类型的噪声都分布在特定的频率范围内。.

例如,在频域中识别低频电子元件可能比在原始波形中更容易。.

傅里叶变换在这些两种表示形式之间架起了一座数学桥梁。.

在实际的数字音频处理中,工程师通常使用 快速傅立叶变换 (FFT) 以高效地计算频域信息。.


为什么短时傅里叶变换(STFT)在音频降噪中被广泛应用

语音以及许多其他声学信号都是非平稳的。它们的频谱成分会持续变化。.

因此,对整段语音录音仅进行一次FFT分析,无法提供足够的信息来反映频谱随时间的变化情况。.

SISTC的 短时傅立叶变换 (STFT) 该方法通过将信号划分为短的、通常相互重叠的帧,并为每帧计算频率表示,从而解决了这个问题。这样就得到了信号的时间-频率表示。.

一个典型的基于STFT的处理流程如下:

音频输入 → 分帧 → 窗口化 → FFT → 噪声估计 → 增益/掩蔽计算 → IFFT → 重叠加法

许多经典和现代的音频增强算法都采用了这一框架。.


经典音频降噪算法

在深度学习兴起之前,工程师们已经开发出了许多有效的统计和信号处理方法来降低噪声。.

其中一些技术至今仍很有用,特别是在低延迟、低功耗和可预测的计算需求至关重要的情况下。.


光谱减法

频谱减法是最简单的频域降噪技术之一。.

基本思路是:

  1. 计算带噪声信号的频谱。.
  2. 估计噪声谱。.
  3. 从含噪声频谱中减去估计的噪声。.
  4. 应用适当的约束和平滑处理。.
  5. 重建时域信号。.

功率谱的简化表达式为:

P̂x(f) = max[Py(f) − αPn(f), Pmin(f)]

其中:

  • Py(f) 是噪声信号的功率谱
  • Pn(f) 是估计的噪声功率谱
  • α 是一个超减因子
  • Pmin(f) 是一个谱底

该方法计算效率高,且相对容易实现。.

其主要局限在于可能出现 音乐噪音, ,这是由于对个别时频分量的抑制不稳定而产生的人为残余噪声。.

因此,实际实现中通常会采用频域平滑、时域平滑、增益下限或更先进的噪声估计方法。.


维纳滤波

维纳滤波采用统计方法进行信号估计。.

简化的频域维纳增益可表示为:

H(f) = Ps(f) / [Ps(f) + Pn(f)]

其中:

  • Ps(f) 表示估计的信号功率
  • Pn(f) 表示估计的噪声功率

当信号在某个频率范围内占主导地位时,增益趋近于1。.

当噪声占主导地位时,增益会变小。.

维纳滤波相比基本的频谱减法能提供更平滑的抑制效果,但其性能在很大程度上取决于信号和噪声功率估计的准确性。.

这使得 噪声功率谱密度估计 实用维纳滤波系统的一个关键组成部分。.


自适应噪音消除

当存在与不需要的噪声相关的参考信号时,自适应滤波就派上用场了。.

一个典型的自适应降噪系统包含:

主麦克风 → 目标信号 + 噪声

参考麦克风 → 噪声参考

自适应滤波器会估算主信号中包含的噪声分量,并将其扣除。.

常见的算法包括:

  • LMS
  • NLMS
  • RLS

当参考信号的振幅发生显著变化时,NLMS 特别有用,因为它会根据输入信号的能量对适应步骤进行归一化处理。.

自适应滤波在以下应用中具有广泛的相关性:

  • 汽车语音采集
  • 耳机系统
  • 声回波控制
  • 多传感器降噪

然而,参考信号必须经过精心设计。如果其中包含过多的目标语音,算法可能会无意中压制目标信号。.


NMF及其他统计方法

非负矩阵分解(NMF) 可以将谱图表示为非负基分量与激活模式的组合。.

这使得能够分别对语音和噪声中的周期性结构进行建模。.

其他经典方法包括:

  • 基于子空间的方法
  • 小波去噪
  • 统计语音增强
  • 最小统计量噪声估计
  • 递归噪声跟踪

在计算效率和可解释性至关重要的应用场景中,这些方法仍然很有用。.


基于人工智能的音频降噪

深度学习极大地拓展了现代语音增强系统的功能。.

与完全依赖人工设计的数学噪声模型不同,神经网络可以从训练数据中学习噪声音频与干净音频之间的关系。.

一种简化的监督学习方法是:

有噪音的音频 → 神经网络 → 增强后的音频

或者:

噪声音频 → 神经网络 → 时频掩码 → 音频重建

常见的网络架构包括:

  • DNN
  • CNN
  • RNN
  • LSTM
  • GRU
  • U-Net
  • GAN
  • 基于Transformer的模型

基于深度神经网络的降噪

深度神经网络(DNN)能够处理谱特征并估计:

  • 干净的幅度谱
  • 理想比例面具
  • 二进制掩码
  • 噪声谱
  • 增强的语音表示

与更复杂的架构相比,基于深度神经网络(DNN)的方法相对简单,但它们在建模长时序关系方面的能力可能有限。.


基于CNN的降噪

卷积神经网络(CNN)能够分析时频表示中的局部模式。.

这使得它们在识别以下结构时非常有用:

  • 语音谐波
  • 共振峰
  • 瞬态噪声
  • 光谱图

当架构设计得当,基于CNN的模型也可以针对实时处理进行优化。.


RNN、LSTM 和 GRU

言语本质上具有时间性。.

因此,基于RNN的架构在估计当前音频帧时,可以利用前一帧的信息。.

LSTM 和 GRU 架构通常用于改善对时间依赖性的处理,同时克服基本 RNN 的一些局限性。.

这使得递归模型在时间上下文至关重要的、噪声不断变化的环境中非常有用。.


基于Transformer的音频增强

Transformer 架构利用注意力机制来建模序列之间的关系。.

与许多传统的逐帧方法相比,它们能够捕捉更长距离的依赖关系。.

然而,在将基于Transformer的模型部署到嵌入式或实时音频产品中时,必须仔细考虑计算复杂度、内存需求、模型大小和延迟。.

最先进的模型并不一定就是最合适的模型。.


经典DSP与AI降噪技术对比

一个实际的比较如下:

因子经典DSP基于人工智能的处理
计算需求通常较低通常较高
模型可解释性较低
训练数据非必填项通常需要
对复杂噪声的适应性受车型限制可能很强
延迟控制可预见的取决于体系结构
嵌入式部署通常更容易需要优化
参数调优基于人工/工程基于数据/模型的
概括基于信号假设这在很大程度上取决于训练数据

这并不意味着人工智能应该取代DSP。.

在许多实际产品中,最有效的架构是 混合动力系统 该技术融合了声学设计、经典DSP、空间处理和人工智能。.


为什么麦克风阵列能提升降噪效果

单个麦克风主要提供关于某个空间位置处声学信号的信息。.

麦克风阵列还提供了更多功能:

空间信息。.

假设由于位置不同,几支麦克风在略有时间差的情况下接收到了同一说话者的声音。.

这些差异可用于估算声源方向,并增强来自目标方向的声音。.

这就是其背后的基本思路 波束成形.

简化的波束成形输出可表示为:

y(t) = Σ wm xm(t − Δm)

其中:

  • xm(t) 是来自麦克风 m 的信号
  • wm 是麦克风的重量吗
  • Δm 是相应的延迟补偿

当天线阵列设计正确时,来自目标方向的信号可以发生 constructive 叠加,而来自其他方向的信号则会被衰减。.

这与单通道降噪在根本上有所不同。.


麦克风阵列降噪

现代多麦克风系统可以结合以下几个阶段:

MEMS 麦克风

同步

空间滤波/波束成形

噪声估计

后处理

AI增强

AEC / AGC / 附加处理

增强型语音输出

这种架构在以下方面尤其有用:

  • 会议室
  • 教室
  • 智能扬声器
  • 远场语音接口
  • 会议室系统
  • AI语音终端
  • 专业音响系统

麦克风阵列并不能自动消除噪声。其性能取决于麦克风匹配、阵列几何结构、麦克风间距、同步性、声学环境、波束成形设计以及后续处理。.


一个麦克风阵列需要多少个麦克风?

没有一个放之四海皆准的数字。.

具体数量取决于:

  • 目标拾取距离
  • 频率范围
  • 所需的指向性
  • 物理尺寸
  • 波束宽度
  • 干扰源的数量
  • 功耗
  • 处理能力
  • 产品成本

双麦克风系统可以提供有用的空间信息。.

四麦克风阵列可以提供更大的灵活性。.

虽然八麦克风阵列会增加对硬件、同步、处理和功耗的要求,但它也能提供更多的空间信息,并带来更先进的波束成形可能性。.

因此,应根据声学要求确定正确的阵列配置,而不是简单地选择麦克风数量最多的方案。.


实时音频降噪

一种降噪算法在离线实验中可能表现良好,但在实际产品中却仍会失败。.

实时系统必须满足以下额外约束条件:

延迟

音频处理必须在可用的帧预算内完成。.

计算负荷

处理器必须以足够快的速度完成FFT、滤波、神经网络推理及其他运算,以防止缓冲区溢出。.

记忆

缓冲区、模型参数、中间结果和音频帧都会占用内存和存储空间。.

耗电量

对于电池供电的设备而言,这一点尤为重要。.

稳定性

该算法必须在不同的噪声水平和声学环境下均保持可靠性。.

音质

过度的噪声抑制可能会导致出现伪影、语音失真或声音不自然。.

因此,实时降噪是一项 音频系统工程问题, ,而不仅仅是一个算法选择问题。.


应如何评估音频降噪性能?

没有任何一项指标能够全面描述降噪性能的各个方面。.

常见的评估方法包括:

信噪比

测量信号功率与噪声功率之比。.

有助于理解噪声抑制,但并不能完全描述感知质量。.

STOI

STOI 旨在评估语音可懂度,当目标是保持语音理解能力时,该方法会很有用。.

PESQ 与现代客观质量衡量标准

PESQ 历来被广泛用于语音质量评估。然而,ITU-T P.862 已于 2024 年被撤销,目前 ITU-T 建议书系列已将客观听感质量预测的参考标准指向 P.863 及相关建议书。.

MOS

平均意见评分(Mean Opinion Score)通过人类听众来评估感知质量。.

在产品验证方面,主观聆听依然很重要,因为数值指标无法捕捉到所有的失真现象或感知上的权衡。.

因此,一个切实可行的评估流程应将以下方面结合起来:

客观指标 + 听感测试 + 应用层性能

例如,一款专为语音识别设计的麦克风,不应仅凭波形听起来有多“干净”来评估其性能。在真实环境中的识别准确率、可懂度、延迟以及鲁棒性也可能至关重要。.


麦克风前端的重要性

降噪领域最重要的工程原理之一是:

不要指望算法能解决声学和硬件前端造成的所有问题。.

一个完整的音频链可能包括:

声学环境

麦克风

模拟前端 / ADC

数字音频接口

DSP

降低噪音

语音增强

AI处理

如果麦克风发生过载、ADC饱和、信号信噪比(SNR)较差,或者麦克风阵列匹配不良,那么在DSP开始处理之前,信息可能就已经丢失了。.

正因如此,应将麦克风选型、声学设计、信号调理、同步以及算法设计作为一个整体来综合考虑。.


实用的音频降噪工作流程

对于新的麦克风或声学传感项目,一个结构化的工作流程会很有帮助。.

步骤 1:定义声学环境

识别:

  • 所需声源
  • 距离
  • 背景噪音
  • 混响
  • 相互竞争的发言者
  • 预期声压级范围

步骤 2:选择麦克风架构

确定该应用程序是否需要:

步骤 3:测量原始信号

评估:

  • 信噪比
  • 灵敏度
  • 频率响应
  • 失真
  • 自噪声
  • 通道匹配

第 4 步:分析噪声

判断该噪声属于:

  • 静止的
  • 非平稳
  • 宽带
  • 窄带
  • 冲动
  • 空间相关

第 5 步:选择处理架构

可能的方法包括:

  • 光谱减法
  • 维纳滤波
  • 自适应滤波
  • 波束成形
  • 后处理
  • DNN/CNN/RNN 处理
  • 混合式 DSP + AI

第 6 步:针对目标平台进行优化

考虑一下

  • CPU/DSP/NPU 资源
  • 记忆
  • 延迟
  • 功率
  • 采样率
  • 帧尺寸

第 7 步:使用真实录音进行验证

实验室测试虽然有用,但真实环境才是关键。.

测试环境:

  • 安静的环境
  • 中等噪音
  • 高噪声
  • 变化的噪音
  • 多人交谈
  • 有回声的环境
  • 不同的光源位置

音频降噪技术未来将走向何方?

音频处理技术的发展正日益朝着……的方向发展 混合声学智能.

现代系统不再将麦克风、DSP、AI模型和声学环境视为独立的组件,而是越来越多地将它们结合在一起:

高品质 MEMS 麦克风

麦克风阵列

空间信号处理

DSP

人工智能降噪

实时嵌入式处理

这种方法使系统能够同时使用 空间信息时频信息.

例如,麦克风阵列可以先增强包含目标说话者的空间区域,随后由DSP或AI模型进一步抑制残留噪声。.

这种组合在远场人声拾音、会议、课堂音频、智能设备以及其他目标人声与麦克风距离较远的应用场景中,尤其具有价值。.


结论

音频降噪技术已从相对简单的滤波技术发展成为一个融合了声学、数字信号处理(DSP)、统计信号处理、麦克风阵列、嵌入式计算和人工智能等多学科的领域。.

诸如谱减法、维纳滤波和自适应滤波等经典方法仍然很有用,因为它们计算成本低且行为可预测。.

基于人工智能的方法能够应对更复杂的声学条件,但同时也对训练数据、模型优化、计算资源和验证提出了新的要求。.

麦克风阵列还增添了另一个重要维度: 空间信息.

因此,最实用的解决方案并不总是最复杂的算法。一个设计良好的音频系统应从声学前端和麦克风架构入手,然后根据应用需求,合理组合空间处理、DSP和AI技术。.

对于麦克风制造商和音频系统开发商而言,关键在于将 麦克风硬件、声学设计、信号处理和软件作为一个集成系统.


常见问题

什么是音频降噪?

音频降噪是指在保留所需语音、音乐或声学信号的同时,减少不需要的声学或电子噪声的过程。.

最常见的音频降噪算法有哪些?

常见的方法包括频谱减法、维纳滤波、自适应滤波、子空间方法、基于小波的处理、NMF以及基于深度学习的语音增强。.

降噪和降噪有什么区别?

降噪通常指抑制音频信号中的不需要成分。而降噪技术则更具体地指生成或估计一个反向信号,例如在主动降噪或自适应降噪中。具体术语的选用取决于具体应用场景。.

麦克风阵列能降低背景噪音吗?

是的。麦克风阵列可以利用空间信息来提高指向性,并抑制来自不需要方向的声音。其性能取决于麦克风的布置、间距、同步性、波束成形设计以及声学环境。.

AI降噪比传统的DSP更好吗?

人工智能和传统数字信号处理(DSP)各有优势。人工智能能够对复杂且非平稳的声学模式进行建模,而传统数字信号处理则具有计算需求低、行为可预测以及在资源受限系统中更易于部署等特点。混合架构可以结合这两种方法。.

降噪需要多少个麦克风?

没有一个放之四海皆准的数值。合适的数量取决于所需的拾音范围、指向性、阵列几何结构、频率范围、处理能力、功耗预算以及具体应用。.

信噪比(SNR)对麦克风系统为何重要?

信噪比(SNR)反映了有用信号功率与噪声功率之间的关系。质量更高的声学前端通常能为下游的DSP和AI算法提供更多有用的信息。.

在音频处理中,短时傅里叶变换(STFT)有什么用途?

STFT 通过分析音频信号中短暂且相互重叠的片段,提供一种时频表示。它被广泛应用于频谱分析、噪声估计、语音增强以及许多频域音频算法中。.


关于 SISTC

无锡硅源科技有限公司(SISTC)致力于开发MEMS麦克风和声学传感解决方案,适用于需要可靠音频采集、降噪、麦克风阵列及智能声学处理的应用场景。.

我们的产品开发融合了 MEMS 麦克风技术、麦克风阵列设计、信号处理、基于人工智能的音频增强以及软硬件集成 以适应不同的声学环境和系统要求。.

权威参考资料

ITU-T P.863 / 客观语音质量

国际电信联盟电信标准化部门(ITU-T)建议书 P.863

ITU-T P.862 / PESQ 历史参考

ITU-T P.862

SciPy 短时傅里叶变换文档

SciPy STFT 文档

滚动至顶部
SILICON SOURCE
隐私概述

本网站使用 Cookie,以便为您提供最佳的用户体验。Cookie 信息存储在您的浏览器中,其功能包括在您再次访问我们的网站时识别您的身份,以及帮助我们的团队了解您认为网站的哪些部分最有趣、最有用。.