音频的小波去噪:小波降噪的工作原理

传统的音频降噪方法通常在时域或频域中对信号进行分析。.

但现实生活中的音频要复杂得多。.

语音中包含快速变化的瞬态信号、谐波、停顿、辅音以及宽带成分。噪声也会随时间变化,并可能出现在不同的时间尺度上。.

这带来了一个根本性的挑战:

当有用音频信息和噪声的频率与时间特性都在发生变化时,我们该如何将它们区分开来?

小波去噪 提供了一种方法。.

小波方法并非采用单一的固定频率分辨率来分析整个信号,而是将信号分解为不同尺度。这使得算法能够同时考察 其中 信号能量产生,并且 在什么时间尺度上 它发生了。.

在音频处理领域,这使得小波去噪技术对于包含以下内容的信号尤为有价值:

  • 瞬态噪声
  • 脉冲噪声
  • 宽带噪声
  • 非平稳噪声
  • 短时扰动
  • 频谱特性快速变化的语音

因此,在小波去噪方面掌握相关知识对于构建更广泛的……而言至关重要。 音频降噪 and speech enhancement 工具包。.

1. 什么是小波去噪?

小波去噪是一种信号处理技术,它利用一种 小波变换 将音频信号分解为不同尺度的分量。.

基本思路是:

音频有杂音

小波分解

小波系数

阈值 / 修改噪声主导系数

小波重建

去噪音频

该方法基于以下观察:有用的信号结构和噪声可能会产生不同的小波系数分布。.

较大的系数通常对应于重要的信号结构,而许多较小的系数则可能与噪声有关。.

因此,该算法能够抑制那些可能属于噪声的系数,同时保留包含有用音频信息的系数。.

2. 为什么小波在音频处理中很有用

音频信号本质上是随时间变化的。.

考虑一个语音信号。.

元音在数十或数百毫秒内可能保持相对稳定,而辅音(如塞音或摩擦音)的变化则可能快得多。.

传统的傅里叶变换虽然提供了频率信息,但并不能直接表明特定频率分量出现在何时。.

STFT 通过分析短时间段来改善这一情况,但其时频分辨率取决于所选的分析窗口。.

小波分析则采用了另一种方法。.

它利用不同的尺度来考察不同分辨率下的信号结构。.

这通常被描述为:

多分辨率分析

3. 小波变换与傅里叶变换

从概念上讲,这种差异可以概括如下。.

方法主要代表处决议
傅里叶变换频率全球频率信息
STFT时间 + 频率固定时频分辨率
小波变换时间 + 尺度/频率多分辨率
自适应滤波器信号关系随时间变化的滤波器系数

关键在于,小波并不一定比FFT或STFT更优。.

每种方法都适用于不同的信号处理问题。.

例如

  • FFT 非常适合进行频域分析。.
  • STFT 被广泛应用于语音增强领域。.
  • 小波在瞬态和多尺度信号分析中很有用。.
  • 当有相关参考信号可用时,自适应滤波器非常有用。.

4. 连续小波变换

SISTC的 连续小波变换(CWT) 使用小波函数的缩放和平移版本来表示一个信号。.

一个简化的表达式是:

W(a,b) = (1 / √|a|) ∫ x(t) ψ[(t − b)/a] dt*

其中:

  • x(t) = 输入信号
  • ψ(t) = 母小波
  • a = 比例参数
  • b = 时移参数
  • ψ* = 复共轭

这两个关键参数是:

比例

控制小波的大小。.

翻译

确定小波在时间轴上的位置。.

这使得该变换能够考察多个尺度上的局部结构。.

5. 离散小波变换

在实际的数字信号处理中, 离散小波变换(DWT) 通常更实用,因为它降低了计算复杂度。.

DWT 将信号分解为不同的频带或尺度。.

典型的分解过程如下:

输入音频

第1级

  • 近似解 A1
  • 细节 D1

第2级

  • 近似解 A2
  • 细节 D2

第3级

  • 近似 A3
  • 细节 D3

诸如此类。.

该近似值包含低频信息,而细节系数则代表了逐渐不同的高频分量。.

6. 小波分解

可以通过一对滤波器来理解一种常见的DWT实现:

  • 低通滤波器
  • 高通滤波器

输入信号同时通过这两者。.

低通支路生成近似系数。.

高通支路生成细节系数。.

随后,可以在近似分量上重复该过程。.

从概念上讲:

输入

→ 低通 → 近似

→ 高通 → 详情

然后:

近似

→ 低通 → 低频近似

→ 高通 → 下一比例尺的细节

这会生成信号的分层表示。.

7. 为什么这有助于降低噪音

假设输入是:

y(t) = x(t) + n(t)

其中:

  • x(t) = 清晰的音频
  • n(t) = 噪声

小波分解后:

Y → 小波系数

某些系数将包含强烈的信号信息。.

其他数据可能主要包含噪声。.

去噪算法并非直接对原始波形进行滤波,而是对小波系数进行修改。.

总体流程如下:

带噪声的信号

小波分解

系数分析

噪音抑制

小波重建

这就是小波去噪的核心思想。.

8. 小波阈值法

阈值处理是小波去噪中最重要的技术之一。.

一个阈值 λ 已选中。.

幅度相对较小的小波系数被认为更可能代表噪声。.

两种常见的阈值处理策略是:

  • 硬阈值法
  • 软阈值处理

9. 硬阈值法

硬阈值处理会保留绝对值高于阈值的系数,并去除低于阈值的系数。.

基本规则是:

ŵ = w,当且仅当 |w| ≥ λ 时

当 |w| < λ 时,ŵ = 0

其中:

  • w = 原始小波系数
  • ŵ = 处理后的系数
  • λ = 阈值

这导致了一个简单的决定:

系数较小 → 删除

系数较大 → 保留

硬阈值处理能够有效保留强信号特征,但阈值处的突变有时会引入伪影。.

10. 软阈值处理

软阈值处理会降低高于阈值的系数的幅度。.

常用的表达方式是:

ŵ = sign(w)(|w| − λ)

时间:

|w| > λ

否则:

ŵ = 0

换句话说:

  1. 较小的系数被剔除。.
  2. 保留系数较大的项。.
  3. 较大的系数也略有降低。.

软阈值处理能产生更平滑的过渡,并在实际的小波去噪中得到广泛应用。.

11. 硬阈值与软阈值

特征硬阈值法软阈值处理
较小的系数设为零设为零
大系数已保存已减少
过渡突然的流畅
信号保持能够保留鲜明的特征通常更顺滑
潜在的伪影可能会引入不连续性通常更流畅
常见用途特征保留一般降噪

具体选择取决于信号以及所需的音频特性。.

12. 阈值是如何选定的?

阈值的选择至关重要。.

如果阈值过低:

噪音还是太多了。.

如果阈值过高:

重要的音频信息可能会被删除。.

一个常被讨论的阈值是通用阈值:

λ = σ√(2 ln N)

其中:

  • σ = 估计噪声标准差
  • N = 样本数

该公式作为起点很有用,但并不一定适用于所有音频应用。.

更复杂的方法可以使用:

  • 与电平相关的阈值
  • 基于SURE的阈值选择
  • 贝叶斯阈值处理
  • 自适应阈值
  • 基于高频系数的噪声水平估计

13. 噪声级估算

该阈值通常取决于对噪声水平的估计。.

一种切实可行的方法是根据高频小波层级的细节系数来估计噪声。.

稳健估计量可以使用中位数绝对偏差:

σ̂ = median(|d|) / 0.6745

其中 d 表示选定的细节系数。.

在高斯噪声假设下,该常数大致使中位数绝对偏差归一化。.

这使系统能够估算底层噪声的标准差。.

随后可利用该估算值来确定适当的阈值。.

14. 为什么小波类型很重要

小波去噪并不使用单一的通用小波。.

常见的家族包括:

  • Haar
  • 道贝奇
  • Symlets
  • Coiflets
  • 双正交小波

不同的小波具有不同的数学性质。.

对于音频信号,需要考虑的因素包括:

  • 平滑度
  • 紧凑型支架
  • 对称性
  • 消失时刻的个数
  • 计算复杂度
  • 与信号结构的相似性

并不存在一种适用于所有音频应用的、放之四海皆准的最佳小波。.

应根据实际信号和噪声条件对该选择进行验证。.

15. Haar 小波

Haar小波是最简单的小波。.

它在计算效率上很高,而且易于理解。.

然而,其分段常数结构在建模平滑音频波形时,可能不如某些其他小波族那样自然。.

尽管如此,它仍可用于以下方面:

  • 教育性演示
  • 简单的嵌入式实现
  • 包含突变的信号

16. 达贝奇小波

多贝奇小波在信号处理中得到了广泛应用。.

它们具有紧凑的支持集和多个消逝矩,因此能够高效地表示不同的信号结构。.

不同阶数的道贝奇小波具有不同的时频特性。.

对于音频处理,应通过实验来确定合适的阶数,而不是一味地认为阶数越高就越好。.

17. 短发辫与小发髻

Symlets 与许多道贝奇小波相比,这些小波的设计旨在提供更好的对称性。.

当重构对称性和相行为至关重要时,这会很有用。.

Coiflets 为另一个家族提供用于表示信号特征的有用的数学性质。.

同样,小波的选择取决于具体应用。.

最佳选择取决于:

  • 信号类型
  • 噪声特性
  • 采样率
  • 期望的重建质量
  • 计算限制

18. 小波去噪与谱减法

小波去噪和频谱减法都旨在将有用的音频与噪声分离,但它们的工作原理不同。.

特点小波去噪光谱减法
主域名小波/尺度域频域
时间定位强大取决于STFT
多分辨率由STFT参数确定
噪声估计必选项或根据系数估算通常需要
阈值/增益控制系数阈值法光谱增益/减法
瞬态处理通常很有用取决于框架/窗口
音乐噪音可能普遍关切
计算复杂度低至中等低至中等
实时实施可能非常实用

这两种方法都不应被视为普遍更优。.

它们提供了多种方法来表示和抑制不需要的信号分量。.

19. Wavelet Denoising vs. 维纳滤波

维纳滤波是基于估计的信号功率和噪声功率的。.

小波去噪是基于信号信息在小波尺度上的分布。.

特点维纳滤波小波去噪
核心理念统计最优滤波多分辨率系数处理
主要表现形式频率 / STFT小波尺度
信号模型信号与噪声功率稀疏/结构化系数
关键参数维纳增益阈值
噪声估计信号/噪声功率噪声水平/系数
时间定位取决于STFT内在多尺度定位
计算复杂度低至中等低至中等

这使得小波去噪成为整个音频DSP工具箱中的又一有用的工具。.

20. 语音的小波去噪

言语之所以特别有趣,是因为它既包含相对稳定的成分,也包含快速变化的成分。.

例如

  • 元音具有强烈的谐波结构。.
  • 辅音可能包含宽带能量。.
  • 爆破音包含短暂的瞬态信号。.
  • 擦音可能包含强烈的高频成分。.

如果小波阈值设置得过于激进,可能会去除其中一些有用的语音成分。.

因此,语音去噪应在以下方面取得平衡:

噪音抑制

反对

言语保存

当最终应用是以下情况时,这一点尤为重要:

  • 语音识别
  • 语音通信
  • 会议记录
  • 语音助手
  • 音频录音

更干净的波形并不一定就是更好的语音识别输入。.

21. 瞬态噪声的小波去噪

小波分析的一个潜在优势在于它能够对信号结构进行时间定位。.

考虑一个短暂的脉冲扰动:

点击 → 静音 → 语音

根据分析方法的不同,传统的频域滤波器可能会将干扰扩散到更宽的时间范围内。.

小波分析可以识别与瞬态现象相关的局部系数。.

这使得基于小波的处理在以下方面颇具吸引力:

  • 点击删除
  • 脉冲干扰
  • 机械瞬态
  • 开关噪声
  • 短时扰动

然而,具体性能在很大程度上取决于所选的小波、分解层次以及阈值策略。.

22. 分解级别

分解层次的数量是另一个重要参数。.

如果信号分解得不够深入:

该算法可能无法捕获足够的多尺度信息。.

如果分解得过深:

计算成本会增加,且有用信号信息可能会分散在过多的尺度上。.

合适的级别取决于:

  • 采样率
  • 信号带宽
  • 目标应用
  • 小波族
  • 噪声谱

例如,工作频率为16 kHz的语音系统和工作频率为48 kHz的全频段音频系统,通常需要采取不同的处理方案。.

23. 一个实用的小波去噪处理流程

一个典型的实现示例如下:

步骤 1 — 录制音频

MEMS 麦克风 → 数字音频

步骤 2 — 标准化/预处理

消除直流偏置或进行必要的信号调理。.

第 3 步 — 小波分解

应用DWT以获得近似系数和细节系数。.

第 4 步 — 估算噪声

根据适当的小波系数估计噪声水平。.

第 5 步 — 计算阈值

根据噪声估计值和具体应用情况选择一个阈值。.

第 6 步 — 阈值系数

使用硬阈值或软阈值。.

第 7 步 — 重建

应用逆小波变换。.

第 8 步 — 评估

度量:

  • 降低噪音
  • 信噪比(SNR)的改善
  • 语音质量
  • 瞬态保存
  • 识别准确率

24. Python 基础示例

以下示例演示了使用 PyWavelets 进行简单小波去噪的工作流程。.

import numpy as np
import pywt

def wavelet_denoise(
    audio,
    wavelet="db8",
    level=5
):
    # 小波分解
    coeffs = pywt.wavedec(
 audio,
 wavelet,
 level=level
    )

    # 根据最细微的细节系数估计噪声水平
    detail = coeffs[-1]

 sigma = np.median(
 np.abs(detail)
    ) / 0.6745

    # 通用阈值
    threshold = sigma * np.sqrt(
 2 * np.log(len(audio))
    )

 # 软阈值处理
    filtered_coeffs = [
 coeffs[0]
    ]

    for detail_coeff in coeffs[1:]:
 filtered_coeffs.append(
 pywt.threshold(
 detail_coeff,
 threshold,
 mode="soft"
 )
 )

    # 信号重建
    denoised = pywt.waverec(
 filtered_coeffs,
 wavelet
    )

 return denoised[:len(audio)]

此示例旨在演示基本原理,而非提供一个可用于实际生产的音频算法。.

在实际实现中还应考虑以下方面:

  • 边界效应
  • 与电平相关的阈值
  • 实时缓冲
  • 信号缩放
  • 量化
  • 延迟
  • 音质评估

25. 边界效应

小波变换是对有限长度的信号块进行运算的。.

算法对边界处理的方式会影响重建质量。.

可能的扩展方法包括:

  • 零填充
  • 对称扩展
  • 定期延期
  • 持续扩展

该选择可能会影响已处理区块首尾处的伪影。.

对于离线处理,这或许尚可应对。.

对于实时系统,需要特别关注块边界。.

26. 实时音频的小波去噪

小波去噪可以实时实现,但实时处理会带来额外的限制。.

工程师必须考虑:

区块大小

较小的数据块可以降低延迟,但可供分析的数据量较少。.

分解级别

关卡越多,所需的处理量就越大。.

记忆

该算法需要用于存储小波系数的缓冲区。.

计算负荷

DSP 必须在下一音频块到达之前完成处理。.

重建

重叠与边界策略必须避免产生可听见的断续现象。.

耗电量

这一点在低功耗嵌入式设备中尤为重要。.

因此:

一种在离线环境下运行良好的小波算法,在部署到低功耗实时音频产品之前,可能需要进行大量优化。.

27. 基于MEMS麦克风的小波去噪

小波去噪本身并不是一种麦克风技术。.

这是一种在声学捕获之后应用的信号处理技术。.

一个简化的系统是:

声学环境

MEMS 麦克风

模拟/数字前端

DSP

小波分解

噪音抑制

增强音频

最终结果既取决于麦克风输入的质量,也取决于处理算法。.

如果麦克风的信噪比性能较差或存在严重的声学干扰,就会限制后续算法能够恢复的信息量。.

这就是为什么在选择麦克风时应将麦克风与DSP一并考虑。.

28. 基于麦克风阵列的小波去噪

小波去噪技术也可应用于多麦克风系统。.

一种可能的架构是:

MEMS 麦克风阵列

同步多通道采集

波束成形

小波去噪

语音增强

或者,也可以在进行空间处理之前,对每个麦克风通道分别进行小波处理。.

最佳架构取决于:

  • 噪声类型
  • 空间特征
  • 处理资源
  • 所需延迟
  • 麦克风通道数

SISTC的多麦克风设计采用同步数字麦克风通道,并集成了降噪和阵列信号处理功能,为更先进的多通道音频算法提供了硬件基础。.

29. 小波去噪与人工智能

小波处理和人工智能也可以结合起来。.

例如

音频输入

小波分解

小波特征

神经网络

系数增强

小波重建

在此架构中,神经网络并不一定直接对原始波形进行处理。.

相反,它可以学习如何修改小波系数。.

这种方法可以结合:

  • 多尺度信号表示
  • 学习型非线性处理
  • 噪声分类
  • 自适应系数抑制

当传统的阈值处理方法效果不佳时,此类混合方法可能会派上用场。.

30. 小波变换作为人工智能的输入

小波变换还可以为机器学习系统提供有用的特征。.

神经网络可能使用:

  • 小波系数
  • 小波能量
  • 多尺度特征
  • 时间尺度分布

作为模型输入。.

这有助于人工智能系统区分:

  • 演讲
  • 噪声
  • 瞬态现象
  • 机械声
  • 环境事件

具体效果取决于模型架构和训练数据。.

31. 常见的工程错误

错误 1:认为分解层次越高越好

音频电平越高,并不一定意味着音质就越好。.

错误 2:对所有尺度都使用同一个阈值

不同的小波级可能具有截然不同的噪声和信号特性。.

因此,基于级别的阈值可能更为合适。.

错误 3:随意选择小波

不同的小波具有不同的特性。.

测试应基于实际的音频信号和应用场景进行。.

错误 4:阈值处理过度

如果阈值设置得过高,可能会导致语音谐波和瞬态信号被去除。.

错误 5:仅评估降噪效果

某种算法在降低噪声的同时,也会降低语音质量。.

评估应兼顾这两方面。.

32. 如何评估小波去噪

实际评估应将客观测量与听觉测试相结合。.

有用的指标包括:

信噪比

用于测量信号与噪声的相对水平。.

STOI

有助于评估语音可懂度。.

PESQ / POLQA

可根据评估框架和具体应用情况予以考虑。指标的选择应体现相关标准和用例。.

频谱分析

比较:

  • 原始带噪声信号
  • 去噪信号
  • 参考清洁信号

听力测试

人工聆听依然很重要,因为数值指标无法捕捉到所有类型的异常现象。.

应用层性能

对于语音系统,还应评估:

  • 语音识别准确率
  • 唤醒词检测
  • 转录质量
  • 语音可懂度

33. 小波去噪与人工智能降噪的对比

小波去噪具有若干实用特性。.

基于小波的处理

  • 在数学上可解释的
  • 相对较轻
  • 无需训练数据
  • 适用于多种DSP实现方案
  • 能够提供强有力的时间尺度定位

基于人工智能的处理

  • 能够对更复杂的非线性关系进行建模
  • 能够从大型数据集中学习
  • 可能能够处理复杂的非平稳噪声
  • 需要进行训练和模型优化
  • 可能需要更多的计算资源

这未必是一个非此即彼的决定。.

一款实用产品可以将经典的DSP与人工智能相结合。.

34. 小波去噪在现代音频处理流程中的定位

一套现代音响系统可能需要:

MEMS 麦克风

多通道采集

波束成形

AEC / 自适应滤波

小波或谱处理

AI语音增强

AGC / 后期处理

语音识别 / 通信

具体的架构将根据具体应用而有所不同。.

例如,低功耗的嵌入式语音设备可能更注重计算效率,而专业的网络音频系统则可能拥有更多的处理资源。.

35. 工程师应在何时考虑采用小波去噪?

在以下情况下,值得考虑使用小波去噪:

  • 噪声是非平稳的
  • 瞬态干扰很重要
  • 多尺度信号特性至关重要
  • 时间定位很重要
  • 建议采用轻量级DSP方案
  • 仅进行光谱处理是不够的

在以下情况下,它可能不太吸引人:

  • 这种噪声可以通过简单的频谱滤波得到很好的表征
  • 需要超低的计算复杂度
  • 该应用程序已经采用了一个高度优化的AI增强模型
  • 实时限制使得多级处理难以实现

同样,正确的选择取决于整个系统。.

36. 音频工程中的小波去噪:全局视角

小波去噪是规模更大的音频降噪方法家族中的一部分。.

该过程可理解为:

时域滤波

FFT/STFT 分析

光谱减法

维纳滤波

自适应滤波

小波去噪

NMF

深度学习

混合式 DSP + AI

每种技术对音频信号都采用不同的表示方式或假设。.

正因如此,现代音频工程越来越不再专注于寻找一种通用的降噪算法,而是致力于选择以下要素的恰当组合:

麦克风 + 声学设计 + 空间处理 + DSP + AI

常见问题

什么是小波去噪?

小波去噪是一种音频处理技术,它利用小波变换将信号分解为多个尺度,抑制与噪声相关的系数,并重建经过增强的信号。.

小波去噪是如何降低音频噪声的?

它对音频进行多时间尺度的分析,并应用阈值处理或其他系数处理方法,以抑制那些可能代表噪声的成分。.

什么是小波阈值处理?

小波阈值处理是根据选定的阈值对小波系数进行调整。较小的系数可能会被去除,而较大的系数则会被保留或减小。.

硬阈值和软阈值之间有什么区别?

硬阈值处理会去除低于阈值的系数,同时保留较大的系数。软阈值处理还会降低高于阈值的系数的绝对值,通常能产生更平滑的结果。.

小波去噪比维纳滤波更好吗?

这两种方法都没有哪一种是放之四海皆准的。维纳滤波利用信号和噪声功率的统计估计值,而小波去噪则基于多尺度小波表示。它们的有效性取决于信号、噪声以及具体应用场景。.

小波去噪技术能否应用于语音处理?

是的。小波去噪可用于语音增强,但必须仔细控制阈值的选择,以避免去除语音的谐波、辅音和瞬态信息。.

小波去噪技术能否应用于MEMS麦克风?

是的。在MEMS麦克风捕获音频信号后,可以实施小波去噪。该算法可在DSP、MCU、应用处理器或其他合适的处理平台上运行。.

小波去噪能否与麦克风阵列结合使用?

是的。小波处理可与同步多麦克风采集和波束成形相结合,从而实现空间和时间尺度的双重处理。.

小波去噪是否适用于实时音频?

虽然可以,但必须仔细设计分解级别、块大小、计算资源、延迟以及重建方法。.

小波去噪能否与人工智能相结合?

是的。小波系数既可作为特征使用,也可在混合型DSP+AI语音增强系统中作为神经网络的输入进行处理。.

结论

小波去噪通过分析多个时间尺度的信号,为音频降噪提供了一种不同的方法。.

它不再仅依赖频域滤波,而是将音频分解为小波系数,并有选择地抑制那些可能代表噪声的成分。.

其最重要的概念包括:

  • 小波变换
  • 离散小波变换(DWT)
  • 多分辨率分析
  • 小波分解
  • 硬阈值法
  • 软阈值处理
  • 噪声水平估计
  • 自适应或基于级别的阈值
  • 小波重建

对于音频工程师来说,最重要的教训是: 小波去噪不仅仅是选择一个小波并应用阈值那么简单.

最终性能取决于:

小波选择 + 分解级 + 噪声估计 + 阈值策略 + 重构 + 音频系统设计

与……结合使用时 MEMS microphones, 麦克风阵列, beamforming, adaptive filtering, and AI speech enhancement, 小波处理可以成为更广泛的音频信号处理架构中的另一个有用组成部分。.

本技术系列的下一篇文章将探讨 用于音频降噪的非负矩阵分解(NMF), ,从经典的小波处理转向一种更先进的结构化音频成分分离方法。.

滚动至顶部
SILICON SOURCE
隐私概述

本网站使用 Cookie,以便为您提供最佳的用户体验。Cookie 信息存储在您的浏览器中,其功能包括在您再次访问我们的网站时识别您的身份,以及帮助我们的团队了解您认为网站的哪些部分最有趣、最有用。.