诸如频谱减法、维纳滤波、自适应滤波和NMF等传统的音频降噪算法,都是基于信号和噪声的数学模型的。.
深度学习开辟了一种全新的方法。.
与手动定义每项噪声特征不同,神经网络可以直接从音频数据中学习模式。.
在深度学习架构中,, 卷积神经网络 (CNN) are particularly useful for audio denoising because they can identify local patterns in time-frequency representations. The application of 用于音频去噪的CNN shows significant improvements in noise reduction.
当语音被转换为频谱图时,其中包含的结构与图像中的图案相似:
- 谐波结构
- 共振峰
- 瞬态事件
- 语音起始点
- 频段
- 时间连续性
- 噪声模式
卷积神经网络(CNN)能够学习这些局部结构,并判断频谱图的哪些部分对应于语音,哪些部分更可能是噪声。.
研究表明,基于卷积神经网络(CNN)的声谱图去噪方法以及直接对时域音频进行处理的CNN方法均行之有效。.
这使得卷积神经网络(CNN)成为现代 AI音频增强 系统。.
1. 什么是 CNN 音频去噪?
CNN音频去噪技术利用卷积神经网络来估计音频信号的更清晰版本。.
一种常见的架构是:
含噪声音频
↓
STFT
↓
频谱图
↓
卷积神经网络(CNN)
↓
语音/噪声估计
↓
增强型频谱图
↓
逆STFT
↓
增强型音频使用 用于音频去噪的CNN has revolutionized the way we approach noise reduction in audio signals.
CNN可能会预测:
- 语音掩码
- 噪声掩蔽
- 净星等
- 干净的功率谱
- 复杂谱
- 或者,在某些架构中,增强后的波形会直接
最常见的基于频谱图的方法将音频信号视为一种二维时频表示。.
2. 为什么在音频处理中使用卷积神经网络(CNN)?
传统的全连接深度神经网络将其输入视为一组特征。.
卷积神经网络(CNN)利用了局部结构。.
这对频谱图尤其有用,因为相邻的像素代表相邻的时间-频率区域。.
例如
频率
↑
│ ████
│ ███████
│ █████
│ ███
└────────────────→ 时间语音在时间和频率上呈现出特有的模式。.
噪声会产生不同的图案。.
人工神经网络会学习能够响应这些结构的滤波器。.
因此,该网络可以学习诸如以下关系:
局部频谱模式
↓
可能的语音结构或者:
宽带瞬态
↓
可能的噪声事件该网络并未明确使用这些简单规则。它们是由已学习的卷积滤波器自然产生的。.
3. 音频增强中的CNN与DNN对比
深度神经网络(DNN)能够学习非线性关系,但它无法自然地利用频谱图的空间结构。.
CNN 就是这样做的。.
| 特点 | DNN | CNN |
|---|---|---|
| 全连接层 | 是 | 通常不是主要操作 |
| 局部特征提取 | 有限 | 强大 |
| 谱图结构 | 不那么直白 | 自然开采 |
| 参数共享 | 有限 | 是 |
| 翻译/本地模式识别 | 有限 | 强大 |
| 典型的音频输入 | 特征向量 | 频谱图 / 波形 |
| 计算效率 | 取决于架构 | 对于结构化输入,通常很有效 |
这就是为什么卷积神经网络(CNN)被广泛应用于基于声谱图的音频增强。.
CNN 可以在不同的时频位置上复用同一个已学习的滤波器。.
与空间覆盖范围相当的全连接架构相比,这减少了参数的数量。.
4. 音频去噪始于时频表示
一种常见的卷积神经网络(CNN)音频去噪系统以短时傅里叶变换为起点。.
带噪声的信号可表示为:
y(t) = s(t) + n(t)其中:
y(t)= 音频有杂音s(t)= 文明用语n(t)= 噪声
短时傅里叶变换(STFT)之后:
Y(k,t) = S(k,t) + N(k,t)该结果可以表示为频谱图。.
例如
频率
↑
│
│ 语音
│ █████████
│ ███████
│ 噪声
│ ░░░░░░░░░
└────────────────→ 时间CNN 接收该表示,并学会估计干净的语音信息。.
这与上一篇文章自然地衔接起来:
音频信号处理中的FFT与STFT:实用工程指南
5. 神经网络能从谱图中学习到什么?
最初的卷积层通常会学习相对局部的模式。.
例如
- 光谱边缘
- 能源变化
- 谐波结构
- 局部时间模式
- 瞬态特征
更深层的网络可以将这些简单的模式组合成更复杂的表征。.
从概念上讲:
原始频谱图
↓
低级特征
↓
频谱/时域模式
↓
语音表示
↓
增强语音这种分层特征提取是卷积神经网络(CNN)在音频增强中发挥重要作用的主要原因之一。.
6. 卷积的工作原理
卷积是将一个小滤波器应用到输入的不同区域上。.
对于简化的二维卷积:
输出(i,j)
=
Σ Σ X(i+m,j+n)K(m,n)其中:
X= 输入频谱图K= 卷积核i,j= 输出位置
一个小型内核可以检查一个局部区域:
┌─────────┐
│ x x x │
│ x x x │
│ x x x │
└─────────┘随后,将相同的滤波器应用于整个谱图。.
这被称为 负载分担.
因此,该网络能够检测到不同位置的相似声学模式。.
7. 为什么局部时频模式很重要
语音中包含跨越相邻频率bin和时间帧的结构。.
例如,谐波分量可能表现为一系列相关的频带。.
辅音可能会产生一个短暂的瞬态模式。.
元音可能会产生相对稳定的谐波能量。.
噪声也可能具有特征模式。.
CNN 滤波器可以学习这些结构,而无需工程师手动指定它们。.
这在复杂的声学环境中尤为有用,因为在这些环境中,人工设计的滤波器可能难以将语音与噪声区分开来。.
8. 用于谱图去噪的CNN架构
一个简单的卷积神经网络(CNN)可能如下所示:
噪声谱图
↓
Conv2D
↓
激活层
↓
Conv2D
↓
激活层
↓
Conv2D
↓
输出层
↓
语音掩码更先进的系统可以使用:
- 多个卷积块
- 批量归一化
- 残留连接
- 扩展卷积
- 跳过连接
- 注意机制
- 编码器-解码器结构
典型的编码器-解码器架构可能如下所示:
输入频谱图
↓
编码器
↓
压缩表示
↓
解码器
↓
增强频谱图这一概念自然引出了 U-Net, ,相关内容将在“AI音频增强”专题中另行介绍。.
9. 基于频谱掩模的CNN语音增强
最实用的方法之一是训练卷积神经网络(CNN)来预测时频掩模。.
设:
Y(k,t)即该噪声的频谱图。.
CNN预测:
M(k,t)其中:
0 ≤ M(k,t) ≤ 1然后,增强的幅度可按以下方式估算:
|Ŝ(k,t)| = M(k,t)|Y(k,t)|从概念上讲:
带噪声的频谱图
↓
CNN
↓
软掩膜
↓
× 带噪声的幅度
↓
增强的幅度软掩码使网络能够逐步抑制不需要的能量,而不是简单地做出语音/噪声的判断。.
10. 二进制蒙版与柔性蒙版
二进制掩码可能如下所示:
M(k,t) = 1 → 保留
M(k,t) = 0 → 抑制柔性掩码可以包含中间值:
M(k,t) = 0.1
M(k,t) = 0.4
M(k,t) = 0.8
M(k,t) = 1.0软面罩通常能提供更平缓的衰减效果。.
这有助于减少因突兀的时间-频率决策而产生的严重伪影。.
然而,仅靠这款耳机并不能保证音质自然。.
该网络还必须学会保留重要的语音细节。.
11. 基于CNN的清洁频谱估计
卷积神经网络(CNN)无需预测掩膜,而是可以直接估计干净的幅度谱。.
架构如下:
噪声频谱图
↓
卷积神经网络(CNN)
↓
估计的干净频谱
↓
相位合成
↓
逆短时傅里叶变换(STFT)
↓
增强后的音频该网络学习:
带噪声的频谱
→
干净的频谱这可以对增强目标进行更直接的控制。.
然而,相位问题仍然是一个重要问题。.
12. 卷积神经网络(CNN)音频去噪中的相位问题
短时傅里叶变换(STFT)同时包含幅值和相位:
X(k,t) = |X(k,t)|e^(jφ(k,t))许多早期的语音增强方法在估计幅度时,会复用带有噪声的相位。.
这虽然相对简单,但会限制重建质量。.
更先进的卷积神经网络(CNN)系统可以估计:
- 净星等
- 相
- 复杂谱
- 实部和虚部
- 复杂面具
研究表明,某些卷积神经网络(CNN)模型能够估计频谱图中纯净的实部和虚部,而不仅仅依赖于幅度估计。.
这是实现高质量语音增强的一个重要方向。.
13. 复谱图卷积神经网络
不要只使用:
|Y(k,t)|该网络可以接收:
Re{Y(k,t)}
Im{Y(k,t)}并预测:
Re{S(k,t)}
Im{S(k,t)}从概念上讲:
噪声复谱图
↓
卷积神经网络(CNN)
↓
干净的复谱图
↓
逆短时傅里叶变换(STFT)
↓
增强的语音这使得网络能够同时学习与幅度相关的信息和与相位相关的信息。.
相关研究专门探讨了基于卷积神经网络(CNN)的复杂声谱图增强技术以及用于语音增强的多目标学习。.
14. 时域中的CNN
卷积神经网络(CNN)不必基于谱图进行处理。.
它们还可以直接处理波形采样数据。.
时域卷积神经网络(CNN)可表示为:
含噪声波形
↓
一维卷积
↓
特征提取
↓
卷积神经网络(CNN)层
↓
增强后的波形这将显式的STFT/ISTFT处理从推理管道中移除。.
研究表明,全卷积方法能够以带噪声的时间域帧作为输入,生成增强的时间域帧,同时在训练过程中采用可微分的频域运算。.
其取舍在于,时域网络必须直接从波形采样中学习有用的表示,这可能会导致其架构设计和计算要求与基于谱图的模型有所不同。.
15. 谱图卷积网络与时域卷积网络的对比
| 方法 | 输入 | 主要优势 | 主要挑战 |
|---|---|---|---|
| 谱图卷积网络 | 振幅/功率谱图 | 明确的时间-频率结构 | 相位处理 |
| 复数谱图卷积神经网络 | 复数STFT | 可建模相位信息 | 更复杂的模型 |
| 时域卷积神经网络 | 原始波形 | 端到端处理 | 更大的时间建模挑战 |
| 混合卷积神经网络 | DSP + 频谱图 + 波形 | 灵活 | 系统复杂性进一步增加 |
并不存在一种放之四海皆准的最佳架构。.
正确的选择取决于:
- 目标硬件
- 延迟
- 采样率
- 申请
- 模型尺寸
- 音质要求
- 训练数据
16. 卷积神经网络与残差学习
残差学习是基于卷积神经网络(CNN)的去噪方法中的另一项重要技术。.
网络无需重建整个干净信号,而是可以学习噪声信号与干净信号之间的差异。.
例如
噪声 ≈ 带噪声音频 − 干净音频该网络学习:
含噪声音频
↓
CNN
↓
估计噪声
↓
含噪声音频 − 估计噪声
↓
增强音频或者,网络也可以直接学习纯净信号。.
在某些架构中,残差学习可以简化学习问题,因为模型专注于需要应用的变换。.
基于CNN的谱图去噪研究还探讨了残差学习和批量归一化作为网络设计的一部分。.
17. CNN 与多尺度音频特征
噪声可能出现在不同的时间尺度上。.
例如
风扇噪音
→ 长时过程
键盘点击声
→ 短时瞬态
语音
→ 中长期结构单一卷积核的大小可能无法有效捕捉所有这些模式。.
因此,先进的卷积神经网络(CNN)架构可能会采用:
- 不同的内核尺寸
- 扩张的脑回
- 多尺度卷积
- 并行功能分支
从概念上讲:
┌→ 小卷积核
输入 → 卷积神经网络 ─────┼→ 中等卷积核
└→ 大卷积核/扩张卷积核
↓
特征融合
↓
增强音频这使得网络能够观察到不同的时域和频域上下文。.
18. 基于CNN和U-Net的音频去噪
U-Net 架构将卷积编码器和解码器与跳跃连接相结合。.
一个简化的结构如下:
输入
↓
编码器
↓
深度表征
↓
解码器
↓
输出跳过连接将相应的编码层和解码层连接起来:
编码器 ───────────────→ 解码器
↓ ↑
└──── 深度特征 ─────┘这有助于保留在降采样过程中可能丢失的详细信息。.
在音频去噪方面,U-Net 可对频谱图进行处理并预测:
- 干净的频谱图
- 噪声频谱图
- 时频掩模
因此,U-Net 是继基础卷积神经网络(CNN)架构之后的重要一步。.
19. 配备麦克风阵列的CNN
当有多个麦克风可用时,基于CNN的增强技术就显得尤为有趣。.
麦克风阵列可以提供多个通道:
麦克风 1 ─┐
麦克风 2 ─┤
麦克风 3 ─┼→ 多通道卷积神经网络
麦克风 4 ─┤
麦克风 5 ─┘该网络可以处理:
- 单个通道的频谱
- 堆叠频谱图
- 通道间相位差
- 空间特征
- 波束成形信号
因此,该系统可以同时使用以下两种方式:
光谱信息 + 空间信息
这对以下方面很重要:
- 远场语音采集
- 会议系统
- 智能教室
- 智能扬声器
- AI语音界面
- 环境音频感知
相关研究还探讨了基于卷积神经网络(CNN)的多通道语音增强系统。.
20. CNN + 波束成形
一种实用的麦克风阵列架构可以将传统的空间处理与人工智能相结合:
MEMS 麦克风阵列
↓
通道同步
↓
波束成形
↓
STFT
↓
卷积神经网络(CNN)降噪
↓
增强语音另一种方法是直接向卷积神经网络(CNN)提供多个麦克风通道:
MEMS 阵列
↓
多通道 STFT
↓
卷积神经网络 (CNN)
↓
空间与频谱增强
↓
语音如果已有现成的波束成形系统,第一种方法可能更容易部署。.
第二种方法为神经网络提供了更多的原始信息,但可能需要更多的计算量。.
21. CNN 和 MEMS 麦克风
神经网络只是信号链中的一部分。.
对于MEMS麦克风系统,其整体架构可能如下:
声学环境
↓
MEMS 麦克风
↓
模拟/数字前端
↓
ADC / 数字接口
↓
通道同步
↓
DSP / 波束成形
↓
CNN 增强
↓
音频输出麦克风输入的质量依然很重要。.
麦克风的重要参数包括:
- 信噪比
- 灵敏度
- 频率响应
- 声学过载点
- 自噪声
- 通道匹配
- 相位一致性
由于剪切、严重失真、声学耦合不良或麦克风信噪比不足,神经网络无法恢复从未被捕获的信息。.
这就是为什么 AI音频增强技术应与麦克风硬件和声学工程协同设计.
22. 训练用于音频去噪的卷积神经网络
典型的监督学习训练过程使用成对的干净音频和带噪声音频。.
清晰语音
+
噪声
↓
带噪声语音该模型接收:
输入:
含杂音的语音并学会预测:
目标:
文明用语一个训练流程可能如下所示:
干净音频
↓
噪声混合
↓
带噪声音频
↓
STFT
↓
CNN
↓
增强频谱
↓
损失计算
↓
反向传播该过程会针对大量训练样本反复进行。.
23. 构建优质的卷积神经网络(CNN)训练数据集
一个可靠的数据集应包含多种多样的条件。.
言语多样性
包括:
- 不同的扬声器
- 男声和女声
- 不同的口音
- 不同的语速
- 在适当情况下使用不同的语言
噪声分集
包括:
- 风扇噪音
- 暖通空调
- 交通
- 键盘
- 人群的喧闹声
- 机械
- 音乐
- 家庭噪音
- 瞬态事件
声学条件
包括:
- 安静的房间
- reverberant rooms
- 会议室
- 教室
- 办公室
- 户外环境
信噪比分集
例如
+20 dB
+10 dB
+5 dB
0 dB
-5 dB应根据目标产品选择确切的范围。.
24. 用于音频增强的CNN损失函数
一个简单的谱损失函数可以基于均方误差:
L = (1/N) Σ (Ŝᵢ − Sᵢ)²但音质的问题远比单纯地将数值误差降到最低要复杂得多。.
现代系统可能结合了多个目标。.
例如
Ltotal =
λ₁Lspectral
+
λ₂Lwaveform
+
λ₃Lperceptual可能的损失组成部分包括:
- 幅度损失
- 复谱损耗
- 波形损失
- 多分辨率STFT损失函数
- SI-SDR相关损耗
- 感知缺失
正确的损失函数取决于产品需要优化什么。.
25. 基于卷积神经网络的实时音频去噪
一种研究模型虽然能够实现出色的增强效果,但可能仍不适合用于商用嵌入式产品。.
实时系统必须考虑:
延迟
该模型必须以足够快的速度处理音频,以保持可接受的端到端延迟。.
计算复杂度
卷积运算的数量直接影响处理要求。.
记忆
模型参数和中间特征图会占用内存和存储空间。.
电源
边缘设备可能存在严格的功耗限制。.
模型尺寸
大型模型可能需要 NPU、DSP、GPU 或高性能 CPU。.
因此:
最佳研究模型
≠
最佳嵌入式产品模型在模型开发之初就应考虑目标硬件。.
26. 面向边缘设备的CNN模型优化
有几种方法可以降低卷积神经网络(CNN)的推理开销。.
量化
将高精度的权重和激活函数转换为低精度。.
例如
FP32
↓
INT8修剪
删除对最终模型贡献相对较小的参数或结构。.
知识蒸馏
利用规模更大的教师团队,培养规模较小的学生网络。.
轻量级卷积
使用计算效率更高的卷积结构。.
降低输入分辨率
在应用程序允许的情况下,缩减时频表示。.
目标是:
计算量更低
+
内存占用更低
+
延迟更低
+
音质尚可研究还探讨了通过剪枝及其他技术来降低卷积神经网络(CNN)语音增强的计算成本。.
27. CNN 音频去噪与传统 DSP 的对比
神经网络并不一定比所有传统算法都更优越。.
| 技术 | 强度 | 典型的局限性 |
|---|---|---|
| 光谱减法 | 非常轻便 | 可能会产生副产品 |
| 维纳滤波器 | 高效且流畅 | 取决于信号估计值 |
| 自适应滤波 | 适用于相关参考噪声 | 需要合适的参考资料 |
| NMF | 结构化源分解 | 计算需求更高 |
| DNN | 学习非线性关系 | 需要培训 |
| CNN | 出色的局部谱图建模 | 模型复杂度 |
| U-Net | 多尺度特征保留 | 更多计算 |
| Transformer | 长程上下文建模 | 通常计算开销更大 |
对于嵌入式音频系统而言,混合方案往往更为实用。.
28. CNN + 经典DSP
商用系统可能会使用:
MEMS 麦克风
↓
高通滤波器
↓
回声消除(AEC)
↓
波束成形
↓
卷积神经网络(CNN)降噪
↓
自动增益控制(AGC)
↓
输出DSP 负责处理确定性信号处理任务。.
CNN 负责处理复杂的声学模式识别。.
这种职责划分可以使系统更容易进行优化。.
29. CNN + DNN + NMF
更复杂的系统可以结合多种人工智能和数字信号处理方法。.
例如
麦克风阵列
↓
STFT
↓
NMF
↓
频谱特征
↓
卷积神经网络
↓
语音掩码
↓
增强音频NMF 可以提供结构化的源信息。.
这样,CNN 就能学习更复杂的非线性关系。.
这体现现代音频工程中的一种重要趋势:
不同的算法并不一定相互竞争;它们可以构成同一信号处理架构中的不同层。.
30. 如何评估卷积神经网络(CNN)的音频去噪效果
评估不应仅依赖于单一指标。.
信噪比(SNR)的改善
可用于测量降噪效果。.
STOI
有助于语音清晰度评估。.
PESQ / POLQA
根据测试设置和适用的标准,该方法可用于感知语音质量评估。.
SI-SDR
有助于评估在相应的增强任务中信号的重建效果。.
谱图比较
比较:
有噪点
vs.
增强
vs.
无噪点听力测试
请注意:
- 残余噪声
- 语音失真
- 不自然的伪影
- 音乐噪音
- 瞬态抑制
- 语音自然度
应用程序测试
对于人工智能语音界面,还应评估:
语音增强
↓
语音识别(ASR)
↓
词识别准确率关于会议麦克风:
增强
↓
语音清晰度
↓
会议体验因此,评估指标应与产品目标相一致。.
31. 卷积神经网络(CNN)音频去噪中的常见问题
31.1 过度抑制
该模型在去除噪声的同时,也会去除语音信息。.
31.2 语音失真
输出结果虽然更清晰了,但显得不自然。.
31.3 泛化失败
该模型在训练噪声上的表现良好,但在未见过的噪声上的表现较差。.
31.4 光谱伪影
不正确的蒙版可能会产生不自然的频率分布。.
31.5 时间伪影
预测掩码的快速变化可能会导致泵送现象或不稳定的背景噪声。.
31.6 延迟
大型卷积上下文可能会增加处理延迟。.
31.7 计算成本
一个在工作站上运行良好的模型,可能并不适合低功耗的嵌入式设备。.
32. 如何设计一个实用的卷积神经网络去噪系统
一个有用的开发流程是:
1. 确定应用场景
↓
2. 确定目标音质
↓
3. 选择MEMS麦克风/阵列
↓
4. 采集真实声学数据
↓
5. 构建训练数据集
↓
6. 选择STFT/波形表示法
↓
7. 设计卷积神经网络(CNN)
↓
8. 训练与验证
↓
9. 在未见过的噪声下进行测试
↓
10. 优化模型
↓
11. 部署到目标硬件
↓
12. 实时评估
↓
13. 听感测试
↓
14. 应用级测试这种方法可以避免一个常见的错误:
在定义实际声学系统之前,先对神经网络进行优化。.
33. CNN 音频去噪技术的应用场景
基于CNN的音频增强技术可应用于多种产品。.
会议麦克风
提高会议室的语音清晰度。.
智能扬声器
改善远场语音采集效果。.
人工智能语音助手
为语音识别提供更清晰的音频。.
智能教室
提高对教师和学生语音的拾音效果。.
耳机
在通话时降低环境噪音。.
汽车音响
改善车内语音通信。.
专业音频
优化语音和广播录音。.
人工智能多模态系统
为以下组合系统提供更纯净的音频输入:
- 音频
- 愿景
- 语言
- 雷达
- 其他传感器数据
这一领域与新兴的智能传感系统尤为相关。.
34. CNN Audio Denoising and AI Multimodal Sensing
音频正日益成为更庞大的人工智能感知系统中的一个组成部分。.
未来的架构可能如下所示:
麦克风阵列 ──┐
│
摄像头 ─────────────┤
├→ 多模态人工智能
雷达 ──────────────┤
│
其他传感器 ──────┘在音频进入多模态AI模型之前,基于卷积神经网络(CNN)的增强技术可以提升音频流的质量。.
这由此产生了一个重要的区别:
音频增强并不一定就是最终的应用。.
它可以作为更大规模的人工智能感知系统的预处理层。.
35. 音频增强中的CNN与Transformer对比
卷积神经网络(CNN)和变压器(Transformer)各有各的优势。.
卷积神经网络(CNN)在局部特征提取方面特别有效。.
变压器(Transformers)旨在利用注意力机制来建模长序列之间的关系。.
一个简化的比较是:
| 建筑 | 主要优势 | 典型的挑战 |
|---|---|---|
| DNN | 非线性特征映射 | 有限的空间结构 |
| CNN | 局部时频模式 | 长距离上下文 |
| RNN/LSTM | 时间关系 | 顺序计算 |
| U-Net | 多尺度表示 | 模型复杂度 |
| Transformer | 长程注意力 | 计算与内存 |
这使得卷积神经网络(CNN)成为简单深度神经网络(DNN)与计算需求更高的序列模型之间的重要折中方案。.
本系列接下来的文章将分别探讨这些架构。.
36. CNN音频增强技术的未来
仅因为出现了更先进的人工智能架构,CNN就不太可能就此消失。.
其优点包括:
- 强局部特征提取
- 参数共享
- 成熟的实施方案
- 高效推理
- 与频谱图的兼容性
- 是否适合边缘部署
未来的系统很可能将卷积神经网络(CNN)与以下技术相结合:
- 注意
- RNN/LSTM
- U-Net 架构
- 变形金刚
- 波束成形
- 自适应滤波
- NMF
- 多模态人工智能
实际目标并不是仅仅因为某种架构更新,就去使用它。.
目标是在实际应用的限制条件下,构建一套能够达到所需性能的音频系统。.
37. 关键要点
卷积神经网络(CNN)为基于人工智能的音频去噪提供了一种强有力的方法,因为它们能够学习时频表示中的局部模式。.
基本架构如下:
噪声音频
↓
STFT
↓
频谱图
↓
卷积神经网络(CNN)
↓
掩码/干净频谱
↓
逆STFT
↓
增强音频更先进的系统可以直接处理:
- 复谱图
- 多通道频谱图
- 原始波形
卷积神经网络(CNN)还可以与以下内容结合使用:
- 麦克风阵列
- 波束成形
- NMF
- 自适应滤波
- DNNs
- U-Net
- 变形金刚
对于实用产品而言,通常通过处理才能获得最佳效果 将麦克风硬件、声学设计、DSP、AI架构和部署硬件整合为一个集成系统.
因此,CNN不仅仅是一种普通的降噪算法。.
这是现代社会的一个重要基石 AI音频增强 与 intelligent microphone systems.
常见问题
什么是CNN音频去噪?
CNN音频去噪技术利用卷积神经网络识别语音和噪声模式,并生成增强后的音频信号。一种常见的方法是处理频谱图并预测时频掩码。.
为什么卷积神经网络(CNN)在音频去噪方面很有用?
卷积神经网络(CNN)能够学习时频表示中的局部结构。语音中包含具有特征性的频谱和时间模式,卷积滤波器可以从训练数据中学习这些模式。.
CNN的去噪是否需要STFT?
不。许多卷积神经网络(CNN)系统使用短时傅里叶变换(STFT)声谱图,但CNN也可以直接处理原始波形。研究中已经验证了时域CNN语音增强系统的可行性。.
卷积神经网络(CNN)能估计音频相位吗?
是的。先进的卷积神经网络(CNN)架构能够估计复杂的频谱图分量(包括实部和虚部),而不仅仅依赖于存在噪声的相位。.
CNN降噪技术能否应用于MEMS麦克风?
是的。基于CNN的增强技术可以处理由MEMS麦克风采集的音频。不过,麦克风的信噪比、灵敏度、频率响应、声学设计以及信道质量仍会影响最终的性能。.
卷积神经网络(CNN)能与麦克风阵列配合使用吗?
是的。多个麦克风通道可以提供空间信息,这些信息可与基于卷积神经网络(CNN)的频谱处理相结合。这对于远场语音增强和智能麦克风系统尤为有用。.
CNN 比频谱减法更好吗?
卷积神经网络(CNN)和谱减法采用的是截然不同的方法。谱减法通常更简单,计算负担也更轻,而卷积神经网络则能从数据中学习更复杂的模式。具体采用哪种方案取决于具体应用场景。.
CNN音频去噪能否实时进行?
是的,但模型的设计必须围绕目标硬件进行。延迟、内存、计算复杂度、功耗和模型大小都需要加以考虑。.
在AI音频增强领域,继CNN之后会有什么新进展?
重要的架构包括RNN/LSTM、U-Net和Transformer模型。这些方法提供了建模时序上下文以及多尺度或长距离音频信息的不同方式。.