传统 音频降噪 诸如频谱减法、维纳滤波、自适应滤波和NMF等方法已在数字音频系统中得到广泛应用。.
然而,现实世界中的声学环境正变得日益复杂。.
现代麦克风可能需要应对以下情况:
- 多个发言人
- 背景对话
- 交通噪音
- 键盘声音
- 风扇和空调
- 音乐
- 突发的短暂声音
- 混响
- 言语重叠
使用固定的数学假设来对这些条件建模可能比较困难。.
这就是 深度神经网络(DNN) for speech enhancement become useful.
基于深度神经网络(DNN)的语音增强系统能够从海量的训练数据中学习噪声语音与清晰语音之间的关系。.
神经网络无需手动定义每种噪声特征,而是通过学习模式来区分语音与不需要的声学信号。.
本文阐述了基于深度神经网络(DNN)的语音增强技术的工作原理,内容涵盖输入特征、频谱掩模、网络架构、训练、损失函数、实时部署、麦克风阵列,以及人工智能与传统数字信号处理(DSP)之间的关系。.
1. 什么是 DNN 语音增强?
基于深度神经网络(DNN)的语音增强 利用深度神经网络,从带噪声的音频信号中估计出更清晰的语音表征。.
一个简化的系统如下所示:
带噪声的语音
↓
短时傅里叶变换(STFT)
↓
时频特征
↓
深度神经网络(DNN)
↓
语音/噪声估计
↓
增强谱图
↓
逆短时傅里叶变换(STFT)
↓
增强语音输入可以是带噪声的波形、频谱图,或是声学特征的组合。.
输出可以是:
- 增强语音
- 噪声估计
- 语音掩码
- 一种复谱表示法
- 时域波形
架构取决于应用程序。.
2. 为什么使用深度学习进行音频增强?
In recent years, there has been a growing interest in DNN for speech enhancement, which greatly improves the clarity of audio signals in various environments.
传统的DSP算法通常依赖于对信号的某些假设。.
例如,频谱减法方法假设可以估计噪声谱。.
维纳滤波需要对信号功率和噪声功率进行估计。.
自适应滤波通常需要一个有用的参考信号。.
在适当条件下,这些假设是有效的。.
但现实中的声学环境往往难以预测。.
例如
麦克风输入
=
语音
+
风扇声
+
键盘声
+
其他语音
+
房间混响
+
瞬态噪声可能并不存在一个能够描述所有这些组成部分的简单数学模型。.
相反,深度神经网络(DNN)可以从示例中学习统计规律。.
从概念上讲:
训练数据
↓
干净的语音 + 噪声
↓
神经网络训练
↓
学习到的声学表示
↓
带噪声的语音
↓
增强后的语音关键区别在于,该模型是从数据中学习转换规则,而不是完全依赖于人工设计的规则。.
3. DNN for speech enhancement 与传统DSP相比
深度神经网络(DNN)并不一定能取代数字信号处理器(DSP)。.
在许多实际系统中,它们起到了互补作用。.
| 方法 | 主要原则 | 典型优势 |
|---|---|---|
| 光谱减法 | 估计并扣除噪声 | 简单且轻便 |
| 维纳滤波器 | 统计信号估计 | 平滑降噪 |
| 自适应滤波器 | 学习滤波器系数 | 适用于相关噪声 |
| NMF | 谱分量分解 | 结构化源头分类 |
| DNN | 学习非线性映射 | 可处理复杂的声学模式 |
| CNN | 学习局部时空模式 | 高效的特征提取 |
| RNN/LSTM | 建模时间依赖关系 | 强大的时间建模 |
| Transformer | 基于注意力的建模 | 长距离上下文 |
| 混合式 DSP + AI | 组合方法 | 灵活的系统架构 |
因此,工程问题并不只是:
AI 比 DSP 更好吗?
一个更有意义的问题是:
哪种算法组合能够满足对音质、延迟、功耗、内存和处理能力的各项要求?
4. 深度神经网络(DNN)语音增强的基本架构
一个典型的深度神经网络(DNN)系统可分为四个阶段。.
第1阶段——特征提取
噪声音频被转换为有用的特征。.
例如
音频
↓
短时傅里叶变换(STFT)
↓
幅度谱
↓
特征向量可能的功能包括:
- 振幅谱
- 对数幅度谱
- 功率谱
- Mel频谱特征
- 光谱特征
- 与相位相关的特征
- 多通道空间特征
第二阶段——神经网络处理
这些特征被输入到深度神经网络(DNN)中。.
输入特征
↓
全连接层
↓
隐藏层
↓
隐藏层
↓
输出层该网络学习与语音和噪声相关的模式。.
第3阶段——语音估计
DNN 可能会输出一个语音掩码。.
例如
M(k,t)其中:
k= 频率区间t= 时间范围
该掩膜指示了应保留每个时频区域的强度。.
第4阶段——音频重建
将估计得到的掩模应用到含噪声的频谱图上:
Ŝ(k,t) = M(k,t)Y(k,t)其中:
Y(k,t)= 噪声谱M(k,t)= 估计的语音掩蔽值Ŝ(k,t)= 增强频谱
随后,逆短时傅里叶变换(STFT)将增强后的频谱重新转换为音频波形。.
5. 深度神经网络(DNN)究竟在学习什么?
这是一个重要的问题。.
深度神经网络(DNN)不仅仅是在学习:
语音 = 特定频率。.
语音涵盖了许多频率范围。.
相反,该网络会学习以下元素之间更复杂的关系:
- 频率
- 时间
- 谐波结构
- 语音模式
- 时间连续性
- 谱形
- 噪声特性
- 上下文信息
例如,语音谐波模式可能会跨越多个帧而持续存在。.
键盘点击声的时间结构可能截然不同。.
神经网络可以从训练数据中学习这些差异。.
这就是深度学习在复杂环境中能够优于简单的频率阈值处理的一个原因。.
6. 理想比率掩码与深度神经网络语音增强
一种常见的方法是训练该网络来估计一个 理想比例面具(IRM) 或相关的时频掩模。.
假设:
S(k,t) = 清晰语音幅度
N(k,t) = 噪声幅度简化的比率掩膜可表示为:
IRM(k,t) =
S(k,t) / [S(k,t) + N(k,t)]目标值通常在0到1之间。.
例如
掩码 ≈ 1
→ 以语音为主的区域
掩码 ≈ 0
→ 以噪声为主的区域该深度神经网络(DNN)经过训练,能够根据含噪声的音频预测该掩码。.
7. 深度神经网络的其他输出目标
深度神经网络(DNN)并不一定非要预测一个理想的比率掩码。.
常见目标包括:
振幅谱
该网络直接估计纯净语音的幅度。.
功率谱
该网络可预测语音强度。.
比例蒙版
该网络预测了一个软掩码。.
二进制掩码
该网络用于预测某个时频区域是否以语音为主。.
复杂频谱
该网络同时估计了振幅和相位相关的信息。.
时域波形
该网络直接预测增强后的波形。.
每种方法都存在不同的工程权衡。.
8. 为什么相位很重要
许多早期的语音增强系统主要关注幅度。.
然而,音频重建也取决于相位。.
STFT 的简化表示形式如下:
X(k,t) = |X(k,t)|e^(jφ(k,t))其中:
|X(k,t)|= 幅度φ(k,t)= 相位
如果系统修改了振幅,但只是直接复用了带有噪声的相位,那么输出中仍可能包含伪影。.
这使得人们对以下方面越来越感兴趣:
- 复谱映射
- 相位估计
- 复杂面具
- 时域神经网络
这对高质量的语音增强尤为重要。.
9. 深度神经网络(DNN)训练数据
语音增强模型的质量在很大程度上取决于其训练数据。.
一种常见的训练策略是生成合成噪声语音:
干净语音
+
噪声
↓
合成带噪声语音随后,该模型接收:
输入:
含杂音的语音并学会预测:
目标:
文明用语训练数据集可能包含不同的:
- 演讲者
- 语言
- 噪声类型
- 信噪比(SNR)
- 室内环境
- 麦克风特性
- 混响条件
训练条件越广泛,模型在不同环境中进行泛化的可能性就越大。.
然而,数据量的增加并不能自动解决所有部署问题。.
10. 训练过程中的信噪比
训练数据通常是在各种信噪比(SNR)条件下生成的。.
例如
+20 dB
+10 dB
+5 dB
0 dB
-5 dB这使得模型能够体验不同程度的声音难度。.
仅基于干净或高信噪比(SNR)录音训练的模型,在部署到严重噪声环境中时,可能表现不佳。.
相反,在极其严苛的条件下进行高强度训练,会影响模型在语音保留与噪声抑制之间如何权衡。.
因此,训练数据分布应反映预期应用场景。.
11. 语音增强的损失函数
损失函数决定了神经网络被引导去优化什么。.
简单的均方误差可表示为:
L = (1/N) Σ (ŷᵢ - yᵢ)²其中:
ŷᵢ= 预测值yᵢ= 目标值
然而,在音频增强方面,单个MSE损失可能无法完全反映人类的感知。.
其他目标还可以包括:
- 光谱损耗
- 波形损失
- 幅度损失
- 复谱损耗
- 与SI-SDR相关的目标
- 感知缺失
- 多分辨率STFT损失函数
从概念上讲,组合损失可能如下所示:
Ltotal =
λ₁Lwaveform
+
λ₂Lspectral
+
λ₃Lperceptual其中,权重决定了每个目标的贡献程度。.
12. 深度神经网络(DNN)架构的选择
一个简单的深度神经网络(DNN)使用全连接层。.
输入
↓
全连接层
↓
全连接层
↓
全连接层
↓
输出这种架构虽然对某些应用效果良好,但并未明确利用局部谱图结构或长期时间依赖性。.
正因如此,更专业的架构才变得至关重要。.
本“AI音频增强专题”中的后续文章将分别探讨这些内容:
- 用于音频去噪的CNN
- 用于语音增强的RNN和LSTM
- 用于音频降噪的U-Net
- 用于语音增强的变压器模型
13. 深度神经网络(DNN)与卷积神经网络(CNN)在音频增强中的对比
传统的深度神经网络(DNN)主要将输入视为特征向量。.
卷积神经网络(CNN)可以利用频谱图中的局部结构。.
例如
频率
↑
│ ███████
│ █████
│ ███
└────────────→ 时间局部模式可以对应于:
- 谐波
- 共振峰
- 瞬态事件
- 光谱边缘
- 言语结构
因此,卷积神经网络(CNN)在基于声谱图的音频处理中尤其有效。.
应另撰一篇文章,更深入地探讨基于CNN的图像增强技术。.
14. 深度神经网络(DNN)与循环神经网络(RNN)及长短期记忆网络(LSTM)
言语本质上具有时间性。.
某一时刻发生的事情,与之前发生的事情以及之后发生的事情是相互关联的。.
标准的深度神经网络(DNN)不会显式地维护时间状态。.
基于RNN的模型可以。.
从概念上讲:
帧 1 → 帧 2 → 帧 3 → 帧 4
↓ ↓ ↓ ↓
└──────────── 时间上下文LSTM 网络在 RNN 的基础上引入了新的机制,旨在在更长的序列中保留有用的信息。.
这使得RNN/LSTM模型特别适用于:
- 语音增强
- 语音活动检测
- 声学事件检测
- 流媒体音频处理
15. 用于实时音频增强的深度神经网络
研究型产品与商用音频产品之间最大的区别之一在于实时部署。.
离线模型可以处理完整的录音:
60秒音频
↓
神经网络
↓
增强后的60秒音频实时系统必须持续运行:
帧 1 → 处理 → 输出
帧 2 → 处理 → 输出
帧 3 → 处理 → 输出
...这带来了严格的限制。.
延迟
系统的响应速度必须足以满足该应用程序的需求。.
CPU/NPU 负载
该模型必须在现有计算资源范围内运行。.
记忆
模型权重和中间张量会占用内存。.
电源
电池供电的产品需要高效的推理能力。.
模型尺寸
对于嵌入式设备而言,大型神经网络可能并不实用。.
16. 边缘音频的深度神经网络量化
对于嵌入式产品,可能需要对神经网络进行优化。.
常见的方法包括:
- 模型剪枝
- 权重量化
- 精度降低
- 知识蒸馏
- 架构简化
例如
FP32 模型
↓
量化
↓
INT8 模型较小的型号可能会减少:
- 内存使用情况
- 计算要求
- 推理延迟
- 功耗
然而,过度优化也会影响音质。.
因此,最终模型需要在目标硬件上进行评估,而不仅仅是在桌面开发系统上进行评估。.
17. 基于MEMS麦克风的深度神经网络语音增强
神经网络无法无限期地补偿麦克风输入质量差的问题。.
整个系统从声学采集开始。.
一个实用的架构可能如下所示:
Acoustic Environment
↓
MEMS 麦克风
↓
Analog / Digital Front End
↓
Audio Preprocessing
↓
STFT / Feature Extraction
↓
DNN Enhancement
↓
Post-Processing
↓
Application麦克风的重要特性包括:
- 灵敏度
- 信噪比
- 频率响应
- 声学过载点
- 自噪声
- 功耗
- 通道一致性
对于多通道系统,一些额外的参数变得尤为重要:
- 麦克风间距
- 相位匹配
- 通道同步
- 数组几何
- 机械结构
因此,AI增强功能应与麦克风硬件同步设计。.
18. DNN with 麦克风阵列
单个麦克风主要提供频谱信息。.
麦克风阵列可以同时提供以下两种功能:
光谱信息 + 空间信息
例如
麦克风 1 ─┐
麦克风 2 ─┤
麦克风 3 ─┼→ 多通道处理 → 深度神经网络
麦克风 4 ─┤
麦克风 5 ─┘神经网络可以接收:
- 单个麦克风通道
- 波束成形信号
- 通道间相位差
- 空间特征
- 振幅谱
- 多通道频谱图
这为更先进的语音增强技术创造了机遇。.
例如
麦克风阵列
↓
波束成形
↓
空间滤波
↓
深度神经网络增强
↓
增强语音或者:
麦克风阵列
↓
多通道功能
↓
深度神经网络(DNN)
↓
波束成形/增强最佳架构取决于目标应用程序。.
19. 深度神经网络与声学回声消除
语音增强通常与……结合使用 回声消除(AEC)。.
例如,在会议设备中:
远端音频
↓
扬声器
↓
房间
↓
麦克风
↓
回声 + 本地语音 + 噪声AEC算法旨在从麦克风信号中去除扬声器信号。.
随后可利用深度神经网络(DNN)进行进一步的噪声抑制。.
一种可能的架构是:
麦克风
↓
AEC
↓
降噪
↓
DNN增强
↓
输出具体顺序取决于系统设计。.
这就是现代语音处理产品通常会结合多种算法,而不是仅依赖一个神经网络的原因之一。.
20. 人工智能增强与声学设计
人们很容易认为人工智能能够解决所有音频问题。.
不行。.
例如,如果麦克风受到物理屏蔽、位置不当、与振动发生机械耦合,或者因声压过高而饱和,神经网络可能无法恢复丢失的信息。.
一种更好的系统方法是:
优秀的声学设计
+
高品质的MEMS麦克风
+
合理的阵列几何结构
+
DSP
+
AI人工智能应增强硬件成功捕获的信号。.
不应将其视为替代优质声学工程的方案。.
21. 深度神经网络(DNN)音频增强中的常见问题
过度压制
该模型在去除噪声的同时,也会对语音造成损害。.
语音失真
辅音或低强度语音成分可能会变弱。.
音乐噪音
如果蒙版估计不准确,可能会产生不自然的伪影。.
泛化问题
在一种噪声环境下训练出的模型,在另一种噪声环境下可能表现不佳。.
说话人依赖性
对于与训练数据存在显著差异的语音,某些模型的表现可能会有所不同。.
延迟
较大的时间上下文可能会提高性能,但也会增加延迟。.
计算成本
一个在工作站上运行良好的模型,未必适合嵌入式产品。.
22. 如何评估深度神经网络(DNN)语音增强模型
评估应采用多种衡量标准。.
客观指标
可能的指标包括:
- 信噪比
- SI-SDR
- STOI
- PESQ / POLQA
- 光谱失真
- 单词识别准确率
每项指标衡量的是绩效的不同方面。.
主观聆听
工程师应留意以下情况:
- 语言清晰度
- 自然感
- 残余噪声
- 语音失真
- 瞬态伪影
- 后台抽水
- 音乐噪音
应用层测试
对于语音控制类产品而言,识别准确率可能比信噪比(SNR)的微小提升更为重要。.
对于会议麦克风而言,语音清晰度和抗串音性能可能更为重要。.
对于录音麦克风而言,自然音质和低失真度可能更为重要。.
因此,评估应反映实际应用情况。.
23. 一种实用的深度神经网络(DNN)音频增强开发工作流
典型的工程工作流程如下:
1. 定义应用场景
↓
2. 采集声学数据
↓
3. 选择麦克风/阵列
↓
4. 构建训练数据集
↓
5. 生成带噪声的语音
↓
6. 选择输入特征
↓
7. 选择网络架构
↓
8. 定义损失函数
↓
9. 训练模型
↓
10. 在未见过的噪声上进行验证
↓
11. 优化模型
↓
12. 部署到目标硬件
↓
13. 实时测试
↓
14. 聆听体验 + 应用评估这一工作流程之所以重要,是因为在训练过程中测得的模型性能并不一定能直接反映实际产品性能。.
24. 深度神经网络(DNN)与经典数字信号处理(DSP):一种实用的混合架构
对于商用音频产品而言,混合架构往往颇具吸引力。.
例如
MEMS 麦克风阵列
↓
模拟/数字前端
↓
AEC
↓
波束成形
↓
STFT
↓
DNN 降噪
↓
后处理
↓
AGC
↓
输出每个组件都执行特定的功能。.
这种方法可以在以下方面实现有益的平衡:
- 计算效率
- 确定性处理
- 基于人工智能的增强
- 延迟
- 音质
架构应围绕最终产品进行优化,而不是围绕某个单一算法。.
25. 深度神经网络(DNN)语音增强技术的应用场景
基于深度神经网络(DNN)的音频增强技术可应用于:
会议系统
提高嘈杂会议室中的语音清晰度。.
智能扬声器
改进远场语音采集。.
AI语音界面
为语音识别和对话式人工智能准备语音内容。.
智能教室
改进教师和学生的声音采集。.
汽车音响
降低背景噪音和道路噪音。.
耳机
改善通话时的拾音效果。.
电话会议
在实时通信中提升语音质量。.
人工智能多模态系统
为以下组合系统提供更纯净的音频输入:
- 音频
- 愿景
- 语言
- 传感器数据
随着人工智能系统越来越多地同时处理多种传感器模态,这一最新应用正变得尤为重要。.
26. 人工智能音频增强技术的未来
音频增强技术的发展正从单一算法处理向集成式智能音频系统转变。.
未来的架构可能会结合以下要素:
MEMS 麦克风阵列
↓
空间信息
↓
波束成形
↓
经典 DSP
↓
NMF / 统计处理
↓
神经网络
↓
多模态人工智能
↓
应用系统设计师不必纠结于DSP和AI孰优孰劣,而是可以将不同的任务分配给不同的处理层。.
例如
硬件
以高保真度采集声学信号。.
空间DSP
利用麦克风阵列的几何结构。.
经典DSP
处理确定性且计算效率高的处理任务。.
人工智能
处理复杂的非线性声学模式。.
应用人工智能
对生成的音频进行解读。.
随着智能音频系统功能的不断提升,这种分层架构很可能仍将发挥重要作用。.
27. 关键要点
DNN语音增强技术利用深度神经网络,从带噪声的音频中估算或重建更清晰的语音。.
基本概念是:
含噪声音频
↓
特征提取
↓
深度神经网络(DNN)
↓
语音/噪声估计
↓
增强音频最重要的工程考虑因素包括:
- 训练数据
- 噪声分集
- 输入特征
- 网络架构
- 损失函数
- 相处理
- 延迟
- 记忆
- 计算资源
- 功耗
- 麦克风质量
- 麦克风阵列设计
- 实际场景中的泛化能力
深度神经网络(DNN)为现代音频增强提供了强大的工具,但只有作为结合了以下要素的完整系统的一部分,它们才能发挥最佳效果: 麦克风硬件、声学设计、DSP、空间处理和人工智能.
常见问题
什么是DNN语音增强?
DNN语音增强技术利用深度神经网络,从带噪声的音频中估计出更清晰的语音信号。该模型可以预测语音掩码、干净频谱、复频谱或波形。.
人工智能是如何降低背景噪音的?
AI模型从语音和噪声数据中学习统计规律。在推理过程中,模型会判断传入音频的哪些部分可能包含语音,哪些部分可能包含不需要的噪声。.
深度神经网络(DNN)的降噪效果是否优于传统的数字信号处理(DSP)?
深度神经网络(DNN)和传统的数字信号处理(DSP)采用不同的方法。深度神经网络能够建模复杂的非线性关系,而经典的数字信号处理方法则能提供低复杂度的确定性处理。许多实际系统将这两者结合起来。.
基于深度神经网络(DNN)的语音增强技术能实现实时处理吗?
是的。实时深度神经网络(DNN)增强技术具有广泛的适用性,但必须针对延迟、CPU/NPU资源、内存和功耗对模型进行优化。.
深度神经网络(DNN)增强技术能否应用于MEMS麦克风?
是的。DNN增强技术可以处理由MEMS麦克风捕获的信号。麦克风的信噪比、频率响应、灵敏度、通道一致性以及声学设计仍然会影响最终结果。.
深度神经网络(DNN)能否与麦克风阵列配合使用?
是的。多通道麦克风阵列可以提供空间信息,这些信息可以与基于神经网络的语音增强技术相结合。.
DNN和CNN音频增强技术之间有什么区别?
传统的深度神经网络(DNN)通常对特征向量进行处理,而卷积神经网络(CNN)则能够利用时频表示中的局部结构。因此,基于CNN的架构被广泛应用于基于频谱图的音频处理。.
在基于深度神经网络(DNN)的语音增强之后,下一步是什么?
更专业的架构包括卷积神经网络(CNN)、循环神经网络/长短期记忆网络(RNN/LSTM)、U-Net 以及 Transformer 模型。这些架构为空间、时间和多尺度音频建模提供了不同的方法。.