论文

噪声功率失配下基于扩散的语音增强的变分流分析

A Variational-Flow Analysis of Diffusion-Based Speech Enhancement under Noise-Power Mismatch

模型评测模型行为与机制分析

摘要

基于扩散的语音增强架构将确定性预测器与学习评分网络配对,在训练时噪声幅度的 SI-SDR 退化曲线中表现出尖锐的非平滑过渡(“扭结”)。我们给出了路径变分流分析,将这种不平滑性定位于预测器阶段。中心恒等式是参数灵敏度 $\partial \sig^{(M)} / \partial M = K(M) \cdot \partial C_M / \partial M$ 的精确分解,其中 $K(M)$ 是沿着反向轨迹的雅可比行列式的连续矩阵值函数,$C_M = Π(y^{(M)})$ 是预测器输出。在逆过程流的三个假设下(分数雅可比连续性、条件雅可比连续性、$K$的非简并性),当且仅当$M \mapsto Π(y^{(M)})$在$M^\ast$处不能成为$C^1$时,$M \mapsto \sig^{(M)}$ 未能在$M^\ast$ 处成为$C^1$ 才成立。我们将本地化扩展到实际在推理时运行的有限步 Euler-Maruyama 采样器。这些假设转化为具体的实验计划;本文详细说明了程序并给出了变分结构。经验验证被推迟到配套的实验报告中。