论文
贝叶斯深度学习中的校准无采样不确定性估计
Calibrated Sampling-Free Uncertainty Estimation in Bayesian Deep Learning
摘要
众所周知,现代深度学习模型仍然容易过度自信,从而限制了它们在高风险应用中的可靠性。贝叶斯方法旨在通过学习模型参数的分布来解决这个问题,而最近的进展现在使得这种方法对于大规模架构来说是可行的,而成本与 AdamW 相当。然而,测试时仍然存在一个挑战:必须在许多前向传递中对预测进行平均,并使用从后验采样的权重,这是非常昂贵的。方差传播提供了一种有效的替代方案,在单次前向传播中计算不确定性的逐层分析近似。虽然此类技术对 MLP 有效,但由于层类型的深度和多样性的增加,它们向现代架构的扩展仍然具有挑战性。为了填补这一空白,我们提出了校准方差传播(CVP),它为归一化层引入了一种新的传播方法,将其与处理激活函数的最新技术相结合,并通过光校准步骤吸收残差。 CVP 可以在 Transformer 和 CNN 上以相对准确的 MC 采样进行不确定性估计,而成本只是其一小部分。与之前的方差传播工作相比,CVP 在视觉推理 (NLVR2) 上使用 BEiT-3 将 $0.5\%$ 风险的覆盖率从 $8.2\%$ 提高到 $14.6\%$,在 VQAv2 上使用 ViLT 从 $2.6\%$ 提高到 $10.8\%$,并将收益扩展到卷积架构。