论文
$σ$Transfer:$μ\mathrm{P}$ 下从小网络到大型网络的不确定性转移
$σ$Transfer: Uncertainty Transfer from Small to Large Networks under $μ\mathrm{P}$
摘要
拉普拉斯近似中可靠的预测不确定性在很大程度上取决于先验精度,但选择它需要后验扫描,这对于具有数十亿参数的神经网络来说成本高昂。在最大更新参数化 ($μ\mathrm{P}$) 下,我们推导了先验协方差的重新缩放,使得所选精度随着模型宽度的增长而稳定。这导致 $σ\mathrm{Transfer}$:我们选择较小模型上的精度并将其零样本转移到更大的模型,即根本不搜索较大模型上的精度。我们展示了在显式条件下先验核、后验协方差、选定精度和后验导出决策的收敛性,并在回归、图像分类和 Transformer 读数中验证 $σ\mathrm{Transfer}$。例如,在 MNIST 上从宽度 128 传输到 4096 时,测得的精度扫描加速达到 $\sim 5000\times$,目标 NLL 降级为 $0.002$;从公共 1B 模型转移到 7B 模型的中值搜索加速为 $\sim 2.3\times$(最多 $\sim 330\times$),十个任务的平均测量目标 NLL 增加低于 $10^{-4}$。相同的后验稳定性还可以在不构建目标后验的情况下实现采集、OOD 检测和弃权决策的转移。