论文
使用梯度范数进行有效不确定性量化的各向同性方法
An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms
摘要
用于量化神经网络中预测不确定性的现有方法对于 大语言模型 来说要么在计算上难以处理,要么需要访问通常不可用的训练数据。我们通过两个近似得到了一个轻量级的替代方案:一阶泰勒展开,用预测梯度和参数协方差来表达不确定性,以及参数协方差的各向同性假设。总之,从通过未经修改的预训练模型的单个前向-后向传递中,这些产生了作为梯度范数平方的认知不确定性和作为点预测的伯努利方差的任意不确定性。我们通过证明根据非训练数据构建的协方差估计引入了各向同性协方差避免的结构化失真来证明各向同性假设的合理性,并且大型网络的频谱特性的理论结果支持大规模的近似。针对综合问题的参考马尔可夫链蒙特卡罗估计进行的验证表明,随着模型大小的增加,具有很强的对应性。然后,我们使用这些估计来调查每种不确定性类型何时携带有用的信号来预测 大语言模型 问答中的答案正确性,从而揭示了与基准相关的分歧:组合估计在 TruthfulQA 上实现了最高平均 AUROC,其中问题涉及合理答案之间的真正冲突,但在 TriviaQA 的事实回忆上几乎是偶然的,这表明参数级不确定性捕获了与自我评估方法根本不同的信号。