论文

UAT-LITE:面向预训练 Transformer 的推理时不确定性感知注意力

UAT-LITE: Inference-Time Uncertainty-Aware Attention for Pretrained Transformers

模型架构Transformer

摘要

神经 NLP 模型经常被错误校准,为错误的预测赋予高置信度,从而破坏了选择性预测和高风险部署。事后校准方法调整输出概率,但保持内部计算不变,而集成和贝叶斯方法则提高了大量训练或存储成本的不确定性。我们提出了 UAT-LITE,这是一种推理时间框架,它通过预训练 Transformer 分类器中的蒙特卡洛 dropout 进行近似贝叶斯推理,使自注意力不确定性感知。token级认知不确定性是根据随机前向传递估计的,并用于在情境化过程中调节自我注意力,而无需修改预训练的权重或训练目标。我们还引入了分层方差分解来诊断预测不确定性如何在变压器深度上累积。在 SQuAD 2.0 应答性、MNLI 和 SST-2 中,相对于基于 BERT 的微调基线,UAT-LITE 平均将预期校准误差减少约 20%,同时保持任务准确性,并提高分布偏移下的选择性预测和鲁棒性。

UAT-LITE:面向预训练 Transformer 的推理时不确定性感知注意力
图1:左侧,A:标准推理——不带不确定性的确定性前向传播。中间,B:通过随机推理或事后校准进行输出层面的不确定性估计。右侧,C:UAT-Lite——不确定性感知推理,其中认知不确定性以具备诊断洞察的方式调制注意力。