论文
不确定性感知 Transformer:语言模型的保形预测
Uncertainty-Aware Transformers: Conformal Prediction for Language Models
摘要
Transformer对人工智能领域产生了深远的影响,特别是大语言模型及其变体。然而,与神经网络的情况一样,它们的黑盒性质限制了高风险环境中的信任和部署。为了让模型在关键应用中真正有用和值得信赖,它们必须提供的不仅仅是预测:它们必须让用户清楚地理解支撑其决策的推理。本文提出了基于 Transformer 的语言模型的不确定性量化框架。该框架称为 CONFIDE(微调深度语言模型的 CONformal 预测),将共形预测应用于仅编码器架构(如 BERT 和 RoBERTa)的内部嵌入,同时支持超参数调整。 CONFIDE 使用 [CLS] 标记嵌入或扁平化隐藏状态来构建类条件不合格分数,从而通过实例级解释实现统计上有效的预测集。根据经验,与之前的方法(包括 NM2 和 VanillaNN)相比,CONFIDE 在 BERT-tiny 上将测试精度提高了 4.09%,并实现了更高的正确效率(即,以包含真实标签为条件的预测集的预期大小)。我们表明,早期和中期的 Transformer 层通常会为共形预测产生更好的校准和语义上更有意义的表示。在资源受限模型和标签不明确的高风险任务中,CONFIDE 提供了鲁棒性和可解释性,而基于 softmax 的不确定性则无法做到这一点。我们将 CONFIDE 定位为比之前的共形基线进行实际诊断和效率/稳健性改进的框架。