论文

探测路由-注意力残差中的条件校准 Transformer

Probing Routing-Conditional Calibration in Attention-Residual Transformers

模型评测模型行为与机制分析

摘要

事后校准通常仅作为 logits 或 softmax 置信度的函数进行评估,即使路由增强架构越来越多地伴随着具有特定于样本的内部路由轨迹的预测,并将它们与校准相关的不确定性声明配对。我们提出一个基本问题:这些痕迹是否为事后校准提供了稳定的特定路由证据?我们在 Attention-Residual Transformer(Kimi Team,2026)中通过匹配置信度诊断套件研究了这一点,该诊断套件通过路由派生状态对示例进行分层,将子组间隙与箱内路由排列空值进行比较,并评估仅在辅助特征上不同的匹配事后探针。在我们完成的 AR 运行中,标量路由摘要并不能提供路由条件错误校准的稳定证据:加权间隙仍然很小或对种子敏感,并且 $30$ 的箱内排列测试中只有 $1$ 拒绝 $α=0.05$ 的条件空(仅在一个种子上;该单元中的种子之间不稳定)。 AR-CondCal 是关于置信度和路由深度方差的最小 $2$-D Nadaraya-Watson 探针,位于匹配的仅置信度和预测熵控制的种子方差带内,并且不能可靠地改善最差路由三分位数 ECE;带宽敏感性检查(Scott 倍数、CV-NLL、global-ECE oracle)不会改变这一点。 $(c, H_1, \ldots, H_L)$ 上的全向量 MLP 似乎比线性置信基线有所改进,但一旦包含容量匹配的仅置信 MLP 作为控制,明显的增益就会消失,并且混洗的路由配置文件实现了可比较的性能。在匹配置信度、带宽、容量和排列控制排除常见混淆之前,此 AR 设置中的明显路由感知校准增益不应被解读为内部状态校准。