论文
推理稳定点:稳定证据与捷径依赖的训练时信号
Reasoning Stabilization Point: A Training-Time Signal for Stable Evidence and Shortcut Reliance
摘要
微调预训练语言模型可以提升任务性能,同时悄然改变模型所依赖的证据。我们提出一种训练时可解释性视角,跨微调轮次追踪 token 级归因。我们将解释漂移(explanation drift)定义为固定探测集上归一化 token 归因的逐轮变化,并引入推理稳定点(Reasoning Stabilization Point, RSP),即此后漂移持续保持低水平的最早轮次。RSP 由运行内的漂移动态计算得出,无需在分布外数据上调优。在多个轻量 transformer 分类器与基准分类任务上,漂移通常在训练早期就坍缩到一个低而稳定的状态,而验证准确率此后仅继续边缘变化。在带有标签相关触发 token 的受控捷径设定中,即便验证准确率仍有竞争力,归因动态也暴露出对捷径日益增加的依赖。总体而言,解释漂移提供了一个简单、低成本的诊断手段,用于监控微调期间决策证据的演变,以及在稳定证据状态中选择检查点。
