论文
为什么会出现训练验证分离?预训练主干中的更新压力密度动力学
Why Does Train-Validation Separation Emerge? Update-Pressure Density Dynamics in Pretrained Backbones
摘要
训练验证分离是观察到的训练示例和有限保留验证集的性能之间不断变化的差异。我们提出了一种动态结构解释,说明这种差距在预训练模型适应过程中如何发展:持续拟合可以将更新需求从广泛可重用的支持转向具有较弱留出集迁移的更窄的支持。条件局部模型将这种转变与梯度分配和训练验证分离中异质性的增加联系起来。固定训练探针使结构演变可被观测,且不让验证样本进入探针读出;留出集表现单独用于评估其与差距的关系。在使用残差多层感知器(ResMLP)实现的构造层次结构中,将示例私有特征的目标份额从 $p=.3$ 增加到 $.5$ 到 $.7$,同时保留四个共享特征级别之间的相对混合 $1{:}2{:}3{:}4$,将最终平均准确度差距从 $.185$ 增加到 $.331$ 再到 $.527$ 每个条件运行五次。在训练和验证示例上分别测量的掩蔽输入损失暴露了相应的转移不对称性。自然语言处理 (NLP) 分析使用 RoBERTa、DeBERTa 和 Qwen 在 6 个数据集(90 次运行)上训练10个epoch:训练探针加权的类内和整体离散度读数均与所有 90 次运行中的准确度差距具有正的原始和平滑水平相关性。以大约一个纪元间隔配对的原始变化分别在 86/90 和 87/90 运行中保持正相关。一项 40 epoch ResNet-18 研究在三个视觉数据集上测试了这两种读数。受控模拟、自然语言处理和视觉共同支持跨环境的动态结构说明,并通过真实模型证据在指定监视器下测试其可观察的预测。