论文

测量神经训练动态中的结构化可预测性:跨机制研究

Measuring Structured Predictability in Neural Training Dynamics: A Cross-Regime Study

模型评测模型行为与机制分析

摘要

现代深度网络是通过长更新轨迹进行训练的,但它们的时间组织仍然不如架构、损失或优化器那样系统化。我们研究短时域可预测性作为时间冗余的度量:在哪里、何时以及在哪些训练条件下最近的更新包含有关近期参数运动的信息。我们将三个互补探针系列(位移方向、子空间残差和基于预测器的探针)与约定感知、零校准组级读数相结合,并将它们应用于 CIFAR 和公共 Pythia 预训练检查点的多通道视觉训练。在这两种机制中,归一化参数和偏差(辅助参数)等类似向量的张量比类似矩阵的特征转换权重(批量参数)表现出更简单的短期动态,后者的可预测行为集中在局部的、随时间变化的区域中。探针家族内部和探针家族之间的一致性以及独立的轨迹诊断表明这些测量捕获了内在的轨迹结构,而探针差异则区分了时间组织的互补形式。受控 CIFAR 比较进一步表明架构和训练配方系统地调节了测量的结构。 Pythia-70M 案例研究进一步揭示了一系列与角色、深度和规模相关的事件,包括批量 ESA 低于随机符号协议水平以及跨层可预测 qkv 口袋的出现和重新分布。这些结果将短期可预测性定位为训练动态的回顾性、参数解析诊断。