论文

预训练权重谱如何预测基础模型分布外鲁棒性?

Pretraining Shapes Spectral Structure: Architecture- and Strategy-Conditional Prediction of OOD Robustness in Foundation Models

模型评测模型训练预训练模型行为与机制分析鲁棒性、公平性与可信度评测

摘要

在尚无任何目标数据时,能否判断基础模型是否会泛化到分布外(OOD)?现有诊断需要源数据或目标数据,因此在目标域尚不存在时无法使用。仅依赖权重的方法则对所有架构套用同一统计量,无法区分稳健模型与脆弱模型。我们发现,答案蕴含在预训练权重的谱结构中。两种因素塑造这一结构:架构决定信息如何存入权重矩阵,预训练策略决定什么受到奖励。二者共同形成影响OOD鲁棒性的谱几何。我们证明,OOD准确率差距受源表征聚集程度的约束,而仅从预训练权重计算的统计量可以作为该聚集程度的替代指标。指标方向在不同架构家族间会反转。我们将其转化为可操作诊断:在一个“架构×策略”组合内,方向保持稳定;这是实验中最细的分组,我们称之为单元。将覆盖7种模态的116个模型合并分析时,单一统计量对OOD鲁棒性的排序能力较弱,因为方向相反的单元会相互抵消。在同一单元内,为该单元选定的统计量能在样本内按OOD鲁棒性正确排列92%的模型对。选择过程不泄漏目标结果:对矩阵以外的每个模型家族,我们在运行OOD评测之前记录单元、指标和方向,脑电、基因组和蛋白质各例的预测方向均成立。调整谱聚集程度可将OOD差距缩小24%,同时保留87.5%的分布内表现。该诊断仅依赖已发布权重,因此可在为目标域投入数据或计算之前,于模型选型时检查OOD鲁棒性。

预训练权重谱如何预测基础模型分布外鲁棒性?:论文原图
图 1:(架构 ×\times 策略)→\to 谱几何→\to\to OOD 鲁棒性。架构和预训练策略共同塑造分层奇异值谱 (2),它决定表示是集中还是分散 (3),从而设置 OOD 精度差距 (4)。 ρ\rho 的符号是单元和其中读取的统计数据的属性,而不是域的属性:每个 AR-CLM 单元在其自己的校准指标下为正,而 BiDi-MLM/Protein、CNN 和 SSM-v2/RWKV 在其校准指标下为负。