论文

基于代理的强 OOD 性能解释的受控反例:在固定的预训练和探测设置中

A Controlled Counterexample to Strong Proxy-Based Explanations of OOD Performance: in a Fixed Pretraining-and-Probing Setup

模型评测模型行为与机制分析

摘要

与任务无关的结构代理通常用于解释为什么一个预训练语料库比另一个预训练语料库迁移得更好,但这种解释需要代理跟踪对下游任务重要的结构。我们在固定的预训练和探测设置中测试了这一要求,该设置的动机是学习结构的计算边界概念,包括复杂性。核心问题是两个预训练数据集的代理排名是否必须与其 OOD 探针准确度排名一致。我们证明它不需要。首先,我们给出一个受控构造,其中形式结构量、其操作代理和目标族的任务相关结构是分开的。然后,我们在合成序列模型实验中实例化相同的机制:在主要全样本评估下,OOD 准确度排名反转了三个种子中的两个的代理排名,辅助诊断和消融支持相同的解释。反例一般并不拒绝基于结构的解释;它确定了基于强代理的解释的边界。即使在受控设置中,总学习结构的代理也可能无法跟踪驱动 OOD 性能的任务相关结构。