论文
SuperValid:针对可泛化下游扩展的能力对齐 OOD 验证
SuperValid: Capability-Aligned OOD Validation for Generalizable Downstream Scaling
摘要
缩放定律通过将计算与交叉熵损失联系起来来指导 大语言模型 训练,最近的工作进一步扩展了它们以预测下游基准性能。然而,现有方法面临两个方面的泛化限制:关注基准级性能会引入特定于场景的工件,而依赖 IID 验证损失无法跟踪训练分布变化时的能力改进。在这项工作中,我们认为下游扩展应该在能力级别进行研究,它捕获相关任务之间的共享技能因素,同时抽象出特定于基准的噪音。我们提出了 SuperValid,这是一个框架,通过从能力域内的基准中提取核心概念并将其扩展为多样化的知识丰富的文本来合成 OOD(分布外)、能力一致的验证数据。涵盖 16 个基准(分为 6 个功能域)的广泛实验表明,SuperValid 损失在不同架构、规模和训练数据分布的模型中与下游性能表现出强而稳定的相关性。作为在训练期间无需基准评估即可计算的 无需训练 指标,SuperValid 可实现有效的模型选择、早期停止和扩展决策。