论文
使用代理指标预测 LLM 的下游性能
Forecasting Downstream Performance of LLMs With Proxy Metrics
摘要
语言模型开发的进展通常是由比较决策驱动的:采用哪种架构,使用哪种预训练语料库,或者应用哪种训练方法。做好这些决策需要可靠的性能预测,但这两种常用信号从根本上来说是有限的。交叉熵损失与下游能力的一致性较差,直接下游评估成本高昂、稀疏,并且在早期训练阶段通常无法提供信息。相反,我们建议通过聚合 词元级 统计数据(例如熵、top-k 准确度和专家词元排名)来构建代理指标,这些统计数据来自候选模型在专家编写的解决方案上的下一个词元分布。在三种设置中,我们的代理始终优于基于损失和计算的基线:1)对于跨家庭模型选择,他们对异构推理模型群体进行排名,平均 Spearman Rho = 0.81(交叉熵损失的 Rho = 0.36); 2) 对于预训练数据选择,他们可靠地对目标模型的 25 个候选语料库进行排名,其计算量比直接评估少大约 $10{,}000\times$,从而将帕累托前沿推向现有方法之外; 3) 对于训练时间预测,他们在 18 美元的计算范围内推断出下游精度,其误差大约是现有替代方案的一半。总之,这些结果表明,专家轨迹是评估模型功能的广泛有用的信号源,可以在整个模型开发生命周期中实现可靠的性能预测。