论文
能力流形和机器学习缩放定律
The Capability Manifold and ML Scaling Laws
摘要
现有的机器学习 (ML) 缩放法则将预测损失与计算、模型参数和数据联系起来。然而,随着模型越来越多地通过代理工具进行部署,仅损失不足以表征下游性能:具有相似损失的模型可以在推理、检索、规划和适应方面表现出不同的能力。然而,没有统一的框架将此类功能与整个 ML 生命周期中可用的耦合资源连接起来。我们通过引入能力流形来弥补这一差距,这是一个多维框架,通过有界扩展函数将下游能力映射到训练前、训练后和测试时资源。分析雅可比行列式量化了对资源变化和交互的能力敏感性。作为初始应用,我们在框架内嵌入了 Kaplan 和 Chinchilla 型标度律和测试时计算,演示了如何将现有标度关系统一为通用能力流形上的轨迹。