论文

装进少量token的不易过拟合:ML研究智能体中的压缩与泛化

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

模型评测模型行为与机制分析

摘要

原则上,自适应地重用保留的基准应该会导致过度拟合。然而,令人惊讶的是,基准驱动的机器学习 (ML) 在实践中几乎没有产生过度拟合。一个有吸引力的假设是,成功的机器学习策略具有高度可压缩性。我们在大语言模型驱动的研究代理的背景下研究这一点,其中假设可以通过两个互补的信息瓶颈直接进行测试。在\emph{输出压缩}中,探索代理使用验证集自适应地搜索高性能模型,并且我们测试新的“再现代理”是否可以仅在极短的提示和训练数据的情况下再现其性能。在\emph{输入压缩}中,浏览器仅接收一位反馈,指示每个提交的模型是否在运行最佳状态上有所改进。在涵盖表格分类、视觉、语言建模、扩散建模和奖励建模的 8 个数据集中,我们发现这些瓶颈对性能影响很小:简短的提示和可压缩的反馈足以重现和找到高性能模型。这个假设是可证伪的:当我们故意引起验证集过度拟合时,结果无法通过简短的提示重现。总而言之,我们的结果支持了对基准驱动的机器学习中缺乏过度拟合的描述长度解释:成功的策略占据了策略空间的低复杂性区域。

装进少量token的不易过拟合:ML研究智能体中的压缩与泛化:论文配图
图 1:自主代理语言模型预训练策略的可压缩性。一个探索者智能体开发了一个 12 层、768 维的 GPT,有 ∼30{\sim}30 个非默认选择;我们将其策略压缩为逐渐缩短的提示(64 个到 4 个标记),并将每个提示交给 5 个独立的重现器,这些重现器无需浏览器的代码或验证集即可实现该策略。左:压缩提示。令牌编码架构 (12L d768)、优化器 (Muon .1)、激活 (ReLU2)、批量大小 (b2M) 和标准化 (QKnorm);颜色表示生存深度(深蓝色=在最紧张的预算中生存,红色=首先掉落)。右:再现者抵抗损失(BPB);点 = 平均值,灰带 = 最小值–最大值,虚线 = 压缩前的浏览器。表现保持在16个词元; 8 个 token 处的悬崖与批量大小、MLP 比率和 QK 范数的损失同时发生。