论文
装进少量token的不易过拟合:ML研究智能体中的压缩与泛化
What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents
摘要
原则上,自适应地重用保留的基准应该会导致过度拟合。然而,令人惊讶的是,基准驱动的机器学习 (ML) 在实践中几乎没有产生过度拟合。一个有吸引力的假设是,成功的机器学习策略具有高度可压缩性。我们在大语言模型驱动的研究代理的背景下研究这一点,其中假设可以通过两个互补的信息瓶颈直接进行测试。在\emph{输出压缩}中,探索代理使用验证集自适应地搜索高性能模型,并且我们测试新的“再现代理”是否可以仅在极短的提示和训练数据的情况下再现其性能。在\emph{输入压缩}中,浏览器仅接收一位反馈,指示每个提交的模型是否在运行最佳状态上有所改进。在涵盖表格分类、视觉、语言建模、扩散建模和奖励建模的 8 个数据集中,我们发现这些瓶颈对性能影响很小:简短的提示和可压缩的反馈足以重现和找到高性能模型。这个假设是可证伪的:当我们故意引起验证集过度拟合时,结果无法通过简短的提示重现。总而言之,我们的结果支持了对基准驱动的机器学习中缺乏过度拟合的描述长度解释:成功的策略占据了策略空间的低复杂性区域。
