论文
自由配方极限:每个配方效应度量的都是理想化学习者哪个前提被打破
The Free-Recipe Limit: Every Recipe Effect Measures Which Premise of an Idealised Learner Broke
摘要
固定一个语料库并把配方搜索推向无穷:尝试技能的每一种顺序、从分块到交错的每一种排布、每一种组合,并保留最优者。有两个量决定这次搜索的价值:它所探索的可达集的直径,以及任何人能区分两个端点的分辨率。当直径低于分辨率时,再多的搜索也无法转化为决策,其特征不是没有赢家,而是赢家经不起重跑。我们用12个基础模型(0.5B—14B,三个预训练家族)上的761次微调来测量这道配方搜索之墙,任务为竞赛数学技能:基础检查点、AdamW下的监督微调、k=4的精确匹配评分。在固定数据量的同一连贯领域内,三种经典自由度的平均值在0.010—0.021之间,与0.019的分辨率底线相当;最大的对比0.0619越过了三种子分辨率,随后在两次重跑中分别读出+0.010和-0.015。具有系统性答案的例外是连贯性:把一个合并语料库对半分,让两半在不兼容但同等正确的约定下撰写答案,会使排布从能力问题变为约定间的分配问题,比同约定对照组大两个数量级;而把约定写进输入即可关闭这一现象。该开关在第二个预训练家族上复现,并经受住了其自身协议的独立重执行,重执行离散度(0.087)小于搜索选出的顺序单元所承载的分辨率(0.144)。顺序本身是一个瞬态量,其符号在单次运行内三次穿越零点。数据量——这个没人称之为配方的东西——才是真正稳定见效的杠杆。一份公开记分卡对全部26条预注册主张打分:18条获支持,5条失败,2条未检验,1条混合。