论文

可以预测能力的出现:提前预测每个种子,具有校准的间隔、经过认证的误报和盲预注册门

Capability Emergence Can Be Forecast: Per-Seed, In Advance, With Calibrated Intervals, Certified False Alarms, and a Blind Pre-Registered Gate

模型评测评测方法与指标

摘要

新兴能力被广泛认为是不可预测的:损失平稳改善,而能力却突然出现。之前的工作提供了预警指标,但从未将其作为预测进行评分:在受控的误报率下没有交付时间,没有校准,没有负面结果,没有盲目测试。我们提供了这一规则,并表明,在 grokking 模型系统和小语言模型中,每次运行的出现时间都是可以提前预测的,并且具有校准的不确定性。在相同配置的 30 个 Transformer 中,前一个词元头的形成时间预测每个种子的感应头出现时间为 Spearman rho=0.977,中值领先 975 步(约训练的 15%);最佳情况损失规则将排名与领先 50 步(即时预测)联系起来。共形间隔覆盖了 15/15 保留的种子,冻结规则通过了两个从未见过的配置(10/10 和 9/10 覆盖)上的盲预注册门。然后,陷阱语言梯级攻击我们自己的预先注册的规则:其中先前的词元上下文为任务本身付费,在 10/10 能力阻止运行上的裸先驱误报,而机制组成的合取在语言类(0 误报)和 rho=1.000 的出现次数中得到了认证。最后,间隙起源研究打破了固定偏移(lr 和批量移动间隙约 2.3 倍;没有外部时钟拥有它)并揭示了下面的定律:在 80 个有效锚点上,锚点在出现时间的 0.843 处运行 - t_event ~= 1.19 x t_anchor - 并且这个乘法规则在第三种看不见的配置下通过了它自己的盲门(5/5)。针对 33 种制造底片的误报经过认证。前体领先于 3 个公共模型系列(Pythia、OLMo、OLMo-2;7 个套件),其中 1B 词元的 OLMo-2 显示前体已形成,但功能缺失。发射并报告了四个预先注册的杀伤标准。每次冻结都先于公共提交链中的数据。