论文

归纳法的用处:整数序列基准中的描述长度难度和记忆差距

Where Induction Runs Out: Description-Length Difficulty and the Memorisation Gap in Integer-Sequence Benchmarks

模型评测评测方法与指标

摘要

整数序列在线百科全书 (OEIS) 中的整数序列越来越多地用于对语言模型中的数学推理进行基准测试。我们使用精确可计算的参考学习器来询问这些基准实际上测量的是什么:P-递归(完整)递归类上的两部分最小描述长度(MDL),在术语到达时对序列的每个前缀进行评估。以下是三个发现。首先,MDL 难度是参数计数。发现点 nd 是符号假设击败逐字存储的第一个前缀长度,它几乎是通过所选算子的阶数和程度的组合可识别性界限来准确预测的。它对于幅度项是不变的:将斐波那契缩放超过十二个数量级不会改变,因为假设必须对其自己的初始条件进行编码,并且幅度会抵消。其次,在规模上,学习者展示了我们策划的语料库一次都无法产生的机制:在 20,000 个 OEIS 序列中,89.98% 的符合某些前缀递归的序列在全长上都不符合。我们称之为荒野——归纳法获得了一个理论,又失去了它,并且永远无法恢复。第三,根据这些 MDL 体系分层的序列评估三种语言模型驳斥了我们预先注册的假设:模型不会在 MDL 报告没有理论的情况下进行混淆,而是适当地对冲。置信错误被颠倒过来,集中在容易的层次上,其中明显的能力跟踪序列的识别而不是其规则的归纳。因此,OEIS 衍生的基准在很大程度上衡量记忆力,而 MDL 提供了他们目前缺乏的廉价、无污染的难度信号。代码和数据已发布。