论文

评估微型递归模型在代码生成训练各阶段的表现

Evaluating Tiny Recursive Models Across Training for Code Generation

模型评测模型能力评测

摘要

代码生成越来越依赖于大型Transformer模型,其能力随着规模的扩大而提高。然而,这样的规模成本高昂,从而产生了对小型模型的需求,尤其是在数据有限的情况下。递归模型通过重用单个块来增加深度而不是堆叠独立层来解决这个问题。此类模型通常在单个检查点通过教师强制拟合(真实前缀上的下一个词元丢失)或任务准确性进行评估,而代码是通过自由运行的生成生成的,其中模型扩展了自己的输出。教师强制的优势是否能在自由奔跑的一代中幸存下来,以及它是否在整个训练过程中都有效,仍然是一个悬而未决的问题。为了研究这两者,我们将自然语言到 Python 代码生成的约 28M 参数自回归微型递归模型 (TRM-AR) 与参数匹配和深度匹配控制进行比较,跟踪 40 个时期和三个种子的拟合和生成。递归模型和深度匹配控制之间的拟合排序翻转了两次。通过验证损失选择每个检查点并检查轨迹会产生一致的比较。在相同的参数下,TRM-AR 的拟合、生成和泛化能力优于参数匹配控制,同时恢复了两个控制之间约 45% 的验证损失差距和 57% 的生成质量差距,其每步成本约为参数匹配控制的 175 倍。然而,在相同的有效深度下,较大的Transformer在其验证最佳状态下拟合和生成效果更好,这表明 TRM-AR 的优势在于防止过度拟合,而不是更强的能力。这些发现表明,递归代码生成模型应该在整个训练轨迹上的拟合和生成上联合评估,而不是在单个检查点。