论文
是什么使得循环在循环语言模型中有效?
What Makes Recurrence Effective in Looped Language Models?
摘要
循环语言模型 (LoopLM) 通过参数共享增加计算深度,提供了一种无需添加参数即可进行规模推理计算的路径。然而,目前尚不清楚额外的重复何时有益以及架构选择如何影响其有效性。通过对照实验,我们系统地检查(1)复发何时有帮助,(2)应该在哪里应用它,以及(3)它的调节如何影响表现。我们的评估涵盖知识和推理任务下训练范围内、训练范围内和训练范围之外的推理预算。 (1) 我们发现递归可以提高训练范围之外的推理能力,同时降低知识性能,但更难的推理实例并不总是受益更多。 (2) 性能还取决于不同层和循环迭代的分配方式,这表明仅有效深度不足以预测行为。非循环输出层提高了对展开不足的鲁棒性,而输入和输出层的首选放置随推理预算而变化。 (3)最后,我们发现传统的初始状态注入对不同的复发深度提供的鲁棒性有限。因此,我们提出历史状态注入作为替代方案,并表明通道方式历史状态注入与时间步调节相结合提供了一种低成本且更有效的设计,可以在扩展展开下更好地保留知识,同时提高推理预算的鲁棒性。总的来说,我们的结果阐明了循环计算何时有用、何时失败,并为跨可变推理预算设计 LoopLM 提供了实用指南。