论文
走向正确的循环模型,第二部分:在固定点重新思考
Towards Looped Models Done Right, Part II: Rethinking at Fixed Points
摘要
循环语言模型的每次重复都会增加训练、解码、预填充和强化学习 (RL) 的成本。循环状态越接近固定点,到达固定点的路径就越不重要。这使得训练中的截断反向传播成为可能;终端键值(KV)共享解码,几乎不损失准确率;预填充最高加速1.79倍的蒸馏学生模型; RL 更新根据保存的执行轨迹状态计算梯度,比通过重播轨迹反向传播快 2 倍。因此,我们改进了训练塑造这些固定点的两个组件:深度先验和输入注入。固定深度的训练打破了KV共享,Huginn的广泛深度先验支持共享,但稀释了目标深度的监督超过了共享的需要;我们从预测反馈中学习先验,并使用熵项来保持其广泛性。现有的注入方案让国家的组件沿着输入放大或取消注入;我们通过正交注射去除这个组件。从 100M 到 1.6B 参数,学习的先验和正交注入分别相对于 Huginn 的先验和现有注入方案降低了每个尺度的困惑度。在 1.6B 时,使用小 3 倍的 KV 缓存学习到的先验与具有完整缓存的固定深度训练的下游平均值相匹配。
