论文
Ouroboros:通过输入条件 LoRA 调制实现递归 Transformer 的动态权重生成
Ouroboros: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation
摘要
递归 Transformer 在多个深度步骤中重用共享权重块,交换计算参数。一个核心限制:每个步骤都应用相同的转换,从而阻止模型跨深度组合不同的操作。我们推出 Ouroboros,一个将紧凑控制器超网络附加到递归 Transformer 块的系统。控制器观察当前隐藏状态,生成每步对角调制向量,并将其应用于冻结的 SVD 初始化 LoRA 基,使每个递归步骤依赖于输入。我们将其与门控循环(偏差初始化为 88% 保留)和每步 LayerNorm 相结合,以实现稳定的深度迭代。在分成 Prelude/Recurrent/Coda 架构(保留 36 层中的 17 层)的 Qwen2.5-3B 上,Ouroboros 比未修改的 17 层基线减少了 43.4% 的训练损失,弥补了因层移除而导致的性能差距的 51.3%。完整系统仅添加 920 万个可训练参数(控制器、门和每步规范),但在深度 1 处比同等大小的静态每步 LoRA 多出 1.44 个损失点,并且在所有测试深度(1、4、8、16)和等级(8、32、64)上保持领先。我们还发现门控递归是必不可少的:没有它,递归层应用会使模型变得更糟。这些收益是根据训练分布来衡量的;在保留的文本上,控制器尚未改进基线,我们将此限制归因于冻结的下游层并详细讨论。代码:https://github.com/RightNow-AI/ouroboros