论文

将循环深度改造为预训练语言模型:两个参数预算下的安装、外推、传输和保留

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

模型架构递归架构

摘要

密集的、预训练的语言模型可以通过循环深度进行改造,并学习在仅结果退火后持续存在的迭代潜在转变。 Qwen2.5-0.5B-Instruct 被分为前奏、权重关联的循环块和尾声,具有身份保留单循环路径和稍后循环上的重入桥。在循环 1 中,改装仍然不逊色于基于预先注册的 ARC 电池的基础。三项发现。首先,该机制是一个可重用的过程,而不是终端答案查找,并以两个预算安装:冻结基本权重上的 6M 个训练参数和 180M 全块。通过中间步骤监督,该模型每个循环计算一个任务步骤,并在仅对最终答案进行评分时持续存在。适配器与整个块总体匹配(83.8% 对 84.0%),领先深度 11,落后于深度 11。言语 微调 在受控言语渲染上达到 79-86%(零样本迁移是最小的),从安装的机制开始的适配器言语训练比匹配的新训练高出 18.6 个点,包括在保留的测试集上。其次,该操作推断出其监督深度的大约 1.5 倍,在深度 18 时保持 70% 的准确率。第三,相同大小的暂存器训练模型在其学习范围内与循环模型相匹配,但在其范围之外崩溃。循环模型总体获胜,分别为 84% 和 72%,深度 10 后的保留率分别为 53% 和 2.5%,并且响应速度快 7.6 倍。因此,在系统级比较中,迭代 Transformer 可以比在同一任务上微调的类似或更大的模型更快地在潜在空间中执行更深入的推理。第二个任务,反向运行规则,暴露了局限性:逆向是可以孤立学习的,但在保留已安装的机制和一般能力(灾难性干扰边界)的同时,没有继续获得它。学习深度选择仍然开放。