论文

一种激励外化推理的transformer架构改动

A transformer architecture alteration to incentivise externalised reasoning

模型架构Transformer

摘要

我们提出一种新的架构改动与后训练流程,通过教会模型提前截断前向传播,促使LLM成为推理更加冗长外显的推理者。我们在现有transformer架构上加入中间层的提前退出(early-exit)机制,并训练模型在无需深层计算即可预测下一个token时于较浅层退出。经过校准阶段后,我们用强化学习激励模型在保持任务性能的同时尽可能早地退出。我们针对小型推理模型给出了这一方向的初步结果,表明它们学会跨token自适应地减少计算。我们预计,在合适的规模上应用时,我们的方法能将推理模型依靠内部激活执行非短视(non-myopic)规划时可动用的冗余计算量降至最低,只把这类计算留给难以预测的token。

一种激励外化推理的transformer架构改动:论文配图
图 2:左:Qwen3-4B 上用于心理理论(Sclar 等人,2024)任务的强化学习动态训练。每个面板显示单独的运行(细线)、运行平均值(带标记的粗线)和 ±\pm1 SE 误差线。虚线表示 SFT 之前的基本模型性能。步骤0表示RL之前的SFT校准模型。准确性提高,而平均计算量减少,这表明该模型学会在不牺牲性能的情况下提前退出。连贯性始终保持稳定。每步根据 60 个心理理论提示进行评估。右:早期退出行为的token级可视化。每个token都按计算终止的层着色。该模型自适应地改变计算深度,对可预测的标记使用较少的层,对更复杂的标记使用完整的深度。我们使用 λ=1.5\lambda=1.5 和 β=0.25\beta=0.25。