论文

只训练一层就够吗?单层Transformer强化学习可接近全参数收益

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

模型训练强化学习

摘要

强化学习已成为LLM后训练的核心,但适应如何分布在Transformer各层尚不清楚。通常统一更新所有参数,隐含各层贡献相近。论文系统逐层研究,发现训练单层可恢复大部分全参数强化学习收益,有时超过全参数训练,并定义层贡献为孤立训练该层所恢复的全参数收益比例。实验跨Qwen3与Qwen2.5两个家族的七个模型、GRPO、GiGPO、Dr. GRPO三种算法,以及数学推理、代码生成和Agent决策任务。收益稳定集中于少数、许多设置甚至单层;高贡献层集中于Transformer中部,输入和输出附近层贡献较低。层排名在数据集、任务、模型家族与算法之间仍高度相关。