让信用跟随计算:面向大语言模型强化学习的架构感知信用传输
Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning
摘要
大语言模型强化学习(LLM RL)中的信用分配可以拆解为三个对象:关于成功的证据、把证据转化为 token 级优势的传输算子,以及把优势转化为策略变更的更新几何。近期工作在证据、采样和更新几何上已有大幅改进,但传输算子通常与架构无关。固定折扣的 GAE 沿 token 时间轴施加平稳的几何核;组相对方法把一个结果统计量广播到整条响应。两者都无法刻画 Transformer 策略自身所使用的轨迹特定计算。我们提出计算条件化信用传输(CCT),一个通用框架:以行为策略内部计算的一个分离统计量(不参与梯度回传)来参数化因果核,把下游价值沿 rollout 传输。我们的具体算法 CompPO 把原生注意力集中度映射为有界的逐 token 保留门控,把该门控同时用于一步自举和路径相关的广义优势轨迹(Comp-GAE),并协同设计了一个传输对齐的 critic(TAC),复用 actor 的隐藏状态与路由信息,无需第二个同等规模的 Transformer。任务奖励与裁剪的 PPO 策略目标保持不变;常数门控即可退化为固定系数 GAE。在五个 Qwen3-4B 随机种子上,CompPO 达到 61.4% 的最终保留集准确率(95% CI [60.8,62.0]),而调优过的 GRPO 为 53.8% [52.9,54.7]。带标准 critic 的 Comp-GAE(55.2%)和带固定门控的 TAC(56.4%)均不及完整模型(交互效应 +2.4 [1.9,2.9])。打乱与位置对照验证了轨迹特定对齐;CompPO 在 12 次 PPO 网格运行中 10 次稳定,对照为 3/12。冻结评估下,CompPO 在 Qwen3-4B 和 Llama-3.1-8B-Instruct 上分别比 GRPO 高出 4.3 和 3.9 个 greedy pass@1 宏观点数。