论文

ARCA:词元信号退化时的适配器残差贡献分配

ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate

模型训练强化学习

摘要

语言模型强化学习的 词元级 学分分配通常被制定为好像该策略是完全可训练的,而实用的 LLM-RL 管道通常依赖于参数高效的 微调,尤其是 LoRA。我们认为这种分离隐藏了结构性失效模式。在 LoRA 下,策略仅限于参考模型的低秩邻域,因此常见内在信用信号、意外、熵减少和策略发散所使用的每个词元的输出分布差异在轨迹内标准化后可能会变得退化,要么接近统一权重,要么集中在一小部分与任务无关的位置。我们将这种行为形式化,并建议使用权重基尼系数和有效词元比率等集中诊断直接对其进行测量。然后,我们引入\emph{适配器残差贡献分配}(ARCA),这是一种轻量级替代方案,它从适配器自己的隐藏状态残差 $\|h^{\text{adapted}}_t - h^{\text{base}}_t\|_2$ 中得出标记显着性。 ARCA 询问适配器实际上在哪里改变了模型,而不是输出分布在哪里显得不确定或转移,并且不需要学习奖励模型、价值头或树结构。在紧凑的 MATH/Qwen3-1.7B GRPO 扫描中,ARCA 在匹配的轨迹采样预算下展示了预测的非退化中间区间信用分布,并且与秩匹配的基线保持竞争力。