论文
GEAR:通过 Self-蒸馏 对 LLM 代理进行粒度自适应优势重新加权
GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
摘要
强化学习已成为 LLM 代理广泛使用的 后训练 方法,其中训练通常依赖于仅提供粗略监督的结果级别奖励。虽然更细粒度的信贷分配有望促进有效的政策更新,但获得可靠的当地信贷并将其分配到长期轨迹的正确部分仍然是一个开放的挑战。在本文中,我们提出了粒度自适应优势重新加权(GEAR),这是一种自适应粒度贡献分配框架,它使用从自我 蒸馏 派生的词元级和段级信号来重塑轨迹级 GRPO 优势。 GEAR 将 同策略 学生与 真值 条件教师进行比较,以获得参考引导发散信号,用于识别自适应分段边界并调制局部优势权重。这种分歧通常在语义偏差开始时达到峰值,而同一自回归延续中的后续标记可能会恢复到低分歧。因此,GEAR 将此类峰值视为自适应学分区域的锚点:在学生与教师保持一致的情况下,保留 词元级 分辨率;在出发点,GEAR 将相应的延续分组为自适应分段,并使用出发点处的分歧来调整该分段的优势。使用 Qwen3 4B 和 8B 模型进行的八个数学推理和代理工具使用基准的实验表明,GEAR 始终优于标准 GRPO、仅自我 蒸馏 基线以及词元或轮级贡献分配方法。在 GRPO 基线精度较低的基准上,增益尤其强劲,比 GRPO 提高了 20% 左右,这表明所提出的自适应重新加权方案在更具挑战性的长范围设置中特别有用。