论文
保持政策梯度负责:兄弟指导信用 蒸馏 为长期工具使用代理
Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents
摘要
长期工具使用强化学习从结果验证中学习,但轨迹级优势通过推理、API 和答案标记来传播。直接自我 蒸馏 可以提供更密集的信号,但在我们的实验中,它也可以通过排练教师行为而不识别验证者奖励哪些操作来破坏工具的使用。我们引入了 Sibling-Guided Credit 蒸馏 (SGCD),它使用 蒸馏 进行有界信用加权,而不是作为竞争策略损失。动态采样产生混合的成功和失败的同级采样轨迹;外部 LLM 将其对比总结为仅限训练的信用参考;师生分离的分歧重塑了 GRPO 词元的优势。部署的学生仅收到清理任务提示。在 AppWorld 和 tau^3-airline 中,SGCD 报告的保留点估计值高于 GRPO 系列比较器:AppWorld TGC 在 test_normal 上从 42.9 提高到 45.6,在 test_challenge 上从 24.7 提高到 27.0,并且 tau^3-airline 保留评估器分数从 0.583 提高到 0.602。这些结果支持长期工具使用代理的狭窄设计规则:使用 蒸馏 指导贡献分配,同时保持策略梯度负责策略更新。