论文
IGSD:经过环境验证的搜索Agent事后自蒸馏
IGSD: Environment-Verified Hindsight Self-Distillation for Search Agents
摘要
on-policy自我蒸馏在没有外部教师的情况下强化了Agent培训:以特权后见之明为条件的策略为其自身的非特权rollout提供了阶梯式指导。然而,对于搜索Agent来说,事后诸葛亮可能会让老师更喜欢不会改善学生状态检索的查询。现有的方法要么直接提取此偏好,要么使用模型内部分数对其进行过滤,但这两种策略都没有验证查询执行的检索结果。我们提出信息增益门控自蒸馏(IGSD),它在蒸馏之前用环境反馈验证符合策略的词元提案。将每个查询词元视为一个微操作,IGSD 将教师的词元提案和学生的采样词元完成为匹配的查询,并使用相同的检索器从相同的失败状态执行两者。共享反事实控制考虑了答案可能性中查询条件的变化,因此它们的差异(执行的配对信息增益)为检索到的文档提供了相对效用对比。 IGSD 使用这种对比作为候选对蒸馏的纯正软权重,同时保持 GRPO 目标不变并将验证限制在训练中。在七个单跳和多跳 QA 基准测试中,IGSD 在没有推理时间验证的情况下,使用 3B 和 7B 策略分别达到了 42.8% 和 47.0% 的宏观平均精确匹配精度。这些结果支持经过环境验证的后见之明,作为对搜索Agent进行可靠的行动级监督的有效方法。