论文

SELF:联合环境反馈建模与Agent事后自蒸馏

Environmental Feedback Modeling Matters: Rethinking Feedback Treatment in Agentic Hindsight Self-Distillation

模型优化智能体系统Agent 环境交互蒸馏

摘要

强化学习通常用于在交互环境中训练语言代理,但在没有奖励的情况下不能直接应用。最近的方法使用环境反馈作为事后自我蒸馏的特权背景,但我们的分析表明,仅仅根据反馈来调节教师是不够的,这促使我们重新思考如何在 agentic 自蒸馏中使用环境反馈。鉴于环境反馈包含对环境如何响应智能体行为进行建模的丰富监督,我们引入了 \textit{agentic 自蒸馏与环境反馈建模}(SELF),这是一个联合优化环境反馈建模和事后自蒸馏的框架。自我学习预测环境反应,同时将反馈条件自学教师的指导提炼成政策。我们的分析揭示了一个相辅相成的机制:环境反馈模型加强了事后监督和政策学习,而自我蒸馏增强了模型的能力 模型环境反馈。借助 Qwen3-8B,SELF 在 $τ$ 基准成功率方面比 SDPO 和 GRPO 分别高出 6.4 和 4.1 个百分点,在 AppWorld 任务目标完成度方面分别高出 10.71 和 3.57 个百分点。这些结果表明SELF在agentic自蒸馏中更有效地利用环境反馈,提高代理能力。