论文

蒸馏什么与何时蒸馏:面向多轮智能体的选择性事后蒸馏

What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

模型训练强化学习Agentic RL

摘要

强化学习可以用稀疏的任务奖励训练LLM智能体,但长程贡献归因依然困难:单一的成功或失败信号必须分摊到众多动作上。现有方法依赖轨迹级奖励或代理信号,未充分利用每一步的环境反馈。多轮智能体场景鲜有研究,其中反馈可能包括错误消息、页面变化、观测或参考轨迹。我们系统研究五种反馈来源与两种插入粒度,并提出SERL,一个选择性环境重加权学习框架。SERL用任务奖励决定更新方向,而环境反馈调整反馈放置的位置与幅度,聚焦关键动作。在ALFWorld和WebShop上,SERL分别取得90.0%和80.1%的成功率,优于强大的RL与蒸馏基线。分析表明,在有意义的位置注入有据可依、与动作相关的反馈,持续优于不加区分地使用更长或更丰富的上下文。

蒸馏什么与何时蒸馏:面向多轮智能体的选择性事后蒸馏:论文配图
图 1:环境反馈引导智能体 RL 的流程。上半部分总结了仅限训练的事后资源和安置选择。下半部分显示 SERL:放置的反馈仅暴露给教师,这将后见之明转换为 GRPO 的与奖励一致的行动级别信用。