论文
蒸馏什么与何时蒸馏:面向多轮智能体的选择性事后蒸馏
What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents
摘要
强化学习可以用稀疏的任务奖励训练LLM智能体,但长程贡献归因依然困难:单一的成功或失败信号必须分摊到众多动作上。现有方法依赖轨迹级奖励或代理信号,未充分利用每一步的环境反馈。多轮智能体场景鲜有研究,其中反馈可能包括错误消息、页面变化、观测或参考轨迹。我们系统研究五种反馈来源与两种插入粒度,并提出SERL,一个选择性环境重加权学习框架。SERL用任务奖励决定更新方向,而环境反馈调整反馈放置的位置与幅度,聚焦关键动作。在ALFWorld和WebShop上,SERL分别取得90.0%和80.1%的成功率,优于强大的RL与蒸馏基线。分析表明,在有意义的位置注入有据可依、与动作相关的反馈,持续优于不加区分地使用更长或更丰富的上下文。
