论文
PG-SFT:离线Agent微调中平衡能力获取和保留
PG-SFT: Balancing Capability Acquisition and Retention in Offline Agent Fine-Tuning
摘要
离线智能体轨迹上的监督微调(SFT)是训练使用专门工具的智能体的标准方法,但强制模型逐个模仿推理和动作可能会损害基础模型的其他功能(例如,一般推理、工具调用、代码生成)。在这项工作中,我们重点研究 \emph{如何在智能体轨迹SFT中更好地平衡新能力获取与既有能力保留}。通过比较我们设置中的多个基准,标准 SFT 提高了目标基准,同时降低了多个非目标基准分数;同时,简单地使用 KL 惩罚来约束分布漂移或限制更新幅度并不能避免这种回归趋势。受最近的 token-wise 自适应学习目标的推动,这项工作提出 \textbf{Privilege-Guided SFT (PG-SFT)} 利用Agent轨迹的轮级信息增益作为调整监督强度的指标。 PG-SFT 在评估的基准上产生了更有利的观察权衡,以目标任务性能轻微下降为代价,大大减少了分布漂移和广泛的能力下降。我们的研究结果表明,平衡获取-保留权衡不仅取决于模型是否锚定其基本行为,还取决于监督应在何处以及在多大程度上偏离该行为。}