论文
负面优势是一把双刃剑:校准 GRPO 中搜索代理的优势
Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search Agents
摘要
搜索代理通过与搜索引擎的多轮交互实现强大的问答性能,组相对策略优化(GRPO)是广泛使用的训练算法。然而,GRPO 风格的算法在多跳搜索设置中仍然面临一些挑战。首先,当最终答案错误时,正确的中间步骤通常会受到惩罚。其次,训练高度不稳定,常常导致自然语言能力下降,甚至灾难性的训练崩溃。我们的分析将这些问题归因于粗粒度的优势分配以及正负优势之间的不平衡。为了解决这些问题,我们提出了 CalibAdv,这是一种专门为搜索代理设计的优势校准方法,可以实现更准确、更稳定的惩罚和奖励建模。具体来说,CalibAdv 利用中间步骤的正确性在细粒度水平上缩小过多的负面优势。然后进一步重新平衡正负优势,以提高训练稳定性。重要的是,CalibAdv 采用轻量级设计,校准了常规轨迹采样信号的优势,使其部署简单易行。跨三个模型和七个基准的大量实验表明,CalibAdv 提高了模型性能和训练稳定性。我们的代码可在 https://github.com/wujwyi/CalibAdv 获取。