论文
EviSD:用于搜索增强代理的证据条件自我 蒸馏
EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents
摘要
基于结果的强化学习使搜索增强语言代理能够从可验证的最终答案中学习,但其轨迹级信用无法区分多轮搜索过程中各个动作的贡献。我们提出了 EviSD,一种以证据为条件的自我 蒸馏 框架,它使用实例级支持证据作为搜索操作的特权信息,并使用标准答案作为答案操作的补充特权。在训练期间,学生从原始上下文中采样动作,而同一模型在与动作一致的上下文下将他们重新评分为特权教师。 EviSD 将分离的师生差距转化为对结果衍生的 GRPO 优势的有限修正,并仅将其应用于生成的行动跨度。该设计本地化了特权指导,同时保留了由结果奖励确定的更新方向,无需辅助 蒸馏 目标或推理时的任何更改。在七个问答基准和三个跨越模型规模和世代的骨干网中,EviSD 在所有评估设置中实现了最高的宏观平均精确匹配,比最强的比较方法高出 1.3--2.3 个点,同时仅调节 6.7%--15.1% 的响应标记。代码可在 https://github.com/JiananXie/EviSD 获取。