论文

CAFE:自我改进的搜索智能体需要协同演化的反馈

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

模型训练强化学习Agentic RL

摘要

结果监督的搜索智能体学习何时以及如何检索证据,但终端奖励既不能定位中间错误,也不能在错误复合之前纠正正在进行的轨迹。把纠正性反馈当作轨迹内的一种习得干预,会将两种角色耦合在一起:智能体必须决定何时请求并使用反馈,而评论者必须从结果混淆的rollout中推断有用的纠正,而这些rollout的失败模式会随着智能体的改进而变化。我们提出CAFE(Coupled Agent-Feedback Evolution),一个让共享参数模型在搜索智能体与评论者角色之间交替的框架。CAFE从围绕基础智能体自身失败构建的轨迹初始化反馈条件化的恢复,然后耦合在线与离线优化。在在线RL期间,比较性反馈估计使用提示级的调用-跳过成功差距来塑造请求回报,而反馈感知的优势整形在反馈前后重加权token优势。在离线阶段,由rollout衍生的偏好优化从相匹配的成功与失败轨迹中学习反馈。在七个Agentic搜索基准上,CAFE平均优于被评估的基于RL的搜索智能体,在全部六个域外基准上保持增益,并减少答案层面的幻觉。单侧消融表明,只改进智能体或只改进评论者最终都会趋于停滞,而交替更新两者则持续提升性能。这些发现表明,自我改进的搜索智能体需要与其所引导的策略协同演化的反馈。

CAFE:自我改进的搜索智能体需要协同演化的反馈:论文配图
图1:CAFE概览。一个共享模型同时充当智能体与评论者。CFE基于调用-跳过差距塑造请求回报;优势塑形对反馈前后的token加权。RDPO从近期rollout中挖掘前缀匹配对来更新评论者。