论文

Evaluate-as-Action:面向检索增强智能体的自评估过程奖励

Evaluate-as-Action: Self-Evaluated Process Rewards for Retrieval-Augmented Agents

模型训练强化学习RLVRAgentic RL

摘要

检索增强智能体可以查询外部证据,但其在多步推理中的可靠性仍然有限:带噪声的检索可能使多跳问答偏离正轨,而仅基于结果的强化学习所提供的信用信号过于粗糙,难以优化中间步骤。我们提出EvalAct(Evaluate-as-Action),它将隐式的检索质量评估转化为显式动作,并强制执行耦合的Search-to-Evaluate协议,使每次检索之后立即产生一个结构化评估得分,从而得到与交互轨迹对齐的过程信号。为利用这些信号,我们提出过程校准优势重缩放(Process-Calibrated Advantage Rescaling, PCAR),一种基于GRPO的优化方法,根据评估得分在段级重缩放优势,强调可靠段并保守更新不确定段。在七个开放域问答基准上的实验表明,EvalAct取得最佳平均准确率,其中多跳任务上的提升最大;消融实验验证显式评估循环是主要改进的来源,而PCAR提供一致的额外收益。

Evaluate-as-Action:面向检索增强智能体的自评估过程奖励:论文配图
图1:EvalAct与PCAR概览:智能体执行搜索-评估耦合协议,产出分段自评分数,PCAR据此重缩放GRPO优势以优化过程奖励。