论文

Co-ReAct:评分准则作为ReAct智能体的步骤级协作者

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

智能体系统模型训练强化学习Agent 规划Agentic RL

摘要

面向搜索密集型多步推理任务的ReAct类智能体,在很大程度上依赖自身内部判断来决定寻求何种证据、下一步采取何种推理或行动、以及何时停止,常产生浅表、冗余或目标性差的轨迹。已有工作探索将评分准则(rubric)作为外部质量信号,但现有用法大多是评估性而非行动引导性的:rubric通常充当训练时奖励或对已完成输出的事后评估器,且在深度研究场景中往往粗粒度、报告级而非步骤级。我们提出Co-ReAct,一个以rubric引导动作选择的框架,在推理过程中将rubric用作步骤级指导。在每个决策步骤,Co-ReAct向智能体上下文注入一条rubric,引导下一步的推理或行动决策,明确智能体在证据获取、搜索、推理或自评上应瞄准什么。为使这种指导可靠,我们用GRPO训练了一个专门的rubric生成器。与以往成对或二元偏好的表述不同,我们的目标以多评审专家共识排序为参照,优化列表级Spearman秩相关奖励,促使rubric具有区分度而不只是貌似合理。在DeepResearchBench与SQA-CS-V2上,无论搜索智能体基于8B/14B开源还是前沿闭源基础模型构建,Co-ReAct都持续优于ReAct及代表性测试时计算基线。训练好的rubric生成器还可作为即插即用组件,在不改变这些基线底层决策机制的前提下提升其表现。代码已公开于 https://github.com/ZBWpro/Co-ReAct。

Co-ReAct:评分准则作为ReAct智能体的步骤级协作者:论文配图
图 1:Co-ReAct 概述。 (i) 收集:在每个分支点对候选下一步行动进行抽样,并根据多位专家的共识对其进行排名。 (ii) 训练:GRPO,在评分细则引起的排名和专家排名之间提供 Spearman 奖励。 (iii) 推断:经过训练的评估准则驱动五元组(评估准则、推理、行动、验证、观察)循环。