论文
Co-ReAct:评分准则作为ReAct智能体的步骤级协作者
Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents
摘要
面向搜索密集型多步推理任务的ReAct类智能体,在很大程度上依赖自身内部判断来决定寻求何种证据、下一步采取何种推理或行动、以及何时停止,常产生浅表、冗余或目标性差的轨迹。已有工作探索将评分准则(rubric)作为外部质量信号,但现有用法大多是评估性而非行动引导性的:rubric通常充当训练时奖励或对已完成输出的事后评估器,且在深度研究场景中往往粗粒度、报告级而非步骤级。我们提出Co-ReAct,一个以rubric引导动作选择的框架,在推理过程中将rubric用作步骤级指导。在每个决策步骤,Co-ReAct向智能体上下文注入一条rubric,引导下一步的推理或行动决策,明确智能体在证据获取、搜索、推理或自评上应瞄准什么。为使这种指导可靠,我们用GRPO训练了一个专门的rubric生成器。与以往成对或二元偏好的表述不同,我们的目标以多评审专家共识排序为参照,优化列表级Spearman秩相关奖励,促使rubric具有区分度而不只是貌似合理。在DeepResearchBench与SQA-CS-V2上,无论搜索智能体基于8B/14B开源还是前沿闭源基础模型构建,Co-ReAct都持续优于ReAct及代表性测试时计算基线。训练好的rubric生成器还可作为即插即用组件,在不改变这些基线底层决策机制的前提下提升其表现。代码已公开于 https://github.com/ZBWpro/Co-ReAct。
