论文

ARCO:面向多步LLM智能体的协同演化自适应量规

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

多步LLM智能体的强化学习常依赖指示成功、却无法解释轨迹为何好坏的标量奖励。基于量规的奖励经自然语言准则改进可解释性——但既有方法有两个局限:它们在轨迹级打分——对单个步骤无指导;且其评分器闭源且静态——无法随智能体在训练中演化而适配。我们提出ARCO(自适应量规协同演化)——为每个动作生成逐步量规并预测量规条件化的步级奖励——并在自策略rollout上持续更新该量规模型——使其准则与分数随智能体改进的行为共同演化。跨HotpotQA、2WikiMultiHopQA与MuSiQue、两个开源骨干——ARCO在全部设定中取得最高EM——超越结果、量规与过程奖励基线——分析显示其量规逐步专属、对设计选择稳健——并可用于诊断智能体行为。代码与数据见 https://github.com/zihangtian/ARCO。

ARCO:面向多步LLM智能体的协同演化自适应量规:论文配图
图 1:多跳 QA 代理的奖励信号。 (a) 现有的奖励模型均存在不足:结果奖励是单个标量,没有每步积分;由冻结的法官评分的轨迹级评分标准无法适应该政策; PRM 给出每一步但不透明的分数。 (b) ARCO 使用单个开源评分模型 μ\mu 为每个动作生成一个自然语言评分,并根据它对动作进行评分,从而产生可解释的、步骤级的、自适应的奖励,无需外部判断。