论文
ARCO:面向多步LLM智能体的协同演化自适应量规
ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents
摘要
多步LLM智能体的强化学习常依赖指示成功、却无法解释轨迹为何好坏的标量奖励。基于量规的奖励经自然语言准则改进可解释性——但既有方法有两个局限:它们在轨迹级打分——对单个步骤无指导;且其评分器闭源且静态——无法随智能体在训练中演化而适配。我们提出ARCO(自适应量规协同演化)——为每个动作生成逐步量规并预测量规条件化的步级奖励——并在自策略rollout上持续更新该量规模型——使其准则与分数随智能体改进的行为共同演化。跨HotpotQA、2WikiMultiHopQA与MuSiQue、两个开源骨干——ARCO在全部设定中取得最高EM——超越结果、量规与过程奖励基线——分析显示其量规逐步专属、对设计选择稳健——并可用于诊断智能体行为。代码与数据见 https://github.com/zihangtian/ARCO。
