论文
自评估递归智能体
Self-Evaluating Recursive Agents
摘要
递归语言模型智能体分解任务并将子任务委托给同一策略的子实例,形成工作树。然而,训练它们很难:最终结果是可验证的,但自我发明的中间子任务数量众多且没有基本事实。现有的方法通过验证者或判断者对每个节点进行评分,这在规模上成本高昂并且对分解质量视而不见。我们认为,递归智能体必须在一组权重内学习三种耦合功能:将问题分解为子任务、解决它们并评估结果,每个任务都需要自己的训练信号。 SERA(自评估递归智能体)将评估转变为策略本身的学习能力。在委派任务之前,家长为每个子任务编写加权成功标准的规则;然后,根据经过验证的结果进行排名目标,然后训练标题生成,以便标准跟踪真正的子任务成功。此外,互补的叶子覆盖信号为任务分解提供了直接的信用。我们的核心发现是,训练生成对齐规则的策略是推动收益的因素:因为评估和执行的权重相同,学习判断子任务可以增强智能体解决这些问题的能力。值得注意的是,外部监督也减少了:仅咨询法官来训练评分生成器,而解决问题则针对智能体自己的评分评分进行训练,这优于直接使用法官。除了训练之外,学习的标题还可以用作树搜索的推理时选择器。在 TextCraft-Synth 和 TextWorld-Sync 上,SERA 比强递归智能体基线平均提高了 5.38 点和 13.14 点,而推理时的 rubric 引导树搜索在 TextWorld-Sync 上又增加了 2.43 点。
