论文

由克隆体实现的通用习得式委派

General learned delegation by clones

模型训练上下文与知识强化学习上下文工程Agentic RL

摘要

前沿语言模型随着额外测试时计算的增加而提升,但在固定推理预算下,串行推理或缺乏协调的并行采样可能在计算上效率低下。我们提出 SELFCEST,通过 Agentic 强化学习使基础模型具备在各自独立的并行上下文中生成同权重克隆体的能力。训练在全局任务奖励下以共享参数的 rollout 端到端进行,得到一个习得的控制器,可在各分支之间分配生成与上下文预算。在具有挑战性的数学推理基准和长上下文多跳问答上,在匹配的推理预算下,SELFCEST 相比单体基线改善了准确率-成本帕累托前沿,并在两个领域均表现出分布外泛化。

由克隆体实现的通用习得式委派
图1:经 SELFCEST 训练的模型作为根智能体,以先并行后串行的方式协调辅助克隆(以相同参数实例化)来完成子任务,成功泛化到训练数据之外,并在准确率与 token 消耗上优于多种其他方法。