论文
由克隆体实现的通用习得式委派
General learned delegation by clones
摘要
前沿语言模型随着额外测试时计算的增加而提升,但在固定推理预算下,串行推理或缺乏协调的并行采样可能在计算上效率低下。我们提出 SELFCEST,通过 Agentic 强化学习使基础模型具备在各自独立的并行上下文中生成同权重克隆体的能力。训练在全局任务奖励下以共享参数的 rollout 端到端进行,得到一个习得的控制器,可在各分支之间分配生成与上下文预算。在具有挑战性的数学推理基准和长上下文多跳问答上,在匹配的推理预算下,SELFCEST 相比单体基线改善了准确率-成本帕累托前沿,并在两个领域均表现出分布外泛化。
