论文
递归代理工具
Recursive Agent Harnesses
摘要
递归语言模型 (RLM) 表明,模型调用的递归是长上下文推理的有效策略,并且生产 编码智能体 已经开始编写大规模生成子代理的代码,最近是在 Anthropic 的动态工作流程中。我们命名并研究这两条工作线之间的模式,其中递归单元是具有文件系统工具、代码执行和规划的完整代理工具,而不是没有工具的模型调用。我们将其称为递归代理Harness (RAH),并将其定义为Harness递归,即 RLM 模型递归的代码优先扩展。父代理生成并运行一个可执行脚本,该脚本并行生成子代理工具以实现细粒度工作负载,并使用结构化函数调用来执行小型子任务。我们提供对长上下文推理的受控评估。由于骨干网固定在 GPT-5 以匹配已发布的 Codex 和 RLM 基线,RAH 将 Oolong-Synthetic 上的 Codex 编码代理基线从 71.75% 提高到 81.36%(199 个样本、13 个上下文长度桶,最多 4M 词元),这一增益可归因于工具而不是模型。骨干更强的Claude Sonnet 4.5,相同设计达到89.77%。