Orchard:开源智能体建模框架
Orchard: An Open-Source Agentic Modeling Framework
摘要
代理建模旨在将大语言模型转变为能够通过规划、推理、工具使用以及与环境的多轮交互来解决复杂任务的自主代理。尽管投入大量资金,开放研究仍然受到基础设施和培训差距的限制。许多高性能系统依赖于专有的代码库、模型或服务,而大多数开源框架专注于编排和评估,而不是可扩展的代理培训。我们推出 Orchard,一个用于可扩展代理建模的开源框架。其核心是 Orchard Env,这是一种轻量级环境服务,为跨任务域、代理工具和管道阶段的沙箱生命周期管理提供可重用的原语。在 Orchard Env 之上,我们构建了三个代理建模方法。 Orchard-SWE 的目标是编码剂。我们从 MiniMax-M2.5 和 Qwen3.5-397B 中提取 107K 条轨迹,引入贡献归因 SFT 来从未解决轨迹的生产性部分中学习,并为 RL 应用平衡自适应推出。从 Qwen3-30B-A3B-Thinking 开始,Orchard-SWE 在 SFT 后在 SWE-bench Verified 上取得了 64.3% 的成绩,在 SFT+RL 后取得了 67.5% 的成绩,在同等规模的开源模型中创下了新的最先进水平。 Orchard-GUI 仅使用 0.4K 个精炼轨迹和 2.2K 个开放式任务来训练 4B 视觉语言计算机使用代理。它在 WebVoyager、Online-Mind2Web 和 DeepShop 上分别实现了 74.1%、67.0% 和 64.0% 的成功率,使其成为最强的开源模型,同时与专有系统保持竞争力。 Orchard-Claw 的目标是私人助理特工。仅经过 0.2K 综合任务的训练,它在 Claw-Eval 上的 pass@3 成功率为 59.6%,与更强大的 ZeroClaw 安全带配合使用时达到 73.9%。总的来说,这些结果表明,轻量级、开放式、与工具无关的环境层可以实现跨领域的可重用代理数据、训练配方和评估。
