论文

Orchard:开源智能体建模框架

Orchard: An Open-Source Agentic Modeling Framework

AI 基础设施SandboxAgent Sandbox

摘要

代理建模旨在将大语言模型转变为能够通过规划、推理、工具使用以及与环境的多轮交互来解决复杂任务的自主代理。尽管投入大量资金,开放研究仍然受到基础设施和培训差距的限制。许多高性能系统依赖于专有的代码库、模型或服务,而大多数开源框架专注于编排和评估,而不是可扩展的代理培训。我们推出 Orchard,一个用于可扩展代理建模的开源框架。其核心是 Orchard Env,这是一种轻量级环境服务,为跨任务域、代理工具和管道阶段的沙箱生命周期管理提供可重用的原语。在 Orchard Env 之上,我们构建了三个代理建模方法。 Orchard-SWE 的目标是编码剂。我们从 MiniMax-M2.5 和 Qwen3.5-397B 中提取 107K 条轨迹,引入贡献归因 SFT 来从未解决轨迹的生产性部分中学习,并为 RL 应用平衡自适应推出。从 Qwen3-30B-A3B-Thinking 开始,Orchard-SWE 在 SFT 后在 SWE-bench Verified 上取得了 64.3% 的成绩,在 SFT+RL 后取得了 67.5% 的成绩,在同等规模的开源模型中创下了新的最先进水平。 Orchard-GUI 仅使用 0.4K 个精炼轨迹和 2.2K 个开放式任务来训练 4B 视觉语言计算机使用代理。它在 WebVoyager、Online-Mind2Web 和 DeepShop 上分别实现了 74.1%、67.0% 和 64.0% 的成功率,使其成为最强的开源模型,同时与专有系统保持竞争力。 Orchard-Claw 的目标是私人助理特工。仅经过 0.2K 综合任务的训练,它在 Claw-Eval 上的 pass@3 成功率为 59.6%,与更强大的 ZeroClaw 安全带配合使用时达到 73.9%。总的来说,这些结果表明,轻量级、开放式、与工具无关的环境层可以实现跨领域的可重用代理数据、训练配方和评估。

Orchard:开源智能体建模框架
图 2:Orchard 框架概述。 Orchard Env(中)是一种精简的 Kubernetes 原生环境服务,它公开通用原语(沙箱生命周期、命令执行、文件 I/O、网络策略、REST API 和轻量级代理注入)并支持异构任务环境(底行)。开放训练方案(第二行)与该服务组合,无需耦合,我们在三个领域(顶行)实例化相同的堆栈:Orchard-SWE(软件工程)、Orchard-GUI(浏览器导航)和 Orchard-Claw(AI 个人助理);每个域的标题数字汇总在每个域框中。