产品与服务

GKE Agent Sandbox正式提供RL编排SDK与预热环境

GKE Agent Sandbox optimized for RL and orchestration SDK

AI 基础设施模型训练强化学习SandboxAgentic RLAgent Sandbox

概述

GKE Agent Sandbox面向大规模Agentic强化学习及评测,承载策略模型在GPU生成动作后执行代码、获取奖励的CPU环境。本次公告称优化版沙箱、RL编排SDK及Gymnasium、NVIDIA NeMo Gym和OpenHands集成已正式可用。SDK提供异步Python API和可插拔预热池策略,无需把自定义守护进程嵌入任务镜像;环境支持快照、暂停、恢复与分叉。实现将镜像准备移出关键路径,结合SandboxWarmPool、GKE Image Streaming和控制器速率限制;每轮在Pod内重置Git及检出仓库,减少重复创建。官方10节点gVisor测试对比原始Kubernetes Pod,在500个SWE-bench镜像及4,578个R2E镜像、最高18,312个并发任务条件下,平均首次命令等待由44—85秒降至1.1—8.8秒,最坏等待由450秒降至不足10秒;Pod创建量由18,312降至5,869。45倍指最坏等待改善,不能当整体训练吞吐。提前预热会消耗CPU与后台集群时间;失败沙箱须显式列为可重试,避免丢弃造成奖励偏差。公告披露Mistral AI已采用该基础设施,提供仓库、示例和部署文档;本条合并服务及SDK,不重复拆为实践。