论文

DockSmith:经Agentic Docker构建器扩展可靠编码环境

DockSmith: Scaling Reliable Coding Environments via an Agentic Docker Builder

模型训练上下文与知识监督微调与指令调优记忆Agent记忆

摘要

可靠的基于Docker的环境构建是扩展软件工程智能体的执行落地训练与评估的主要瓶颈。我们提出DockSmith,一个为解决这一挑战而设计的专用agentic Docker构建器。DockSmith不仅把环境构建当作预处理步骤,还把它当作一种核心agentic能力,锻炼长时程工具使用、依赖推理与失败恢复,产生可迁移到Docker构建之外的监督。DockSmith在由SWE-Factory式流水线产生的大规模执行落地Docker构建轨迹上训练,该流水线增配了循环检测控制器与跨任务成功记忆。在这些轨迹上训练30B-A3B模型,在Multi-Docker-Eval上取得开源最先进性能,Fail-to-Pass达39.72%、Commit Rate达58.28%。此外,DockSmith在SWE-bench Verified、SWE-bench Multilingual与Terminal-Bench 2.0上提升分布外性能,展示环境构建带来的更广泛agentic收益。

DockSmith:经Agentic Docker构建器扩展可靠编码环境
图1:DockSmith 训练框架。一个包含四个智能体(Context Retrieval、Dockerfile、Eval Script、Test Analysis)的多智能体流水线,在迭代修复循环中从带有测试的 pull requests 生成以执行为依据的 Docker 构建轨迹。采用循环检测与跨任务成功记忆,随后进行轨迹过滤与课程采样,用于监督微调。