论文

GraphForge:使用图锚定工作空间合成来训练工作Agent

GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis

模型训练合成数据

摘要

工作Agent需要读取不同的文件、协调工具并生成可交付成果。训练此类Agent需要基于许多具有可验证结果的真实文件构建任务,但很少有管道可以合成此类数据。现有的管道要么生成带有模型的文件,缺乏真实性和多样性,要么在没有特定于任务的验证器的情况下在真实文件上构建任务,从而导致结果质量不受检查。我们介绍 GraphForge,一个基于证据图的框架,该框架将任务及其验证建立在真实文件中。从以职业为基础的种子开始,以实现受控的多样性,GraphForge 为每个种子组装了一个真实文件的工作区,并根据它们的关系构建了一个证据图。由于任务陈述和细则均源自该图,因此任务要求由工作区文件支持,并且每个标准都锚定到验证它所需的文件。初始部署进一步测试可执行性,修订Agent在收集轨迹之前根据原始文件修复任务和规则。在 2,169 个 GraphForge 轨迹上微调 Qwen3.6-27B,使 OpenHands 下的 GDPVal 达到 1445.7 (+65.7),在 Claude Code 下,Workspace-Bench-Lite 和 SpreadsheetBench II 达到 63.7 (+7.7) 和 24.0 (+13.7)。对 SFT 模型本身的rollout进行拒绝微调,并通过证据锚定的评分标准选择候选者,在所有三个基准上产生进一步的改进,这表明评分标准提供了有用的选择信号。数据和模型都有。