论文

WorkGenesis:构建教Agent工作的世界

WorkGenesis: Building the Worlds That Teach Agents to Work

模型训练合成数据

摘要

大语言模型(LLM)Agent完成日常和专业工作的能力越来越受到关注。训练此类Agent需要现实的工作场景。专家撰写的职业工作成本高昂且制作缓慢,而不受约束的综合往往会产生事实基础薄弱或内部要求不一致的任务。为了弥补这一差距,我们引入了 WorkGenesis,这是一个框架,通过两项核心技术创新,从现实世界的工件构建可执行的休闲工作:(1)基于证据的工作构建,通过检索 O*NET 休闲知识引导的公共文件并综合周围的背景、配套材料、工作请求和围绕它们的逐项标题,将每个工作单元建立在现实世界证据的基础上; (2) 执行引导一致性验证,在构建的工作中提供参考可交付成果,将每个不满意的评分项归因于Agent、任务或评分标准,并使用任务和评分标准缺陷作为反馈来迭代修复工作,直到通过审核。实验结果表明,Fx-Work-35B 仅在 WorkGenesis 合成的 20K 工作单元上进行简单监督微调 (SFT) 训练,在 GDPvalAA-v2、APEX-Agents-AA 和 JobBench 的五个报告指标上的所有可比规模基线中取得了最高分(平均分 31.00 与 24.79),甚至超越了 1.6T 等前沿模型DeepSeek-V4-Pro-预览版。这些结果表明 WorkGenesis 为工作Agent提供了可扩展的训练数据。