论文

超越数量:面向代码智能体的轨迹多样性扩展

Beyond Quantity: Trajectory Diversity Scaling for Code Agents

模型训练AI 基础设施合成数据SandboxAgent Sandbox

摘要

随着代码大语言模型(LLM)经由模型上下文协议(Model Context Protocol,MCP)演化为可与工具交互的智能体,其泛化能力日益受制于低质量合成数据与数量扩展的收益递减。此外,以数量为中心的扩展呈现早期瓶颈,未能充分利用轨迹数据。我们提出TDScaling,一个基于轨迹多样性扩展的代码智能体数据合成框架,通过多样性而非原始数量来扩展性能。在固定训练预算下,增加轨迹多样性比添加更多轨迹带来更大收益,改善了智能体训练的性能—成本权衡。TDScaling整合四项创新:(1)捕获真实服务逻辑依赖的业务集群(Business Cluster)机制;(2)强制轨迹连贯性的蓝图驱动多智能体范式;(3)自适应演化机制,利用领域熵、推理模式熵与累积动作复杂度将合成引向长尾场景以防模式坍缩;(4)沙盒化代码工具,缓解内在编码能力的灾难性遗忘。在通用工具使用基准(BFCL、tau^2-Bench)与代码智能体任务(RebenchT、CodeCI、BIRD)上的实验表明了双赢结果:TDScaling同时提升工具使用泛化与内在编码熟练度。我们计划在发表后发布完整代码库与合成数据集(含30,000多个工具集群)。

超越数量:面向代码智能体的轨迹多样性扩展
图2:TDScaling 框架概览。该流程包含四个阶段:(1)工具空间构建:将原始 MCP 定义组织成 Business Cluster,并通过贪心选择进行过滤,以最大化功能覆盖。(2)蓝图合成:以选定的工具集和 Global Memory 稀缺度为条件,Blueprint Agent 生成一个包含目标、计划、约束和策略的场景蓝图(Scenario Blueprint)。(3)多智能体执行:User、Assistant 和 Observation 智能体生成轨迹,并动态调用 Code Tool 进行程序化推理,同时 Quality Agent 确保格式合规与逻辑一致。(4)自适应演化:对经过验证的轨迹进行多样性和复杂性评分;成功的轨迹更新 Global Memory,后者调整策略配置(strategy profile),引导生成走向探索不足的推理模式和更高复杂度的区域。