论文
超越数量:面向代码智能体的轨迹多样性扩展
Beyond Quantity: Trajectory Diversity Scaling for Code Agents
摘要
随着代码大语言模型(LLM)经由模型上下文协议(Model Context Protocol,MCP)演化为可与工具交互的智能体,其泛化能力日益受制于低质量合成数据与数量扩展的收益递减。此外,以数量为中心的扩展呈现早期瓶颈,未能充分利用轨迹数据。我们提出TDScaling,一个基于轨迹多样性扩展的代码智能体数据合成框架,通过多样性而非原始数量来扩展性能。在固定训练预算下,增加轨迹多样性比添加更多轨迹带来更大收益,改善了智能体训练的性能—成本权衡。TDScaling整合四项创新:(1)捕获真实服务逻辑依赖的业务集群(Business Cluster)机制;(2)强制轨迹连贯性的蓝图驱动多智能体范式;(3)自适应演化机制,利用领域熵、推理模式熵与累积动作复杂度将合成引向长尾场景以防模式坍缩;(4)沙盒化代码工具,缓解内在编码能力的灾难性遗忘。在通用工具使用基准(BFCL、tau^2-Bench)与代码智能体任务(RebenchT、CodeCI、BIRD)上的实验表明了双赢结果:TDScaling同时提升工具使用泛化与内在编码熟练度。我们计划在发表后发布完整代码库与合成数据集(含30,000多个工具集群)。
