论文
代码智能体LoRA微调的轨迹数据整理系统评估
A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents
摘要
在专家智能体轨迹上对开放权重LLM做监督微调(SFT),已成为不依赖专有模型构建强代码智能体的主流路径。一个核心但未被充分探索的问题是:轨迹的质量与数量如何共同塑造模型性能。我们对Qwen2.5-Coder-7B-Instruct在SWE-trajectory数据集(67,074条轨迹,其中32,161条已解决)上LoRA微调的轨迹数据过滤做系统性实证研究。我们提出双轴质量评分框架——效率与风格——并通过横跨策略、规模与消融分析的16组受控实验评估。由于7B规模模型的SWE-bench解决率接近零,我们采用留出轨迹上的交叉熵(CE)损失作为主要指标,并经首动作生成验证:CE损失与ROUGE-L完全秩相关(Spearman ρ=-1.00),小样本证据支持但未确证这一代理。结果揭示随规模变化的质量—数量权衡:小规模下把数据集翻倍(500到1,000)带来约12.7%的CE损失下降,而TopQ-Random差距小于1%(Mann-Whitney p>0.10);到2,000条轨迹时同一差距扩大到3.6%(p=0.016)。消融进一步确认错误重试率是主导子维度,与完整复合分数表现相当(Δ<0.2%)。这些发现确立轨迹级质量评分是代码智能体SFT可行但规模敏感的杠杆,并为端到端解决率在统计上不可行的区间提供代理验证的评估协议。