论文
然而,对于代理、推理和编码来说,越少越好 LLM
Yet Even Less Is Even Better For Agentic, Reasoning, and Coding LLMs
摘要
训练有效的软件工程代理需要大量特定于任务的轨迹,从而产生大量的数据构建成本。受数学推理中“少即是多”假设的启发,我们研究了其对代理场景的扩展,并提出了一种端到端的训练框架,该框架可以通过更少但更高质量的训练轨迹实现卓越的代理能力。这是通过 STITCH(滑动记忆轨迹推理和任务分块启发式)实现的,这是一种从粗到细的机制,可以过滤低值噪声并保留决策关键标记,以最大限度地提高训练信号质量。我们跨多个代理框架(例如 mini-SWE-agent、MSWE-agent)、模型规模(30B 到 355B)和多语言设置(Python、Java 和 ArkTS)进行实验。在 SWE-bench Verified 上,使用 STITCH 训练的模型比基本模型实现了高达 63.16% 的相对改进。在 Multi-SWE-bench (Java) 上,MiniMax-M2.5-STITCH 使用我们的 CodeArts Agent 支架实现了 43.75% (+16.67%)。在 HarmonyOS (ArkTS) 上,GLM-4.7-STITCH 在训练轨迹少于 1K 的情况下将编译通过率提高到 61.31% (+43.34%)。我们的结果证实,“少即是多”范式可以有效地推广到跨不同语言和模型规模的复杂代理任务。