论文
Composer 2 技术报告
Composer 2 Technical Report
摘要
Composer 2 是专为代理软件工程设计的专用模型。该模型展示了强大的长期规划和编码智能,同时保持了有效解决交互式使用问题的能力。该模型分两个阶段进行训练:首先,持续预训练以提高模型的知识和潜在编码能力,然后进行大规模强化学习,通过更强的推理、准确的多步执行和长期现实编码问题的一致性来提高端到端编码性能。我们开发基础设施来支持在已部署模型使用的同一 Cursor 工具中进行训练,具有等效的工具和结构,并使用与实际问题密切匹配的环境。为了衡量模型在日益困难的任务上的能力,我们引入了一个基准,该基准源自大型代码库(包括我们自己的代码库)中的真实软件工程问题。 Composer 2 是一个前沿级编码模型,演示了训练强大的领域专业模型的过程。在我们的 CursorBench 评估中,与之前的 Composer 模型 (61.3) 相比,该模型在准确性方面取得了重大改进。在公共基准测试中,该模型在 Terminal-Bench 上的得分为 61.7,在 SWE-bench Multilingual 上的得分为 73.7,与最先进的系统相当。