论文

跨模型跨语言AI 编码智能体性能:并行CLRS算法的准确性和速度

Cross-Model Cross-Language AI Coding Agent Performance: Accuracy and Speed of Parallel CLRS Algorithms

模型评测模型能力评测

摘要

AI 编码智能体 已迅速在软件工程中变得无所不在。它们的串行性能,无论是在精度还是速度方面,都得到了广泛的报道。然而,最近的初步结果表明它们的并行编程能力落后于串行编程能力。本文提出了对三个 编码智能体(Cursor's Composer 2.0、GPT 5.4 和 Claude Sonnet 4.6)的跨语言评估,评估了 C++、Python 和 Julia 中跨三个算法类别(排序、图遍历和搜索)的并行代码生成。对于每个算法和语言对,我们提示 编码智能体 从串行基线生成并行实现,跟踪实现功能正确性和性能改进所需的提示工作,并根据自定义串行基线和第三方库实现测量加速。我们发现 编码智能体 可以通过适度的提示努力产生正确的并行实现,但是实现有意义的加速在很大程度上取决于算法和语言。 Sonnet 4.6 提供了最强的整体性能提升,而 GPT 5.4 尽管正确性始终如一,但没有产生可测量的加速。 C++ 对于图算法来说是最一致的可并行化,而 Python 和 Julia 在搜索算法上实现了最大的加速:没有一种语言在所有类别中占主导地位。 Python 和 Julia 在某些图算法上都实现了加速,但在其他图算法上却出现了退化。这些发现强调了除了准确性之外,将运行时性能效率作为主要 LLM 性能指标的影响,特别是对于并行实现。