从34个国际象棋引擎看编程语言对编码Agent的影响
Do programming languages still matter to your AI coding agent teammate? Evidence at scale from chess engines
摘要
前沿 编码智能体 现在承诺完整软件系统的端到端生成能力。接下来是两个实证问题:人工智能编码代理团队成员是否可以使用任何目标语言进行编程,包括那些没有类似的现有开源产品的语言?如果是这样,语言选择是否仍然会影响生成系统?沿着哪些维度?我们通过围绕国际象棋引擎构建的多语言案例研究来研究这两者:非平凡的多组件系统,它承认与语言无关的验证标准体系,从精确的移动生成正确性到强度量表(Elo),可以从 Rust 到 Brainfuck 观察到。我们在能力级别上提示了两个前沿编码智能体(Claude Code 和 Codex),没有国际象棋知识或实施指导,而是根据记录在案的干预和阻止政策。这些代理制作了 34 个国际象棋引擎,涵盖 17 种主要编程语言,从主流到专业、特定领域、传统和深奥目标。我们将每个引擎的特征分析、独立的 Elo 评估、会话轨迹与代码和会话记录的定性分析相结合。 前沿 编码智能体 是真正的多语言:我们尝试的每一种语言都至少产生了一个功能丰富的工作引擎,其中一些引擎之前没有类似范围的开源版本(例如 LaTeX),并且代码是从头开始合成的,而不是复制的。然而,语言选择仍然很重要:强大的游戏强度只有在主流编译语言中才能达到,随着语言变得更加奇特,成本和工程工作量急剧增加,并且功能选择在不同语言家族中发生变化。代理会自动验证自己的工作,但他们的实力自我评估存在偏差,并且一些引擎通过调用国际象棋库进行了欺骗。编程语言不再关乎人工智能队友是否可以构建一个工作系统,而是关乎性能、成本、构建什么以及仍然需要多少人类监督验证。