论文

前沿编码智能体用元编程适配陌生编程语言

Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages

智能体系统Agent任务评测

摘要

基于 LLM 的编码代理通常在熟悉的软件设置中进行评估:主流语言、公共库和公共存储库。这些基准仍然很重要,但它们可以隐藏代理在语言本身不熟悉时的行为方式。我们使用具有文件编辑、本地执行和隐藏测试评分的顺序设置,对四种深奥编程语言的六种当代编码代理进行了评估。我们的协议揭示了这些代理之间的功能差异,主流编码和代理基准(例如 SWE-Bench Verified 和 Terminal-Bench 2.0)压缩为更窄的频带。我们观察到最强的代理 Claude Opus 4.6 和 GPT-5.4 xhigh 通常避免直接编写目标语言。在 Brainfuck 和 Befunge-98 上,他们编写了生成目标语言代码并在本地调试这些生成器的 Python 程序。禁止这种元编程策略会导致性能大幅下降。从该策略中提取的文本指导并不能实质性地改善较弱的代理。相比之下,Opus 派生的用于构建生成器的 Python 帮助程序代码,没有解决基准程序或隐藏测试答案,在相同问题上大幅改进了 Sonnet 4.6 和 GPT-5.4 mini,而 Haiku 4.5 仍然很低。更多的解释器调用和输出令牌可以改善更强的代理,但使较弱的代理接近其原始性能,这表明这些资源放大了有用的策略,而不是创建它们。总之,这些结果表明,强大的编码代理通过使用工具、反馈和工作空间状态来构建目标语言的工作模型来适应不熟悉的语言。元编程是最明显的例子,但更广泛的差距是构建和调试在目标语言规则下运行的策略。