论文

编码中隐式软件世界模型的评估 LLM

Towards Evaluation of Implicit Software World Models in Coding LLMs

模型评测模型能力评测

摘要

软件工程,无论是由人类还是人工智能代理执行,都需要推理软件的行为方式。我们将支持这种推理的内部模型称为软件世界模型,并将当前的代码执行基准视为涵盖了其中一个经过充分研究的部分——控制流。在本文中,我们通过将可观察轴转移到执行资源,朝着更广泛的评估迈出了一步:除了测试结果和异常类之外,我们还预测峰值内存、挂钟时间,并按方法和行粒度对分析器输出进行排名。我们使用 SWE-bench Verified 作为数据源,使测试接近真实的软件工程任务。所有测试的模型(包括前沿模型)都表现出适度的性能和脆弱的行为,这表明人们对软件的执行方式(而不是其源代码的编写方式)明显缺乏了解。