论文

在现实环境下评估 LLM 代码推理

Evaluating LLMs Code Reasoning Under Real-World Context

模型评测基准与评测资源

摘要

代码推理任务对于评估 大语言模型 (LLM) 越来越重要。然而,大多数现有基准测试依赖于简单化的 LLM 生成的代码片段或人工编写的解决方案来应对代码挑战,并且通常将输入和输出限制为原始类型,无法反映现实世界项目的结构和依赖性。这些简化限制了他们衡量实际普遍性的能力。我们推出 R2Eval1,这是从 10 个广泛使用的 Python 项目中抽取的 135 个代码推理问题的基准。与之前的工作不同,R2Eval 序列化复合和自定义类型,保留现实世界数据的复杂性,并能够对 LLM 进行更现实的评估。