论文

LibEvoBench:探索代码生成模型中的时间知识分层

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

模型评测基准与评测资源

摘要

大型软件项目通常依赖于旧版本的库,即使 API 在各个版本中不断发展。这给 LLM 带来了一项挑战:他们必须了解多个 API 版本,而不仅仅是最新或最常见的版本。然而,当前的 LLM 是在时间混合语料库上进行训练的,并且缺乏针对此类特定于版本的推理的明确机制,从而导致不合时宜的错误 - 调用 API,因为它们存在于不同的库版本中。为了系统地评估这种现象,我们引入了 LibEvoBench,这是一个涵盖广泛使用的 Python 库的多个版本的多任务基准测试,以及一个新指标软件进化理解分数 (SEUS),用于衡量模型在使用不断发展的 API 时的一致性。我们的结果表明,最先进的模型在很大程度上是版本无关的:不断发展的 API 的性能会下降,而对于稳定的 API,它在各个版本中保持不变。此外,简单地指定目标版本没有任何好处,而相关文档可以显着提高模型的准确性。这些发现凸显了当前训练范式的系统局限性,并激发了代码生成中基于时间的知识的新方法。