论文

大模型跟不上API演进:代码生成中的知识冲突

When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Code Generation

模型评测基准与评测资源

摘要

软件库快速演进,大模型训练后静态参数知识可能变得过时。检索增强生成(RAG)常用于提供最新API规格,但当外部指令与模型内部知识矛盾时,会出现上下文—记忆冲突。本文构建八个Python库的270次真实更新基准,包含API弃用、修改与新增,系统评测四类共11种模型的代码生成。结果显示,没有完整文档时,模型难以优先采用外部上下文,生成代码在目标环境中的平均可执行率仅42.55%。结构化文档与更大模型有助于采用更新,但可执行率仍仅66.36%,没有完全解决问题。自反思等推理策略进一步提高表现,可执行率改善11%。研究揭示,即使提供更新规格,大模型仍可能保留过时写法,需要能够反映API演进的基准与技术。