论文

CodeChat-Eval:在多轮代码细化对话中评估 大语言模型

CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于软件工程中来生成和优化代码。在实践中,开发人员通常会从初始代码生成请求继续执行后续细化指令,例如改进样式、重组实现或在保留预期行为的同时更改执行策略的请求。然而,现有的基准测试通常忽略了这种多轮代码细化对话设置,因此无法评估 LLM 是否保持功能正确性,即细化后的代码是否仍然通过原始任务的测试套件。为了解决这个限制,我们引入了 CodeChat-Eval,这是一个评估框架,它使用动态指令选择算法从多轮代码细化对话构建评估会话。我们对开放权重和专有 LLM 的实证研究观察到,多轮细化的功能正确性在统计上显着下降,范围从 19.2% (GPT-5 Nano) 到 69.2% (Llama 3.1 8B)。最大的正确性下降与逻辑级细化和附加变更请求相关。这些发现表明,LLM 在多轮代码细化对话期间难以保持功能正确性,并强调需要评估单轮生成之外的功能保留细化的基准。