论文

DevIntent:LLM 生成的代码在多大程度上违反了开发人员的意图?

DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

模型评测评测方法与指标

摘要

当给出不明确的提示时,LLM 生成的代码可能会违反开发人员的隐含意图,但标准基准测试仅衡量代码是否通过其规定的测试。我们引入了意图违规率 (IVR) 和源自 HumanEval+ 的 49 个问题试点基准。每个问题都从明确的提示中剥离隐式约束,并将它们编码为隐藏约束测试。 IVR 测量 LLM 生成的解决方案中通过规定(可见)测试但未通过捕获未说明意图的隐藏约束测试的比例。评估 Claude Sonnet 4.6 和 OpenAI GPT 4.1,我们发现两者都通过了超过 92% 的规定测试,但在超过一半的问题中违反了意图(54.5% 和 63.5%),遵循两个模型一致的系统双峰模式。调查结果表明,通过率夸大了生成的代码反映开发人员意图的程度。