论文

LLM 代码生成中的复合提示约束:格式、角色和紧迫性的析因研究

Compound Prompt Constraints in LLM Code Generation: A Factorial Study of Format, Persona, and Urgency

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用于软件工程管道中的代码生成,其中生产提示通常结合多个约束。本文提出了关于输出格式、角色分配和紧急框架如何共同影响 LLM 代码生成可靠性的全因子实证研究。我们评估受控 3x3x3 设计中的所有 27 种组合,并将每个复合条件分解为加性预测和捕获超加性退化的残差相互作用项。该研究使用了 GPT-4o 系列、GPT-4.1 系列和 o3-mini 的五个 OpenAI 模型中的所有 164 个 HumanEval+ 问题,产生了 22,140 个贪婪解码评估。格式感知提取管道将格式失败与推理失败分开,并通过 McNemar 测试、比值比和 95% 置信区间评估显着性。结果表明,复合约束可能会产生单因素实验无法预测的架构相关退化。 GPT-4o 系列表现出一致的超级加性效应,pass@1 降低幅度比加性预测高出 3-12 个百分点;对于 JSON + 专家角色 + 中等紧迫性,GPT-4o-mini 上最大的交互是 -12.2 pp。 JSON 组合通常会产生比 XML 更大的交互。相比之下,GPT-4.1 系列在很大程度上具有抵抗性,而 o3-mini 显示了一种性质不同的模式,其中结构化输出约束可以提高性能。这些发现表明,脆弱性与体系结构相关,而不是与规模相关,单独的中性或有益的约束可以结合起来导致显着的退化,并且复合提示测试应该成为 LLM 辅助工程管道可靠性评估的标准。