论文

LLM 版本中即时工程技术的老化

Aging of Prompt Engineering Techniques Across LLM Versions

模型评测模型能力评测

摘要

即时工程和即时工程技术(PET)已成为人工智能系统软件工程的组成部分。然而,新的 LLM 频繁发布,目前尚不清楚即时工程技术的有效性在连续几代 大语言模型 (LLM) 中如何变化。为此,我们对 Khojah 等人的研究进行了部分复制。 (2025)。我们在分为三个版本对的六个指令调整模型上评估五种技术 - 零射击、少射击、思维链 (CoT)、对比思维链 (CCoT) 和思维程序 (PoT) 的改编版本 - GPT-3.5-Turbo/GPT-4o、Qwen2 7B Instruct/Qwen2.5 7B Instruct,以及Mistral-7B-指示/Mistral-Large。我们使用 CodePromptEval 数据集的清理子集,其中包含 218 个上下文丰富的 Python 函数和通过基于 pass@k 的函数正确性评估的 19,620 个总代,以评估函数级代码生成任务的模型对。我们表明,提示工程以模型系列特定的方式“老化”:较新的 GPT 模型表现出结构化提示带来的边际收益递减甚至负值,这表明指令遵循和推理支架越来越内化,而 Qwen 模型继续从 Few-Shot 和 CCoT 中受益匪浅。 Mistral 模型表现出混合行为,CCoT 带来持续收益,但 CoT 和 PoT 带来的收益减弱。我们的结果表明,有效的激励策略必须根据模型家庭和世代进行调整,而不是一成不变地转移。这激励了未来在自适应、模型感知提示和更广泛、多维代码质量评估方面的工作。