论文

超越即时工程:即时词汇敏感性及其对质量影响的系统分析

Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality

上下文与知识上下文工程

摘要

大语言模型 (LLM) 对表面级别的提示变化表现出极高的敏感性,其中微小的词汇变化可能会引发不成比例的性能波动。超越黑盒优化和粗粒度模板,我们利用包含 132,000 个提示变体的数据集,提出了第一个大规模 n-gram 词元级 提示稳定性机械分析。我们的研究揭示了即时性能稳定性的基本缩放定律:较高的平均任务性能与较低的方差和较高的即时扰动鲁棒性密切相关。我们确定了这种鲁棒性背后的两个核心语言驱动因素:(1)领域特定术语,它紧密锚定语义边界;(2)显式行动指令,它形式化推理轨迹。这些元素共同限制了模型的解释空间,有效地“锁定”了更具确定性的生成行为。基于这些见解,我们引入了一个自动化的 Prompt-Refining Agent,它通过注入域锚定和操作约束来系统地重组输入查询。实证评估表明,我们的方法将代码生成任务中的性能方差降低了 40.7%,同时保持或提高了平均性能。这些发现为实现稳健的即时工程提供了一个有统计依据且机械上可解释的框架。