论文
ESPO:通过诊断、多样化和稳定进行错误结构提示优化
ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize
摘要
诸如 GEPA 之类的进化提示优化器会遭受提示膨胀的困扰:每次迭代都会附加规则和警告,从而产生长达 3$\times$ 的提示,但并不更准确。我们将其追溯到三个缺陷 - 不完整的错误观察、有限的搜索多样性和不可靠的选择 - 并提出 ESPO(错误结构提示优化),它将提示优化分解为三个阶段: 在一轮中将所有训练错误诊断为结构模式; Propose 通过四种具有独立偏见的互补策略生成候选人;选择应用引导稳定性选择。在七个公共 NLP 基准测试(Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer 和 PUPA)上,ESPO 的平均准确度比最先进的水平提高了 3.76 美元(GEPA 为 74.67% 与 70.91%),在每个数据集上匹配或超过了 GEPA,同时生成的提示缩短了 47%(1,004 个字符与 1,878 个字符)并且速度更快。推论。针对另外四个学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)的跨模型实验表明,ESPO 在每个测试模型上均产生最佳平均准确度,其中 Qwen3 GSM8K 上的差距最大(15.00% 到 91.40%)。泛化界限(附录)将每个阶段置于测试时间间隙的相应项中,并且消融证实了一个关键预测:在没有引导选择的情况下添加多样性实际上会损害性能($-$1.20%)。