论文

从整体式到模块化:片段级自动提示词优化

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

上下文与知识上下文工程

摘要

自动提示词优化(APO)常常整体地重写提示词,这可能改善一种行为的同时损害其他行为。我们提出SAPO,一种片段级的APO方法:将提示词分解为角色、上下文、任务与输出格式,然后基于表现最好与最差的各5个示例施加针对性改进。优化循环使用单个大语言模型,配合静态元提示词与结构化输出来完成分段、弱点分析与候选生成。我们描述了一个训练/验证协议和一个两阶段生成过程:(1) 片段级诊断与建议提取,(2) 受弱/强片段信号约束的候选合成。在GPT-3.5-Turbo与GPT-4o-mini上、覆盖SQuADv2、TweetEval、XSUM、CommonGen与GSM8K的评测设置中,SAPO相对Zero-shot以及APE、OPRO、EvoPrompt、GEPA和StraGO等强APO基线取得了最佳平均分。

从整体式到模块化:片段级自动提示词优化:论文配图
图1:SAPO循环。从初始提示P(0)P^{(0)}出发,该方法首先把指令分割为角色/上下文/任务/输出格式,然后在训练数据上进行对比证据提取,以诊断弱段和强段。接着,它生成保留强段同时修订弱段的受约束候选,在验证数据上评估这些候选,在分数相等时应用编辑距离决胜,并且仅在验证性能提升时才接受更新;否则保留当前提示。