论文

$p1$:更少的提示更好的提示优化

$p1$: Better Prompt Optimization with Fewer Prompts

上下文与知识上下文工程

摘要

提示优化通过搜索更好的系统提示来改进语言模型,而无需更新其权重,但其有效性在不同任务中差异很大。我们研究是什么让任务适合快速优化。我们表明,不同系统提示之间的奖励方差可以分解为两个组成部分:响应之间的方差(捕获生成随机性)和系统提示之间的方差(捕获系统提示质量的差异)。当系统提示之间的方差足够大时,提示优化会成功,但当响应之间的方差主导系统提示的方差时,提示优化会失败。令人惊讶的是,我们进一步表明,扩展到更多的用户提示可能会通过减少系统提示之间的差异来损害优化,特别是在异构数据集上,其中不同的用户提示有利于不同的系统提示。受这一见解的启发,我们提出了 $p1$,一种简单的用户提示过滤方法,该方法选择在候选系统提示之间具有高方差的一小部分用户提示。用户提示的这一子集允许人们区分好的系统提示和坏的系统提示,从而使系统优化变得更加容易。推理基准实验表明,$p1$ 显着提高了对完整数据集训练的即时优化,并且优于 GEPA 等强大的基线。值得注意的是,仅对 AIME 24 中的两个提示进行训练就会产生一个可以很好地推广到其他推理基准的系统提示。