论文
AdaGEPA:用于反射提示优化的自适应反馈分配
AdaGEPA: Adaptive Feedback Allocation for Reflective Prompt Optimization
摘要
提示优化通过细化提示来提高语言模型系统在下游任务上的性能。经典方法评估任务示例的提示,并使用生成的反馈通过反思来指导提示修改。然而,当反馈选择没有考虑到提示的弱点时,这些修改可能会提高所选示例的性能,但不会产生更广泛的任务改进。为了解决这个问题,我们提出了 AdaGEPA,一种自适应反馈分配方法,它使用提示的性能和任务结构来选择下一个提示修订的示例。我们的方法最多替换每个反馈小批量中的一个示例,以针对已识别的弱点,同时保留剩余的反馈上下文。在我们对六个下游基准的主要实验中,AdaGEPA 在匹配的rollout预算下比非自适应反馈选择获得了更高的平均验证分数。 AdaGEPA 还可以更早地在多个任务中找到高性能提示。在最初的模式引导对话 (SGD) 研究中,其半预算提示在搜索期间看到和未看到的服务的新对话的联合目标准确性方面优于非自适应基线的全预算提示。总的来说,我们的研究结果强调了自适应反馈分配在提高反思性提示优化的有效性和rollout预算效率方面的潜力。