SPEAR:代码增强代理提示优化
SPEAR: Code-Augmented Agentic Prompt Optimization
摘要
自动提示工程(APE)重写提示以提高下游任务性能,但现有的 APE 循环将优化器本身视为固定管道。我们将 CodeAct(Wang 等人,2024a)的代码即操作范例移植到 APE,并提出 SPEAR(具有主动回滚功能的沙盒提示工程师),这是一种自由形式的代理优化器,具有四种工具——evaluate、python、set_prompt、finish——可以自主决定如何以及何时使用它们。独特的工具是 Python 沙箱:优化器在当前评估 DataFrame 上编写并执行任意 Python,执行代理本身编写的结构错误分析(混淆矩阵、错误聚类、每组指标)。两个护栏将长视野代理转变为单调改进优化器:度量回归自动回滚,以及可选的保护度量下限。我们对三个工业 LLM-as-judge 套件(跨招聘人员接收、对话记忆和查询细化系统的 13 个判断任务)以及 7 个 BBH 任务和 GSM8K 进行评估。 SPEAR 在主要指标上赢得了每项工业任务(在工具选择上,$κ$ 0.857 vs 0.359;在过滤器相关性上,F1 宏 0.815 vs 0.763;在最难的提取维度上,$κ$ 0.254 vs 0.218)。 BBH-7 SPEAR 的平均准确度为 0.938,而 GEPA 为 0.628,TextGrad 为 0.484。消融显示,Python 工具是复杂判断任务上最大的单一杠杆(5 级工具选择判断上的 $Δ\approx +0.79κ$,删除后最难提取维度上的 $Δ\approx +0.35κ$);其不可替代的贡献是类对混淆聚合,长上下文 LLM 无法从原始 eval DataFrame 中可靠地提取该聚合。