论文
SePO:用于系统提示优化的自我进化提示代理
SePO: Self-Evolving Prompt Agent for System Prompt Optimization
摘要
系统提示优化可以在不修改底层模型的情况下改善代理行为,从而产生人类可读的、与模型无关的指令。现有方法构建了一个提示代理,该提示代理改进了任务代理的系统提示,但保留了提示代理自己的系统提示的手工设计和固定。我们提出了自我进化提示优化(SePO),它将提示代理自己的系统提示与任务代理的系统提示一起视为优化目标。 SePO采用自我参照设计。单个提示代理在开放式进化搜索下改进了任务代理的系统提示和它自己的系统提示,该搜索维护候选提示的档案作为垫脚石。训练分两个阶段进行:预训练 在多任务池上发展提示代理,然后 微调 将其应用于目标任务。在涵盖数学 (AIME'25)、抽象推理 (ARC-AGI-1)、研究生水平科学 (GPQA)、代码生成 (MBPP) 和逻辑谜题 (数独) 的五个基准测试中,SePO 始终优于 Manual-CoT、TextGrad 和 MetaSPO,与 Manual-CoT 相比,平均准确度提高了 4.49 分。 预训练 的提示优化技能还可以推广到 预训练 混合之外的任务,而不是记住每个任务的提示。