论文
朴素提示优化:重新思考复杂提示搜索的必要性
Naive Prompt Optimization: Rethinking the Need for Complex Prompt Search
摘要
高效地改进自主智能体以应对多样任务,是加速智能体AI中递归自我改进(RSI)的核心,而提示优化作为一种有前景的方法,能够带来与微调模型权重相当的性能提升,同时降低优化与服务两端的计算成本。然而,近期发展日益倾向于不必要地复杂的提示优化器。我们提出朴素提示优化(NPO),一种轻量的单谱系方法,利用教师模型结合rollout反馈迭代地修订提示。NPO以更少的rollout达到与GEPA相当或更好的性能,且其优势随教师模型变强而增大,这表明更强的教师推理可以在一定程度上替代优化器侧的搜索复杂度。在交互式游戏中,NPO与GEPA相比仍具广泛竞争力,而GRPO在某些较不适合提示优化的任务上表现更好。我们还表明,NPO优化得到的提示逐字应用于其他学生模型时也能带来相近的性能提升,尤其是在同一家族的模型之间。总体而言,我们的初步结果表明,简单的线性提示优化可以与复杂得多的搜索程序相抗衡。