论文
STEVE:通过错误驱动的细化和正则化验证稳定基于文本梯度的提示优化
STEVE: Stabilizing Textual Gradient-Based Prompt Optimization via Error-Driven Refinement and Regularized Verification
摘要
文本梯度方法通过自然语言反馈自动提示优化,但它们的迭代更新可能不稳定。我们确定了这种不稳定性的两个来源:已经正确的示例产生的噪声梯度以及过度专业化的困难情况,从而降低了简单输入的性能。我们介绍 STEVE,一个具有两个耦合机制的稳定框架。错误驱动的细化仅从错误处理的示例中生成梯度,将更新集中在信息错误上。正则化验证将每次更新视为临时更新,并且仅当硬案例的改进不会导致保留集出现不可接受的回归时才接受它。通过十个推理基准、三个评估器/优化器模型以及已建立的提示优化基线,STEVE 减少了退化并产生了更强大的提示。使用 gpt-5.4-mini/gpt-5.4 对符号推理、GSM8K-Platinum 和 DS-1000 进行的其他评估表明,这些收益在更新的模型和更大的测试集上仍然存在。因此,STEVE 提供了一种提高文本梯度提示优化稳定性和有效性的实用方法。