MAGE:了解多组件提示优化中的稳定性与性能权衡
MAGE: Understanding Stability-Performance Trade-offs in Multi-component Prompt Optimization
摘要
迭代提示优化的不同组成部分如何相互作用,以及它们组合时会发生什么?我们通过 MAGE(记忆增强目标导向提示进化)对此进行研究,这是一个用于研究提示优化中组件交互的受控分析框架。从绝对意义上来说,MAGE 并不是一个优秀的优化器;它集成了情景记忆、多目标帕累托选择和自适应评估作为受控消融的平台。我们的实验揭示了一个以前未报告的现象,即即时优化耦合效应(POCE):当多个随机优化信号在闭合反射环内运行时,它们以同时提高性能和放大方差的方式相互作用,这是无法通过单独分析组件来预测的行为。出现了三个主要发现。首先,基于失败的反思至关重要:仅依靠分数(OPRO)或抽象批评(自我改进)的方法无法改善提示。其次,MAGE 在 GSM8K-Hard 上实现了 46.4%,而 GEPA 在 GSM8K-Hard 上实现了 34.0%(+12.4%,P(MAGE>GEPA)=0.998,在 gpt-4o-mini 上有 5 个种子),方差相当(7.3% 对 7.0%)。第三,增加候选多样性揭示了最清晰的 POCE 信号:将候选池从 n=3 扩展到 n=5 将平均准确度提高了 +21.6%,同时将方差增加了 3.7 倍。我们进一步在 Llama 3.1 8B 上进行验证,并表明 POCE 是动态余量相关的:当基础模型已经达到高精度时,方差放大消失。最后,在低数据情况下(Ntrain = 30),精心设计的固定提示优于所有反射优化器,表明支架选择主导优化器选择。我们的结果表明,即时优化系统表现为耦合随机过程,应该根据性能和稳定性进行评估,而不仅仅是峰值精度。