论文

黑暗中的反思:揭示并逃离反思式提示优化中的黑箱

Reflection in the Dark: Exposing and Escaping the Black Box in Reflective Prompt Optimization

上下文与知识上下文工程

摘要

自动提示优化(APO)已成为无需人工提示工程即可提升 LLM 性能的强大范式。GEPA 等反思式 APO 方法通过诊断失败案例迭代改进提示,但优化过程仍是黑箱且无标注,导致轨迹不可解释与系统性失败。我们识别并实证演示了四点局限:在 GSM8K 上使用有缺陷的种子提示时,GEPA 将准确率从23.81%降至13.50%。我们提出 VISTA,一个将假设生成与提示改写解耦的多智能体 APO 框架,实现带语义标签的假设、并行小批量验证与可解释的优化轨迹。结合随机重启与 epsilon-greedy 采样的两层探索—利用机制进一步逃离局部最优。VISTA 在同一缺陷种子上将准确率恢复至87.57%,并在 GSM8K 与 AIME2025 的全部条件下持续优于基线。

黑暗中的反思:揭示并逃离反思式提示优化中的黑箱:论文配图
图2:概念示意:在缺陷种子下反射式提示优化的轨迹如何演化,呼应论文对优化黑盒问题的剖析。