论文
反思器应看到什么?提示优化中反思证据的实证研究
What Should the Reflector See? An Empirical Study of Evidence in Reflective Prompt Optimization
摘要
反射提示优化使用模型行为的示例来修改指令,但反射器应该接收哪些证据仍不清楚。我们在单亲帕累托引导搜索中研究证据构成、示例的可见性、候选选择和领域知识策略。使用 Qwen3.5-9B 作为任务模型和反射器,我们在五个数据集上评估了九种反射策略。从这些实验中,我们发现了三种不同的模式。对于性能改进,仅失败会产生最大的平均测试增益(+8.0 个百分点),而平衡混合和无示例+Val 共享最佳平均性能排名。就反思有效性而言,无示例在改善抽样父母方面取得了最佳排名,但仅产生 1.4 分的平均测试增益:局部反思成功并不一定会产生更强的最终提示。对于过度拟合评估,仅失败和平衡混合共享最低的平均校准差距排名,而 GPQA 和 IFBench 上较大的差距表明校准增益可能夸大了保留的改进。这个差距是一个描述性指标,而不是过度拟合的直接衡量标准。总之,这些结果表明了为什么应该根据最终表现、家长改进和校准到测试转移来单独评估反思策略。