ContraPrompt:基于成对推理轨迹分析的对比式提示词优化
ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis
摘要
提示词优化方法要么孤立地分析单个失败案例,要么跨样例比较提示词变体,都只作用于单次执行轨迹,无法接触到在同一输入上区分成功与失败的推理过程。我们提出 ContraPrompt,其建立在如下观察之上:当模型失败但在带反馈的重试中成功时,其两条思维链轨迹之间的差异构成了一种先前方法未能捕捉的优化信号。与先前的对比方法不同,我们比较的是完整的中间推理过程:两条轨迹共享模型、输入与基础提示词,因此剩余差异反映的是推理策略与附加的错误反馈——我们称之为成对推理轨迹分析(dyadic reasoning trace analysis)。多次尝试求解阶段是一个经过插桩的智能体重试循环,可自动生成对比数据而无需人工标注。提取出的规则被组织成一棵输入感知的决策树,依据可观察的输入特征来路由指令。在四个推理与合规基准上,ContraPrompt 在全部四项上超越 GEPA(Agrawal et al., 2026),绝对提升为 HotPotQA +8.29 个百分点(相对 +20.8%)、GDPR-Bench +2.21 个百分点(相对 +18.2%)、GPQA Diamond +7.14 个百分点(相对 +10.6%)、BBH +0.74 个百分点(相对 +0.85%)。消融实验证实成对轨迹对比性是关键组件,移除后平均相对下降 16%。在 53 个 EvalSet 黑盒优化问题上,等预算下 ContraPrompt 对 GEPA 取得 11 胜、41 平、1 负。在 FiNER-139 金融命名实体识别(Loukas et al., 2022)上,ContraPrompt 相对未优化基线取得 +7.77 个百分点(相对 +11.6%),相对 GEPA 取得 +1.94 个百分点(相对 +2.66%),且分支条件与标准 US GAAP 金融工具类别相吻合。
