论文

ContraPrompt:基于成对推理轨迹分析的对比式提示词优化

ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis

上下文与知识上下文工程

摘要

提示词优化方法要么孤立地分析单个失败案例,要么跨样例比较提示词变体,都只作用于单次执行轨迹,无法接触到在同一输入上区分成功与失败的推理过程。我们提出 ContraPrompt,其建立在如下观察之上:当模型失败但在带反馈的重试中成功时,其两条思维链轨迹之间的差异构成了一种先前方法未能捕捉的优化信号。与先前的对比方法不同,我们比较的是完整的中间推理过程:两条轨迹共享模型、输入与基础提示词,因此剩余差异反映的是推理策略与附加的错误反馈——我们称之为成对推理轨迹分析(dyadic reasoning trace analysis)。多次尝试求解阶段是一个经过插桩的智能体重试循环,可自动生成对比数据而无需人工标注。提取出的规则被组织成一棵输入感知的决策树,依据可观察的输入特征来路由指令。在四个推理与合规基准上,ContraPrompt 在全部四项上超越 GEPA(Agrawal et al., 2026),绝对提升为 HotPotQA +8.29 个百分点(相对 +20.8%)、GDPR-Bench +2.21 个百分点(相对 +18.2%)、GPQA Diamond +7.14 个百分点(相对 +10.6%)、BBH +0.74 个百分点(相对 +0.85%)。消融实验证实成对轨迹对比性是关键组件,移除后平均相对下降 16%。在 53 个 EvalSet 黑盒优化问题上,等预算下 ContraPrompt 对 GEPA 取得 11 胜、41 平、1 负。在 FiNER-139 金融命名实体识别(Loukas et al., 2022)上,ContraPrompt 相对未优化基线取得 +7.77 个百分点(相对 +11.6%),相对 GEPA 取得 +1.94 个百分点(相对 +2.66%),且分支条件与标准 US GAAP 金融工具类别相吻合。

ContraPrompt:基于成对推理轨迹分析的对比式提示词优化:论文配图
图 2:系统概览。训练(上):仪器重试循环产生对比轨迹对 (τ−,τ+)(\tau^{-},\tau^{+}) 和一个全失败桶;提取的规则以二元方式提供给输入感知树,该树在每次外部迭代时被注入并设置检查点。推理(底部):特征 φ⁡(x)\varphi(x) 通过树路由输入,因此增强提示 𝒫⊕ℛ⁡(x)⊕x\mathcal{P}\oplus\mathcal{R}(x)\oplus x 仅携带与该输入类相关的规则子集。