论文

提示词优化如同掷硬币:诊断复合AI系统中它何时奏效

Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems

模型评测评测方法与指标

摘要

复合人工智能系统中的即时优化在统计上与抛硬币没有什么区别:在 Claude Haiku 上运行的 72 次优化中(6 种方法 $\times$ 4 个任务 $\times$ 3 次重复),49% 的分数低于零样本;在 Amazon Nova Lite 上,故障率更高。然而,在一项任务上,所有六种方法都比零样本提高了 $+6.8$ 点。成功与失败的区别是什么?我们通过 18,000 次网格评估和 144 次优化运行进行调查,测试 TextGrad 和 DSPy 等端到端优化工具背后的两个假设:(A) 单独提示值得优化,(B) 代理提示交互,需要联合优化。交互效应从来都不显着($p > 0.52$,所有 $F < 1.0$),并且只有当任务具有可利用的输出结构(模型可以生成但不默认的格式)时,优化才有帮助。我们提供两阶段诊断:针对代理耦合的 80 美元方差分析预测试,以及预测优化是否值得的 10 分钟净空测试 - 将抛硬币变成明智的决策。

提示词优化如同掷硬币:诊断复合AI系统中它何时奏效
图 2:所有 6 个模型 × \times 任务条件的评分矩阵(10 × 10 10\times 10 提示网格)。行/列带占主导地位;没有可见的非对角线相互作用模式。蓝色方块 = 联合最优;红色圆圈=独立最优。差距:0.0–3.3 分。