论文
提示词优化如同掷硬币:诊断复合AI系统中它何时奏效
Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems
摘要
复合人工智能系统中的即时优化在统计上与抛硬币没有什么区别:在 Claude Haiku 上运行的 72 次优化中(6 种方法 $\times$ 4 个任务 $\times$ 3 次重复),49% 的分数低于零样本;在 Amazon Nova Lite 上,故障率更高。然而,在一项任务上,所有六种方法都比零样本提高了 $+6.8$ 点。成功与失败的区别是什么?我们通过 18,000 次网格评估和 144 次优化运行进行调查,测试 TextGrad 和 DSPy 等端到端优化工具背后的两个假设:(A) 单独提示值得优化,(B) 代理提示交互,需要联合优化。交互效应从来都不显着($p > 0.52$,所有 $F < 1.0$),并且只有当任务具有可利用的输出结构(模型可以生成但不默认的格式)时,优化才有帮助。我们提供两阶段诊断:针对代理耦合的 80 美元方差分析预测试,以及预测优化是否值得的 10 分钟净空测试 - 将抛硬币变成明智的决策。
