论文
提示码本:面向语言模型指令精炼的离散组合优化
Prompt Codebooks: Discrete Compositional Optimization for Language Model Instruction Refinement
摘要
自动提示优化 (APO) 推动了基于 LLM 的代理工作流程的显着进步。然而,现有方法将每个任务的提示视为通过全局编辑优化的整体、实例盲字符串,从而产生脆弱的更新并阻止重用学习的子行为。我们提出了 Prompt Codebooks (PCO),这是一种新颖的组合提示优化框架,它将 APO 重新定义为对自然语言本能的有限词汇(原子的、可重用的指令单元)的离散学习。 PCO 在离散码本中组织提示构造知识,并通过基于 LLM 的编码器将每个输入路由到一小部分条目;生成器将它们组合成冻结目标模型的提示;批评者发出结构化的结论,该结论通过归因分解为每个变量的文本梯度,在语言值最小-最大目标下联合训练编码器、生成器和密码本。由此产生的路由是针对每个实例的:同一任务中的不同输入接收不同的本能组合,这是在实例盲方法下结构上无法表达的机制。在 Qwen3-8B 和 LLaMA-3.1-8B 的六个基准测试中,PCO 比零样本提高了高达 +30.36 点,在 HotpotQA 上超过了最强先验基线 (GEPA) +3.34,总计超过了 +1.11,并且与仅使用 K=16 本能的 MIPROv2 相比,部署提示长度缩短了 14.1 倍,与 GEPA 相比缩短了 3.0 倍。