论文
BayesPO:通过并行梯度引导离散 MCMC 进行贝叶斯提示优化
BayesPO: Bayesian Prompt Optimization via Parallel-Tempered Gradient-Guided Discrete MCMC
摘要
提示优化在不更新模型参数的情况下适应 大语言模型 (LLM),但许多自动提示优化器仍然对候选指令进行启发式搜索过程。本文研究提示优化作为离散提示标记上的贝叶斯后验采样。我们通过将任务似然项(奖励解释输入输出示例的提示)与语言模型先验(有利于流畅的指令)相结合来定义后验分布。这将即时优化转换为基于能量的后验采样问题,其中梯度可用于指导词汇标记上的离散马尔可夫链蒙特卡罗(MCMC)建议。我们将我们的框架称为 BayesPO,是贝叶斯提示优化的缩写。在本文中,BayesPO 使用马尔可夫链蒙特卡罗进行实例化:它使用 Metropolis-Hastings 校正的 Gibbs-with-Langevin (GwL) 方案,并集成并行回火以对崎岖的 LLM 引发的能源景观进行全局探索。具体采样器进一步使 GwL 采样器适应非权重绑定 LLM 嵌入的实际约束。 Qwen2.5 模型的实验表明,采样器在诊断任务中发现了语义上有意义的提示,并行回火有助于摆脱诗歌完成任务中的局部最优,并且对 24 个指令归纳子任务进行优化后的 APE 提示将平均准确度从 60.04% 提高到 63.23%。该研究还揭示了两个主要局限性:能量最小化可能会过度拟合小型优化集,并且当前采样器的计算成本仍然很高。这些发现将贝叶斯提示采样定位为一种有原则的后优化工具,并为概率提示优化指出了一个有希望的方向。