论文

GFlowPO:生成流网络作为语言模型提示优化器

GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer

上下文与知识上下文工程记忆Agent记忆

摘要

为语言模型(LM)寻找有效提示至关重要却出了名地困难:提示空间在组合意义上极其庞大,且奖励因目标语言模型评估昂贵而十分稀疏。然而,现有的基于强化学习(RL)的提示优化器往往依赖同策略(on-policy)更新以及从固定分布中采样的元提示,导致样本效率低下。我们提出 GFlowPO,一个概率性提示优化框架,它将提示搜索转化为对潜在提示的后验推断问题,并以元提示的参考语言模型先验加以正则化。在第一步中,我们使用离策略(off-policy)的生成流网络(GFlowNet)目标微调一个轻量级提示语言模型,采用基于回放的训练策略,复用过去的提示评估以实现样本高效的探索。在第二步中,我们引入动态记忆更新(DMU),一种无需训练的机制,通过注入回放缓冲区中的多样化提示和小型优先队列中的表现最优提示来更新元提示,从而使搜索过程逐步集中于高奖励区域。在少样本文本分类、指令归纳基准和问答任务上,GFlowPO 持续超越近期的离散提示优化基线。

GFlowPO:生成流网络作为语言模型提示优化器
图2:GFlowPO 流水线。优化器 prompt-LM 在元提示 M 的条件下采样提示,目标 LLM 提供奖励,off-policy GFlowNet 训练加上动态记忆更新(DMU)迭代地改进探索与提示质量。