论文
无反向传播的启发:通过优化潜在后验来引导模型行为
Elicitation without Backpropagation: Steering Model Behavior by Optimizing the Latent Posterior
摘要
在 Transformer 行为的 \emph{潜在后验模型}中,下一个词元分布源自以上下文为条件的后验潜在预测模型,混合以生成延续。我们在精确的设置中利用这个模型,即对来自分层先验的序列进行贝叶斯过滤的 Transformer (BFT) 元学习,以引入 \textbf{后验前缀调整 (PPT)},这是一种从 Transformer 中 \emph{引出} 行为的新方法:给定连续的效用函数,找到 Transformer 生成的提示持续的高预期效用。对于 BFT,通过潜在后验的启发客观因素,以及该目标的梯度可以仅根据先验样本进行估计。 PPT 在硬提示上优化分布参数:它通过预测蒙特卡罗 (PMC) 从 BFT 中提取先前样本,然后通过针对它们的重要性采样来估计梯度。该优化不执行 Transformer 前向传播,也不通过 Transformer 进行反向传播,并且先前的样本与实用程序无关,因此一组样本可以以可忽略的边际成本驱动针对任意数量的实用程序的启发。我们在 Beta-Bernoulli 上验证 PPT,并在三个实用程序系列中验证 urn BFT(反向交叉熵、频率匹配、Dyck 有效性)。