论文

概率程序综合中的似然黑客

Likelihood Hacking in Probabilistic Program Synthesis

模型训练奖励建模与过程监督

摘要

当通过强化学习(RL)训练语言模型来编写概率程序时,它们可以通过生成数据分布无法标准化的程序而不是更好地拟合数据来人为地夸大其边际似然奖励。我们将此称为失败可能性黑客攻击 (LH)。我们用核心概率编程语言(PPL)形式化了 LH,并给出了足够的语法条件来预防它,证明满足这些条件的安全语言片段 $\mathcal{L}_{\text{safe}}$ 不能产生似然黑客程序。根据经验,我们表明,生成 PyMC 代码的 GRPO 训练模型在前几个训练步骤中发现了 LH 漏洞,从而使违规率远高于未经训练的模型基线。我们将 $\mathcal{L}_{\text{safe}}$ 的条件实现为 $\texttt{SafeStan}$,这是 Stan 的抗 LH 修改,并凭经验证明它在优化压力下抑制 LH。这些结果表明,语言级安全约束在自动贝叶斯模型发现方面既有理论依据,在实践中也是有效的。