论文
从预期危害到目标概率:LLM Agent越狱的概率分析
From Expected Harmfulness to Likelihood: A Probabilistic Reformulation of Jailbreaking LLM Agents
摘要
当 LLM Agent输出的危害性可以量化时,自然的越狱目标就是在允许的输入修改上最大化预期危害性。另一种方法构建或选择有害的目标输出并修改输入以增加其可能性。我们通过概率重构在这两种方法之间建立了精确的联系。具体来说,我们表明,预期危害性相对于输入的对数梯度等于危害性重新加权输出分布下模型对数似然的预期输入梯度。该恒等式提供了预期危害性和目标可能性优化的统一解释。在此联系的基础上,我们提出了 OPUR,这是一种抽样分布,旨在生成高度有害的目标输出,并使用生成的样本来指导基于可能性的输入优化。实验证明了该方法在越狱 LLM Agent方面的有效性。