论文

语言模型中罕见事件估计的自适应多级扭曲序列蒙特卡罗

Adaptive Multilevel Twisted Sequential Monte Carlo for Rare Events Estimation in Language Models

模型评测评测方法与指标

摘要

大语言模型 中罕见的不安全行为即使发生的概率极小,但实际上仍然很重要,特别是在涉及数百万或数十亿次交互的部署规模下。扭曲序列蒙特卡罗 (SMC) 通过学习引导生成目标事件的扭曲函数,为罕见事件概率估计提供了原则框架。然而,标准扭曲学习框架依赖于罕见事件目标分布的正样本,在学习信息扭曲之前,这些正样本可能几乎不存在,从而导致罕见事件估计不可靠。我们提出了自适应多级扭曲 SMC,它通过一系列逐渐稀有的中间事件来学习稀有事件扭曲。在每个级别,学习到的转折都为学习下一个转折提供了更多信息丰富的正面示例,最终为目标罕见事件提供了更准确的最终转折。跨不同任务和模型规模的实验表明,所提出的方法可以产生更准确的罕见事件概率估计。通过更可靠地发现难以观察的不安全行为,我们的方法为加强已部署语言模型的评估和安全调整提供了实用工具。