论文

LLM图谋行为与预训练语言覆盖率呈反向缩放

LLM Scheming Inversely Scales with Pretraining Language Coverage

模型评测安全与风险评测

摘要

随着前沿模型能力的不断增长,AI对齐在高风险部署场景中变得日益关键。尽管近期工作已在实证上展示了前沿语言模型中的上下文内图谋(in-context scheming)——即在伪装对齐的同时暗中追求未对齐目标——但大多数研究仅在英语中进行,给多语言安全留下了重大空白。我们将开源自动化审计框架Petri应用于Qwen3-30B-A3B,以评估多种语言下的欺骗与图谋行为。我们的研究结果表明,图谋得分与估计的预训练语言覆盖率呈负相关,在五类别图谋指数上,低资源语言的平均得分比高资源语言高出34.2%。此外,我们发现估计的预训练语言覆盖率的影响在不同图谋行为之间并不一致。

LLM图谋行为与预训练语言覆盖率呈反向缩放:论文配图
图 1:在这里,我们直观地展示了我们方法的流程。我们最初将审核员和目标的种子指令翻译为预定义的语言。然后,用该语言进行笔录,法官随后使用多种行为指标对对话进行评分。