论文
LLM图谋行为与预训练语言覆盖率呈反向缩放
LLM Scheming Inversely Scales with Pretraining Language Coverage
摘要
随着前沿模型能力的不断增长,AI对齐在高风险部署场景中变得日益关键。尽管近期工作已在实证上展示了前沿语言模型中的上下文内图谋(in-context scheming)——即在伪装对齐的同时暗中追求未对齐目标——但大多数研究仅在英语中进行,给多语言安全留下了重大空白。我们将开源自动化审计框架Petri应用于Qwen3-30B-A3B,以评估多种语言下的欺骗与图谋行为。我们的研究结果表明,图谋得分与估计的预训练语言覆盖率呈负相关,在五类别图谋指数上,低资源语言的平均得分比高资源语言高出34.2%。此外,我们发现估计的预训练语言覆盖率的影响在不同图谋行为之间并不一致。
