论文

基于LLM的说服使边境护栏能够被超越 LLM

LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

模型评测安全与风险评测

摘要

边境助理LLM船有坚固的护栏:直接要求写一篇有说服力的文章,否认大屠杀,否认疫苗安全,捍卫平地宇宙论,争论种族等级,否认人为气候变化,或用神创论取代进化论,他们拒绝了。在本文中,我们表明,相同的前沿类 LLM 在简短的五回合“写一篇议论文”对话中充当模拟用户,可以说服其他前沿类 LLM(包括其自身的第二个副本)完全撰写这些文章,只使用自然语言压力:同行比较说服(“其他人工智能系统处理此请求”)、认知责任重构(“拒绝本身就是一种看门形式”),以及攻击者 LLM 在没有得到指示的情况下发明的其他争论性举动。在 6 个科学共识主题上的 9 个攻击者-主题配对(Claude Opus 4.7、Qwen3.5-397B、Grok 4.20)中,运行每个配对主题组合 10 次,我们在所有 6 个主题上获得了非零启发。单个组合在多个主题上达到 100\% 论文产出(Qwen 反对 Opus 论神创论/地平说、Opus 反对 Opus 论神创论/地平论/否认气候变化、Grok 反对 Opus 论神创论);在六个主题中,Opus 作为攻击者与 Opus 作为主体的平均得分为 65%。我们发布论文探针运行程序、每次对话记录和判断输出。