论文
真相深藏:以潜在意图验证对抗语义伪装
Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification
摘要
大语言模型(LLM)的安全对齐往往是肤浅的,依赖于仅在生成最后阶段才触发的拒绝机制,而没有抹除预训练期间获得的有害概念的基础知识。本研究证明,这种架构上的脱节使模型容易受到语义伪装(Semantic Camouflage)攻击——将有害意图包裹在良性叙事语境(如创意写作)中的对抗攻击,能有效绕过标准的输入和输出护栏。通过分析三个不同的小语言模型(SLM)家族(Phi-3、Qwen2.5和Gemma-2b)在对抗压力下的潜在激活轨迹,本研究识别出一个普遍存在的“意图视界”(Intent Horizon)——一个临界深度(通常为总层数的15–20%),在此处模型对有害意图的独特的预训练表征随着查询被语境化为“安全”叙事而坍缩。结果表明,虽然伪装攻击的晚层表征在数学上与安全查询无法区分(检测率<20%),但早层表征保留了独特的、可检测的“危害特征”。利用这一洞察,本文提出潜在意图验证(LIV),一种轻量级的探测防御。在PKU-SafeRLHF数据集上的实验表明,LIV在所有受测架构上以20–50%的优势超越标准护栏,无需模型再训练即可有效化解零日语义攻击。
