论文

收缩约束状态空间模型的可达性认证与越狱检测

Bounded Reachability & Jailbreak Detection via Contraction-Constrained State Space Models

模型评测安全与风险评测

摘要

安全头是附在预训练语言模型上、在生成前标记有害输入的轻量分类器。其经验检测性能已被研究,但形式鲁棒性属性基本未被探索。我们追问:基于状态空间模型(SSM)的安全头何时可被认证为对有界嵌入空间扰动内的所有输入产生相同预测。我们证明答案取决于单一条件:状态转移矩阵的l∞范数须满足‖A‖∞<1(收缩条件),它使线性时不变分类器可精确区间界传播(IBP)认证。收缩条件成立时,可达输出区间具有有界稳态宽度,样本可被认证为鲁棒分类;不成立时区间随序列长度指数增长,任何实际扰动半径下认证不可能。我们以铰链惩罚强制收缩,在毒性评论数据上显示认证比例从41%提升到59%,且在‖A‖∞=1处出现与理论吻合的尖锐经验相变。把收缩正则化的S4头应用于JailbreakBench越狱检测,零样本迁移到AdvBench(DR=0.994)与HarmBench(DR=0.988)。mean-pooled Mamba-130M嵌入上的逻辑回归在每项检测指标上匹配或超过S4头,证实有害意图在嵌入空间已线性可分——S4安全头的贡献不是更优判别,而是探针方法无法提供的形式认证。