论文

话安全事致命:在隐状态风险空间中探查文本越狱之外的物理越狱

When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space

模型评测安全与风险评测

摘要

大语言模型(LLM)日益充当具身智能体的高层规划者——语言上无害的指令一旦落地到物理世界就可能不安全。我们研究这种物理落地越狱是否与普通文本越狱是同一个安全问题。经隐状态方向分析与随机划分零检验:我们显示文本越狱(TJ)与物理越狱(PJ)在LLM表示中构成可分信号——跨Qwen2.5-3B/7B/14B/32B、Phi-3.5与SmolLM2。基于这种可分性,我们提出PRISM:一个在完整隐状态上的单层L2正则逻辑探针。PRISM在SafeAgentBench上取得86.2–87.7%准确率、11.7–13.7%假正率(FPR),而同规模LLM裁判以24.7–39.0%的FPR过度阻断安全任务。为检验结果经词汇捷径对照后是否存活,我们引入PhysicalJailbreakBench-2K的交互平衡修订版:一个固定2,000行的对照集——按标签与物理机制从更大的物体—场所构造中采样。在底层1万行池上:词TF-IDF与嵌入层保持随机(AUC 0.497与0.500)。在经独立同分布扫描选出的第25层:单元分组交叉验证给PRISM 0.718 AUC,对比同协议下无物理标签对照的0.398。在相同的2,000对照行上:这些PRISM预测取得0.671平衡准确率,而3B到72B的Qwen2.5裁判取得0.538–0.577且FPR高。结果支持隐状态探针作为超越文本审核的物理安全表示级方法——不依赖捷径易发的配对模板的近满分。

话安全事致命:在隐状态风险空间中探查文本越狱之外的物理越狱:论文配图
图 6:TJD/PJD 的跨架构通用性。 (a) 所有三种架构中,TJD–PJD 探针权重角度簇位于 71∘71^{\circ} 和 78∘78^{\circ} 之间(Qwen2.5-3B 75.9∘75.9^{\circ}、SmolLM2-1.7B 71.1∘71.1^{\circ}、Phi-3.5-mini 77.3∘77.3^{\circ})。 (b) PRISM 实现了 81/77/87% 的物理越狱检测,而仅 TJD 则下降至 20/26/38%。 (c) PJD 的独特方差在与 TJD 的正交化中幸存下来(<1.5<1.5pp 下降),排除了微不足道的重复。