论文

HoloAegis:冻结表示与拓扑推断——面向大语言模型护栏的极简参数安全流形及其能力边界

HoloAegis: Frozen Representation, Topological Inference --- Minimally Parametric Safety Manifolds and Their Capability Boundaries for LLM Guardrails

模型评测安全与风险评测

摘要

当前大语言模型安全护栏面临根本张力:微调会扭曲预训练表示,而生成式裁判带来高昂的推理成本。我们提出一个互补问题:仅凭对冻结表示的纯几何推理,安全性可以达到什么程度,又在哪里失效?我们提出HoloAegis,一个极简参数的拓扑推断框架,将表示与推理解耦:未经微调的编码器将文本映射到单位球面S^{d-1},所有决策都归结为对预计算锚点质心的吉布斯-玻尔兹曼自由能差。我们的贡献是边界测绘研究,而非排行榜声明。在固定的三基准协议上,HoloAegis(3.2 MB)在毒性上与WildGuard-7B(14 GB)统计持平(0.96对0.96),在有害行为上超过后者(0.99对0.79),在过度安全检测上落后(0.62对0.98)——而ShieldGemma-2B在间接伤害上失效(0.34)。这些失效模式互补且机制可追溯:势差评分感知流形聚类,而策略条件化的大语言模型评判需要显式分类匹配。我们以比率形式重述拓扑边界稳定性猜想,并通过参考集自助法验证:锚点库将分数方差降低4-15倍,边界位移约为全空间估计器的0.44 + 0.23 sqrt(k/K)。逐域分析进一步揭示,几何可分性追随域内语义同质性。我们的结果标出了几何护栏可替代大语言模型裁判之处,以及其必须让位于大语言模型裁判之处。