论文

保真度并不安全:温和压缩的 LLM 通过了所有无数据质量守卫,但在代理执行中发明了程序步骤

Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Data-Free Quality Guard Yet Invent Procedure Steps in Agentic Execution

模型评测模型行为与机制分析

摘要

一旦压缩的语言模型清除了一堆数据廉价的质量守卫,从业者就会接受它:原始的一小部分的困惑,置信区间内的下游精度(例如 MMLU),以及在随机探测输入下比较压缩和原始网络内部表示的无数据输出保真度信号。这个堆栈有一个盲点。在三个模型系列中,温和压缩的模型清除了所有防护,然后发明了当它们作为代理运行标准操作程序 (SOP) 时从未在说明中出现的程序步骤。该效应是特定于算子的:相干低秩(SVD)截断会引发这种效应,而与相同困惑度匹配的幅度剪枝则不会。一种分离可以隔离原因。 CI 赢得配对输出保真度测试 CI 失败的相同压缩权重发明步骤金丝雀。控制轴是压缩误差的相干性乘以其速率;损害的严重程度无法预测。无数据保真度探针是构建的保真度预言机,因此它看不到该轴。我们通过跨三种架构的预注册、动力金丝雀上的配对置信区间来描述盲点和分离。操作员特异性在所有三个上都复制,并且当模型允许守卫低秩余量时,就会出现困惑守卫规避。然后,我们提供一个无数据屏幕:压缩错误(相干分数和错误率)的两轴统计数据,它使用跨架构的固定阈值标记失败的构建,并匹配相干倍率机制。困惑度、MMLU 和保真度接受度并不能证明代理的安全性。在代理部署之前筛选轻轻压缩的低秩压缩模型