论文

移除信息并不能证明开放权重模型抗篡改

Removing Information Content Does Not Certify Tamper Resistance in Open-Weight Models

模型评测安全与风险评测

摘要

删除有害信息是否可以使开放权重模型抵抗微调攻击?我们表明,仅发布时的共同信息并不能普遍证明恢复缓慢。保留功能的重新参数化在改变梯度下降几何形状时保持信息不变,因此不变证书受到最快可达参数化的限制。我们将这一原理应用于训练数据过滤下的权重数据互信息和能力去除下的标签表示互信息。训练顺序可以改变固定权重数据信息的恢复时间,而精确的表示级独立性可以保留整个参数雅可比矩阵。显式构造的信息量均为零,并且在一个梯度步骤中恢复。受控实验说明了顺序相关的恢复和参数化相关的攻击速度。这些结果确定了认证所缺失的要求:对发布时的相互信息之外的攻击动态的限制。