论文

路由子空间:审计微调模型在评测与部署中的行为差异

Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models

模型评测模型行为与机制分析

摘要

安全评测常假设测试行为能够反映日常使用行为,但微调可能使这一假设失效:模型在评测式提示下看似已经修复,日常提示下却保留相同行为。输出得分可以揭示这种差异,但不能定位其内部来源。论文研究差异是否编码在稳定的内部位置,先借助路径修补确定中间层窗口、拟合成对激活差异,再在留出提示上修改相应坐标。 在四个经过完整矩阵测试的指令微调模型实例中,这一干预在12组模型—行为配置中缩小了10组的评测—部署差距,其中配对问题不少于120的8组配置中改善6组。第五个模型用于定位与编辑来源检查,部署式提示下的行为发生率最多变化6.1个百分点。两个没有变化的配置均涉及谄媚行为,说明当差异具有更高秩,或选层启发式未捕捉到相关位置时,单坐标审计并不足够。该方法用于诊断微调检查点,不是训练阶段的防御,也不保证部署安全。