论文

删除拒绝方向并非精准手术:不同模型的决策倾向受到连带影响

Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families

模型评测模型行为与机制分析

摘要

Abliteration是从模型权重中删除拒绝方向的操作,常用于所谓“无审查”的开放权重模型。本文发现这种权重修改存在连带影响。作者使用21,600次不确定性决策作为探针:在18周内对华沙证券交易所60只股票作每周涨跌判断,并使用冻结流程重放,使决策模型成为唯一变量。任务本身不触发拒绝,因此实验组之间的差异属于修改的副作用。 在控制官方BF16检查点、同一修改者、相同推理服务栈及完全相同提示后,论文比较Gemma-4-26B-A4B-it与Qwen3-30B-A3B-Instruct-2507两个MoE模型家族的原始版本和修改版本。三个变化在两个家族中均出现,按周聚类的bootstrap置信区间不含零:修改后的模型更乐观,Gemma增加12.2个百分点、Qwen增加7.4个百分点,这是得到确认的预注册主要指标;回答的自我辩护更长,自我批评时明确表达不确定性的词更少,后两项为探索性发现。第四项变化方向相反:修改使Gemma表达的置信度降低,却使Qwen提高,两者置信区间不重叠。 能力控制变量排除了指令遵循退化这一解释;各实验组都没有显示出经济预测能力,修改版本表面上的优势来自市场行情暴露,即beta而非alpha。来源审计还发现了两个独立污染渠道:量化器不匹配的试验模型对,以及悄然破坏提示的过时社区聊天模板。这说明社区修改检查点的研究需要检查工具链影响。将“无审查”模型作为Agent部署,实际部署的是决策行为已发生变化的模型,而非仅减少拒绝的原始模型。