论文

安全纠错:冻结基础模型并保留能力的输出调整

Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation

模型训练参数高效训练

摘要

我们研究小型纠错模块能否修正冻结语言模型输出而不损害基础能力。CRN v2是位于完全冻结Gemma 4 E2B之上的轻量logit纠错模块,约3400万可训练参数,占46.5亿文本模块的0.73%。基础模型不更新,仅模块在83400个纠错对上先监督微调再做无参考DPO。在60题CEHRI人机智能领域考试,覆盖事实、算术与隐含目标推理,CRN v2修正53.3%的基础模型错误,改述变体为43.3%,在所测MMLU/BoolQ共N=200及洗车N=8能力基准上未退化。匹配CRN v1预算的LoRA基线,660万参数、秩19,纠错83.3%,却在相同基准损失30—75%能力,呈现纠错能力权衡。消融显示KL保留项λ=0.1关键,降至0.01后纠错降到35.0%。更早层隐藏状态注入变体,160万参数、仅SFT,达到50.0%/55.8%但未超越logit纠错;第4层更浅注入降至30.0%/28.3%;约3500万参数多深度logit纠错仅40%;更长训练5000步SFT加2000步DPO仍53.3%。受测替代配置均未超过秩128的logit结果,说明约53%是已达到最佳而非下限。这研究冻结底座、logit纠错与KL锚定的设计原则,不主张架构新颖。代码、主要结果权重与评估脚本已公开,深层变体仅代码,无已训练检查点。