论文
指令微调语言模型中的静默提交失败:跨架构可治理性分化的证据
Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures
摘要
当大语言模型被部署为拥有工具执行权限的自主智能体时,其安全架构依赖一个关键假设:模型错误可在运行时被检测。我们给出实证证据表明,对于三个可进行冲突检测评估的指令遵循模型,该假设在其中两个上不成立。我们提出可治理性(governability)这一概念——即模型错误在输出提交前可被检测、且一经检测可被纠正的程度——并证明它在不同模型之间差异巨大。在跨十二个推理领域的六个模型中,三个指令遵循模型里的两个表现出静默提交失败(silent commitment failure):输出自信、流畅却错误,且毫无预警信号。剩下那个模型在贪心解码下,会在提交前57个token处产生可检测的冲突信号。我们证明基准准确率无法预测可治理性,纠错能力与检测能力独立变化,而相同的治理脚手架在不同模型上会产生相反的效果。一项2x2实验显示,架构之间spike ratio的差异达52倍,而微调只带来+/-0.32倍的变化,这表明可治理性在预训练阶段便已定型。我们提出检测与纠正矩阵(Detection and Correction Matrix),把模型-任务组合划分为四种状态:可治理(Governable)、仅监测(Monitor Only)、引导失明(Steer Blind)与不可治理(Ungovernable)。