论文
离崩溃还有一步之遥:根据指令调整的帮助的脆弱性
One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness
摘要
经过指令调整的 大语言模型 会产生有用的、结构化的响应,但是在微不足道的约束下这种有用性有多强大?我们表明,简单的词汇约束(禁止单个标点符号或常用词)会导致指令调整的 LLM 崩溃其响应,跨五个系列的七个模型(7B--70B、开放权重和封闭权重)损失 14--48\% 的全面性。由 10 名受过 STEM 培训的评估员进行的盲人评估证实了真实的内容损失,信息标准比表面标准降低了 1.5$--2.3\times$,这一发现得到了来自两个模型系列的三名 LLM 法官的 4,100 多个自动配对比较(77--100\% 基线偏好)的证实。诊断分析将此识别为 \emph{计划失败}:两遍生成恢复了响应长度的 59--96\%,提示表示上的线性探针在生成开始之前用 $R^2 = 0.51$--$0.94$ 预测响应长度。相同的探测在基本模型上产生负 $R^2$,证实指令调整引入了崩溃背后的表征结构。基础模型在相同的约束下没有表现出系统退化,这表明指令调整将任务能力与狭窄的表面形式模板结合起来。这种影响延伸到现实的部署限制(序言抑制、公司语气准则、法律合规对冲、可访问性要求),导致相当的降级($-$22\% 到 $-$34\%),仅抑制对话开场白(“当然!”)会导致我们最脆弱的模型崩溃 40\%,尽管只限制了开场标记。我们进一步表明,标准独立的 LLM 作为法官评估仅检测到 3.5% 的质量下降,而成对评估则显示 23%,暴露了当前评估实践中的方法盲点。