论文
解码级禁忌:LLM 鲁棒性的诊断压力测试
Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
摘要
大语言模型 评估通常侧重于标称条件下的性能,从而产生一种模型能够舒适地走在狭窄、高度优化的生成路径上的错觉。然而,在现实部署中,复杂的系统提示、安全护栏和结构约束不断迫使模型偏离这条名义路径,从而导致基准分数和部署性能之间出现差异。为了解决这个问题,我们引入了解码级禁忌,这是一种零提示诊断压力测试,可在运行时直接干预 logits 空间,迫使模型脱离其标称路径。通过动态屏蔽单词边界处的主要候选标记,Taboo 强制机器进行迂回表达。对几个开放权重模型系列的 Taboo 进行评估表明,路径外鲁棒性很大程度上受到参数规模和 后训练 指令对齐的影响,鲁棒性通常随着模型大小和对齐而提高。除了本文提出的结果之外,Taboo 还提供了一种新颖的原语,用于生成各种合成数据集、压力测试运行时安全护栏以及在实际部署之前审核模型可靠性。