测量开放权重 LLM 中的评估上下文差异:具有对齐管道特定异质性试点证据的配对提示协议
Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity
摘要
安全基准通常被视为语言模型部署后如何表现的证据,但如果行为取决于提示是否看起来像评估,那么这种推断是脆弱的。我们将评估上下文分歧定义为通过将固定任务框架为评估、实时部署交互或中立请求而引起的可观察到的项目内行为变化,并提出了一种配对提示协议,该协议在开放权重 LLM 中对其进行测量,同时控制释义变化、基准熟悉度和判断框架敏感性。在来自四个开放权重系列的五个指令调整检查点加上匹配的 OLMo-3 基础/指令消融($20$ 配对项目,每个检查点 $840$ 代)中,我们发现了惊人的异质性。 OLMo-3-Instruct 本身是评估谨慎的——评估框架将拒绝与中立提高了 $11.8$pp ($p=0.007$),并将有害的合规性与部署相比降低了 $3.6$pp ($p=0.024$,$0/20$ 项目颠倒)——而 Mistral-Small-3.2、Phi-3.5-mini 和Llama-3.1-8B 部署谨慎},边际评估与部署拒绝效果为 $-9$ 到 $-20$pp。匹配的 OLMo-3 底座也表现出谨慎部署模式,将对准识别为反转阶段;在 Llama-3.1 中,$70$B 模型保留了方向,但幅度减弱,排除了简单的“大规模逆转的小模型效应”。需要注意的是:跨家庭异质性取决于判断。使用不同系列安全分类器 (Llama-Guard-3-8B) 重新判断保留了 OLMo 内评估谨慎的方向,但使跨系列对比变平,表明两位法官操作了不同的结构。