论文
语言模型中的评价意识对行为的影响有限
Evaluation Awareness in Language Models Has Limited Effect on Behaviour
摘要
大型推理模型 (LRM) 有时会在其思想链 (CoT) 中指出它们可能正在接受评估。研究人员担心,这种口头评估意识(VEA)会导致模型战略性地调整其输出,优化感知评估标准,例如,这可能会使模型看起来比实际更安全。然而,VEA 是否真的具有这种效果尚不清楚。我们在开放权重 LRM 和涵盖安全、一致性、道德推理和政治观点的基准测试中对此进行了测试。我们测试了 同策略,对每个项目的多个 CoT 进行采样,并将自发包含 VEA 的内容与不包含 VEA 的内容进行比较,以及 离策略,使用模型预填充在缺失的地方注入评估感知句子,并在存在的地方删除它们,然后进行重新采样。 VEA 对模型行为的影响有限:将 VEA 注入 CoT 会产生接近于零的影响 ($ω\leq 0.06$),删除它会导致小幅变化 ($ω\leq 0.12$),并且自发发生的 VEA 会使答案分布最多移动 3.7 个百分点 ($ω\leq 0.31$)。我们的研究结果呼吁在将高 VEA 率解释为战略行为或对齐篡改的证据时务必谨慎。评估意识可能带来的安全风险比当前文献假设的要小。