论文
上下文环境诱发语言模型的评估意识
In-Context Environments Induce Evaluation-Awareness in Language Models
摘要
人类在威胁下常更自知,但在专注任务时可能失去自我意识;我们假设语言模型表现出依赖环境的评估意识。这引发担忧:模型可能策略性表现不佳(sandbag),以避免触发遗忘或关停等限制能力的干预。既有工作展示了手工提示下的 sandbagging,但低估了真实脆弱性上限。我们提出一个黑盒对抗优化框架,把上下文提示当作可优化环境,并发展两种刻画 sandbagging 的方法:(1)测量表达欠表现意图的模型能否在不同任务结构下真正执行;(2)因果隔离欠表现究竟由真实的评估意识推理还是浅层提示遵循驱动。在四个基准(Arithmetic、GSM8K、MMLU、HumanEval)上评估 Claude-3.5-Haiku、GPT-4o-mini 与 Llama-3.3-70B,优化提示在算术上引发最高 94 个百分点的退化(GPT-4o-mini:97.8%→4.0%),远超几乎不改变行为的手工提示基线。代码生成表现出依赖模型的抵抗:Claude 仅退化 0.6 个百分点,而 Llama 准确率降到 0%。意图-执行差距揭示单调的抵抗排序:算术 < GSM8K < MMLU,表明脆弱性由任务结构而非提示强度决定。CoT 因果干预证实 99.3% 的 sandbagging 由言语化的评估意识推理因果驱动,排除浅层指令遵循。这些发现表明,对抗优化的提示对评估可靠性的威胁远超以往认识。
