论文

选项顺序随机化揭示了提示沙袋中的分布位置吸引子

Option-Order Randomisation Reveals a Distributional Position Attractor in Prompted Sandbagging

模型评测模型行为与机制分析

摘要

一位前任飞行员(Cacioli,2026)发现 Llama-3-8B 的工具促使沙袋作为位置崩溃而不是回答回避。然而,MMLU-Pro 中的固定选项排序尚未确定,这是否反映了模型级位置主导策略或数据集级干扰结构。该预先注册的随访(3 个模型、2,000 个 MMLU-Pro 项目、4 个条件、24,000 项初步试验)添加了循环选项顺序随机化作为关键控制。预注册的项目级同字母诊断未确认确定性位置跟踪(同字母率 37.3%,低于 50% 阈值)。然而,预先指定的支持分析表明,沙袋条件下的响应位置分布在完全内容旋转下高度稳定(Pearson r = 0.9994;Jensen-Shannon 散度 = 0.027,而诚实条件和沙袋条件之间的散度为 0.386)。当正确答案恰好占据首选位置 E 时,准确率飙升至 72.1%,而在位置 A 时准确率下降至 4.3%。数据为软分布吸引子提供了强有力的证据:在沙袋指令下,模型进入以 E/F/G 为中心的低熵响应位置盆地,该盆地在总体水平上高度稳定且基本上内容不变。 Qwen-2.5-7B 作为阴性对照(不合规,无分布变化)。这些结果在 7-90 亿个参数范围内提供了证据,表明响应位置熵是这种沙袋模式的一个有前途的黑盒行为特征。