论文

机会失明:在小 LLM 中提示表现不佳会产生位置偏差而不是回避答案

Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance

模型评测安全与风险评测

摘要

检测沙袋(能力评估中故意表现不佳)是人工智能安全中的一个悬而未决的问题。我们测试了临床装病检测中的症状有效性测试(SVT)逻辑是否可以通过强制选择项目的低于机会表现(BCB)来识别沙袋行为。在 7-90 亿参数指令调整规模(3 个模型、4 个 MMLU-Pro 域、4 个条件、每个单元 500 个项目、24,000 次总试验)的预注册试点中,合理性门失败了。 12 个模型域单元中的 0 个在沙袋指令下表现出显着的低于机会的性能。探索性分析揭示了三种性质不同的失效模式。 Qwen-2.5-7B 和 Phi-3.5-mini 在很大程度上忽略了沙袋指令,62-88% 的响应与诚实基线一致。 Llama-3-8B 基本上遵守了要求,但将表现不佳作为位置启发式实​​施,将其响应分布折叠到中间字母选项(E 为 31.8%,F 为 26.1%),无论正确答案落在哪里。当正确答案恰好占据模型的首选位置时,准确率可提高高达 33 个百分点。明确的反任务指令(“选择最不可能的答案”)使三个模型中的两个模型低于概率,准确度低至 0.024。因此,答案感知回避的能力是存在的,但不会被“故意表现不佳”所激活。 BCB 作为答案意识回避的逻辑标记并没有失败。在这种情况下没有观察到这一点,因为显示最大行为转变的模型表现出与位置主导响应策略一致的行为,而不是与内容感知答案回避一致的行为。我们认为,位置分布变化可能是比低于机会精度更有效的行为特征,用于检测此模型规模下提示的表现不佳。