论文

模型说步行:测量 LLM 条件是否存在隐藏约束

The Model Says Walk: Measuring whether LLMs Condition on Hidden Constraints

模型评测评测方法与指标

摘要

当被问及是步行还是开车去 50 m 外的洗车场时,大多数语言模型都说步行,忘记了汽车必须在那里。此类失败通常通过隐藏约束适用的问题的准确性来衡量。我们证明这是误导性的:模型可以正确回答这些问题,而无需推理约束,只需选择谨慎的选项即可。相反,我们会问当约束被移除时模型的决策是否会改变。我们在三个控制级别上对此进行测试:开放权重模型上的对数概率扫描、500 次提示压力测试以及 CORE(一种新的经过人类验证的最小约束存在/约束不存在对的基准)。图片是一致的。约束推动决策而不是管理决策。模型仍然缺少像洗车这样的存在约束,但在其他地方它们应用了不存在的约束。结果,标准准确率使我们评估的所有十个模型都变得更漂亮,并重新排序了它们的排名,并且在配对评分下,看似有效的提示修复基本上消失了。关于隐藏约束推理的主张需要配对证据。