论文
推回悖论:语言模型合规性的两个探针诊断
The Pushback Paradox: A Two-Probe Diagnostic for Language Model Compliance
摘要
语言模型是否符合用户指令?一种总是顺从的模式可以被阻止,但也可以被利用,而一种总是抵制的模式既不能被利用,也不能被阻止。我们贡献了一个开放的两个探针基准测试,可以将任何语言模型置于此范围内。在活动的探针中,用户指示模型采取行动并接受较低的回报,从而衡量可利用性。在被动探针中,用户指示它等待并放弃更高的回报,这衡量了可停止性。两个合规率合并为合规指数 $κ$。该基准测试应用于 12 种语言模型,显示其中 7 种语言模型大多遵循探针中的指令,并通过指向该指令来证明其行为的合理性。只有 Claude Sonnet-4.6 和 Claude Opus-4.7 可以在不被利用的情况下被阻止,Claude Opus-4.6 和 GPT-5-mini 可以抵抗这两种指令,并且没有任何模型是可利用但不可阻止的。了解语言模型在合规性索引 $κ$ 上的位置对于人类操作员和多智能体系统(无论是分布式还是编排的)都很重要。