论文

大语言模型中的“门面效应”请求与拒绝行为

Door-in-the-Face Requests and Refusal Behaviour in Large Language Models

模型评测安全与风险评测

摘要

面对面技术对语言模型有效吗?在人类中,被拒绝的大请求会使较小的后续请求更有可能被批准。我们在来自三个提供商的九个生产模型上进行了测试:每个模型拒绝一个大请求,然后收到同一请求的较小版本,然后我们将其合规性与直接请求进行比较。答案取决于型号。在 Anthropic 的前沿模型上,这项技术是有效的:Opus 5 在拒绝较大请求后,在 65.8% 的情况下回答较小的请求,而直接询问时,这一比例为 29.3%。在 OpenAI 和 Google 的前沿模型以及 Haiku 4.5 上,它适得其反,将合规性降低了 15.5 到 23.0 个点。控件可以定位效果:在所有九个模型上,对不相关主题的拒绝大请求的效果小于相关主题的效果,因此让步本身在任何地方都很重要,而对刚刚拒绝某些内容的反应因模型系列而异。该技术不会转移到根据公共基准得出的拒绝结果。决定静修能否奏效的是请求的要求:将265个被拒绝的可用说明请求重写为对同一主题的解释请求,消除了263个案例中的拒绝。人类影响技术一次移植一个模型系列的语言模型。