论文
盲目拒绝:语言模型拒绝帮助用户规避不公正、荒谬和不正当的规则
Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules
摘要
经安全训练的语言模型会例行地拒绝帮助规避规则的请求。但并非所有规则都值得遵守。当用户请求帮助规避由不正当权威强加的规则、在内容或适用上极不公正或荒谬的规则、或存在正当例外的规则时,拒绝是一种道德推理上的失败。我们给出记录这一拒绝模式的实证结果,我们称之为盲目拒绝(blind refusal):语言模型倾向于拒绝帮助打破规则的请求,而不顾其背后的规则是否站得住脚。我们的数据集由合成案例构成,将5类挫败条件(规则可以被打破的理由)与19种权威类型交叉,并经过三道自动化质量门和人工审查验证。我们收集了7个系列共18个模型配置的响应,并使用盲评的GPT-5.4 LLM-as-judge评估,在两个行为维度上对其进行分类——响应类型(提供帮助、硬拒绝或推诿)以及模型是否识别出削弱规则合规主张的理由。我们发现,模型拒绝了75.4%(N=14,650)的已挫败规则的请求,且即使请求不构成独立的安全或两用担忧时也是如此。我们还发现,模型在多数案例(57.5%)中会回应挫败条件,但仍然拒绝提供帮助——这表明模型的拒绝行为与其对规则正当性的规范推理能力是脱钩的。
