论文

语言模型知道什么时候会拒绝吗?探索安全边界的内省意识

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

模型评测模型能力评测

摘要

大语言模型 接受过拒绝有害请求的训练,但它们能否在响应之前准确预测何时会拒绝?我们通过系统研究来调查这个问题,模型首先预测他们的拒绝行为,然后在新的环境中做出反应。在涵盖 300 个请求的 3754 个数据点中,我们评估了四种前沿模型:Claude Sonnet 4、Claude Sonnet 4.5、GPT-5.2 和 Llama 3.1 405B。使用信号检测理论(SDT),我们发现所有模型都表现出较高的内省敏感性(d' = 2.4-3.5),但敏感性在安全边界处大幅下降。我们观察到 Claude 的代际改进(Sonnet 4.5:95.7% 准确度 vs Sonnet 4:93.0%),而 GPT-5.2 显示出较低的准确度(88.9%),且行为更多变。 Llama 405B 实现了高灵敏度,但表现出强烈的拒绝偏差和较差的校准,导致总体精度较低 (80.0%)。按主题分析表明,与武器相关的查询始终是最难自省的。至关重要的是,置信度分数提供了可操作的信号:限制高置信度预测可以使经过良好校准的模型获得 98.3% 的准确度,从而为安全关键型部署提供实用的基于置信度的路由。