论文

基于知识和安全的拒绝的统一机制分析

A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地接受培训,以拒绝超出其知识范围的查询(基于知识的拒绝,KR)或违反安全策略(基于安全的拒绝,SR)。尽管 KR 和 SR 产生表面上相似的反应,但它们在很大程度上是孤立研究的,而它们是否共享潜在机制尚不清楚。我们通过对 213 个对比四元组的新数据集进行系统研究来解决这一差距,这些四元组共同探讨了两种拒绝类型。我们发现 KR 和 SR 受到重叠但又可区分的机制的控制。两者共享拒绝方向,但重叠是不对称的:SR 信号比反向信号更强烈地传输到 KR。特定类型的专业化主要出现在上层,KR 与不确定性和知识相关的表示相一致,SR 与安全和政策相关的表示相一致。因此,我们将拒绝描述为一个提交然后指定的过程:共享的初始机制承诺拒绝,然后后面层中的特定于类型的特征指定理由是认知的还是规范的。