论文
奖励镜头:奖励模型的机械可解释性库
reward-lens: A Mechanistic Interpretability Library for Reward Models
摘要
每个 RLHF 训练的语言模型都是由奖励模型塑造的,但机械可解释性工具包——logits 透镜、直接 logits 归因、激活修补、稀疏自动编码器——是为生成式 LLM 构建的,其原语都投射到词汇非嵌入上。奖励模型用标量回归头取代了它,破坏了每个工具。我们提出了奖励镜头,一个开源库,将该工具包移植到奖励模型,围绕一个观察组织:奖励头的权重向量 $w_r$ 是每个可解释性问题的自然轴。该库提供奖励透镜、组件归因、三模式激活修补、奖励作弊 探针套件、TopK SAE 特征归因、跨模型比较和五个基于理论的扩展(失真指数、分歧感知修补、错位级联检测、奖励项冲突分析、概念向量分析)。十方法适配器协议涵盖 Llama、Mistral、Gemma-2 和 ArmoRM 多目标头,并具有适用于任何 HuggingFace 序列分类模型的通用适配器。我们在约 695 个 RewardBench 对中验证了两种生产奖励模型。核心实证结果是否定的:线性归因不能预测因果修补效应(Spearman $ρ= -0.256$ 在 Skywork 上,$-0.027$ 在 ArmoRM 上)。该框架将这种分歧视为要公开的属性,而不是错误,从而激发了一种设计,使观察和因果视图保持一流且可直接比较。