论文
奖励通知稀疏自动编码器和解决方案完整性混淆
Reward-Informed Sparse Autoencoders and the Solution-Completeness Confound
摘要
稀疏自动编码器 (SAE) 将语言模型激活分解为稀疏的、可解释的特征,而一种吸引它们进行推理的方法是利用强化学习已经产生的信号来管理数据:奖励。我们构建了这样一个基于奖励的 SAE (RI-SAE):我们将 GRPO 轨迹分为高奖励(“好”)和低奖励(“坏”)推理延续,在其激活上训练标准 JumpReLU SAE,然后询问最终的好/坏分离实际测量的是什么。在 Llama-3.1-8B 上,16,384 个特征的稀疏子集确实分离了类(所选特征的轮廓为 0.79,完整代码的轮廓为 0.005),但控制组显示分离主要是解决方案完整性而不是推理质量:TF-IDF 文本分类器已经分割了类(AUC 0.75--0.83),并且仅三个结构线索(长度、封闭推理块、和一个框起来的答案)达到 AUC 0.70(99% 的好完成和 69% 的坏完成被框起来)。从未见过奖励的通用 SAE 根本无法区分类别(轮廓 0.01,没有区分特征),因此 0.79 是此策划信号的样本内拟合,而不是奖励盲字典恢复的结构。因此,我们将配方及其控制电池放在一起:奖励过滤是一种廉价、无标签的方式,可以重复使用 RL 信号以实现可解释性,但它所呈现的大部分内容都是完成形式。两个判别性特征仍然是可读的(符号数学;程序性和评价性语言),我们将其视为说明性的而不是孤立的推理。