论文

SAEExplainer:通过激活引导的偏好优化解释 SAE 功能

SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization

模型训练偏好优化

摘要

尽管稀疏自动编码器 (SAE) 通过将密集表示分解为稀疏特征来减轻 大语言模型 (LLM) 的不透明度,但解释这些特征仍然是一个核心挑战。然而,当前的解释方法通常在开环范式内运行,无法利用机械反馈进行进一步细化。在本文中,我们提出了 SAEExplainer,这是一种训练框架,利用激活分数作为客观奖励信号来训练模型进行自我校正和迭代引导。通过两轮优化过程迭代验证和修正基础解释,SAEExplainer实现了解释能力的不断提升。这种机制显着减少了解释幻觉并强化了因果触发模式。大量的实验表明,我们的方法在大多数指标的既定基线上得到了改进,特别是在因果触发和判别性激活方面。代码可在 https://github.com/he-jingyi/SAEExplainer 获取。