论文

Qwen-Scope:将稀疏功能转变为 大语言模型 的开发工具

Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 在不同的任务中取得了卓越的能力,但其内部决策过程在很大程度上仍然不透明,限制了我们检查、控制和系统改进它们的能力。这种不透明性激发了越来越多的机械可解释性研究,稀疏自动编码器(SAE)成为将模型激活分解为稀疏、可解释特征表示的最有前途的工具之一。我们推出了 Qwen-Scope,这是一个基于 Qwen 模型系列构建的开源 SAE 套件,包含来自 Qwen3 和 Qwen3.5 系列的 7 个模型变体的 14 组 SAE,涵盖密集和专家混合架构。建立在这些 SAE 之上,我们表明 SAE 可以超越事后分析,作为沿四个方向的模型开发的实用接口:(i)推理时间引导,其中 SAE 特征方向控制语言、概念和偏好,而无需修改模型权重; (ii) 评估分析,其中激活的 SAE 特征为基准冗余和能力覆盖范围提供了代表性水平的代理; (iii) 以数据为中心的工作流程,其中 SAE 功能支持多语言毒性分类和以安全为导向的数据合成; (iv) 后训练 优化,其中 SAE 衍生信号被纳入监督 微调 和强化学习目标中,以减轻不良行为,例如语码转换和重复。总之,这些结果表明,SAE 不仅可以用作事后分析工具,还可以用作诊断、控制、评估和改进 大语言模型 的可重用表示级接口。通过开源 Qwen-Scope,我们的目标是支持机制研究并加速将模型内部结构与下游行为连接起来的实际工作流程。