论文
SAEScientist-Bench:AI 智能体能否进行自主 SAE 可解释性研究?
SAEScientist-Bench: Can AI Agents Conduct Autonomous SAE Interpretability Research?
摘要
虽然递归自我改进 (RSI) 的研究主要采用自动化模型训练流程,但可靠的自主开发需要一个缺失的支柱:事后监控和审计,以了解模型学习的内容并确保安全对齐。机械可解释性工具对于弥合这一差距至关重要,其中稀疏自动编码器(SAE)通过隔离模型检查和引导的可解释特征作为基石。在本文中,我们引入了 SAEScientist-Bench 来评估 AI 智能体是否可以充当科学家,利用 SAE 工具进行自主机械发现。给定目标概念,智能体设计对比探针并导航 Gemma-2-9B-IT 中包含 131K+ 特征的 Gemma Scope 字典,以发现最佳特征,并根据锚定在 Neuronpedia 上的精选专家参考特征进行评估,涵盖激活等级、对比文本的概念选择性和因果转向。在 10 种智能体配置和 20 项任务中,前沿智能体展示了真正的发现能力并领先于不同的评估维度,但仍远远落后于专家基线,在将目标概念与对比控制分开方面接近专家水平,同时在因果生成指导方面大幅落后。进一步的分析表明,尽管智能体可以设计对比来排除虚假候选者,但他们经常会误解实验测量结果。这些结果将实验模型理解建立为闭环自主人工智能研发的可衡量能力。我们的代码可在此 https URL 获取。