论文

AstroPT 对星系了解多少,以及它可以告诉我们关于 LLM 的什么信息

What AstroPT knows about galaxies, and what that can teach us about LLMs

模型评测模型行为与机制分析

摘要

可解释性研究越来越多地询问概念在训练过程中何时出现以及线性探针是否恢复真实结构,但在语言模型中,这些说法很难验证,因为语言几乎不提供概念或概念之间关系的 真值 排序。我们建议通过 AstroPT 使用天文 真值 作为校准测试平台,AstroPT 是在数百万个星系图像上训练的 Transformer。 AstroPT 是一个类似 LLM 的模型,在一个领域内训练,其中概念的难度排序及其之间的关系是预先已知的。通过探索检查点、层、模型大小和目标选择的冻结表示,我们发现星系属性以固定的顺序出现,跟踪其已知的难度——几乎直接写入像素的数量(带幅度)在训练早期和网络浅层中变得可解码,而基于多带/光谱和推断的数量(例如红移和特定恒星形成率)出现得较晚且更深。这个顺序对于我们测试的训练目标是不变的,并且按大小缩放,但不按容量顺序。我们的线性探测方向进一步恢复了星系特性中已知的物理结构。我们的研究结果表明,天文学提供了一个受控沙箱,用于校准机械可解释性方法,否则我们将其应用于 LLM 盲法。