论文

在 Language-模型训练 过程中,概念何时在功能上变得足够?

When Do Concepts Become Functionally Sufficient During Language-Model Training?

模型评测模型行为与机制分析

摘要

深入理解模型及其学习机制需要确定其内部结构何时变得有用,而不是简单地查看最终状态。我们通过概念动力学来研究这一点:在每一层和检查点,我们分解激活,选择稀疏软掩模,并将掩模重建注入模型中。因此,概念分析是在功能上进行测试的:面具只有在保留干预目标时才有用。我们比较了学习对齐下激活重建、线性可解码性、真实下游保存和检查点转移的充分性。该框架将分解假设视为假设,而不是可解释性保证,监控跨检查点的功能充分性以及学习对齐下的源到最终的可重构性。在七个模型的共享固定惩罚操作点,下游掩模保留的软质量比重建掩模少得多;预测分布变化仍然很小。