论文
架构决定 Transformer 的可观察性
Architecture Determines Observability of Transformers
摘要
自回归 Transformer 会产生输出置信度监控无法捕获的置信错误。仅当训练留下的决策质量信号超出输出已暴露的范围时,激活监视器才会捕获它们。该信号是训练模型的架构属性,固定在任何监视器的上游。控制输出置信度可以消除 14 个模型中平均 60.3% 的原始激活探针信号。原始探头信号主要是输出置信度,输出侧读数无法恢复残差。剩下的取决于架构和训练。在 Pythia 的受控训练中,两种宽度匹配的配置都会尽早形成信号。一种通过收敛来保留它,而另一种则随着困惑度的不断提高而消除它。能力和可观察性本质上并不矛盾。在独立训练的家庭中,即使崩溃点发生变化,这种模式仍然存在。在信号存在的地方,监控可以捕捉到信心无法捕捉到的东西。在下游 QA 中,经过 WikiText 训练且没有针对特定任务进行调整的探针以 20% 的标记率捕获了输出置信度监控遗漏的大约八分之一的置信错误。这些结果将信号工程确立为与损失和能力并列的训练时设计轴。架构设定了可观察性的条件,而训练则决定了哪些内容仍然可读。