论文

可观测性基础模型知道什么?

What Does an Observability Foundation Model Know?

模型评测模型行为与机制分析

摘要

线性探针可以表明标签可以从模型的隐藏状态中恢复,但不能表明它是否超出输入已经揭示的内容,或者模型是否使用它。我们在五个系列不相交重新分割的可观测性指标基准 (BOOM) 上审核了 Toto(一种可观测性预测基础模型),将其冻结残差流上的线性探针与读取原始输入窗口的模型以及剥离了训练配置的 Toto 架构进行比较。与每次重新分割中最强的原始窗口模型相比,短节奏与中节奏和公制类型更能从 Toto 残差中线性恢复(宏观 F1 0.766 与 0.633 以及 0.545 与 0.498)。域几乎是平的,并且从原始窗口可以更好地恢复级数基数。 MOMENT-base 显示相关的节奏、度量类型和域读出。可恢复性不是使用:将 Toto 的残差与高突发捐赠者的残差进行交换会按预期移动未来突发读出,但不会使预测始终比随机捐赠者更突发。经过 BOOM 训练的协调探针在测试的外部基准上具有负零样本 R^2。我们根据其最强基线报告每个标签。