论文

谱基础模型中预处理不变性的归因

Attributing Preprocessing Invariance in Spectral Foundation Models

模型评测模型行为与机制分析

摘要

预处理不变性是光谱基础模型的一个理想目标:即使不同实验室采用不同的光谱预处理,冻结模型仍应有用。通常的评测在一种预处理流水线下训练分类器,再在另一种下测试,将准确率保持视为学习的证据。我们以一个拉曼基础模型为例重新审视这种解释。这类模型在使用任何学习参数之前先归一化输入;如果归一化把两种不同预处理的光谱映射为相同向量,编码器就收到完全相同的输入,因此这种不变性不能归因于学习。对于使用每条光谱自身统计量的归一化,当一条光谱等于另一条乘以正数再加常数时,恰好会发生这种情况;多种标准预处理操作都符合这一形式。因此,编码器应与不含任何学习参数的单独归一化基线比较。在六个拉曼评测数据集上,该模型并未可测量地优于自身的归一化。它优于原始光谱,但单独归一化同样如此。训练确实使编码器优于随机初始化,受控实验也表明,只有当变换实际传递到编码器时,它才学会忽略该变换。数值测试可以确定某种归一化会消除哪些变换。在五种模态的已发布系统中,大多数归一化已消除了这种形式的变换,但其中若干系统仍将该不变性归因于学习;对其中两个系统复现比较后,也未见收益。

谱基础模型中预处理不变性的归因:论文配图
图1:迁移网格。在流水线 i 上训练、在流水线 j 上评估的探针的平衡准确率(%),在六个数据集上取平均。星号标记跨家族的流水线。归一化再现了 RFM 的大部分迁移结构,而 RFM 在导数迁移上要弱得多。