论文
ChaosProbe:冻结 Transformer 输入嵌入空间上的神经混沌透镜
ChaosProbe: A Neurochaotic Lens on Frozen Transformer Input-Embedding Spaces
摘要
Transformer 模型通常是通过它们所做的事情来理解的:它们的基准性能、生成质量或下游任务的行为。然而,在上下文计算或特定于任务的适应之前,也可以通过对受控确定性探针的响应来检查冻结的 Transformer 输入嵌入空间。在这种基于响应的视图的指导下,我们引入了 \emph{ChaosProbe},这是一种受确定性神经混沌启发的方法,用于构建冻结 Transformer 输入嵌入空间的基于响应的指纹。对于每个提示级嵌入矩阵,ChaosProbe 应用基于混沌轨迹的变换,并用互补的表示级度量总结其发射率和熵通道响应,为每个模型生成固定长度的签名。在一项针对 80条中性提示和四种预训练模型(GPT-2、DistilGPT2、BERT-base-uncased 和 RoBERTa-base)的有界概念验证研究中,Pearson 相关性、Spearman 相关性和余弦相似性均恢复了所有四个同族最近邻分配和两个预期的相互族对。欧几里得距离恢复了四个分配中的三个和两个共同家庭对之一。配对引导重采样支持 Pearson 和 Spearman 配对在观察到的提示集上的稳定性,签名有效性检查表明恒定或折叠响应不会主导报告的指纹。这些结果提供了依赖于队列的概念证明,即确定性神经混沌响应特征可以暴露冻结的 Transformer 输入嵌入空间中的广泛结构。