近地板几何是通用的:利用经过训练的超完备代码中的分散
Near-Floor Geometry Is Generic: Leverage Dispersion in Trained Overcomplete Codes
摘要
过完备的代码将 $F$ 特征打包到 $d<F$ 维度中,因此一个特征的线性读出会受到其他特征的串扰,其下方受排名跟踪下限 $W(F,d)=(F-d)/(d(F-1))$ 限制。靠近这一层被视为高效安排的证据。它不是:独立同分布(i.i.d)。相同形状的代码在我们测量的每个形状和负载下都达到了这个值(7 个匹配的控制为 1.0000-1.0005),原因是准确的。对于增益校准伪逆,达到比率为 $\frac{d}{F(F-d)}(\sum_i h_i^{-1}-F)$,其中 $\sum_i h_i=d$,因此当杠杆 $h_i$ 在各个特征上均衡时,它恰好等于 1:距下限的距离是杠杆离散度。在 40 个已发布的解码器矩阵(24 个稀疏自动编码器解码器加上混合模型的 16 个 MLP 下投影)上,所有矩阵都位于其匹配控制 (1.0055-1.2018) 之上,并且都提前 4 到 40 个稀疏级别达到保证仿射失败:在相同形状的随机代码仍然安全的情况下,已发布的字典已经具有仿射规则无法恢复的功能。使用相同方法在同一模型的随机初始化副本上训练的自动编码器在所有 10 个配对层中返回到底数 (1.0038-1.0065),因此多余的部分反映了模型学到的内容,而不是拟合自动编码器的行为。在受控条件下,损失决定界面是否存在:$L^2$ 达到 $R_{geom}=18.5635$ 到 32.3131,其边界折叠为 $1$,而 $L^4$ 则为 $1.0002$,并且该边界遵循我们在最宽运行之前记录的速率(预测为 10.79,测量为 10.510)。两个限制是明示的而不是暗示的:前沿陈述是最坏的情况,而不是典型情况的主张;并且因为探针类包含网络自己的解码器,所以我们的解码器比较限制了监督拟合而不是仿射表达。