论文
ATLAS:宪法条件潜在几何和跨语言模型和神经扰动数据的重新分布
ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data
摘要
宪法条件 后训练 可以被分析为模型学习的表征几何的结构化扰动。我们介绍 ATLAS,这是一个几何优先的程序,可以跨图表、模型和基底追踪体质诱发的隐藏状态结构。 ATLAS 不是将相关单元视为单个行为、神经元、向量或补丁,而是测试局部图,其切线结构、占用分布和行为耦合可以在系统变化下进行测量。在 Gemma 上,锚定的源本地图表捕获 310 / 320 个已审阅的源行和所有 84 / 84 个已审阅的分数翻转行,但紧凑的精确补丁充分性并未关闭,因此可导出的单位是更广泛的源定义系列。冻结该家族,我们在未适应的 Phi 模型中重新识别目标局部实现,其中完全判定的验证性对比与 AUC 0.984 和平均差距 5.50 分开。在保留 ALM8 小鼠额叶皮层扰动数据中,相同的源定义家族获得了 5/5 倍的支持,平均保留 AUC 为 0.72,平均倍数间隙为 4.50。多项选择分析提供了主要边界:附近的目标局部信号可能会出现,而无需源忠实闭合。由此产生的对应关系不是坐标恒等式、站点恒等式或目标方中介定理。这是重新分配下的几何递归:书面构成可以诱导可恢复的潜在几何体,其组织在模型和基底变化时仍然可检测,同时其局部坐标、占用和行为表达发生变化。