论文
跨有限同构符号域的操作级因果转移的预先指定构造确认测试
A Pre-Specified Construction-Confirmation Test of Operation-Level Causal Transfer Across Finite Isomorphic Symbolic Domains
摘要
行为准确性、线性可解码性和成功的激活干预本身并不表明模型具有从一个符号域到另一个符号域的操作级结构。我们在有限同构状态空间中提出一个更狭窄的问题:如果为每个源输入单独估计两个操作之间的隐藏状态差异,那么将该差异添加到映射的接收者输入中是否会使模型朝着相应的接收者答案移动?该设计将这种特定于输入的干预与错误操作、规范匹配随机和无操作控制进行比较,并将候选构建与独立隔离的确认分割分开。在第 20--21 层冻结的 Qwen2.5-7B-Instruct 模型上,来自一个系列的一个路线-域-操作候选者在确认访问之前预先指定并冻结,透明 |整数_mod16--字母16 |后继者->前任者,通过了两个 PyVene 拆分;其确认交集-联合 p 值为 0.000198,其 36 族 Holm 调整 p 值为 0.006943。随后的 NNsight 0.7.0 实验在确认访问之前进行了预先指定和冻结,仅测试了此选定的提示路由,而没有重新选择候选或层。它以数字方式再现了所有 12 个确认效应估计、置信区间和精确的符号翻转 p 值;其 36 个家族 Holm 调整后的 p 值为 0.007141。因此,结果仅限于一条即时路线和一名候选者,并在一次模型修订和一层间隔的两次干预实施中复制。它没有建立跨模型泛化、全族后端独立性、域通用转移或代数不变性。