论文
超越语言:大语言模型 中与格式无关的推理子空间
Beyond Language: Format-Agnostic Reasoning Subspaces in Large Language Models
摘要
大语言模型 以截然不同的表面形式(英语散文、Python 代码、数学符号)代表相同的推理,但它们在这些符号系统中是否共享共同的内部基础仍然未知。我们引入了 TriForm 基准(18 个概念 x 6 种形式 x 3 个实例 = 324 个刺激)并研究了三个架构系列中的 5 个 LLM (1.6B-8B)。使用排列校正 RSA、跨形式探测和激活修补,我们在中间层找到了格式无关推理子空间 (FARS) 的收敛证据。我们将 FARS 具体化:概念质心 PCA 提取一个 10 维子空间,将概念结构放大 3 倍,同时将形式信息抑制到接近零。在跨表单修补过程中仅替换这 10 个维度可以保留 90-96% 的模型输出,远远超过完全激活替换 (44-56%) 和方差最大化 PCA (60-74%),而消除它们会导致有针对性的破坏。 FARS 推广到保留的概念并在架构之间收敛(所有模型对的 CCA > 0.79),为柏拉图表示假说提供模态内证据。我们进一步发现了声明性与程序性的不对称性:散文和数学之间的表示比两者与代码之间的兼容性要高得多,这表明分歧的关键轴不是语言与形式,而是声明性与程序性。