论文

State Stream Transformer (SST) V2:潜在空间推理的非线性递归并行训练

State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning

模型架构递归架构

摘要

当前的 Transformer 丢弃了位置之间丰富的潜在残留流,在每个新位置重建潜在推理上下文,并留下未开发的潜在推理能力。状态流 Transformer (SST) V2 通过每个解码器层的 FFN 驱动的非线性循环,在连续潜在空间中实现参数高效推理,其中潜在状态通过学习混合在整个序列中水平流式传输。同样的机制支持在推理时对每个位置进行连续的潜在审议,在提交词元之前专门使用额外的 FLOP 来探索抽象推理。两遍并行训练过程解决了递归的顺序依赖性,以允许计算高效的训练。隐藏状态分析表明,状态流通过探索连续潜在空间中的不同语义盆地来促进推理,其中内容相关位置的转换将模型移动到完全不同的贝叶斯后验,直接影响未来位置的潜在空间。我们还通过学习探针发现,在第一个生成的标记位置,潜在状态已经预测了最终答案是否会在每个后续位置的额外潜在计算下生存或崩溃。仅使用一小部分 GSM8K 示例数据集对现有 27B 主干进行联合训练,SST 在分布外 GPQA-Diamond 上比 微调 匹配基线提高了 +15.15 点,并将同一基线的剩余 GSM8K 错误减少了 46%,这表明推理改进归因于架构机制,而不是规模或训练数据。在 GPQA-Diamond 上,所得的 27B SST 还比几个较大的开放重量和专有系统(包括高达 25 倍大的开放重量模型)实现了更高的精度。