论文

超越密集状态:将稀疏转码器提升为主动运算符以进行潜在推理

Beyond Dense States: Elevating Sparse Transcoders to Active Operators for Latent Reasoning

模型架构新型架构

摘要

潜在推理将思想链(CoT)压缩为连续的隐藏状态,但现有方法依赖于仍然难以解释和控制的密集潜在转换。与此同时,稀疏表示模型揭示了人类可解释的语义特征,但在很大程度上仍局限于事后分析。我们通过提出 LSTR(潜在稀疏转码器推理)来调和这种紧张关系,这是一种潜在推理框架,它将功能性稀疏转码器提升为主动推理运算符,以通过稀疏语义转换执行多步计算。 LSTR 的核心采用了带有残差跳跃架构的潜在转换转码器 (LTT),该架构将线性流形传输与稀疏语义更新解耦,从而通过显式稀疏约束实现可控语义解析。大量实验表明,LSTR 保留了推理准确性和压缩效率,同时显着提高了密集潜在基线的可解释性。因果干预和轨迹分析进一步证明,这些稀疏特征在推理过程中充当可解释且因果有效的算子。

超越稠密状态:稀疏转码器作为LLM潜在推理中可因果检验的算子
图2:LSTR 概览。一段连续的显式推理 token 序列在时间维度上被聚合为一个压缩的目标嵌入。在每个潜在步骤(latent step)中,Latent Transition Transcoder(LTT)对转移动态进行双边分解:线性传输路径(Transport Path)保持流形连续性,而稀疏创新路径(Sparse Innovation Path,通过 Top-k 选择)注入可解释的语义更新。在固定 (r,k) 预算下,LSTR 支持语义分辨率控制,不同的稀疏激活模式对应不同的推理原语,例如算术运算或逻辑门。