论文
CHASE:循环状态空间语言模型的缓存洞适配跳步退出
CHASE: Cache-Hole-Adapted Skip Exit for Looped State-Space Language Models
摘要
循环语言模型的近期工作提示:许多推理问题受益于更大的计算深度而非更多独立参数。但既有研究几乎只关注Transformer骨干,该原则是否适用于状态空间语言模型仍开放。我们研究Looped Mamba与Looped混合Mamba-Transformer架构:反复施加共享Mamba(或混合)块以引入显式的有限深度循环计算。在两个受控推理任务(模运算操作Mano与p跳归纳)上:Looped Mamba持续优于参数匹配的非循环基线,并在多个设定下匹敌或超过同等有效深度的非循环模型。我们随后在匹配等参数与等FLOPs协议下把研究扩展到语言模型预训练——共同解耦参数共享与有效深度的效应:循环模型以少得多的独立参数在下游基准上保持竞争力,尽管更深的非循环模型在严格等FLOPs比较中保持验证困惑度优势。最后我们把Ouro的两阶段退出门适配到Looped Mamba,在循环步输出间做阈值控制的挑选。但在状态空间骨干上执行此类退出会使循环状态失去深层更新,验证困惑度严重退化。为此我们引入缓存洞适配:使继续训练与跳态推理对齐。在所研究规模上,适配后的模型保持困惑度接近全计算,在下游基准上匹敌或超过全计算退出态选择,同时只执行约一半循环步——在prefill受计算约束时转化为实测推理加速。