论文
SANE:稳定极端上下文 Delta 规则模型的状态异常中和
SANE: State Anomaly Neutralization for Stable Extreme-Context Delta-Rule Models
摘要
Delta-Rule 循环模型保持固定大小的状态,启用 $O(1)$ 推理内存,但在极端上下文外推下可能会变得不稳定。通过在多达 100M 个词元的序列上跟踪 RWKV-7,我们凭经验识别出一种独特的故障模式:\textbf{相对稀疏的基底上的局部范数爆炸},而不是全局状态饱和。对周期性更新的分析表明,持续衰减使弱更新条目保持较小,而不均匀注入则允许一些通道积累极值。受此诊断的启发,我们提出 \textbf{状态异常中和(SANE)},它在块边界应用自适应 $\tanh$ 压缩,同时保留块内并行结构。在安全阈值范围内 ($3 \le α\le 5$),SANE 与 11 个短上下文推理基准的基线相匹配,没有统计上显着的退化。在超过训练长度超过 $24{,}000\times$ 的 100M 词元前缀之后,SANE 保留了功能推理 ($33.46$--$35.56$),而基线遇到了数值溢出。相比之下,过度宽松的阈值($α\ge 8$)保持数值稳定,但完全失去推理能力,表明数值稳定本身并不能保证功能推理,并揭示状态压缩中的容量与稳定性权衡。