论文

SamatNext v0.2-B:小型代码模型混合解码器的课程保留实验

SamatNext v0.2-B: An Exploratory Study of RMS-Normalized Hybrid Decoders for Curriculum Retention in Small Code Models

模型架构混合架构

摘要

标准自回归 Transformer 解码器通常会在连续 微调 的变化课程分布下表现出大量遗忘。本技术报告评估了 SamatNext v0.2-B,这是一种实验性 356M 参数混合序列解码器,它使用 RMS 归一化和输出比例校准,将差分注意式层与 DeltaNet 启发的简化线性状态混合器层交替使用。我们在受控分阶段 Python 代码课程下研究该模型,并将其与参数匹配的 Transformer 基线进行比较。在此设置中,SamatNext v0.2-B 在受控的第5阶段留出集中实现了 100.0% 的通过率,同时保留了 98.8% 的相邻第 3 阶段语义行为,并在第2E阶段早期语法留出集中达到 12.0%。最强的 Transformer 基线在第 5 阶段达到 97.6%,但仅保留第 3 阶段行为的 6.0%。两种架构在长期早期保留方面仍然很弱,因此结果应该被解释为在这种受控环境中改变保留/可塑性权衡的证据,而不是作为灾难性遗忘的通用解决方案。提供代码、模型规范、评估脚本和结果表以供独立验证。