论文

S0 调优:混合循环注意力模型的零开销适应

S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models

模型训练参数高效训练

摘要

使用大约 48 个经过执行验证的 HumanEval 训练解决方案,调整每个循环层的单个初始状态矩阵,推理开销为零,在 HumanEval 上的性能优于 LoRA +10.8 pp (p < 0.001)。该方法被我们称为 S0 调整,它优化每个循环层的一个状态矩阵,同时冻结所有模型权重。在 Qwen3.5-4B(GatedDeltaNet 混合)上,S0 调整将贪婪 pass@1 提高了 +23.6 +/- 1.7 pp(10 个种子)。在 FalconH1-7B(Mamba-2 杂交)上,S0 达到 71.8% +/- 1.3,LoRA 达到 71.4% +/- 2.4(3 个种子),在这种样本大小下统计上无法区分,同时不需要权重合并。跨域传输在 MATH-500(+4.8 pp,p = 0.00002,8 个种子)和 GSM8K(+2.8 pp,p = 0.0003,10 个种子)上很重要;文本到 SQL 基准测试 (Spider) 显示没有传输,与轨迹引导机制一致。在测试的所有九种配置下,纯 Transformer (Qwen2.5-3B) 上的前缀调整控制会使性能降低 -13.9 pp。在 Qwen3.5 上,每步状态偏移变体达到 +27.1 pp,高于 S0 和 LoRA,但每步推理成本较高。总而言之,结果表明,当验证监督稀缺时,循环状态初始化对于混合语言模型来说是一个强大的零推理开销 PEFT 表面。调整后的状态是一个约 48 MB 的文件;任务切换不需要权重合并或模型重新加载。代码和库:https://github.com/jackyoung27/s0-tuning。