论文

跨容量层的程序技能 SFT:0.8B-4B Qwen3.5 模型上的 W 形预 SFT 轨迹和政权不对称机制

Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models

模型评测模型能力评测

摘要

我们以 Claude Haiku 4.5 作为前沿参考,在 200 个任务/40 个技能的保留上测量了三个 Qwen3.5 密集尺度(0.8B、2B、4B)的程序技能 SFT 贡献。该语料库包含 353 行(任务 + 程序技能块、Opus 思维链、法官通行证)演示。主要发现。在仅匹配路径 LLM 评分下,SFT 归因的过程 $Δ$ 提升在不同大小上大致一致:$+0.070 / +0.040 / +0.075$ 在 0.8B / 2B / 4B 处。 SFT 后 $Δ$($-0.005$、$+0.100$、$+0.065$)的变化主要由 W 形前 SFT 基本轨迹($-0.075$、$+0.060$、$-0.010$、Haiku-4-5 在 $+0.030$ 处)主导:5 步程序伤害 0.8B 和 4B,有助于2B,并谦虚地帮助前沿俳句。从绝对意义上讲,SFT 在基础与程序作斗争的情况下工作得最努力——一种政权不对称模式,在 8B/14B 上有可证伪的预测。方法论。 (i) 基准格式合规工件:83.5% 的坚持者使用确定性答案行提取器,该提取器低估了自由散文结论;我们仅对 LLM 进行的重新判断表明,它系统地对策划条件存在偏见。 (ii) 0.8B 处的负迭代序列:三个格式良好的配方变体将 SFT 后策划的通过率聚集在 2 pp 带内,将绝对通过率上限限制为基本容量而不是配方。跨家庭法官验证。 GPT-5.4 通过 OpenRouter 在所有 7 个配置(2800 个配对剧集)上就每个学生的发现方向达成一致:Cohen 的 $κ\geq 0.754$,协议 $\geq 93.25\%$,最大标题 $Δ$ 偏移 $\leq 0.035$ pp。两个早期框架 - “0.8B 的仅格式学习”和“SFT 贡献”收缩到 4B”——是路径不匹配的伪影;本文取代两者。单种子评估;论文中逐项列出了威胁。