论文

卡在“A”上:0.6B 语言模型的注意力 KDA 线性化中诊断和修复接口损伤

Stuck on "A": Diagnosing and Repairing Interface Injury in Attention-to-KDA Linearization of a 0.6B Language Model

摘要

我们在单个消费级 GPU 预算上将 Qwen3-0.6B-Base 的 28 个全注意力层中的 21 个转换为 KDA(Kimi Delta Attention)线性注意力层,并提出一个简单的问题:转换到底会破坏什么?手术后,隐藏状态对齐和端到端 KL 蒸馏 使学生在困惑中接近老师,但多项选择的准确性保持接近随机机会(C-Eval 上的 25-29% 与老师的 50.6%)。使用在保持内容固定的情况下旋转答案选项的四排列诊断,我们显示模型坚持选项标签(81% 的时间预测“A”;106/161 问题在所有四次旋转下保持相同的标签),而不是遵循答案内容——这是标准 蒸馏 指标无法看到的界面损伤。 1,000 步格式目标仅完成的 KL 阶段修复了界面(C-Eval 上+12.48 分,标签粘性大致减半),之后 persona SFT 和一轮 同策略 DPO 将基准分数保留在噪声内。我们发布了代码、权重、配方和完整的审计跟踪,并提炼了工程经验教训——包括 FP32 主故障模式,其中 bf16 优化器更新被默默地吞没——这使得在此预算下的收敛成为可能。