论文
列表计数失败并不是一种现象
List Counting Failures Are Not One Phenomenon
摘要
计算括号列表中的项目看起来微不足道,但开放权重聊天模型经常会出错。之前的工作通常归咎于输入瓶颈,例如子词碎片或注意力稀释,它们预测不同的模型应该以大致相同的方式失败。然而,在相同提示下的七个指令模型中,错误答案形成了不同的模式:Qwen 和 Gemma 27B 经常将奇数长度翻转为附近的偶数整数,OLMo 将错误集中在一些中等大小的整数上,而 Llama 往往会少算。这些模式是有用的标签,而不是稳定的家庭法则(Gemma 9B 不会重现 Gemma 27B 的奇数到偶数下降),并且较重的子字碎片不会使我们的基准测试变得更加困难。当模型回答错误时,线性探针通常仍然可以从残余流中恢复真实计数。匹配相同的奇偶误差也不意味着相同的后期 MLP 幅度修复:缩放后期 MLP 输出对 Qwen 略有帮助,但在相同协议下的 Gemma 27B 上接近于零,而残余转向只能通过用奇数增益换取偶数损失来移动两者。这些结果警告不要在没有传输检查的情况下跨模型传输幅度修复。