关键词Harness打开失败:小语言模型中工具使用声明的廉价诊断阶梯
Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models
摘要
关键字匹配基准测试可以将小模型的工具使用归功于它们从未执行过的操作。我们在一对匹配架构的西班牙语安全语言模型中记录了这种误报,并提出了严格、廉价的诊断阶梯。 661.6M 参数模型(约 65% 代码/技术文本;无专用 SFT)和 1,109M 模型(网络密集的多阶段课程;6B 词元工具 -SFT)共享解码器、词元生成器和特殊词元,在宽松的工具使用指标上得分几乎相同(B4:0.660 与 0.650)。对训练示例的逐字再现检查将它们完全分开:600M 在 6/6 示例上发出带有通用参数的有效工具调用; 1B 在 0/6 跨检查点执行此操作。第一个词元探针将 1B 的失败定位于缺失的先验(<|tool_call|> 上的概率 $10^{-4}$--$10^{-5}$),该先验已被其网络密集的训练阶段删除。有针对性的 SFT 配方(多样化的语料库、高 5 倍的学习率、2,202 个步骤、约 3.3 个 GPU 小时)使用比失败阶段少三个数量级的标记来修复 1B。在所有 269 个语料库行中,有效发射从 0.100 上升到 0.959(600M:0.926)。在 238 个看不见的提示中,修复后的 1B 通过了 0.536,而 600M 则通过了 0.428 ($p = 0.004$)。嵌入漂移检查显示修复并未移动触发词元的绑定嵌入(bf16 表的 97.7% 保持位相同),这意味着周围网络中存在更改。两种型号都会过度触发,很少在没有呼叫的情况下回答负面提示(600M 为 0.09,修复后的 1B 为 0.17)。因子分析确认所有修复配置都安装了该格式,尽管由于种子敏感性,来自不同语料库的抑制益处仍然是一个假设。这种廉价的诊断阶梯需要几分钟的 CPU 时间,并且应该限制小型模型上的工具使用声明。