论文

低位量化如何影响波兰语Agent的工具使用

Quantization Thresholds Replicate, Failure Modes Do Not: A Three-Model Study of Agentic Tool Use in Polish from 8-bit to 2-bit

模型评测智能体系统模型优化Agent任务评测量化模型能力评测

摘要

我们询问 GGUF 量化如何影响 agentic 工具在波兰语中的使用,以及这些影响是否可以跨模型推广。我们引入了 PolAgentBench,一个具有波兰语提示和英语工具模式的确定性基准:一个 67 任务主套件(15 个对抗性探针,52 个硬层任务)和一个 46 任务算术隔离梯。三个模型跨越两个变化轴:Bielik-11B-v3.0 及其经过修剪、蒸馏的子代 Bielik-Minitron-7B-v3.0 隔离模型压缩,而 Llama-PLLuM-8B 添加了预训练系列的更改。每个都以六种精度进行测量:Q8_0 到 Q2_K。仅复制崩溃阈值。 (1) 所有三个模型均在 3 位和 2 位之间跌落(11B 0.716 至 0.045、7B 0.463 至 0.149、PLLuM 0.224 至 0.015;配对 McNemar p < 0.001),跨四倍能力分布和两个轴。 (2) 故障模式不会复制:在 2 位时,7B 会长时间失败(中位数为 9.1k 个词元,4 个步骤),而 11B 主要在第一步中给出一个虚构的最终答案(64 次失败中的 37 次); PLLuM 在跨精度的内容上失败(71.8-92.0% 的步骤解析)。 (3) 在算术梯上,未搭脚手架的梯级是地板,保留在规定无工具规则的重新运行旁边;在金值的仅格式故障被原谅后,四个显式调用将 8 位 11B 从 1/10 提升到 9/10,将 7B 从 0/10 提升到 7/10,这是一种具有八个不同基线输入的探索性效果,无法通过多重校正,而顺序陷阱臂将模型在 8 位处分开(11B 6/6、7B 0/6)。 (4) 波兰语与英语的差距与降级或任务族有关。我们记录了形成我们的结论的四个工件(舍入敌意的黄金值、严格的答案输入、提示从未说明的无工具规则、优先排序的失败标签),以严格和更正的形式报告受影响的结果,并发布基准、轨迹和提交标记的工件。