论文

平分,放大的失败:错误预算如何掩盖量化 LLM 代理的损害

Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

模型评测评测方法与指标

摘要

据广泛报道,后训练 量化到 4 位权重几乎是无损的。我们针对多回合、工具调用代理测试了这一说法,这在现在最为重要。在$τ^2$-bench上,跨密集和MoE变体的两个开放权重模型系列和两个域(八个单元,每个单元456集,权重为16位、8位和4位),量化在标准指标上看起来确实是自由的。没有一个单元显示出能够经受多重比较校正的分数变化,并且在过程损坏最大的单元中,等效性测试将变化限制在 $\pm$7.5 分之内。这个过程讲述了一个不同的故事。量化将模型已经在完全精确度下表现出的故障(电信中的工具名称幻觉,与零售实体错误中的相同方向趋势)放大了高达 2.5$\times$ 的数量(每个任务+17.6 点),同时基本上不会产生新的故障。每个精度的故障集都是相同的(等级相关性 $\geq$ 0.94,新事件为 0.18%)。分数保持平稳是因为基准测试的十个错误预算吸收了额外的失败。将预算缩小到两个错误会重新暴露出 17 分的分数差距,而且仅在量化增加错误量的一个单元格中才会出现这种情况,正如掩蔽帐户所预测的那样。有针对性的错误修复提示,在每个精度下针对五种电信型号运行,可以准确地消除损坏,而且只消除损坏所在的地方。预算缩减下的每通道错误率和成功率这两种诊断均来自已收集的日志基准;我们建议将它们与任务奖励一起报告。