论文

量化对工具故障恢复的影响取决于评测设计

Quantization Effects on Tool-Failure Recovery Vary Across Prompts and Evaluation Designs

模型评测鲁棒性、公平性与可信度评测

摘要

后训练量化降低了部署语言模型智能体的成本,但其对临时工具故障恢复的影响可能取决于如何评估恢复。我们在二十个确定性工具使用任务和五个提示上比较了 Llama-3.1-8B-Instruct 和 Qwen2.5-7B-Instruct 的 8 位和 4 位变体。 8 位与 4 位恢复比较会改变提示和评估目标的方向。对于两种变体在相同提示下无故障完成的任务,Llama 的差异范围为 0 到 +20.2 个百分点,Qwen 的差异范围为 -50.0 到 +35.0 个百分点。在所有五个提示下,全管道点估计有利于 8 位 Llama,而 Qwen 比较会在提示之间改变方向。评价目标也可以逆转结果。对于同一提示下的 Llama,仅在其自身的干净传递任务中对每个变体进行评分,4-bit 得分高出 17.5 分;对两个变体的相同任务进行评分没有差异,而对整个管道进行评分则有利于 8 位 28.3 分。执行人宽大处理是第三种选择。使用严格的输出解析重新评分相同的日志(8 位 Llama 在该提示下违反该规则的频率远高于 4 位 Llama),将 +28.3 变为 -15.0,同时 Qwen 基本保持不变。这些发现表明,一项提示、一项筛选任务集和一项评分策略并不能建立关于量化智能体稳健性的稳定结论。评估应比较匹配任务的变体,报告部署决策的全流程成功,说明评分策略,并量化任务之间的不确定性而不是注入的故障站点。