论文

量化对临床基准的影响:模型系列的准确性和安全性

The Effect of Quantization on Clinical Benchmarks: Accuracy and Safety Across Model Families

模型评测鲁棒性、公平性与可信度评测

摘要

量化可以在资源有限的临床边缘设备上部署大型语言模型,但其对临床准确性和安全性的影响仍未得到充分研究。我们在五个基准上评估了 FP16、GPTQ-INT8 和 GPTQ-INT4 精度的 5 个 7-8B 参数模型:MedQA、MedMCQA、Med-HALT、HealthBench 的风险分层样本和 MedSafetyBench。该研究共同改变了量化位宽、模型系列和临床任务类型,并具有明确的风险分层和安全措施。 INT8 GPTQ 是普遍安全的(最大降级 -1.9%-1.9%),而 INT4 降级是显着的并且依赖于模型:经过临床微调的 BioMistral-7B 在 MedMCQA 上损失了 19.7%,比任何通用模型都要多,这表明临床微调并不能赋予压缩鲁棒性。 MedMCQA 在 INT4 下比 MedQA 降级更多; Med-HALT 基本上不受影响。在 HealthBench 的紧急风险子组中,Qwen2.5-7B 在 INT4 下降级了 26.8%,这表明高风险场景特别容易受到压缩。在 MedSafetyBench 上,该模型系列在精度方面占据主导地位(FP16 的拒绝率范围为 10.2%-74.9%),尽管 Qwen2.5-7B (-17.8%) 和 Meditron-7B (-28.3%) 显示 INT4 安全性大幅下降;值得注意的是,Qwen2.5-7B 同时是精度最鲁棒的模型,证明精度和安全鲁棒性是独立的属性。我们还测试了两种恢复方法,即临床校准替代和 QLoRA 微调,两者都产生相同的权衡:MedMCQA 恢复,而 MedQA 进一步降级,表明恢复策略需要针对特定​​任务进行验证,而不是假设普遍有益。这些发现表明 INT8 对于临床部署来说基本上是安全的,而 INT4 的安全性必须根据每个模型和每个任务进行评估,并且安全性一致性主要由指令调整而不是临床领域适应来确定。