论文

用于保持量化语言模型中的不确定性的目标感知校准数据选择

Target-Aware Calibration Data Selection for Preserving Uncertainty in Quantized Language Models

摘要

量化被广泛用于部署 大语言模型,但其对不确定性行为(例如置信度、余量和弃权)的影响很少被视为主要目标。我们将量化的校准数据选择作为一个与目标相关的不确定性保持问题。不同的部署强调输入分布的不同区域,但先前的工作主要优化面向精度的压缩指标或调整量化后的分数。我们用分布和边界保存风险形式化了这个目标,并提供了一个简单的混合失配论点,解释了为什么没有一个校准配方可以满足所有目标。我们引入了保留怀疑量化(DPQ),这是一个轻量级的预量化配方系列,它使用全精度预测来构建高怀疑示例和通用锚点的目标对齐校准混合物。在 8 种语言模型、9 种 NLP 基准和 22 种比较方法中,领先的固定配方随保留目标而变化:DPQ-r75 在 SQuAD2 应答性边界保留上领先,而较温和或单信号变体,包括 DPQ-r50、仅置信度和仅熵,可以更好地保留广泛的多项选择 QA 行为。这些结果表明,应针对部署需要保​​留的特定全精度评分行为选择校准数据,而不是将其视为固定的量化细节。