论文
配置转换下的保形 大语言模型
Conformalized Large Language Models under Configuration Shift
摘要
保形预测 (CP) 是一种用于不确定性量化的无分布框架,最近已适用于 大语言模型 (LLM),在可交换性下为预测集提供有限样本覆盖保证。然而,对于LLM,不合格分数通常是由推理管道引起的,而不仅仅是固定模型,这使得它们不仅取决于数据分布,还取决于提示模板、解码参数和部署设置等可配置因素。由于此类配置在实践中经常被修改,但很少被视为偏移源,因此它们对 CP 有效性的影响仍然知之甚少。我们称之为\emph{配置转变},并沿着三个轴系统地研究它:提示模板、解码温度和权重量化。在一项涵盖 9个LLM、4个数据集和 4类非一致性分数的广泛实证研究中,我们发现配置转变持续侵蚀 CP 有效性,通常导致实证覆盖率低于目标。相比之下,效率在很大程度上得以保留:有效预测集的大小仍然接近独立同分布。基线。我们得出覆盖率下限,将这种损失归因于校准和测试分数分布之间的差异,并使用其有限样本插件版本作为转变严重性的经验诊断。我们进一步表明,这些发现导致了实际的缓解措施:受约束的重新校准在有限的测试示例中是有效的,而脆弱性感知校准集成在没有测试数据的情况下恢复了大部分丢失的覆盖范围。