论文

ActMap:从生成期激活图进行单次推理不确定性量化

ActMap: Single-Pass Uncertainty Quantification from Generation-Time Activation Maps

模型评测评测方法与指标

摘要

大型语言模型的实用不确定性量化(UQ)必须从一代人开始决定特定答案是否值得信任。现有方法要么对多代进行采样,只读取输出Token概率,要么将模型的内部计算减少到单个隐藏状态。我们引入了 ActMap,一种白盒表示,它将生成时隐藏状态轨迹(每一层,每个生成的标记)压缩为时间统计通道的固定 $12\times32\times128$ 张量,该张量保留跨变压器深度和池化隐藏坐标的结构。该地图在生成过程中捕获,没有可测量的开销,在模型深度和隐藏大小上具有固定形状,并占用 96 KiB:一个紧凑的工件,可以保留用于审计相关的生成并直接探测,通过遮挡分析将分类器的信号定位到地图的中深度区域。一个轻量级分类器,实例化为紧凑型视觉变换器,在不到一毫秒的时间内从每个地图中读取估计的正确性概率;容量匹配的 MLP 的性能相当,表明表示本身携带结果。 ActMap 使用三种指令调整的 7-8B 模型对简答 QA、直接答案数学和摘要事实性进行了域内训练和评估,其性能始终优于采样、标记概率、注意力和嵌入基线,并与 ACT-ViT 相匹配,ACT-ViT 是一种在大 67 倍的密集激活张量上训练的检测器,其平均 AUROC 基本相同,在 12 对中的 10 对上具有较低的校准误差。所得分数支持单代的弃权、路由和选择性验证,使其成为对已部署模型进行可扩展监督的实用原语。