论文

仅在确定时才信任您的指南:推理时的不确定性感知稀疏对齐

Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time

模型推理解码与生成控制

摘要

推理时间对齐的一个突出范例采用轻量级管理器来引导 大语言模型 (LLM)。通过实证分析,我们发现了这种范式中的结构性不匹配:弱监督者在绝大多数词元中表现出普遍的高熵,但盛行的密集干预方法要求在每个解码步骤进行监督。这导致频繁的低置信度干预,可能会破坏有效的基本模型推理并产生大量的公用事业成本。为了解决这个问题,我们提出了 TUSA(基于信任的不确定性稀疏对齐)。 TUSA 摆脱了持续监督,将一致性重新构建为动态仲裁过程,引入了一个具有不确定性意识的仲裁器,仅在满足两个条件时才授权干预:监管者有信心并且词元在语义上是显着的。这种机制有效地过滤了不确定性驱动的噪音和冗余监督。跨多个模型和基准的广泛实验表明,TUSA 不断提高安全性和总体帮助性。通过绕过大约 50% 的对齐步骤,与密集基线相比,它不仅将安全偏好提高了高达 15.6%,而且将一般偏好率提高了高达 12.0%,这表明选择性、高精度对齐可以优于连续监督。