论文

用于单代推理 LLM 的无监督置信度校准

Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation

模型推理推理验证与自校正

摘要

推理语言模型可以解决日益复杂的任务,但难以生成可靠部署所需的校准置信度估计。现有的校准方法通常依赖于标签或推理时的重复采样,这使得它们在许多设置中不切实际。我们引入了一种当推理时只有单代可用时推理 LLM 的无监督置信度校准方法。我们的方法使用对未标记数据的离线采样来派生基于自一致性的代理目标,然后将该信号提炼为轻量级部署时间置信预测器。在使用 9 个推理模型对 5 项数学和问答任务进行的广泛评估中,我们的方法大大优于基线,包括在分布转移的情况下,并提高了选择性预测和模拟下游决策中的下游性能。