论文

在线推理校准:测试时训练可实现通用保形 LLM 推理

Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning

模型推理解码与生成控制

摘要

虽然测试时间扩展使 大语言模型 能够解决高度困难的任务,但最先进的结果却需要高昂的计算成本。这些低效率可归因于训练后语言模型的错误校准以及流行采样技术缺乏校准。在这里,我们提出在线推理校准(ORCA),这是一个利用保形预测和测试时训练来校准采样过程的框架。具体来说,我们引入了一个元学习过程,可以更新每个输入的校准模块。这使我们能够在分布变化下提供有效的置信度估计,例如在推理的不同阶段出现的思维模式,或者在模型开发和部署之间的即时分布。 ORCA 不仅为保形风险提供了理论保证,而且在经验上显示出跨不同推理任务的更高效率和泛化性。在风险水平 $δ=0.1$ 时,ORCA 提高了 Qwen2.5-32B 在分配任务上的效率,使用监督标签可节省高达 47.5%,使用自一致性标签可节省高达 40.7%。在零样本域外设置下,它将 MATH-500 节省从静态校准基线的 24.8% 提高到 67.0%,同时保持较低的经验错误率,并且在模型系列和下游基准中也存在相同的趋势。我们的代码可在 https://github.com/wzekai99/ORCA 上公开获取。