论文

Reinforcement Inference:利用不确定性实现自纠错的语言模型推理

Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning

模型推理推理验证与自校正

摘要

现代大语言模型(LLM)通常在\emph{一次性,贪婪}推理协议下进行评估和部署,特别是在需要确定性行为的专业环境中。这种制度可能会系统地低估固定模型的真实能力:许多错误不是由于知识缺失而产生,而是由于内部模糊性下的过早承诺。我们引入了\emph{强化推理},一种熵感知的推理时间控制策略,它使用模型自身的不确定性来选择性地调用第二次、更深思熟虑的推理尝试,从而实现更强的性能\emph{无需任何再训练}。对于 14 个科目的 12,032 个 MMLU-Pro 问题,在零样本设置中使用具有确定性解码的 DeepSeek-v3.2,强化推理将准确性从 60.72% 提高到 84.03%,同时仅产生 61.06% 的额外推理调用。 100% 的重新请求消融达到 84.35%,这表明不确定性感知选择以更少的计算捕获了大部分可实现的改进。此外,\emph{仅提示}消融的表现低于基线,这表明增益不能用通用的“你的输出具有高熵,一步一步思考”单独提示来解释。除了提供实用的推理时间升级之外,我们的结果还提出了一种更广泛的\emph{熵感知}范式,用于测量和扩展模型能力:因为现代基于解码器的模型以自回归方式生成输出,所以熵和相关的置信度测量在生成过程中自然地作为一流的控制信号出现。由此产生的一次性贪婪推理和不确定条件深思熟虑之间的差距为大语言模型的潜在推理视野提供了一个诊断镜头,并激发了明确限制正确性(置信度)的未来培训目标。

Reinforcement Inference:利用不确定性实现自纠错的语言模型推理
图3:来自16次运行扫描的准确率-算力权衡。每个点是一个阈值对(τ_H, τ_MSP),按其重问率(x轴)和最终总体准确率(y轴)绘制。