论文
从批评到信心:基于语言的定量预测和置信度估计的 PPO
From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation
摘要
LLM 可以根据非结构化输入执行基于语言的定量预测,但仍然容易出现幻觉和过度自信的错误,因此不仅了解模型的预测内容,而且了解其预测何时可信也至关重要。我们引入了 CARE-PPO,这是一种强化学习框架,它在不确定性估计的损失预测和 actor-critic PPO 微调 之间建立了联系,从而能够在基于语言的定量预测中联合学习准确的数值估计和可靠的置信信号。 CARE-PPO 使用置信度一致的估计奖励(定义为预测误差的函数)向参与者提供密集的错误感知反馈,同时诱导批评者学习与预测质量一致的价值函数。在推理过程中,我们将批评者重新定位为置信度估计者。在医疗保健和金融领域的两项现实任务以及两个 Qwen-3 模型量表(4B 和 8B)中,CARE-PPO 实现了强大的定量预测性能,同时通过批评家产生了比基于 logits 和语言基线的显着更好的一致性置信估计。这些收益在跨领域的实际分布外设置下持续存在,跨越语言和领域的转变。最后,CARE-PPO 减少了一般指令遵循提示上特定任务的过度拟合,这与 RL 微调 相对于监督方法更广泛的泛化优势一致。