论文
以置信度缩放:校准LLM置信度用于自适应测试时扩展
Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling
摘要
用强化学习(RL)训练大语言模型(LLM)已显著推进其在推理与问答任务上的性能。但主流RL奖励设计通常优先响应正确性——忽略激励模型准确表达置信度。这导致关键问题:性能增益常伴随置信度与准确率之间的糟糕校准——误导模型在不确定时过度自信地幻觉。为解决该局限——我们提出C3RL(正确性与置信度校准强化学习)——新颖RL算法——将正确性、校准与数据集知情的参考准确率奖励奖励整合在一起。跨8个文本与多模态数据集的全面评估表明:C3RL在不牺牲准确率的前提下增强校准——在性能与校准指标上都超越当前最先进方法。利用C3RL良好校准的言语化置信度——我们进一步引入基于置信度的自适应测试时扩展(CAS)——可调推理时策略——基于响应置信度分配计算资源。实验表明CAS在域内与域外数据集上都超越多数投票——同时将推理预算最多降低12.33倍。我们相信C3RL与CAS的协同为部署更可靠、更资源高效的LLM铺路。代码、数据与模型将发布。
