论文
CoCal:在能力训练过程中同步学习置信校准
Shared Experience, Separate Learning: Companion Confidence Calibration for LLMs
摘要
可靠的自我评估对于大语言模型 (LLM) 至关重要,但当他们的答案错误时,他们通常仍保持高度自信。我们研究并发置信度校准,其中置信度是在能力提高的同时学习的,而不是仅在训练后进行校准。可验证奖励的强化学习 (RLVR) 为这种范式提供了一个自然的设置,因为它不断产生与可验证的正确性反馈相匹配的响应。然而,现有的并发方法通过共享策略参数内的强化学习来学习能力和置信度,这可能会耦合两个根本不同的学习问题。相反,我们提出 共享经验但单独学习:能力和信心从相同的轨迹学习,但通过单独的优化机制和参数。基于这一原理,我们引入了 CoCal(同伴置信度校准),它通过rollout隐藏状态和验证者导出的正确性监督来训练轻量级同伴,同时保持任务优化不变。 Qwen3-8B 和 Qwen3-14B 上的实验表明,CoCal 在不牺牲任务性能的情况下提高了置信度估计,优于基于 RL 的并发方法和匹配的事后校准。博学的同伴进一步概括了各个领域和策略转变,而 CoCal 的优势在两个层面上都持续存在。