论文
确定性的幻觉:同策略 蒸馏 中的解耦能力和校准
The Illusion of Certainty: Decoupling Capability and Calibration in On-Policy Distillation
摘要
同策略 蒸馏 (OPD) 是 后训练 语言模型日益重要的范例。然而,我们发现了普遍存在的错误校准缩放定律:虽然 OPD 有效提高了任务准确性,但它系统性地使模型陷入严重过度自信。我们将这种失败归因于信息不匹配:教师监督是在训练期间可用的特权上下文下形成的,而部署的模型必须仅使用部署时信息来报告置信度。我们从理论上形式化了这一观点,表明以教师为条件的成功通常不是部署时信心的有效目标,并且有帮助的特权背景会导致熵崩溃和系统性乐观偏见。为了解决这个问题,我们提出了一个校准感知的 OPD 框架 CaOPD,它可以根据模型的采样轨迹来估计经验置信度,用这个以学生为基础的目标取代自我报告的置信度,并通过相同的自我 蒸馏 管道提取修订后的响应。跨各种模型和领域的实验表明,CaOPD 在保持竞争能力的同时实现了帕累托最优校准,在分布外和持续学习下具有稳健的泛化能力。我们的研究结果强调,能力 蒸馏 并不意味着校准信心,并且信心应被视为 后训练 的基本目标。代码:https://github.com/SalesforceAIResearch/CaOPD