论文
HEAL:面向推理蒸馏的后见熵辅助学习
HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation
摘要
将大推理模型 (LRM) 的推理能力提炼为较小的模型通常会受到拒绝采样的限制。标准方法将教师视为静态过滤器,丢弃教师无法独立探索有效解决方案的复杂“极端情况”问题,从而为学生创造了人为的“教师天花板”。在这项工作中,我们提出了后见之明熵辅助学习(HEAL),这是一种无强化学习的框架,旨在弥补这一推理差距。 HEAL借鉴最近发展区(ZPD)的教育理论,协同三个核心模块:(1)引导熵辅助修复(GEAR),一种主动干预机制,通过熵动力学检测关键推理断点,并注入有针对性的事后提示来修复损坏的轨迹; (2)困惑-不确定性比率估计器(PURE),一种严格的过滤协议,可将真正的认知突破与虚假的捷径分离; (3)渐进式答案引导课程演化(PACE),这是一种三阶段蒸馏策略,组织从基础调整到前沿突破的培训。对多个基准的大量实验表明,HEAL 的性能显着优于传统的 SFT 蒸馏和其他基准。
