论文
通过门控和减弱的策略蒸馏提高 OCR 忠实度
Improving OCR Faithfulness via Gated and Attenuated On-Policy Distillation
摘要
视觉语言模型可能会将图像中的异常文本重写为语言上合理的表达,从而损害 OCR 转录的可信度。序列级任务奖励和当地教师指导是互补的,但随着学生的进步,来自同一位教师的指导可能不会保持同样有效。离线分析表明,随着学生的进步,固定教师的监督变得越来越不利,无论是在训练检查点还是在具有不同任务奖励的响应组中。受这一观察的启发,我们引入了 GAD-RL,它根据学生当前的任务表现和局部分布,在联合后训练期间自适应地调节教师监督。冻结的老师以参考转录和学生生成的前缀为条件。 GAD-RL 禁用包含任务奖励至少 0.95 的输出的响应组的蒸馏,并随着组平均奖励的增加而不断减弱蒸馏强度。它还根据学生获得教师 Top-1 词元的概率对 KL 进行加权,当学生对该候选人的支持度较低时调节本地辅助更新。在 Qwen3.5-2B 上,GAD-RL 在 CHAOS-Bench 上实现了 59.92% 的微召回率,分别超过 GRPO 和 GRPO+OPD(固定权重)8.45 和 4.43 个百分点,同时在 OmniDocBench v1.6 上获得了 91.18 的总分。