论文
CA-OPD:面向结构化视觉预测的置信度感知同策略蒸馏
CA-OPD: Confidence-Aware On-Policy Distillation for Structured Visual Prediction
摘要
自回归视觉语言模型可统一不同感知任务,但容易累积错误。同策略蒸馏在学生自身采样轨迹上训练以缩小训练与推理差异,但早期不可靠的预测可能使轨迹偏离并降低教师监督质量。已有交错蒸馏允许教师核验和替换词元,却多依赖固定排名指标而非准确置信度,也未充分把干预决策用于词元级监督。我们提出置信度感知同策略蒸馏CA-OPD,联合可靠轨迹构建和自适应监督。教师依据置信度选择纠正不可靠转移,并按先严格后宽松的安排把采样控制逐步交给学生。被纠正的位置直接接受教师预测的交叉熵监督,保留位置则使用教师完整预测分布。在GUI目标定位和光学字符识别的多教师设置中,Qwen3.5-0.8B在全部六项目标基准改善,ScreenSpot-Pro提高9.50点,OCRBench-v2 English提高6.72点。对照显示,收益取决于干预位置、渐进采样控制和与干预相匹配的监督,而非仅干预频率。