论文
DeltaPrompts:逃离多式联运中的零增量陷阱 蒸馏
DeltaPrompts: Escaping the Zero-Delta Trap in Multimodal Distillation
摘要
蒸馏 使紧凑的视觉语言模型 (VLM) 能够获得强大的推理能力,但驱动此过程的提示通常是通过简单的启发式方法选择的,或者是从现成的数据集中聚合的。我们揭示了这种方法的一个严重的低效率问题:标准图表/文档推理数据集中高达 69% 的提示实际上是零增量,这意味着教师和学生已经得出了完全相同的答案分布。根据这些提示进行训练只能提供最小的学习信号,导致学生的进步迅速饱和,无论数据规模如何。为了摆脱零增量陷阱,我们回到首要原则:蒸馏 从根本上最小化分布分歧,因此只有当提示暴露了教师和学生之间的功能能力差距时才有价值。我们通过答案分歧 ($Δ$) 量化这一差距,证明非零分歧对于有效扩展至关重要。基于这一见解,我们提出了一个分阶段的综合管道,将现有数据集重新用作种子,积极针对学生的失败模式以产生更好的提示。其结果是 DeltaPrompts,这是一个包含 20 万个综合、高分歧推理问题的多样化数据集。我们通过三种不同的设置评估 DeltaPrompts:带有目标师生对的 同策略 蒸馏,转移到一个新颖的模型系列而不重新生成数据,以及非推理模型的 离策略 微调。在所有场景中,DeltaPrompts 都带来了巨大的收益,即使在高度优化的推理模型(例如 Qwen3-VL-8B-Thinking)之上,也能产生高达 15% 的相对改进——跨越图表、文档和以感知为中心的推理的 10 多个基准的平均值。