论文

TED:无需训练 体验 蒸馏 的多模态推理

TED: Training-Free Experience Distillation for Multimodal Reasoning

摘要

知识蒸馏 通常是通过监督或基于强化的优化将教师模型的知识转移到学生的参数中来实现的。虽然有效,但此类方法需要重复的参数更新和大规模的训练数据,限制了它们在资源有限的环境中的适用性。在这项工作中,我们提出了 TED,一个 无需训练,基于上下文的 蒸馏 框架,它将 蒸馏 的更新目标从模型参数转移到注入学生提示中的上下文体验。对于每个输入,学生生成多个推理轨迹,而教师则独立生成自己的解决方案。然后,教师将学生的轨迹与其推理和 真值 答案进行比较,提取捕获有效推理模式的概括经验。这些体验随着时间的推移不断完善和更新。基于上下文的 蒸馏 的一个关键挑战是无限制的经验增长和噪音积累。 TED 通过体验压缩机制解决了这个问题,该机制跟踪使用统计数据并有选择地合并、重写或删除低效用体验。多模态推理基准 MathVision 和 VisualPuzzles 上的实验表明,TED 持续提高了性能。在 MathVision 上,TED 仅用 100 个训练样本就将 Qwen3-VL-8B 的性能从 0.627 提高到了 0.702,在​​ VisualPuzzles 上从 0.517 提高到了 0.561。在这种低数据、无更新的设置下,TED 的性能可与经过充分训练的基于参数的 蒸馏 相媲美,同时将训练成本降低了 5 倍以上,这表明可以通过情境体验实现有意义的知识转移。