论文
高效推理蒸馏:通过合成 CoT 和难度感知微调的小型视频语言模型
Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning
摘要
我们提出了一种有效的方法,将推理能力提炼成用于视频问答(VideoQA)的紧凑视频语言模型(VLM)。我们的方法仅使用 $\sim$900 个不确定性选择的示例来微调 2B 参数模型,每个示例都通过 4B 教师生成的综合思想链 (CoT) 原理进行了增强。尽管其计算成本极低(单个 A100 GPU 上的时间不到两小时),但我们的方法使 2B 模型的性能比 VLM 高出 4 倍\倍,并且在 CinePile、ActivityNet-QA 和 MLVU 上进行泛化,接近其自己的 4B 教师的性能。一个重要的发现是,将 CoT 基本原理放在答案之后(与标准提示相反)可以大大改善紧凑模型中的推理。这一见解挑战了现行的 CoT 惯例,并揭示了有限模型容量下的新对齐策略。我们的研究结果为训练适合移动和边缘应用的可部署、推理丰富的 VLM 提供了实用的蓝图。