论文

视频-FLAIR:不是是否推理,而是如何推理

Video-FLAIR: Not Whether to Reason, But How

模型训练强化学习

摘要

多模式查询可能需要不同类型的推理。有些可以通过感知推理来回答,直接从视觉信号中提取信息,而另一些则需要组合推理,结合观察或评估竞争假设的深思熟虑推理。然而,许多现有方法在查询之间应用统一的推理策略,导致对简单任务的不必要计算和对复杂任务的推理不足。我们引入了 Video-FLAIR,这是一个训练框架,它学习使用强化学习为每个查询选择合适的推理模式。在训练过程中,模型会针对同一提示在所有三种模式下生成响应,从而实现直接比较。综合奖励会根据正确性、基础和成本对这些响应进行比较,以支持最有效的响应,同时阻止不受支持或不一致的审议。这产生了用于学习自适应推理的监督信号,而无需每个查询注释。 Video-FLAIR 在 MathVista 上比 Qwen2.5-VL 基本模型的准确度提高了 +5.4,在 Video-Holmes 上提高了 +4.8,在 Video-MMMU 上提高了 +4.8,同时将平均词元使用量减少到 95,而始终思考的基线为 417。