论文
BUS:通过后向预测进行多模态推理的受大脑启发的无监督自我反思
BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
摘要
当前的视觉语言模型 (VLM) 通常难以处理需要一致且细粒度推理的复杂视觉任务。最近的方法旨在训练模型以促进自我反思推理,即审查和改进生成的推理。然而,它们需要大量带注释的数据,并且在测试期间缺乏明确的反射行为。相比之下,人类通过向后预测等机制进行明确且有效的自我反思,即预测哪些当前状态可能先于给定的未来状态。受神经科学的启发,这项工作提出了一种新颖的解决方案来应对这些挑战。我们首先观察并研究主流VLM可以进行向后预测的现象,类似于人脑。提出了一种名为大脑启发无监督自我反思(BUS)的无标签训练框架,以利用和利用后向预测能力来增强复杂视觉任务中的反思推理。 BUS 能够基于后向预测进行反思性推理的自我验证,在无监督条件下提供明确的学习信号。通过这种方式,BUS消除了对标注数据的依赖,同时提高了推理性能。我们的框架被设计为与模型无关的插件,与流行的 微调 方法兼容,例如监督 微调 (SFT) 和强化学习 (RL)。它从 Qwen3-VL-8B 初始化,改进了 HR-Bench-8K (+8.0%)、HR-Bench-4K (+7.7%)、V* Bench (+6.3%) 和 MME-RealWorld-Lite (+5.8%),证明后向预测是推进反思推理的关键。