论文
超越感知捷径:轻量级 MLLM 中通用视频推理的因果启发去偏优化
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs
摘要
尽管强化学习 (RL) 在大型多模态语言模型 (MLLM) 中具有显着先进的推理能力,但对于边缘部署所必需的轻量级模型,其功效仍然有限。为了解决这个问题,我们利用因果分析和实验来揭示感知偏差的根本现象,证明基于强化学习的 微调 迫使轻量级模型优先采用数据偏差引起的感知捷径,而不是发展真正的推理能力。受这一见解的启发,我们提出了 VideoThinker,这是一个受因果启发的框架,通过两阶段去偏差过程在轻量级模型中培养强大的推理能力。首先,偏见意识训练阶段打造了一个专门的“偏见模型”来体现这些捷径行为。然后,因果去偏策略优化 (CDPO) 算法对主要模型进行微调,采用创新的排斥目标,主动将其推离偏差模型的有缺陷的逻辑,同时将其拉向正确的、可推广的解决方案。我们的模型 VideoThinker-R1 在视频推理效率方面建立了新的最先进水平。对于相同规模的比较,不需要监督 微调 (SFT) 并且仅使用 1 个 RL 训练数据,它超越了 VideoRFT-3B,在广泛使用的基准上平均增益 3.2%,在 VideoMME 上领先 7%。对于跨尺度比较,它在多个基准测试中优于较大的 Video-UTR-7B 模型,包括在 MVBench 上提高 2.1%,在 TempCompass 上提高 3.8%。代码可在 https://github.com/falonss703/VideoThinker 获取。