论文
AdaThinkV:词元高效视频推理的自适应思维
AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
摘要
思想链 (CoT) 推理可以提高困难视频问题的性能,但通常会浪费简单问题的解码标记。我们研究视频多模态 大语言模型 是否可以针对每个问题调整其推理工作。我们提出了 AdaThinkV,一种用于视频推理的自适应框架,它可以学习是否在没有离线难度标签、手动调整置信度阈值或外部路由器的情况下进行显式推理。在强化学习过程中,AdaThinkV 对每个提示以显式推理和直接回答模式进行匹配的采样。 ThinkGain 通过平衡准确度增益与额外响应长度来估计显式推理的提示级效用,为条件响应生成和自主模式选择提供监督。对于困难的提示,有限的轨迹采样探索可能会产生每个响应都不成功的组,并且准确性奖励几乎没有变化,从而为学习提供了不足的信号。因此,我们引入了方差恢复策略优化(VRPO),它保留并逐步扩展这些组,以从困难但可解决的提示中恢复信息信号。在推理时,AdaThinkV 选择响应模式并以单个自回归序列生成响应。在一套统一的视频推理评估中,AdaThinkV 的平均准确度为 40.79,平均有 257.20 个输出标记,比最强的评估自适应基线高 2.98 个点,同时使用的标记少了 22.7%。项目页面:https://trilarflagz.github.io/AdaThinkV/