论文
Video-ToC:视频线索树推理
Video-ToC: Video Tree-of-Cue Reasoning
摘要
现有视频 大语言模型(视频 LLM)难以理解复杂的视频,表现出有限的推理能力和潜在的幻觉。特别是,这些方法往往仅依赖于预先训练的固有推理原理来执行推理,同时缺乏对输入视频内容的感知感知适应。为了解决这个问题,我们提出了 \textbf{Video-ToC},这是一种新颖的视频推理框架,可以通过线索树推理来增强视频理解。具体来说,我们的方法引入了三个关键创新:(1)树引导的视觉线索定位机制,通过结构化推理模式赋予模型增强的细粒度感知能力; (2)推理需求奖励机制,根据推理需求的估计动态调整强化学习(RL)的奖励值,实现按需激励以实现更有效的推理策略; (3) 一个自动注释管道,分别构建用于监督 微调 (SFT) 和 RL 训练的 Video-ToC-SFT-1k 和 Video-ToC-RL-2k 数据集。对六个视频理解基准和视频幻觉基准的广泛评估证明了 Video-ToC 相对于基线和最新方法的优越性。代码可在 https://github.com/qizhongtan/Video-ToC 获取。