论文

BoxTuning:直接注入多模态模型 微调 的对象框

BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning

模型训练监督微调与指令调优

摘要

对象级时空理解对于视频问答至关重要,但现有的多模态 大语言模型 (MLLM) 对帧进行整体编码,缺乏细粒度对象定位的明确机制。最近的工作通过将边界框坐标序列化为文本标记来解决这个问题,但这种文本坐标范式存在基本的模态不匹配问题:对象信息本质上是视觉的,但将其编码为文本会产生很高的标记成本,从而强制进行积极的时间下采样。我们提出了 BoxTuning,它通过将对象时空信息直接注入视觉模态来解决这种不匹配问题。彩色边界框和轨迹轨迹作为视觉提示渲染到视频帧上,仅保留简洁的颜色到对象图例作为文本。这显着降低了词元成本,在实践中实现了 87-93% 的文本词元减少。它还保留了完整的时间分辨率,其中轨迹轨迹进一步编码每个关键帧内的帧间运动方向和速度,恢复文本坐标方法被迫丢弃的细粒度动态。五个视频 QA 基准(CLEVRER、Perception Test、STAR、NExT-QA、IntentQA)的实验结果表明,BoxTuning 在面向空间的任务上超越了文本坐标基线,并且几乎消除了在以推理为中心的任务上观察到的准确性下降,将视觉提示建立为向视频 MLLM 传递对象信息的更自然、更有效的范例。