论文

TPRU:推进大型多模态模型的时序与程序性理解

TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models

模型训练合成数据

摘要

多模态大语言模型(MLLM),尤其是较小的可部署变体,在理解时序与程序性视觉数据上存在关键缺陷,成为其在现实具身AI中应用的瓶颈。这一缺口主要源于训练范式的系统性缺失——缺乏大规模、程序上连贯的数据。为解决该问题,我们提出TPRU,一个大规模数据集,取材自机器人操作与GUI导航等多样具身场景。TPRU经系统设计,通过三个互补任务培养时序推理:时序重排(Temporal Reordering)、下一帧预测(Next-Frame Prediction)与上一帧回顾(Previous-Frame Review)。一个关键特性是加入具挑战性的负样本,促使模型从被动观察转向主动的跨模态验证。我们以强化学习(RL)微调方法利用TPRU,专门面向提升资源高效型模型。实验显示方法收益显著:在人工整理的TPRU-Test上,TPRU-7B准确率从50.33%跃升至75.70%,这一最先进结果显著优于包括GPT-4o在内的大得多的基线。关键是,这些能力能有效泛化,在既有基准上取得显著提升。代码库见 https://github.com/Stephen-gzk/TPRU/ 。

TPRU:推进大型多模态模型的时序与程序性理解
图1:我们的TPRU数据集概览。与既往合成数据集(a)不同,TPRU由真实世界场景构建并组织为时间任务(b)。如能力展示(c)所示,TPRU-7B在时间理解方面取得显著性能提升。