论文

APT:因果视频语言理解的原子物理转换

APT: Atomic Physical Transitions for Causal Video-Language Understanding

模型训练参数高效训练

摘要

物理事件不能仅通过其名称来理解,还可以通过构成它们的因果状态变化来理解。诸如“反弹”之类的剪辑级标签可以是正确的,同时隐藏使事件物理有效的过程,从支撑损失和接触开始到反弹和稳定。为了使这个隐藏的过程变得明确,我们引入了原子物理转变(APT):最小的、暂时局部的状态变化,将可见的线索绑定到活跃的物理机制和动态机制之前/之后。 APT 链将视频表示为有序的因果转换序列,而不是单个聚合事件标签:事件标签告诉发生了什么; APT 链解释了它发生的原因。为了使 VLM 能够学习 APT,我们从人类注释和模拟器 真值 构建了混合源 APT 数据,涵盖接触、重力、摩擦和旋转/稳定性的 14 种转换类型,在 1,246 次试验中包含 27,303 个定时实例。使用这些数据,我们发现当前的 VLM 错过了过渡级物理,零样本召回率最多为 14%,错误主要由错过的过渡引起。 APT 链上的直接 微调 改进了转换检测,但会导致事件级遗忘,这表明模型学习了专门的答案格式,而不是可重用的物理表示。因此,我们提出了 APT-Tune,这是一种参数高效的方法,可以教会 VLM 使用因果转换,而不会忘记如何回答视频问题。它结合了图像板感知监督、格式条件协同训练和机制条件域到类型解码,使 APT 学习格式具有鲁棒性并以物理规律为依据。由于 Qwen3-VL-2B 上只有 11 M LoRA 参数,APT-Tune 显着提高了 APT 召回率,同时还改善了事件级视频传输。这些结果表明,APT 并不是一种新的答案格式,而是一种用于物理视频理解的人性化因果监督信号。