论文
PhysMLLMs:面向图像与视频统一指代分割与视觉证据对齐推理的空间先验
PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos
摘要
视频多模态大语言模型支持语言引导的视频分割,但它们常常表现出时空不一致,例如抖动、漂移与身份切换。当目标被部分遮挡或附近出现相似物体时,这类失败更为常见。一个可能的原因是当前训练缺乏显式的空间先验,使得难以随时间维持稳定的空间身份与形状。我们提出PhysMLLMs,一种训练阶段先验注入架构,将受物理学启发的空间连续性先验注入视频MLLM。PhysMLLMs旨在通过在训练期间将学生模型的全局视觉表示与冻结的教师模型对齐,来促使更稳定的以物体为中心的表示。其核心机制——全局表示先验对齐(REPA-Global)——使用离线嵌入缓存与计划式蒸馏方案,从冻结的DINOv2教师蒸馏全局视觉表示。这一设计保持推理过程不变,不增加推理时间成本。在多个视频基准上,PhysMLLMs提升了视频分割掩码质量与跨帧一致性,在小目标、快速运动、遮挡、干扰物与推理查询等具有挑战性的情形中增益更大。在单帧指代图像分割与代表性通用VLM基准上,PhysMLLMs保持了相当的性能,表明注入的空间先验在不损害图像级目标定位或通用多模态能力的情况下改善了视频一致性。这些结果提示,受物理学启发的空间先验注入可以在保持通用能力的同时提升时间稳定性。代码可在 https://github.com/tusu-code/20260121-icml2026-2.git 获取。
