论文
你的VLM已知道事件何时发生:通过是非问答实现无需训练的时序定位
Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No
摘要
多模态LLM即使能可靠识别事件,也未必能准确指出其发生时间。直接要求时间戳时,较强VLM在Charades-STA上的R@0.5最低仅3.8%,且77%–80%的错误预测具有低输出熵,模型自信地出错,基于熵的错误检测甚至低于随机分类器。研究将问题定位于任务接口而非感知能力:保持权重不变,用从粗到细的二元问题扫描替代时间戳回归,仅将首词元概率用于排序,在四个冻结骨干上使R@0.5提高28至50个百分点。剩余失败可分为随骨干变化的感知因素,以及由输出窗口与事件宽度比例决定的几何因素。基于这一分析构建的无需训练方法FV-Action,在Charades-STA上达到56.8%的R@0.5,高于同一骨干的原生定位流程及该基准上最强的无需训练结果;在TACoS零样本评估中超过所比较的全部经过时序定位训练的模型,并在ActivityNet Captions与QVHighlights上优于直接预测,全过程不使用时序监督。