论文
TimePLE:重新思考视频时间基础的时间表示
TimePLE: Rethinking Temporal Representation for Video Temporal Grounding
摘要
视频时间基础(VTG)旨在定位自然语言查询描述的连续视频间隔。然而,当前基于 VLM 的方法通常通过两个端点输出间接产生此间隔,表示为离散时间戳标记或连续边界坐标。这些公式的不同之处在于端点的编码方式,但不在于预测的内容:事件间隔仍然是派生对象,而间隔有效性、持续时间和间隔级别相似性仅隐式处理。我们提出了 TimePLE,它通过预测有效时间间隔上的单个联合分布,将 VTG 从端点预测重新表述为间隔本地基础。 TimePLE 将每个间隔映射到规范位置持续时间正方形中的一个点,其中每个支撑点对应于一个有效的跨度,相邻点代表几何上相似的间隔。给定视频和查询,VLM 生成单个潜在 <|TIMESPAN|> 标记,其隐藏状态被解码为联合间隔分布,通过持续时间感知坐标校正进行细化,并转换为连续边界。相同的间隔表示用于对输入时间锚点进行编码,从而将视频侧时间证据与输出侧跨度预测对齐。为了可靠地将潜在跨度表示与完整的事件间隔对齐,我们策划了 90K 规模的时序定位样本并进行人工验证 3K 规模的基准注释。四个 VTG 基准的实验表明,TimePLE 始终优于端点预测基线,平均 mIoU 达到 58.9,在短期和中等持续时间事件上有明显的收益。