论文

为任意视频时序定位模型提供保形覆盖保证

Conformal Coverage Guarantees for Any Video Temporal Grounder

模型推理推理验证与自校正

摘要

连续视频中的事件边界存在歧义:同一查询与视频交由不同标注者重新标注时,大量样本的事件区间重叠不到一半。因此,视频时序定位的真实标签应视为区间上的分布,但现有模型只返回单一区间而不说明可靠性。COVER是事后、模型无关的包装方法,适用于已训练的定位器或黑盒视频语言模型。它在留出标签上校准时序不符合度分数的分位数,再相应扩展原始预测,使输出区域以至少1−α的概率包含真实事件。在可交换性条件下,这一保证适用于有限样本、无需假设特定分布,也不要求重新训练或白盒访问。论文提出两类分数:针对区间输出的双侧边界扩展分数,以及针对相关性信号的上水平集分数,并分析认证区域大小、按事件长度条件化时的覆盖,以及同一视频多个事件破坏可交换性后的退化。三个基准、五个定位模型上,实际覆盖率接近目标水平,校准也揭示了单点指标掩盖的问题。