论文

时空视频定位中的查询不敏感行为

Investigating Query-Insensitive Behavior in Spatio-Temporal Video Grounding

模型评测鲁棒性、公平性与可信度评测

摘要

时空视频定位(STVG)旨在在空间和时间上定位自然语言查询描述的对象或事件。现有的 STVG 模型通常是在每个查询都与输入视频相关的假设下进行训练和评估的。在这项工作中,我们通过研究最先进的 STVG 模型在不相关查询和缺失文本输入下的行为来挑战这一假设。我们的实验表明,即使查询与视频无关或完全删除,当前模型仍然可以产生合理的时空预测。我们进一步分析 HCSTVG-v2 和 VidSTG,以确定可能鼓励这种查询不敏感行为的数据集规律。我们的研究强调了 STVG 模型尚未充分探索的局限性,并激发了明确评估查询相关性的负样本感知评估协议和架构。