论文

VRR-QA 挑战视频关系推理的自适应密集证据细化

Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

模型推理测试时计算扩展

摘要

VRR-QA 评估视频语言系统是否可以推断空间、时间、视点、深度和可见性关系,而这些关系并不总是由单帧解析。我们提出了一个围绕自适应测试时间计算构建的纯推理系统。该系统首先通过直接视频语言模型传递回答每个问题,然后使用多个轻量级视图来查找不稳定的问题。只有这些困难的问题才会被路由到高预算的密集证据模块,该模块构建带时间戳的帧观察、特定于关系的探测、候选验证和保守的时间聚合。这种设计区分了视频问答中经常混淆的两个问题:寻找看似合理的替代答案和决定何时实际更改当前答案。在测试分割上,最终系统获得了90.07的平均准确度和87.81的宏观平均准确度。该报告重点介绍了最终的测试系统以及重现自适应密集验证器所需的实现设置。