论文
CVPR 2026 VidLLMs 挑战赛中保证金触发问题重新仲裁的答案自我一致性
Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge
摘要
在本报告中,我们介绍了 CVPR 2026 VidLLMs 挑战赛第 2 场的解决方案。该轨道评估视频中的视觉关系推理,其中模型必须推断并不总是明确可见的关系。我们提出了答案自我一致性与保证金触发问题重新仲裁(ASC-MQRA),这是一种基于多模态推理模型构建的 无需训练 测试时推理框架。核心 ASC 组件执行多个随机视频问答运行,并通过答案级别的自我一致性来聚合他们的答案选择。这大大改进了单遍推理,并形成了我们的最终测试提交。我们进一步研究了 MQRA,这是一种针对低票差样本的条件重新仲裁模块,其中第一阶段投票分布表明存在不确定性。我们的选票差额分析表明,低差额示例通常会在最佳候选人中保留 真值 答案,从而促使 MQRA 缩小候选人集范围,并仅在保留的候选人中重新观看视频。在验证中,MQRA 比 ASC 进一步改进,表明低利润投票分布可以提供有用的不确定性信号。然而,在测试中,相对于 ASC,MQRA 的性能略有下降,这表明重新仲裁对触发子集的大小和类别分布很敏感。因此,我们的最终测试提交使用 ASC,无需重新仲裁,验证时达到 72.73 平均准确度和 78.34 类别宏观平均准确度,测试时达到 81.16 平均准确度和 80.91 类别宏观平均准确度。本报告详细介绍了我们的提示策略、实施设置、消融研究和诊断分析。该代码位于 https://github.com/data-analytics-labo/ASC-MQRA