论文
PerceptionComp:以感知为中心的复杂推理的视频基准
PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning
摘要
我们引入了 PerceptionComp,这是一个手动注释的基准,用于复杂、长期、以感知为中心的视频推理。 PerceptionComp 的设计使得没有一个时刻是足够的:回答每个问题需要多个时间上分离的视觉证据和联合逻辑和顺序逻辑下的组合约束,跨越对象、属性、关系、位置、动作和事件等感知子任务,并需要包括语义识别、视觉对应、时间推理和空间推理等技能。该基准包含来自不同领域的 279 个视频的 1,114 个高度复杂的问题,包括城市步行游览、室内别墅游览、视频游戏和极限户外运动,并 100% 手动注释。人类研究表明,PerceptionComp 需要大量的测试时思考和重复的感知步骤:参与者花费的时间比之前的基准要长得多,并且当不允许重新观看时,准确性会下降到接近概率(18.97%)。最先进的 MLLM 在 PerceptionComp 上的表现也比现有基准差得多:我们评估中最好的模型 Gemini-3-Flash 在五项选择设置中仅达到 45.96% 的准确率,而开源模型仍低于 40%。这些结果表明,以感知为中心的长视距视频推理仍然是一个主要瓶颈,我们希望 PerceptionComp 能够帮助推动感知推理的进步。