论文
ChronoPhyBench:MLLM 真正理解世界还是仅仅利用语言先验?
ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?
摘要
多模态 大语言模型 (MLLM) 的最新进展表明了其在开放世界推理和理解方面的卓越能力。然而,一个关键的模糊性仍然存在:目前尚不清楚这些模型是否真正综合跨模态信息来构建物理基础推理链,或者它们是否只是利用强语言先验来掩盖单模态依赖,从而产生先进的多模态能力。受此启发,为了严格减轻语言模态偏差和捷径,我们提出了一种新颖的多模态时间逻辑物理动力学推理基准 ChronoPhyBench,它通过以历史视频上下文和文本描述为条件,将下一状态预测与视觉问答(VQA)范式统一起来,以强制模型通过单图像选择和多帧时间顺序排序的固有更复杂的任务来推断后续物理状态。同时,我们构建了一个使用 ChronoPhyBench 标准策划的大规模多模态推理数据集,其中包含 10,000 多个长视频以及精心注释的字幕,总计 500 万个标记。我们的实验评估揭示了与之前基准得出的结论形成鲜明对比。当前开源模型执行基于物理的多模态推理的能力仍处于起步阶段。最终,这项工作旨在系统地对多模态模型的推理能力进行压力测试,量化幻觉率,并推动物理人工智能的发展,从而为社区提供一个强大而透明的通用人工智能(AGI)评估框架。