论文

DynaPix:视觉语言模型能否识别确切的未来?

DynaPix: Can Vision-Language Models Identify the Exact Future?

模型评测基准与评测资源

摘要

在物理场景中表演需要了解其真实的后期状态,而不是看似合理的状态。当前的评估通常接受文字或逼真的图像,因此预测状态永远不会与真实状态进行检查。我们引入了 DynaPix(动态像素),这是一个可以检查预测的基准。给定一个在关键事件之前停止的视频剪辑以及有关稍后时刻的问题,模型必须从接近的候选者或大型图库中挑选出真实的未来图像。这些场景来自物理模拟器,因此正确的图像及其时间是准确已知的,并且错误的选项是故意相似的。当可见事件标记目标时刻时,模型通常会成功,但当仅经过时间标记时,模型几乎是偶然的。图库搜索更加困难,因为真实的图像很少排在第一位。人们很好地处理经过时间的项目,因此困难在于模型,而不是问题。对从模拟器的真实记录(而不是老师的猜测)中提取的场景帐户进行训练可以修复大部分问题,但不能修复经过时间较长的情况。因此,DynaPix 暴露了时间锚定间隙:模型将预测附加到事件上,而不是附加到时间本身。