论文
MindWorldBench:评估图像到视频生成中的心理状态到行为推理
MindWorldBench: Evaluating Mental-State-to-Behavior Reasoning in Image-to-Video Generation
摘要
当前的图像到视频模型实现了视觉真实性和物理合理性,但关于心理状态的推理仍有待探索。行动是由信念、欲望和感知驱动的,需要超越明确指令的推理。我们引入 MindWorldBench 来评估精神状态调节的视频生成。我们将其形式化为心理状态到行为推理,其中模型根据世界状态和潜在变量生成动作,而无需明确的动作提示。 MindWorldBench 利用零动作提示和具有 744 个提示的反事实设计来隔离心理状态的因果影响。自动化管道可评估视频质量、常识合理性和心理状态一致性。对 11 个模型的评估表明,尽管具有视觉保真度和物理推理能力,模型仍无法将行为与潜在的心理状态保持一致。我们确定了一种失败模式,称为全知偏差,其中模型默认为客观世界状态而不是人类的主观信念。这些结果证明了视觉生成和认知推理之间的脱节,表明需要在视频生成系统中进行明确的心理状态建模。项目网址:https://richard2049-lee.github.io/MindWorldBench/