论文

视觉语言模型距离构建真实世界有多远?物理生成推理基准

How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning

智能体系统Agent任务评测

摘要

物理世界并非仅仅是视觉的,它受严格的结构与流程约束支配。然而,视觉语言模型(VLM)的评估仍严重偏向感知真实性,优先考量生成视觉上可信的3D布局、形状与外观。现有基准很少检验模型是否掌握真正建造这些物件所需的逐步流程与物理依赖关系,而这一能力对自动化设计到施工的管线至关重要。为此,我们提出DreamHouse,一个面向物理生成推理的新基准:即综合生成同时满足几何、结构、可施工性与规范合规约束的物件的能力。我们将该基准锚定于住宅木构架建造这一领域,其工程标准完全成文化、正确性可客观验证。我们精选了超过26,000个覆盖13种建筑风格的结构,均经验证达到施工图文件标准(LOD 350),并开发了确定性的10项测试结构验证框架。与仅评估最终输出的静态基准不同,DreamHouse支持迭代式智能体交互。模型观察中间建造状态、生成施工动作并接收结构化环境反馈,从而实现对规划、结构推理与自我纠正的细粒度评估。对最先进VLM的大量实验揭示了在现有排行榜上基本不可见的重大能力差距。这些发现将物理有效性确立为与视觉真实性正交的关键评估维度,凸显物理生成推理是多模态智能中独特且欠发达的前沿。项目页面见 https://luluyuyuyang.github.io/dreamhouse。

视觉语言模型距离构建真实世界有多远?物理生成推理基准:论文配图
图 2:DreamHouse 数据集概述。 (上)数据集统计数据显示所有 13 种架构风格的成员计数分布(箱线图,左轴)和风格比例(虚线,右轴),按结构复杂性递减排序。会员人数从 133 人到 1,548 人(平均 673 人)不等。 (下)代表性的 Cycles 渲染的每种风格的木框架结构:庭院、十字形、殖民地、错层、谷仓、牧场、联排别墅、Z 形平面、马车、农舍、盐箱、猎枪、A 形框架,跨越复杂的多翼配置到紧凑的单层形式。