论文
3DHarnessBench:探索前沿视觉语言模型的代理 3D 代码功能
3DHarnessBench: Probing Agentic 3D-to-Code Capabilities of Frontier Vision-Language Models
摘要
我们推出了 3DHarnessBench,这是一个基准测试,用于评估前沿视觉语言模型 (VLM) 从各种输入将 3D 几何形状恢复为 Blender Python 代码的代理能力。与以前使用固定输入(例如,单个渲染或文本描述)提示 VLM 的框架不同,3DHarnessBench 评估四个独立的Harness设置,这些设置逐渐启用主动代理探索,并由最近的 Blender MCP 功能促进。我们从单视图、多视图、主动视觉(任意视点访问)和全 3D 交互(通过 Blender 函数调用完全访问目标对象)的层次结构探索模型在视觉感知和主动推理、工具调用和自我校正方面的能力。我们观察到,所有前沿模型恢复 3D 几何的能力随着更丰富的函数调用访问而显着提高,尽管这些改进强烈依赖于模型,揭示了高度不均匀的代理 3D 到代码功能。我们将发布用于可重复 3D 评估的基准、代码、输出和代理轨迹。