论文

SceneActBench:智能体能对其所见的3D场景采取行动吗?

SceneActBench: Can Agents Act on the 3D Scenes They See?

模型评测基准与评测资源

摘要

视觉语言模型(VLM)智能体越来越多地使用工具对 3D 场景采取行动,而不仅仅是描述它们。现有 3D 基准只对文本响应或单对象操作评分,智能体对完整多对象 3D 场景的行动则缺乏评估。我们提出 SceneActBench,一个在统一智能体-环境循环下、横跨五个 3D 任务的视觉条件化行动基准。给定 PNG 图像或采样的视频帧,以及在适用时提供的 3D 资产,智能体在 3D 环境上执行操作。我们使用任务特定的几何指标,将每个最终输出与隐藏的真实标注进行比较评估。SceneActBench 包含由 210 个源实例构建的五个任务,产出 520 个任务案例(含成对输入条件)。每个任务都通过同一个固定的智能体循环运行,以保证比较公平。在十一个专有 VLM 配置上,总体得分介于 38.6-50.2 之间,且没有一个模型在所有任务上表现持续良好。我们进一步分析了失败在何处以及如何显现。

SceneActBench:智能体能对其所见的3D场景采取行动吗?:论文配图
图 9:输入条件灵敏度因配置而异。单元格显示固定参考任务分数从基本条件到替代条件的变化。布局在 100 个配对案例中比较多视图与单视图输入; Dynamic 将 10 个配对场景的照片级真实感与低多边形输入进行比较。正值有利于替代条件,该条件仍被排除在总体之外。