论文

ManiPhysicsBench:VLA操作的物体保全物理评估

ManiPhysicsBench: Physics-Based Assessment of Object Preservation in VLA Manipulation

模型评测基准与评测资源

摘要

视觉-语言-动作(VLA)模型旨在执行多样操作任务,但既有刚体基准的任务成功并不表明其保全了物体。我们提出ManiPhysicsZoo:把文献支持的材质属性、3D网格与支撑参考整合为可复用的物体资产。基于这些资产,基于求解器的评估从物体几何、材质属性与记录的抓取条件计算抓取特定的损伤阈值,并与记录的接触力比较以评估潜在形变与断裂。在此基础上,ManiPhysicsBench在LIBERO与SimplerEnv上跨三个物理轴、三个难度级别评估物体保全。公开VLA检查点显示任务成功与安全成功(完成任务且保全物体)之间存在实质差距:其夹爪命令集中于全开与全闭附近、跨物体的聚合分布大体相似,与二元夹爪监督一致。我们通过重训VLA模型检验物体特定连续抓握标签如何改变模型行为:重训模型表现出更依赖物体的抓握与更高的安全成功,但任务成功率更低、保物行为的泛化有限。