论文
Agentic Real2Sim:使用视觉语言代理进行基于物理的世界建模
Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents
摘要
机器人与物体交互的实数到模拟转换仍然是劳动密集型的,因为它需要的不仅仅是视觉重建:简化的 real2sim 流程必须恢复场景几何形状和物体状态,推断物理参数,并将演员、物体、相机、姿势和轨迹组装成可运行的物理模拟。如今,这个过程仍然依赖于跨视觉感知工具和模拟器的脆弱工作流程:手动调整视觉基础模型、网格清理、坐标系对齐等。我们引入了 \textit{Agentic Real2Sim},这是一个使用视觉语言代理进行广义物理世界建模的框架,它将真实世界的对象-机器人交互记录转换为可模拟的情景孪生,并将生成的孪生连接到下游策略 微调 和评估。我们在刚性对象操作、可变形对象交互和人形运动场景上评估 Agentic Real2Sim,跨越通常由单独的 Real2Sim 管道处理的领域。该框架的代理决策可以由开放重量的 VLM 后端驱动,成本仅为前沿模型的一小部分,同时获得可比的转换成功率。该框架还支持自定义场景转换、预训练策略的 微调 以及从转换的片段生成的数据,并且可以有效地作为现实世界策略评估的替代。该项目站点(包括代码)可在 https://agentic-real2sim.github.io 上找到。