论文
FoldingAgent:从演示视频推断参数化折纸程序
FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos
摘要
我们提出了 FoldingAgent,一个代理框架,用于直接从折纸演示视频推断显式参数化折叠程序。我们的框架利用了预先训练的视觉语言模型(VLM)的推理能力,该模型配备了一套专用工具,使代理能够模拟几何过渡,验证物理合理性,检索和比较视觉内容,并评估自己的预测。为了将视觉内容转化为折叠程序,我们定义了一个参数空间,该空间由纸张的几何形状和一组参数折叠动作组成。与预测静态折痕模式的模型不同,我们的代理按顺序操作并具有重新计划其动作的能力,有效地减轻多步折叠中固有的复合错误。我们的方法朝着缩小人类折纸知识(主要通过非结构化视觉演示共享)和计算方法(通常依赖于结构化参数表示(例如折痕图案或可执行参数计划))之间的差距迈出了一步。我们在 PurelandFold 上评估我们的方法,这是一个新策划的各种 Pureland 折纸视频基准,具有 真值 几何和动作标签。我们的结果表明,通过将 VLM 推理与一组专用工具和物理模拟相结合,我们可以成功地将非结构化视觉演示转换为可执行的、物理上合理的折叠程序。