论文
PhysCaP:通过基于物理的探索将代码作为策略代理落地
PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
摘要
我们提出了 PhysCaP,一种基于物理的代码即策略代理,用于机器人操作中的主动感知。虽然视觉-语言-行动政策擅长模仿示范,但它们依赖于被动观察,无法推断对操纵至关重要的潜在物理特性。 PhysCaP 通过物理信息探索层增强了代码即策略框架,该探索层可通过交互实现显式信息查找。它引入了 无需训练 物理属性提取模块,无需额外的传感器即可通过机器人本体感知来估计物体质量和刚度。为了平衡探索成本和获取信息的效率,PhysCaP 采用了双代理设计:一个 Planner 决定何时探索和何时停止,以及一个 Prioritizer 过滤不可信的交互并使用启发式优先级分数对剩余部分进行排名,从而实现高效、有针对性的探索。我们在现实世界的桌面操作任务(搜索隐藏的物体、检测空罐头和寻找成熟的鳄梨)和 LIBERO 中的模拟任务上评估 PhysCaP。结果表明,现有的被动和幼稚的交互式基线在物理属性被隐藏或过度探索时要么失败,而 PhysCaP 通过更少的交互和减少的执行时间实现了相当的性能。消融研究进一步验证了所提出的物理属性提取模块的有效性。项目页面:https://physcap.github.io