论文

PhysV2A:视频到机器人操作的可达性门控和语义掩码约束的可行性完成

PhysV2A: Reachability-Gated and Semantic-Mask-Constrained Feasibility Completion for Video-to-Robot Manipulation

摘要

基于视频的操纵通过人类演示、生成的视频或 RGB-D 观察提供以对象为中心的运动先验,但此类先验通常与实施例无关,并且无法由特定机器人直接执行。本文提出了 \textbf{PhysV2A},这是一种可达性门控和语义掩码约束的可行性完成框架,用于将视频衍生的 6D 对象运动转换为机器人可执行的操纵轨迹。关键思想是将抓取可行性视为轨迹条件而非局部:每个 RGB-D 生成的 6-DoF 抓取候选者与恢复的对象运动严格耦合,以形成抓取条件 TCP 轨迹假设。然后,PhysV2A 执行分层可达性门控选择,其中以机器人为中心的运动学检查拒绝不可行的抓取轨迹对,并根据下游执行适用性对幸存的候选对象进行排名。对于选定的可达轨迹,VLM 辅助且经过规则验证的 S-Mask 识别任务关键且可松弛的笛卡尔组件,通过冗余优先优化和有界笛卡尔松弛实现语义掩模约束的可操作性细化。针对四个桌面操作任务的真实机器人实验表明,PhysV2A 比代表性视频先验和仅 IK 基线提高了任务成功率,减少了运动学可行性失败,并生成具有有限语义偏差的条件更好的轨迹。