论文
使用视觉语言模型进行校准概率障碍推理,用于杂波中的抓取
Calibrated Probabilistic Obstruction Reasoning with Vision-Language Models for Grasping in Clutter
摘要
从混乱中检索目标需要决定是抓住目标、移除障碍物还是推迟。现有方法通常致力于单个障碍图或移除策略,忽略替代场景解释之间的不确定性。它们还依赖于错误校准的视觉语言模型(VLM)预测,并且可能产生共同不一致的成对阻碍关系。此外,当前的近似值无法保证放弃的假设对最终决策的影响。我们提出了 CPOR-Grasp,一种经过校准的概率阻塞推理框架,它将不确定性从成对证据传播到行动决策。 CPOR-Grasp 校准并融合 VLM、深度和非模态掩模线索以估计阻塞概率,在有效阻塞图上得出分布,并在这些图上边缘化以计算目标可访问或给定阻塞物应被移除的可能性。为了使推理易于处理,它仅保留最高概率的图,并在丢弃的概率质量上得出总变异界限,从而实现经过认证的决策、自适应停止和有原则的延迟。在合成和真实 UNOBench 场景中,CPOR-Grasp 的性能优于最先进的基线。 Gemini Robotics 主干上的校准误差从 0.1416 减少到 0.0185,而图截断则使用减少 56 倍的图来匹配 99.74% 决策的精确推理。在实际实验中,CPOR-Grasp 的平均成功率达到 77.8%,超过了 SOTA 基线。