论文
Agentic RAG-VLM:面向机器人抓取的可供性感知检索增强生成与自反思规划
Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping
摘要
杂乱环境中的通用机器人抓取对于在非结构化人类空间中部署操纵器至关重要,但现有的基于 VLM 的方法依赖于视觉相似性进行对象匹配,忽略了物理可供性(例如手柄可抓取性和材料易碎性),并且在没有空间推理或故障恢复的情况下进行开环操作,当对象密集或物理多样化时限制了其有效性。我们提出了 Agentic RAG-VLM,这是一个统一的框架,通过将检索增强生成 (RAG) 与视觉语言模型 (VLM) 和代理自我反思规划相结合,将基于 VLM 的语义理解和遵循物理约束的抓取执行联系起来。 Agentic RAG-VLM 引入了三个紧密耦合的组件:(1)分层可供性感知 RAG(HAA-RAG),编码四维可供性描述符,包括类型、材料、脆弱性和可抓区域,并通过功能可供性兼容性而不是视觉外观来检索策略; (2) 场景图约束推理器,从 VLM 感知构建空间关系图,并将邻近度、遮挡和支撑约束转化为具体的抓取参数调整; (3) 具有 14 种故障分类法和三级自适应重试的代理自反射管道,用于闭环掌握细化。在跨越单抓取、交互式和长视野场景的 12 任务基准测试中进行评估,每种配置进行 360 次试验,Agentic RAG-VLM 取得了 78.3% 的总体成功率,比仅 VLM 的基准提高了 53.3 个百分点的绝对收益,这表明可供性感知检索、场景图推理和代理恢复对于鲁棒操作来说共同至关重要。
