论文
Agentic机器人的递归视频情境学习
Recursive Video In-Context Learning for Agentic Robot
摘要
LLM智能体编排冻结的视觉-语言-动作 (VLA) 策略通过文本记忆跨情节进行改进,该文本记录智能体做了什么,但不记录任务是如何完成的。演示视频显示了这一点,但不太适合智能体的环境。完整的视频每回合都会变慢,固定关键帧会丢失决定抓握是否有效的接触细节,并且智能体需要的内容从任务结构转移,同时规划到每个接触周围的帧。我们引入了递归视频情境学习 (RV-ICL),这是一种无需训练方法,可将演示转变为智能体导航的层次结构,而不是它收到的提示。该层次结构是根据演示的子事件(例如抓取和释放)构建的。它的关卡变得更加精细,从整个任务的关键帧到阶段、时刻和短片,并通过只读工具公开。 智能体在规划之前读取粗略级别。在执行期间,只要步骤需要更多细节,它就会重新进入层次结构,并仅加载其当前子目标的剪辑。每个任务一次演示就足够了。 RV-ICL 基于 RPent 构建,将 LIBERO-PRO 上的成功率从 92.6% 提高到 96.5%,将 LIBERO-Plus 上的成功率从 86.7% 提高到 95.8%。
