论文

Agentic机器人的递归视频情境学习

Recursive Video In-Context Learning for Agentic Robot

上下文与知识上下文工程

摘要

LLM智能体编排冻结的视觉-语言-动作 (VLA) 策略通过文本记忆跨情节进行改进,该文本记录智能体做了什么,但不记录任务是如何完成的。演示视频显示了这一点,但不太适合智能体的环境。完整的视频每回合都会变慢,固定关键帧会丢失决定抓握是否有效的接触细节,并且智能体需要的内容从任务结构转移,同时规划到每个接触周围的帧。我们引入了递归视频情境学习 (RV-ICL),这是一种无需训练方法,可将演示转变为智能体导航的层次结构,而不是它收到的提示。该层次结构是根据演示的子事件(例如抓取和释放)构建的。它的关卡变得更加精细,从整个任务的关键帧到阶段、时刻和短片,并通过只读工具公开。 智能体在规划之前读取粗略级别。在执行期间,只要步骤需要更多细节,它就会重新进入层次结构,并仅加载其当前子目标的剪辑。每个任务一次演示就足够了。 RV-ICL 基于 RPent 构建,将 LIBERO-PRO 上的成功率从 92.6% 提高到 96.5%,将 LIBERO-Plus 上的成功率从 86.7% 提高到 95.8%。

Agentic机器人的递归视频情境学习的原论文方法或结果图
图 1:RV-ICL 对 LIBERO-PRO 的 LIBERO-10 套件任务的概述。 智能体以层次结构形式接收一个任务演示 (a),并在以新布局 (b) 解决相同任务时查阅它。 (a) 该层次结构有四个级别:$L_{0}$ 事件驱动的关键帧(细线标记其时间)、$L_{1}$ 抓取和释放之间的阶段、$L_{2}$ 围绕每个子事件的时刻以及 $L_{3}$ 20 帧剪辑(此处为第一个抓取)。 (b) 一个已解决的评估事件的工具调用(连续呼叫分组,机器人动作为灰色,重新进入为橙色)。 智能体在规划时读取 $L_{0}$–$L_{2}$,并仅在执行期间加载剪辑。每次重新进入都会加载当前子目标的剪辑:抓住、释放或关闭门。