论文
RECIPE:通过教学视频进行程序规划
RECIPE: Procedural Planning via Grounding in Instructional Video
摘要
视觉规划要求模型在给定部分视频上下文和目标的情况下以自然语言生成过程的其余步骤。这项任务的进展受到注释的瓶颈:干净的标记数据集很小,域很窄,并且每个示例都编码单个执行轨迹,即使存在许多有效的排序。大规模教学视频语料库提供了更多数量级的程序内容,但来自嘈杂的 ASR 叙述的伪标签上的监督 微调 会传播分割和对齐错误并保持单轨迹。我们发现了一个关键的不对称性:从嘈杂的视频中提取干净的步骤标签很困难,但验证生成的步骤序列是否在时间上基于 ASR 转录本很便宜,并且可以通过预先计算的文本嵌入扩展到数百万个视频。我们在 RECIPE 中利用了这种不对称性,它使用时序对齐质量作为 GRPO 的奖励,将嘈杂的语料库变成验证者而不是标签源。该框架统一适用于两种规划器输入配置(苏格拉底式,通过冻结的 VLM 提取文本历史,以及视频,直接消耗视频词元)以及带注释和弱监督的机制。我们使用基于参考的 LLM 作为法官协议评分计划跨 6 个程序标准对 7 个程序基准进行评估。 RECIPE-RL 在所有尺度(0.5B、3B、7B)和每个基准上都比基本检查点有所改进,域内宏观精度提高了 +7 到 +8 点,零样本高达 +16 点。它在带注释和伪标记计划(后者降低了基础)方面均优于受监督的 微调,并且在没有人工注释的情况下保持稳健。用作先前提议-评估-搜索规划器的提议阶段,它改进了视觉规划辅助中每个视野中最强的零样本基线,并且在 COIN 上它保留了 SFT 崩溃的生成多样性。