计划、观察、恢复:主动程序协助的基准和架构
Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance
摘要
我们设想了一个主动的多模式助理系统,它为用户提供有关程序任务的实时分步指导,自主决定\textit{何时}中断,以及\textit{如何}指导。然而,由于缺乏反映现实条件的大规模跨领域基准,特别是用户偏离预期步骤顺序的常见情况,进展受到限制。我们通过四个贡献来解决这一差距: \textbf{(1)}~我们发布了 \textbf{EgoProactive},这是一个以自我为中心的大规模可穿戴数据集,用于通过明确的计划外 (OOP) 注释和恢复步骤提供主动程序协助; \textbf{(2)}~我们在统一的主动指导模式下将五个已建立的基准(Ego4D、EPIC-KITCHENS、EgoExo4D、HoloAssist、HowTo100M)增强到 \textbf{Pro\textsuperscript{2}Bench} 中; \textbf{(3)}~我们提出了一个\textbf{解耦规划器——交互架构},专门用于程序状态、视觉提示和恢复注入; \textbf{(4)}~我们引入了一种可跨模型系列传输的 后训练 配方,并通过 Llama~4 和 Qwen-3.6-VL 上的跨主干复制进行验证。在广泛的实验中,我们训练有素的 Llama-4 系统在所有六个数据集上比强大的专有基线(Claude Opus~4.6、Gemini~3.1~Pro、GPT~5.2)和开放权重基线(Qwen3~VL~235B)基线显着提高了客观干预质量。 Oracle 计划实验进一步表明,当计划质量得到控制时,经过训练的双工模型会产生高质量的指导并在计划外恢复方面获得巨大收益。