论文

当视频误读时:用于探索性操作跟踪 QA 的阅读启发式闭环 蒸馏

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

上下文与知识上下文工程

摘要

探索性操纵通常会将明显失败的尝试变成下一步行动的关键证据。例如,机器人拉动一个上锁的柜子抽屉,失败,只有在打开锁后才成功。失败的拉动揭示了一个潜在的前提条件(抽屉被锁定),它决定了最小成功动作链(完成任务的最少动作),这里是[锁打开,抽屉拉动]。因此,正确读取该跟踪是恢复该链的先决条件。我们将这种设置形式化为探索性操作跟踪 QA (EMT-QA):给定来自探索性跟踪的同步视频和本体感觉,在探针揭示的潜在前提下预测最小成功动作链。然而,即使是最先进的 VLM 和体现的多模态 LLM 也误读了这一证据:它们无法可靠地从原始视频、原始本体感受或其组合中恢复链条。我们引入了闭环跟踪 蒸馏,这是一种使用每个任务 编码智能体 来检查标记的训练跟踪并在跟踪上提取单行自然语言提示的管道,我们将其称为蒸馏阅读启发式 (DRH)。推理时,不调用代理,也不更新模型权重;冻结的 VLM 接收原始跟踪加上 DRH 作为提示条目。在三个模拟器和两个真实机器人任务中,DRH 将链精度比最佳原始模态基线提高了 +0.38 至 +0.47。相同的 DRH 还充当与提示的 VLM 匹配的一次性编程分类器的唯一规范。