论文

KITE:基于 VLM 的机器人故障分析的关键帧索引标记化证据

KITE: Keyframe-Indexed Tokenized Evidence for VLM-Based Robot Failure Analysis

上下文与知识上下文工程

摘要

我们推出了 KITE,这是一种 无需训练、关键帧锚定、基于布局的前端,可将长机器人执行视频转换为视觉语言模型 (VLM) 的紧凑、可解释的标记化证据。 KITE 将每个轨迹提炼为一小组具有开放词汇检测的运动显着关键帧,并将每个关键帧与示意性鸟瞰图 (BEV) 表示配对,该表示对相对对象布局、轴、时间戳和检测置信度进行编码。这些视觉提示与机器人配置文件和场景上下文标记一起序列化为统一的提示,允许相同的前端使用现成的 VLM 支持故障检测、识别、定位、解释和纠正。在 RoboFAC 基准测试中,采用 Qwen2.5-VL 的 KITE 在 无需训练 设置中比普通 Qwen2.5-VL 有了显着改进,在模拟故障检测、识别和定位方面取得了特别大的进步,同时与 RoboFAC 调整的基准保持了竞争力。一个小的 QLoRA 微调进一步提高了解释和纠正质量。我们还报告了真实双臂机器人的定性结果,证明了 KITE 作为机器人故障分析的结构化和可解释前端的实际适用性。代码和模型发布在我们的项目页面上:https://m80hz.github.io/kite/