论文

MATEO:面向 LVLM 时序推理与规划的多模态基准

MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs

模型评测基准与评测资源

摘要

AI 智能体需要规划来实现复杂目标,这涉及协调感知、子目标分解与执行。这些计划由按时间执行顺序(TEO,一种确保每步只在其前提满足后执行的有向无环图)结构化的有序步骤组成。关于基础模型对时序执行理解的研究,仅限于自动派生的标注、把 TEO 近似为线性链,或纯文本输入。为填补这一空白,我们提出 MATEO(MultimodAl Temporal Execution Order),一个旨在评估并提升大型视觉语言模型(LVLM)真实世界规划所需时序推理能力的基准。我们获取了高质量的专业多模态食谱语料库,通过标准化编辑流程撰写,将指令分解为离散步骤,每步配有对应图像。通过设计并使用可扩展的众包流水线,我们以图的形式收集 TEO 标注。利用 MATEO,我们跨模型规模评估了六个最先进 LVLM,并变化语言上下文、多模态输入结构和微调策略。

MATEO:面向 LVLM 时序推理与规划的多模态基准
图 7:注释指南中提供的注释工具的图示。突出显示的区域(以红色字母标记)表示关键功能,包括拖动步骤、添加或删除连接以及保存注释。