论文

从感知到规划:通过课程学习演化自我中心任务导向的时空推理

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning

模型训练监督微调与指令调优

摘要

现代视觉-语言模型在静态感知方面表现出色,但在具身、自我中心任务所需的复杂时空推理方面仍然受限。失败的一个主要来源是其依赖从被动视频数据中学习到的时序先验,这常导致时空幻觉以及在动态环境中的泛化能力差。为解决这一问题,我们提出EgoTSR,一个基于课程学习的任务导向时空推理框架。EgoTSR建立在如下前提之上:具身推理应从显式空间理解演进到内化的任务状态评估,并最终演进到长程规划。为支持这一范式,我们构建了EgoTSR-Data,一个包含4600万样本的大规模数据集,按三个阶段组织:思维链(Chain-of-Thought,CoT)监督、弱监督标注和长程序列。大量实验表明,EgoTSR有效消除了时序偏差,在长程逻辑推理任务上达到92.4%的准确率,同时保持高精细粒度感知精度,显著超越现有开源与闭源最先进模型。

从感知到规划:通过课程学习演化自我中心任务导向的时空推理:论文配图
图 1:EgoTSR 框架概述。该图说明了通过课程学习不断发展的以自我为中心、以任务为导向的时空推理过程。左:4600万样本的EgoTSR数据和三阶段课程学习范式,从知识引导(CoT数据)到能力内化(标签数据)和泛化巩固(LongTag数据)。上中:推理增强的任务分解,其中子任务规划器将抽象任务和场景观察映射到原子子任务序列的逻辑骨架中。右上:注重空间感知和逻辑推理的双层评估框架,结合双向评估以消除时间偏差。右下:涵盖人类演示、模拟环境和真实机器人平台的广泛案例研究证实,我们的 EgoTSR 已成功内化了广义的“感知-规划-决策”认知路径,在动态、开放世界场景中展示了卓越的稳定性和适应性。