论文

以感知流为大模型提供可核验的时空监督

Spatio-Temporal Grounding of Large Language Models from Perception Streams

模型训练合成数据

摘要

具身AI Agent必须推理对象如何随时间在 3D 空间中移动和交互,但现有的规模较小的前沿 大语言模型 (LLM) 仍然无法正确处理细粒度的空间关系、度量距离和时间顺序。我们引入了通用框架形式化可解释时空场景 (FESTS),通过将自然语言查询编译为空间正则表达式 (SpRE),将可验证的时空监督注入到 LLM 中。空间正则表达式 (SpRE) 是一种将正则表达式语法与 S4u 空间逻辑相结合的语言,并在此处通过全称与存在量化进行了扩展。该管道将​​每个 SpRE 与任何结构化视频日志进行匹配,并导出对齐的(查询、帧、匹配、解释)元组,从而无需手动标签即可实现无限的训练数据。在 27k 个此类元组上训练 30 亿参数模型,可将帧级 F1 从 48.5% 提高到 87.5%,在复杂时空推理上与 GPT-4.1 相匹配,同时模型规模仍小约两个数量级,从而实现视频 LLM 的时空智能。