论文

IG-VLA:内化时空想象的VLA推理

Imagine the Future, Internalize the Gist: Efficient VLA Reasoning via Internalized Spatiotemporal Imagination

摘要

视觉-语言-动作(VLA)模型日益引入中间推理以改善机器人操作,但现有方法主要对观测状态推理,不显式预期未来场景演化;把这种推理扩展到每步显式未来rollout又带来大量计算开销。我们提出IG-VLA,让模型"想象未来、内化要点"的VLA推理框架:潜时空推理学会直接在视觉表示空间想象任务相关的未来场景演化,为动作预测提供引导而无需昂贵的像素级视频生成;为进一步降低推理开销,场景要点记忆把推理导出的场景-行为关联内化为紧凑的场景要点token,在推理时绕过显式未来想象而保留未来推理的收益。LIBERO、LIBERO-Plus与VLABench的大量实验证明其有效性与效率:LIBERO-Plus语言套件上推理与要点策略的成功率都较最强基线高近6%;要点策略较基线提速至多6.38倍,单块A6000上每动作块推理延迟从1081毫秒降至169.5毫秒。结果表明未来时空推理可有效内化以支持高效VLA部署。