论文

MIRTH:视觉-语言-动作代理的时空中心的相互信息推理

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

模型推理解码与生成控制

摘要

VLA 模型已成为将语义知识从网络规模数据转移到物理机器人控制的强大范例。然而,当前的单帧架构存在内在的局限性:丢弃历史动态的时间短视、高级指令和底层运动命令之间的推理差距以及由于自回归标量解码而导致的推理效率低下。在这项工作中,我们提出了 MIRTH,一个旨在应对这些挑战的统一框架。 MIRTH 通过三项关键创新增强了预训练的 VLA 主干:(1)双尺度时间记忆中心,将长期场景演化和短期运动趋势压缩为紧凑的嵌入; (2)通过互信息目标优化潜在推理标记,划分出语义计划空间,以使多模态上下文与动作轨迹保持一致; (3)并行动作解码方案,用向量预测代替自回归生成,以最大化控制吞吐量。对 LIBERO 模拟基准和真实 LeRobot 平台的广泛评估表明,MIRTH 实现了最先进的性能并展现了紧急错误恢复能力。代码和收集的数据集发布在http://github.com/kiva12138/mirth。