论文

FibVLA:采用斐波那契采样的高效时间视觉-语言-动作模型

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

上下文与知识上下文工程

摘要

视觉-语言-动作模型(VLA)利用多模态信息的认知来推断物理世界的动作,为具体的人工智能应用提供了通用的解决方案。传统的 VLA 通常专注于当前的数字认知。虽然人们努力通过捕获时间信息来增强 VLA 的推理能力,但对长上下文历史进行编码会导致效率降低的问题。为了调和 VLA 中捕获时间信息和保持推理效率之间的冲突,本文引入了 FibVLA,这是一种具有长上下文历史时间感知的高效框架。具体来说,我们利用对本体感觉状态和视觉框架的对数事后采样,以最小的冗余捕获长期时间依赖性。对于动作专家,我们引入了流匹配来产生动作分布,以及斐波那契循环推理策略来基于实时闭环反馈生成长期规划步骤。实验表明,FibVLA 无需重新训练大规模视觉编码器即可显着提高动作平滑度和成功率。与现实世界评估中基于视频的基线相比,效率分析显示出卓越的实时响应能力。