论文
Capek 0.5:以执行为中心的具身智能视觉语言模型
Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence
摘要
视觉语言模型正日益成为具身智能体的推理核心。机器人执行本质上是迭代的:每个动作都会重塑场景与物理状态,不断更新需要感知、推理和验证的内容。满足这些需求需要多种互补能力,而它们在监督信号、预测格式和验证标准上各不相同。现有方法通常围绕孤立、任务特定的目标来开发这些能力,尚未解决应如何围绕执行这一整体来组织和整合它们。我们提出Capek 0.5,一个围绕以执行为中心的能力分类体系构建的具身视觉语言模型。该分类体系不按数据集或任务组织训练,而是按具身能力在执行全过程中的功能角色分组,包含四个能力族:空间推理、时间理解、动作引导和状态验证。每项能力先由专门的专家模型基于共享骨干通过带可验证奖励的强化学习习得,随后通过权重空间合并加路由策略空间蒸馏,将专家模型整合为单一的推理时模型。我们在2B和35B-A3B两个规模上实例化Capek 0.5,并从三个互补视角进行评估:包含Capek-StateBench(一个新的状态验证基准)在内的综合基准套件、从专家模型到统一模型能力保持情况的受控研究,以及模拟具身环境中的闭环评估。Capek 0.5在其初始化基础上改进了大多数匹配的基准项,在单一检查点内以可量化的损失保留全部四项专业能力,并能迁移到闭环具身任务执行。
