论文

LabVLA:在科学实验室中奠定视觉-语言-动作模型的基础

LabVLA: Grounding Vision-Language-Action Models in Scientific Laboratories

模型训练预训练

摘要

科学实验室越来越依赖人工智能系统来推理实验,但进行科学研究的物理行为在很大程度上仍然超出了他们的能力范围。人工智能可以帮助阅读文献、生成假设和规划协议,但在工作台上执行这些协议仍然需要人类操作员。视觉-语言-动作(VLA)模型提供了书面协议和机器人执行之间的一种可能的接口,但现有策略主要针对家庭和桌面演示进行训练,很少遇到科学实验室中的仪器、透明液体或固定协议工作流程。缩小这一差距需要实验室特定的监督和统一的学习框架,该框架可以适应用于执行实验协议的不同机器人实施例。因此,我们将数据和实施例视为模型设计的中心瓶颈。为了解决数据方面的问题,我们构建了 RoboGenesis,这是一个基于模拟的工作流程和数据引擎,它根据原子技能组成配置的实验室工作流程,验证和过滤执行轨迹,并跨支持的机器人配置文件导出结构化演示。在策略方面,我们提出了 LabVLA,采用两阶段配方进行训练:FAST 动作词元预训练首先使 Qwen3-VL-4B-Instruct 骨干动作在学习任何连续控制之前进行感知,然后流匹配后训练在知识隔离下附加 DiT 动作专家。在 LabUtopia 基准测试中,LabVLA 在分布内和分布外设置下的所有评估基线中均取得了最高的平均成功率。