论文

BioProVLA-Agent:一种经济实惠、协议驱动、视觉增强的 VLA 嵌入式多代理系统,具有用于生物实验室操作的闭环推理能力

BioProVLA-Agent: An Affordable, Protocol-Driven, Vision-Enhanced VLA-Enabled Embodied Multi-Agent System with Closed-Loop-Capable Reasoning for Biological Laboratory Manipulation

摘要

生物实验室自动化可以减少重复性的手工工作并提高再现性,但在湿实验室环境中可靠的具体执行仍然具有挑战性。协议通常是非结构化的,实验室软件通常是透明的或反射性的,多步骤程序需要状态感知执行,而不仅仅是一次性指令跟踪。现有的机器人系统通常依赖于昂贵的硬件、固定的工作流程、专用仪器或面向机器人的接口。在这里,我们介绍 BioProVLA-Agent,这是一种经济实惠、协议驱动、视觉增强的体现多代理系统,由用于生物操作的视觉-语言-动作 (VLA) 模型启用。该系统以协议作为任务接口,将协议解析、视觉状态验证和体现执行集成在闭环工作流程中。定制的 LLM 协议代理将协议转换为可验证的子任务; VLM-RAG 验证代理使用观察结果、机器人状态、检索到的知识和成功/失败示例来评估准备情况和完成情况; VLA Embodied Agent通过轻量级策略执行经过验证的子任务。为了提高湿实验室视觉扰动下的稳健性,我们开发了 AugSmolVLA,这是一种针对透明实验室器皿、反射、照明变化和过度曝光的在线增强策略。我们在分层基准上评估系统,涵盖 15 个原子任务、6 个复合工作流程和 3 个双手任务,包括管装载、分类、废物处理、旋盖和液体倾倒。在正常和高曝光设置中,AugSmolVLA 比 ACT、X-VLA 和原始 SmolVLA 提高了执行稳定性,特别是对于精确放置、透明对象操作、复合工作流程和视觉退化场景。这些结果提出了一条通往可访问、以协议为中心且具有验证能力的生物操纵人工智能的实用途径。