论文

CoMaTrack:基于视觉—语言—动作模型的竞争性多智能体博弈论跟踪

CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models

模型训练强化学习

摘要

具身视觉跟踪(EVT)是具身智能中的一项核心动态任务,要求智能体精确跟踪语言指定的目标。然而,大多数现有方法依赖于单代理模仿学习,受到昂贵的专家数据和静态训练环境导致的有限泛化的影响。受竞争驱动的能力进化的启发,我们提出了 CoMaTrack,这是一种竞争性博弈论多智能体强化学习框架,可在动态对抗环境中通过竞争性子任务训练智能体,从而产生更强的自适应规划和抗干扰策略。我们进一步介绍了 CoMaTrack-Bench,这是竞争性 EVT 的第一个基准,其特点是跟踪器和自适应对手之间跨不同环境和指令的游戏场景,从而在主动对抗交互下实现标准化的鲁棒性评估。实验表明,CoMaTrack 在标准基准测试和 CoMaTrack-Bench 上均取得了最先进的结果。值得注意的是,使用我们的框架训练的 3B VLM 在具有挑战性的 EVT-Bench 上超越了之前基于 7B 模型的单智能体模仿学习方法,在 STT 中实现了 92.1%,在 DT 中实现了 74.2%,在 AT 中实现了 57.5%。基准代码将在 https://github.com/wlqcode/CoMaTrack-Bench 上提供

CoMaTrack:基于视觉—语言—动作模型的竞争性多智能体博弈论跟踪:论文配图
图 2:CoMaTrack 框架概述。该系统采用基于 Qwen2.5VL-3B 构建的端到端 VLA 架构。在 SFT 阶段,模型学习从多视图观察和历史视觉序列预测未来轨迹。在 RL 阶段,跟踪器和对手代理在动态对抗环境中进行竞争训练,通过 GRPO 算法共同进化鲁棒的跟踪策略。