论文

潜在桥:面向实时游戏智能体的连续快慢通道

The Latent Bridge: A Continuous Slow-Fast Channel for Real-Time Game Agents

智能体系统Agent 架构与控制循环

摘要

通用计算机使用的实时智能体——游戏是最苛刻场景——必须在数十毫秒内行动同时仍要跨秒规划。这两种机制位于延迟-质量权衡的两端。推理型VLM(Qwen3-VL-8B-Thinking)深思有效但每次响应需约1.5秒——对15Hz控制环太慢。相比之下——反应型VLM(MiniCPM-o 4.5)毫秒级行动——但在规划密集任务上表现不佳。我们耦合两个规模匹配的冻结模型(9B反应、8B推理)——让通信通道成为唯一可训练组件。标准耦合是文本桥(T):慢模型写后缀供快模型读。我们引入学习到的连续潜在桥(L)——以LLaVA式方式把慢模型残差投影进快模型输入嵌入空间——避免任何文本往返;两者都对照仅快(F)比较。在7个Atari游戏与驾驶域(MetaDrive)上——按通道在留出种子上调优动作解码器——潜在桥在每个域都匹敌或超越文本桥:显著改进两个游戏(MsPacman +57%、RoadRunner +28%)——其他处为安全替换。两通道组合破坏性干扰(RoadRunner -96%)——因此只应使用一个。收益高度可预测:当且仅当慢推理本就胜过快反应(T>F)时桥才有帮助——潜在桥与文本桥相对仅快的增益同动(r=0.93)。MetaDrive是受控反例——文本桥不增价值处潜在桥明显惰性。我们发布回放录制与可复现管线。

潜在桥:面向实时游戏智能体的连续快慢通道:论文配图
图 2:八个评估领域。七款 Atari 游戏(原始像素,~\sim15 Hz 控制),涵盖快速避险(鬼魂、障碍物、敌人火力)和较慢的路线/策略规划,以及 MetaDrive(自上而下的驾驶),我们的非 Atari 控制负面游戏。冻伤(不包括)和 Pong(报告但未提供信息)未显示。