论文

Best-of-Q:推理时用Q函数动作排序改进VLM智能体

Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference

智能体系统Agent 规划

摘要

视觉-语言模型(VLM)已成为智能体在网页与操作系统等数字环境中自主运行的强大骨干。然而,这些模型难以适应网页等快速变化的环境,而缓解这一问题的微调需要庞大的模型训练与数据收集。在本工作中,我们提出一种无需策略重训练即可在推理时增强agentic VLM策略的新范式。根本上,我们的方法把VLM作为高容量动作提议者的角色与最终动作选择机制解耦。我们保持VLM策略冻结,用它为给定状态生成一组候选动作;然后由一个轻量、离线训练的Q函数对这些候选重排序,智能体执行估计价值最高的动作。主要贡献是把Q函数直接用于推理以实现即时策略提升,而非离线用于重标注数据以供策略重训练。在学术基准WebVoyager上,我们证明该方法显著提升智能体成功率:Qwen2.5-VL-7B智能体从38.8%提升到55.7%,专有GPT-4.1智能体从82.4%提升到88.8%。

Best-of-Q:推理时用Q函数动作排序改进VLM智能体
图3:智能体在一个具有挑战性的 Google Flights 任务上的性能分解。分析显示,在 50.2% 的步骤中,基础 VLM(Qwen2.5-VL-7B)因未能提出正确的“golden”动作(由更强的 GPT-4.1 策略定义)而失败。当正确动作被提出时,我们的 Q-function 在 13.6% 的情况下成功选中它,但在其余 36.2% 的情况下未能做到。这表明主要性能瓶颈是 VLM 有限的提议能力,而非 Q-function 的选择过程