论文
Best-of-Q:推理时用Q函数动作排序改进VLM智能体
Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference
摘要
视觉-语言模型(VLM)已成为智能体在网页与操作系统等数字环境中自主运行的强大骨干。然而,这些模型难以适应网页等快速变化的环境,而缓解这一问题的微调需要庞大的模型训练与数据收集。在本工作中,我们提出一种无需策略重训练即可在推理时增强agentic VLM策略的新范式。根本上,我们的方法把VLM作为高容量动作提议者的角色与最终动作选择机制解耦。我们保持VLM策略冻结,用它为给定状态生成一组候选动作;然后由一个轻量、离线训练的Q函数对这些候选重排序,智能体执行估计价值最高的动作。主要贡献是把Q函数直接用于推理以实现即时策略提升,而非离线用于重标注数据以供策略重训练。在学术基准WebVoyager上,我们证明该方法显著提升智能体成功率:Qwen2.5-VL-7B智能体从38.8%提升到55.7%,专有GPT-4.1智能体从82.4%提升到88.8%。
