论文

VLM-in-Sandbox:面向Agent视觉推理的视觉工作区

VLM-in-Sandbox: Visual Workspaces for Agentic Visual Reasoning

上下文与知识AI 基础设施上下文工程SandboxAgent Sandbox

摘要

沙箱化计算机环境通过工具、可执行程序和持久文件支持多步推理,但将其从语言模型扩展到视觉-语言模型(VLM)引入一个独特的状态管理问题。视觉推理产生中间图像值证据——裁剪、掩码、叠加、放大区域和分析渲染——它们必须保持可寻址,又不能在多模态上下文中无限累积。我们提出 VLM-in-Sandbox,一个在受控计算机环境中进行智能体多模态推理的免训练框架。其视觉工作区在图像账本中登记生成的产物,维护有界的活跃视觉上下文,并让模型显式提升所选证据供后续检查。这将视觉证据生成(由沙箱工具完成)与视觉证据管理分离。在七个基准和四个基座 VLM 上,VLM-in-Sandbox 在 Vanilla VLM、只追加沙箱和本方法中取得最高的样本加权平均准确率。在 1,260 个样本上的编译器对齐 2×2 研究进一步分离了模型引导的可见性与有界保留:VLM-in-Sandbox 以少 18.6% 的总 token 达到 66.27% 的准确率(对比自动保留全部的对照)。在全部 6,350 个提交的 GPT-4.1-mini 样本上,相对 Original Append-only 产生 302 次挽救和 142 次回退。带前缀缓存的本地 vLLM 研究确认,更小的请求负载也降低了未缓存 token、首 token 时间和端到端延迟。这些结果将显式视觉证据状态确立为沙箱化 VLM 智能体的核心抽象。

VLM-in-Sandbox:面向Agent视觉推理的视觉工作区:论文配图
图 1:HRBench-4K 启发性示例。原始 VLM 直接从图像推理;Append-only Sandbox 在其多模态历史中累积生成的视图;VLM-in-Sandbox 将视觉产物保存在磁盘上并为两个活动槽位选择证据。颜色掩膜与自行车裁剪的配对展示了视图选择;图中显示的答案来自原始运行,其轨迹在 §3 中讨论。