SharedVisCache:审核并认证多 Agent 视觉证据复用
Visual Orchestration Tax in Agentic VLM Pipelines: Auditing and Certifying Visual Evidence Reuse
摘要
Agentic VLM 管道越来越多地通过多个专业智能体和工具传递相同的静态视觉证据。此设计创建了编排级冗余模式:语义上未更改的图像在 VLM API 边界处重复重建为图像条件请求。我们将这种现象称为视觉编排税,并开发了一个测量到认证框架,用于 Agentic VLM 管道中视觉证据的重用。审计方定义 $\mathrm{M1}_{\mathrm{trace}}$ 来计算原始视觉证据触摸,并定义 M2 来测量结构触摸冗余,并具有查询级分布、引导置信区间和配对质量测试。在 SeeingEye 和 MAMMQA 的图表、文档、通用 VQA 和多模态 QA 任务中,审计显示出 66.8-75.6% 的视觉证据触摸冗余,并且每个审计查询都超出了预定义的门限。认证方引入了 SharedVisCache,这是一种以图像内容、预处理指纹和编码器假设为关键的合同感知证据重用钩子。在 SeeingEye 上,合约验证证明 75.0-75.5% 的重复触摸可重复使用,同时保留 350/350 输出字符串和 $Δ\mathrm{M5}{=}0$。在物理层,经过认证的命中将 ChartQA-200 跟踪重放中的 $F_{\mathrm{vision}}$ 从 800 减少到 200,并将实时 SeeingEye 翻译阶段物理集成中的 $F_{\mathrm{vision}}$ 从 200 减少到 50,保留 800/800 重放字符串和 200/200 集成呼叫输出。结果将视觉重用定位为智能体编排的可测量的、行为保留的属性,并定义了一个智能体层契约,使后端前缀或 token 重用在语义上可解释。
