SAFE-Cascade:用于图表问答的成本自适应视觉语言路由
SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering
摘要
视觉语言模型 (VLM) 对于图表问题回答非常强大,但当许多问题可以通过 OCR 文本和轻量级语言推理来回答时,为每个查询调用 VLM 可能会不必要地昂贵。我们演示了 SAFE-Cascade,这是一种用于成本自适应图表问答的交互式系统。给定图表图像和自然语言问题,SAFE-Cascade 首先使用 OCR 提取图表文本,从纯文本语言模型中获取临时答案,然后使用学习路由器决定是接受文本答案还是升级到 VLM。该演示向用户展示了这个决策过程:OCR 证据、纯文本答案、路由概率、升级决策、最终答案、估计成本和估计延迟并排显示。 SAFE-Cascade 被设计为透明界面,用于了解何时实际需要视觉证据定位。用户可以上传或选择图表、提出问题、检查每个途径使用的证据、比较纯文本和 VLM 答案,并调整升级阈值以探索准确性成本边界。该系统使用用于 OCR 的 Azure 文档智能、gpt-5-mini 作为纯文本模型、gemini-2.5-flash-image 作为 VLM 以及经过推理时间功能训练的随机森林路由器来实现。在由 2,500 个示例实验中的 375 个示例组成的 ChartQA 测试中,SAFE-Cascade 通过 73.1% VLM 调用实现了 69.1% 的统一准确度,而完整 VLM 基线的准确度为 67.7%,VLM 调用为 100%。观察到的 +1.4 个百分点的差异在统计上是不确定的,因此我们将 SAFE-Cascade 解释为与完整 VLM 性能相匹配,同时将 VLM 调用减少了 26.9%,估计成本减少了 9.3%。该演示展示了选择性模态路由如何使多模态知识系统更加透明、可调节和具有成本意识。