论文

搜索特定任务的视觉路径:跨视觉语言模型的进化块修剪

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models

摘要

视觉语言模型通常对每个问题执行相同的完整视觉编码器,即使 OCR、计数、对象、属性和空间查询可能不需要相同的计算。我们研究了是否可以在没有 微调 的情况下跳过视觉块的固定预算组合。共享 K 块路由针对每个问题跳过一组恰好为 K 块的搜索集合,而特定于功能的 K 块策略则使用已知的功能标签选择一条相同大小的路由。我们引入了源平衡进化搜索,并将其与预算匹配的独立排名、连续删除和随机路线进行比较。实验使用 Qwen2.5-VL-3B-Instruct、SmolVLM2-2.2B-Instruct 和 876 个示例图像不相交选择分割。跨架构搜索传输:在 SmolVLM2 上,搜索到的共享四块路线比独立构建的路线高出 4.91 个百分点。能力专业化不太稳定。在 Qwen 上,在 OCR 增益 7.10 点的推动下,六块能力策略比共享路线高出 2.17 点。然而,在密封的 IIIT5K 上,SmolVLM2 OCR 特定路线落后其共享路线 13.6 个点。组合搜索可靠地改进了路线构建,但能力标签并未定义普遍可转移的视觉路径。