简洁是推理效率的灵魂:通过数据管理促进 VLM 的简洁
Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation
摘要
通常通过缩小模型来追求推理效率:蒸馏、修剪、量化和稀疏路由,每个词元成本较低,同时将词元计数视为固定。但输出长度一直在膨胀,而它正是标准工具包未触及的部分。在这里,我们认为简洁性是缺少推理效率的杠杆,而预训练数据管理是实现这一点的实用方法:在简洁、正确的数据上训练的模型学会用更少的标记来回答;即它的通过成本较低。我们将 VLM 管理流程应用于 MAmmoTH-VL 单图像子集,并比较在我们的管理数据、标准 MAmmoTH-VL 数据和外部开放权重前沿 VLM 上训练的模型。在受控的 20 个评估集和 1B-4B 激活参数的 14 个 VLM 上,我们通过每个模型回归固定输出长度,将简洁性与质量分开,并以每个正确答案的 FLOP 为价格模型。与最冗长的 4B 比较器 (Qwen3.5-4B) 相比,Curation 的通过成本优势高出 35 倍,精确度为 $\sim$1 pp(每个正确答案 0.41 vs 14.58 TFLOP;平均准确度 0.691 vs 0.704)。 Curation 还比未策划的基线获得了 +17.55 个百分点的匹配长度精度增益,该基线随着模型规模的增长而增长(从 1B 的 +16.7 pp 到 4B 的 +21.2 pp)。这种简洁性改进不承认任何质量:通用的冗长在任何能力或规模上都买不到准确性,并且推理结构的冗长仍然获得其词元的窗口从 2B 的 8 个功能组中的 4 个缩小到 4B 的 8 个功能组中的 1 个。例如,简洁的模型甚至可以达到详细推理模型所错过的正确答案,将推理标记为独特的管理目标,而不是简洁性放弃的东西。在这种情况下,推理效率是一个每正确一个词元的问题,而简洁性是直接针对它的杠杆。