论文
SpiralFovea:输入自适应焦点标记化作为资源自适应推理的第三个杠杆
SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference
摘要
大多数基础模型的自适应推理技术都会改变模型的功能——提前退出、MoE 路由、KV 缓存压缩、动态注意力稀疏性。然而,到达主干网的输入仍然是与图像内容无关的固定网格标记化。我们认为这是一个错失的杠杆。我们提出了 SpiralFovea,一种无参数、输入自适应标记器,其中标记身份、位置、尺度和计数都是局部视觉熵的函数,并且选择在查询任何骨干参数之前完成。围绕内容驱动的热点锚点,多尺度螺旋环产生 <= 78 个补丁,取代输入阶段的标准 196 个补丁 ViT 网格。在四个规范的细粒度基准测试中,SpiralFovea 的准确率提高了 1.7-2.1 pp,输入标记减少了 60%,每个 Transformer 层的自注意力 FLOP 减少了 84%,与匹配的静态标记化基线相比,吞吐量提高了 18-29%。 CUB-200-2011 Genus 上四个主干的受控消融揭示了一个清晰的诊断:增益幅度与主干的整个图像位置先验的强度成反比,将自监督基础模型隔离为输入自适应标记化最有价值的机制。