论文

AdaTok:使用保持质量的动态词元进行自我预算图像词元化

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

模型推理测试时计算扩展

摘要

图像标记器,从 2D 网格到最近的 1D 序列,通常使用相同的固定数量的标记对每个图像进行编码。然而,视觉复杂性是高度异构的,因此统一的预算会在简单的输入上超支,而在复杂的输入上服务不足。现有的弹性标记器公开了可变长度重建,但通常将标记长度保留为部署时操作点、搜索目标或外部预测,而不是标记器本身的输出。在这项工作中,我们询问离散视觉分词器是否可以一次性预算自身。我们的中心发现是,可操作的弹性需要一种表示分配协同设计:前缀必须在预算范围内保持可解码,并且标记器必须了解每个图像需要哪个前缀。我们提出 AdaTok,一种自我预算的离散一维分词器。 AdaTok 将优先表示学习与自适应词元分配相结合,前者通过嵌套尾部掩码对词元进行排序,并通过多头 LoRA 解码器头解决预算相关的语义转移,后者根据候选预算训练轻量级确定性组 GRPO 策略。动态帕累托加权在政策训练期间平衡保真度和效率,无需手动权衡扫描。在 ImageNet-1K 上,AdaTok-Full 在 256 个词元下达到了 rFID 1.31,而 AdaTok-Adaptive 平均仅使用约 118 个词元就达到了 rFID 1.50,在可比预算下优于离散 1D 基线。在自回归图像生成中,较短的自适应表示比固定的 256 个词元解码产生约 2.1 倍的吞吐量,这表明视觉词元计数可以作为内容条件输出来学习,而不是设置为固定的超参数。