论文
Hi-Token:用于生成视觉基础的分层坐标标记化
Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding
摘要
生成视觉语言模型 (VLM) 通常将边界框坐标视为独立的输出符号,而隐含数字顺序和轴语义。我们认为这种表示是视觉基础错误的重要来源。 Hi-Token 使用特定于轴的百位、十位和个位标记对每个坐标进行编码,这增加了从粗到细的结构并增加了标记重用,同时保留了现有的 VLM 架构。 Hi-GAR 通过在多个尺度上使用框重叠和坐标精度,通过基于几何的组相对策略优化 (GRPO) 奖励来补充这种表示。匹配训练条件下的受控比较表明,Hi-Token 在整个评估的 IoU 范围内改善了定位。 Hi-GAR 进一步减少了低重叠预测,并且仅在训练期间使用。在三个 VLM 主干和 RefCOCO 系列上进行的实验表明,模型和基准测试都取得了一致的收益。 Hi-R1 在大多数报告的指标上实现了比强大的专家基线更高的值。对标记频率、数字边界、对象尺度和 IoU 分布的分析解释了坐标表示和奖励训练的效果。结果表明,结构化坐标生成为生成视觉基础提供了一种有效的方法。项目页面:https://xyzzzh.github.io/Hi-Token/