论文
ABACUS:采用统一基础模型来桥接图像计数理解和生成
ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation
摘要
我们提出了 ABACUS,一种统一的视觉语言模型,它在单个 3B 参数模型中联合解决对象计数、人群计数、引用表达计数和计数忠实图像生成问题。 ABACUS 引入了三个贡献:密度感知自适应缩放与从多头自注意力分解到空间地面计数预测的对象映射相结合;通过 GRPO 训练的边界感知计数策略,具有嵌套的本地、边界和全局奖励,以消除作物边界的多计数和少计数;以及循环一致的 GRPO 策略,其中冻结的理解分支分数生成了计数偏差和审美质量的候选者,在没有任何外部批评或注释的情况下缩小了理解生成协同差距。 ABACUS 在对象计数(FSC-147、CARPK)、人群计数(上海科技大学 A/B)、引用表达计数(REC-8K)、计数忠实生成(CoCoCount、T2I-CompBench、GenEval)和计数推理(CountQA)等七个基准测试中取得了最先进的结果,超越了特定任务的专家和更大的通才模型。项目页面位于 https://mondalaindya.github.io/pages/ABACUS。