论文
GroundAnything:以闪电般的速度协调并行解码与精确视觉grounding
GroundAnything: Reconciling Parallel Decoding with Precise Visual Grounding at Flash Speed
摘要
自回归 (AR) 基础模型将空间预测序列化,引入顺序延迟并对输出标记施加因果顺序。我们将基础视为视觉证据提取:对象、位置和空间关系受到图像和查询的共同约束,但它们的依赖性并不意味着内在的从左到右的生成顺序。这种区别使得双向扩散成为一种自然的选择,允许空间假设并行出现并通过迭代去噪共同完善。我们引入了 GroundAnything,这是一种 4B 参数grounding基础模型,可通过分块去噪协调快速并行解码与精确定位。训练结合了来自公共数据集和专用数据引擎的基础预训练、具有联合 AR 和扩散目标的直接 AR 到扩散转换、监督微调以及基于 GRPO 的强化后训练。在 30 个grounding基准测试中,我们的自回归变体 GroundAnything-VLM 在类似尺寸的模型中以 72.42% 的成绩建立了新的整体最先进水平,与 GPT-6 Astra (71.35%) 保持竞争力。通过熵引导解码,GroundAnything 在此规模上也超越了现有技术水平,平均为 61.75%,而基于快速 MTP 的 LocateAnything 模型为 53.32%。我们进一步探索解码策略,表明可选的自推测模式比 AR 对应模式实现了 4.51 倍的加速,COCO F1mIoU 下降了 0.74 个百分点。基础设施实验表明,渐进式推理优化可将并行解码转化为实际的加速效果。这些支持对延迟敏感的现实系统中的高效视觉基础。