论文
CoEvolve:具有双向状态细化的构建到编辑视觉基础
CoEvolve: Construct-to-Edit Visual Grounding with Bidirectional State Refinement
摘要
视觉基础通过边界框来定位由语言描述的对象。大多数多模态grounding模型将目标识别、空间推理和边界估计压缩为一个终端预测。自由形式的基本原理使推理在语言上变得明确,但不一定暴露可测量、可编辑的空间状态。因此,中间定位错误很难诊断和纠正,导致最终的框中持续存在不正确的区域选择和不精确的边界。我们引入了 CoEvolve,一个从构建到编辑的框架,它将基础分为显式状态构建和状态编辑。区域进化强化(RER)将基础分析组织成渐进的语义空间轨迹,每个推理步骤都致力于一个明确的候选区域。双向去噪细化器(BDR)将推理文本视为固定语义上下文,并通过双向同位置重建细化轨迹的坐标场。几何和行为级目标提供目标几何和编辑偏好信号,用于巩固可靠的候选者、保留准确的输入或纠正注释。评估涵盖自然图像和遥感grounding。 CoEvolve 具有 9B 主干,在grounding精度方面可与高达 241B 参数的模型相媲美。在受控损坏的情况下,单次 BDR 传递将平均框重叠提高了 27 个百分点以上,这表明从大量定位错误中可以实现强大的恢复。状态-源比较进一步支持显式状态构建和源匹配编辑的互补性。该项目位于https://sundongwei.github.io/CoEvolve_Project/.