论文
GEAR-Seg:用于推理分割和数据引擎的有视觉依据的可解释智能体
GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine
摘要
推理分段需要基于复杂的隐式查询来本地化目标。当前的端到端模型通常将感知和推论纠缠在不透明的黑匣子中,严重限制了可解释性和可扩展性。为了解决这个问题,我们提出了 GEAR-Seg(用于推理分割的有视觉定位依据的可解释Agent),这是一种明确解耦的代理,它通过将视觉像素转换为密集的、属性丰富的文本来改变范式。通过解耦与类别无关的分段、语义描述和 大语言模型 (LLM) 推导,GEAR-Seg 将隐式推理转换为显式的、可跟踪的逻辑链。作为一个零样本推理框架,它在不同的推理和细粒度的引用分割基准上实现了极具竞争力的性能。此外,GEAR-Seg 本身就是一个高度可扩展的数据引擎。利用该引擎,我们构建了 GEAR-131K,这是一个大型基准测试(超过 38k 图像、656k QA-mask 对),引入了为复杂的现实世界面向操作的推理量身定制的多方面分类法。最后,蒸馏 实验表明,由我们的自动化管道专门监督的轻量级模型与昂贵的人工注释基线的上限性能非常匹配。