论文

ENEAS:用于自适应分割的嵌入引导神经集成

ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation

应用与实践视觉感知与空间理解

摘要

我们提出了 ENEAS,一种统一的、文本提示的方法,用于实例跟踪和语义发现。文本提示分割模型,包括最新的基础模型(如 SAM 3),仍然存在时间幻觉、空间碎片和语义错误分类的问题:当对象离开视野时,它们无法报告目标缺失;在极端特写时分割局部纹理而不是完整对象;优先考虑视觉特征而不是本体现实,因此视觉上相似的工件(如雕像、绘画或倒影)被分割为目标实体。 ENEAS 通过单一方法以两种方式工作:对唯一实例进行精确跟踪和高质量分割,以及对文本查询命名的每个实例进行开放概念发现,并由语义验证层解析。为了进行跟踪,我们通过文本提示适配器扩展了几何稳健的 SeC 架构(之前仅限于点交互)并利用其时间记忆,以便目标在消失过程中保持不变,而不会漂移到干扰物,即使目标充满整个视图也能保持完整。对于发现,验证层将高速视觉嵌入匹配与条件 VLM 细化相结合,仅对不明确的候选者调用语义推理,从而过滤掉纯视觉模型无法区分的本体错误,同时保持较低的延迟。 ENEAS 的设计考虑到了 3D 重建,即单个错误分类的干扰物会破坏资产,ENEAS 解锁了视频、广泛的库以及时间或空间无序数据集合的高质量语义跟踪和分割,以及区分真实实例与其分身的区别:看起来相似但不相同的事物。代码和模型可在 https://github.com/speridlabs/eneas 获取